La delincuencia es un problema que afecta a todos los países del mundo. Ocupa un lugar destacado en la agenda política de todos los gobiernos por ser una preocupación social que tiene un impacto en la economía, la calidad de vida, la seguridad social y en el desarrollo regional (Detotto & Otranto, 2010; Liang et al., 2022; Sun et al., 2023). Afrontarla implica diseñar e implementar estrategias a corto y largo plazo (Bogomolov et al., 2014). Una forma eficiente de reducir la criminalidad es lograr su prevención, con lo cual se puede prever las acciones criminales antes de su ocurrencia y así generar mecanismos eficientes para las entidades gubernamentales, con el fin de asignar recursos pertinentes y rápidos, conducentes a la mitigación y reducción de las actividades delictivas.
Los investigadores se esfuerzan por comprender los comportamientos delictivos y sus patrones, pero la gestión de los datos relacionados con el crimen se vuelve compleja debido al rápido crecimiento de la información. La incertidumbre sobre cómo analizar estos datos, debido a su falta de consistencia y exhaustividad, motivan a los investigadores a indagar y desarrollar métodos más efectivos para abordar este problema persistente (Kshatri & Narain, 2020; Zaidi et al., 2020). La predicción del crimen se ha convertido en una herramienta esencial para la formulación y aplicación de políticas públicas efectivas. Su utilidad radica en la asignación eficiente de recursos, lo que permite dirigir los esfuerzos de prevención y aplicación de la ley hacia áreas y momentos críticos. Además, facilita la prevención temprana al identificar zonas o poblaciones en riesgo, antes de que ocurran delitos graves. Este enfoque basado en datos respalda el diseño de políticas más efectivas y la evaluación de estrategias existentes. En última instancia, las políticas públicas fundamentadas en predicciones precisas contribuyen a reducir la delincuencia, mejorar la seguridad ciudadana y el bienestar general, y fomentar la transparencia y la confianza entre los ciudadanos y las autoridades. Estas ventajas hacen de la predicción del crimen una herramienta valiosa en la promoción de comunidades más seguras y prósperas. De acuerdo con el Índice Global de Crimen Organizado 2023, publicado por Global Initiative, aumentó la proporción de la población mundial que habita en países con un alto nivel de criminalidad, pasando del 79% en 2021 al 83% en 2023. En Colombia específicamente, la tasa de criminalidad pasó de 7.66 a 7.75, convirtiéndose en el país con mayor índice de criminalidad en América Latina.1 La alta tasa de delitos y los incidentes violentos de este país tienen una larga historia y a su vez este problema ha sido uno de los principales desafíos de gobernabilidad a nivel nacional y local. Según Mejía et al. (2014) la tasa promedio de homicidios en las principales ciudades del país (Barranquilla, Bogotá, Cali y Medellín) ha aumentado en los últimos cinco años, pasando de ser de 30.6% en 2008 a 40.1% en 2011 y 35.3% en 2013. Sánchez-Torres y Núñez-Méndez (2001) encontraron que la tasa de homicidios en Colombia aumentó considerablemente desde un 16% entre 1970 y 1974 hasta alcanzar un pico del 89% en el año de 1991. Datos más recientes analizados por Duarte-Velásquez y Cadavid-Carmona (2020) registraron 584216 delitos reportados para 2019 en Colombia. Teniendo en cuenta lo anterior, el crimen se ha convertido en una de las principales preocupacio nes de los colombianos.
Esta investigación se enfoca en Medellín, ciudad colombiana que tiene una alta incidencia de crimen. En los años 70 y principios de los 80, fue conocida por ser el epicentro de un poderoso cartel de droga, que generó un nivel de violencia sin precedentes (Collazos et al., 2021). Así mismo, Ramírez (2008) y Martin (2012) , en sus investigaciones, señalan que entre 1990 y 1993 la tasa de homicidios en la ciudad de Medellín superó los 350 casos por cada 100000 habitantes.2 Según Blattman et al. (2020) , aproximadamente dos tercios de los barrios de Medellín están bajo el dominio del crimen organizado. Además, Sánchez-Jabba (2013) concluyó que, a finales del siglo xx, la ciudad experimentó una creciente violencia, exacerbada por la crisis económica de ese período, lo que la sumió en una crisis urbana de múltiples dimensiones políticas, económicas y sociales.
Adicionalmente, Medellín es la segunda ciudad más grande de Colombia con una población de alrededor de 2.5 millones de personas, lo cual ofrece un entorno propicio para estudiar la difusión espacial del crimen. Durante el período analizado, la ciudad fue una de las más violentas del mundo, lo que permitió observar claramente la disparidad en las tasas de crimen y la segregación de oportunidades económicas, características comunes en grandes centros urbanos (Khanna et al., 2022).
En el contexto previamente expuesto, el objetivo central de esta investigación consiste en estudiar los patrones espaciales de delitos, a través de la implementación de las técnicas de Random Forest (rf), Extreme Gradient Boosting (xgboost) y un modelo de Mínimos Cuadrados Ordinarios (mco), para predecir la probabilidad de ocurrencia de diversos tipos de delitos, tales como hurto a personas, hurto a residencias, hurto a vehículos, homicidios y extorsiones, haciendo uso de datos reales de eventos delictivos, así como registros históricos y variables sociodemográficas. Estas predicciones se realizan a nivel anual con diferencias espaciales en Medellín, Colombia. Según estudios relevantes, el uso de estos métodos de aprendizaje en conjunto tiene un mejor desempeño que los que no lo son (AL Mansour & Lundy, 2019). Además tanto el xgboost como el rf no se ven afectados por los problemas de multicolinealidad de las variables, ya que, al ser modelos no paramétricos, no imponen suposiciones acerca de la naturaleza de las relaciones entre las variables. Esta característica les otorga una flexibilidad significativa para detectar patrones complejos (Zhang et al., 2022; Deng et al., 2023). Por otro lado, Maloof (2003) resaltó que rf es eficaz en la predicción de crímenes, especialmente cuando se enfrenta a conjuntos de datos desequilibrados, lo cual es común en la predicción de crimen donde los eventos delictivos son poco frecuentes en comparación con los no delictivos. Es importante destacar que, para los propósitos de este estudio, resulta crucial diferenciar entre los distintos tipos de delitos, ya que todos ellos muestran diversos patrones de comportamiento en relación con el tiempo y el espacio, así como una amplia variación en su frecuencia. Esta investigación se destaca por dos contribuciones fundamentales: en primer lugar, se incorporaron variables adicionales que resultan relevantes para mejorar la precisión de la predicción del delito, tales como: el índice de pobreza multidimensional, la proporción de personas que pertenecen al sisben, proporción de personas desempleadas, proporción de personas que no saben leer ni escribir y proporción de personas que hacen parte del estrato socioeconómico 1 o 2; y, en segundo lugar, para la predicción se abarcaron datos a un nivel de desagregación de barrio y grilla, debido a que esto permitirá identificar patrones y concentraciones de delitos en áreas específicas, lo que resulta fundamental para comprender la dinámica de la criminalidad a nivel local. Dado el aumento de la delincuencia y la complejidad de los datos criminales, el uso de técnicas de aprendizaje automático se ha convertido en una estrategia destacada para comprender y anticipar patrones delictivos en diversas escalas urbanas (Varian, 2014; Goin et al., 2018; Lima & Delen, 2020). Estas técnicas tienen la capacidad de analizar datos complejos y discernir relaciones no lineales, lo que ha despertado un gran interés en la seguridad ciudadana (Andini et al., 2018; Kounadi et al., 2020). Además, dichas técnicas se centran en optimizar la toma de decisiones y asignar recursos eficientemente en la prevención del crimen y en abordar la modelación y anticipación de actividades delictivas en áreas geográficas específicas, lo que contribuye a un enfoque más preciso y estratégico en la protección de entornos urbanos.
La literatura ha identificado diversas variables relevantes para la predicción del crimen. Entre las que se han usado variables socioeconómicas como: la desigualdad de ingresos, el desempleo total, el porcentaje de mujeres, hombres y jóvenes desempleados, la población total, el número de extranjeros por cada 1000 habitantes, el tamaño medio de los hogares, la superficie media de edificios habitados (m2), el porcentaje de adultos con estudios secundarios, las características del empleo, los patrones de viaje, el nivel educativo, los indicadores de dificultades financieras, el estado civil y las características de la vivienda (Gerber, 2014; Alves et al., 2018; De Blasio et al., 2022). Adicionalmente, se han tenido en cuenta características del entorno, entre ellas: estrato, clima, estaciones de policía, escuelas, centros comerciales, iglesias, licorerías, bares, analfabetismo, la ubicación, la demografía (Goin et al., 2018; Ingilevich & Ivanov, 2018; Reier-Forradellas et al., 2020; Kajita & Kajita, 2020; Stalidis et al., 2021; Liang et al., 2022).
En este estudio, se incorporaron variables utilizadas previamente, como la media de desempleo, estratificación socioeconómica de los barrios, la ubicación del delito (latitud y longitud), género y diferentes grupos de edad, las cuales, al igual que en el estado del arte, en esta investigación demuestran tener una relación significativa con el crimen. Como contribución adicional, se introdujeron las siguientes variables: percepción del crimen, densidad criminal, proporción de personas analfabetas e indicadores de desigual- dad: la pobreza multidimensional, proporción de personas que pertenecen al sisben y el déficit cuantitativo y cualitativo de vivienda. La inclusión de estas variables reviste una importancia significativa para la predicción del delito, ya que aportan una comprensión más completa de las dinámicas de la delincuencia, teniendo en cuenta que no solo se evalúa la incidencia de crímenes, sino también la vulnerabilidad de las comunidades. Esto tiene un profundo impacto en la toma de decisiones y en la formulación de polí- ticas públicas, ya que permite abordar de manera más efectiva los factores subyacentes que contribuyen a la delincuencia. Así, estas variables no solo son útiles para predecir el crimen, sino que también orientan estrategias específicas de intervención y prevención, promoviendo la seguridad y la calidad de vida en las áreas urbanas. Por ejemplo, la pobreza multidimensional, al identificar carencias en aspectos como educación, vivienda y salud, señala la necesidad de programas de inclusión social que mejoren estas condiciones. El déficit cuantitativo y cualitativo destaca la importancia de políticas de vivienda y de atención médica que mejoren la calidad de vida y reduzcan la criminalidad. La estratificación socioeconómica permite focalizar recursos y políticas de seguridad en las zonas más afectadas. En conjunto, estas variables orientan acciones concretas que abordan las raíces de la criminalidad y mejoran el bienestar de la población en áreas urbanas. Adicionalmente, en esta investigación se presentan otras contribuciones, entre las cuales se destaca el nivel de desagregación de barrios, reconociendo la necesidad de capturar la variación oculta en áreas geográficas pequeñas, donde la criminalidad puede variar significativamente (Mustard-David, 2010). A diferencia de la mayoría de la literatura nacional sobre predicción del delito, que ha optado por enfoques a nivel municipal o áreas locales, esta investigación se ha centrado en una desagregación detallada. Por ejemplo, investigaciones previas, como las realizadas por Giraldo Alegría et al. (2020) ; Mojica-Muñoz (2021) ; Ferro-Briceño et al. (2021) ; Bazzi et al. (2022) ; Rojas- Guerrero y Grautoff Laverde (2022), han abordado la predicción del delito a nivel municipal en Colombia, mientras que Ordóñez-Eraso et al. (2020) la implementaron en ciudades colombianas, y Sánchez-Torres y Núñez-Méndez (2001) ; García et al. (2012) ; y Khanna et al. (2022) se centraron en Medellín, aunque sin realizar una desagregación a nivel de barrios o comunas. Asimismo, Gelvez-Ferreira et al. (2022) llevaron a cabo su investigación en la ciudad de Bucaramanga, a nivel de manzana. Por otro lado, se destaca el uso de grillas como unidad de observación, lo cual representa una decisión desafiante dada la naturaleza cambiante de los delitos (Wang et al., 2020). Este nivel de desagregación ofrece una comprensión más profunda y precisa de la dinámica del crimen en Medellín y tiene implicaciones políticas importantes al mejorar la asignación de recursos, diseñar estrategias de prevención efectivas y promover políticas de seguridad pública más informadas y adaptadas a las necesidades de cada comunidad (Rosser et al., 2017; Lin et al., 2018).
Este documento consta de cinco secciones. En la primera, se presenta una introducción al tema junto con su contexto. En la segunda, se tiene la revisión de literatura. La tercera, abarca las fuentes, la descripción detallada de los datos, la muestra utilizada, la descripción de la metodología y las técnicas de machine learning usadas para la predicción de la delincuencia en la ciudad de Medellín. En la cuarta se incluyen los resultados y la última sección contiene las reflexiones y trabajos futuros del estudio.
En esta sección se exponen los antecedentes relacionados con el objeto del estudio actual: la predicción de diversos tipos de delitos por barrio y grilla en Medellín, por medio de técnicas de aprendizaje automático. Para lo cual, se realizó una compilación de investigaciones a nivel internacional y nacional, de tal manera que se pudiera construir el conocimiento sobre el asunto, destacando los aportes y vacíos existentes en torno a este.
La conexión entre el estado de la economía y la incidencia del crimen ha sido objeto de estudio en la investigación criminológica durante un largo período. Este interés se remonta a investigadores como Shaw y McKay (1931) y Becker (1968), pionero en la aplicación de modelos económicos de toma de decisiones racionales al estudio del crimen y derivó la función de oferta de delitos. Esta función se basa en relacionar el número de delitos cometidos por una persona con su probabilidad de ser condenada, las consecuencias legales en caso de condena, y otras variables, como sus ingresos legales e ilegales. La propuesta de Merton (1938) complementa este enfoque al señalar que las tasas de criminalidad tienden a ser mayores en sociedades caracterizadas por una mayor desigualdad de oportunidades. Adicionalmente, Cornish y Clarke (2016) mencionan en su investigación la Teoría de la Elección Racional, que es similar a la teoría de Becker en algunos aspectos, esta teoría se centra en las decisiones individuales de cometer delitos. Considera que los individuos toman decisiones racionales basadas en la relación entre los beneficios y los costos de cometer un delito, como la probabilidad de ser capturado y castigado.
Por otro lado, la teoría de la elección racional, desarrollada por Cornish y Clarke (1989) , ofrece una perspectiva fundamental sobre cómo las personas evalúan y toman decisiones en relación con el comportamiento delictivo. En el centro de esta teoría está la noción de que los individuos que cometen delitos no son actores irracionales, sino que son tomadores de decisiones racionales que sopesan cuidadosamente sus opciones antes de involucrarse en actividades ilegales. Esta perspectiva psicológica desafía la noción tradicional de que los infractores son inherentemente distintos de las personas que obedecen la ley, y sugiere que el comportamiento criminal puede entenderse como parte de un proceso racional de toma de decisiones. Entender cómo los factores económicos influyen en estas decisiones criminales se convierte en un paso clave para anticipar dónde es más probable que ocurra un delito en Medellín. Esta capacidad predictiva podría ser de gran utilidad para los responsables de la formulación de políticas, ya que les proporcionaría información crucial para dirigir estrategias preventivas hacia áreas específicas y situaciones que presenten un mayor riesgo. La identificación proactiva de estas zonas críticas permitiría la implementación de políticas y medidas preventivas más efectivas y dirigidas, trabajando hacia la reducción de la incidencia delictiva en la comunidad.
Por otro lado, en el campo de la criminalística, la minería de datos ha representado un impulso significativo, ya que ha permitido extraer cono- cimiento, responder preguntas de investigación, desarrollar sistemas de apoyo e identificar características del crimen, por lo que es una herramienta poderosa que permite a las fuerzas del orden descubrir patrones y predecir futuros delitos. Siguiendo esa idea, se encuentran Falade et al. (2019), quienes realizaron una revisión en la que enfatizan la importancia de la predicción del crimen mediante la minería de datos y otras técnicas, concluyeron que es un tema destacado de investigación debido a la influencia del crimen en el desarrollo económico de una nación. De manera similar, diversos investigadores han concluido -a partir de sus estudios- que la minería de datos es una herramienta en la lucha contra el terrorismo (Thuraisingham, 2004; Okonkwo & Enem, 2011).
En un estudio de Mittal et al. (2019) se utilizaron cuatro algoritmos (Decision Trees, Random Forest, Regresión Lineal y Neural Networks) para predecir la tasa de criminalidad en India. Los resultados revelaron que un alto Índice de Precios al Consumidor (ipc), Producto Interno Bruto (pib) y el desempleo redujeron la motivación para cometer delitos por necesidad económica. Además, se observó que el modelo de regresión lineal superó a los demás algoritmos, mostrando la mayor precisión en la predicción del crimen. De Blasio et al. (2022) -en su investigación a nivel de municipio en Italia-, utilizando árboles de clasificación, lograron prever con precisión un porcentaje superior al 70% de los municipios que experimentarán un aumento en los delitos de corrupción, durante el periodo 2012-2014. Además, concluyeron que características específicas de los mercados laborales y del sector inmobiliario a nivel local, junto con el historial previo de delitos de cuello blanco en la región, desempeñan un papel significativo en la predicción de la corrupción.
Stalidis et al. (2021) y Liang et al. (2022) en sus investigaciones descubrieron que al agregar al modelo variables como latitud, longitud, la categoría delictiva, la semana anterior, la hora del día, año, mes y eventos cercanos, tanto en el espacio como en el tiempo, obtuvieron una predicción con una precisión más alta al clasificar, a nivel de localidad, diversos tipos de crimen como robo, venta de narcóticos, asalto, allanamiento de morada, entre otros, por medio de la implementación de Convolutional Neural Networks (cnn), Decision Trees (C4.5), Naive Bayes, Logit Boost y Random Forest. Concluyendo que, es beneficioso incorporar tanto la dependencia categórica espaciotem- poral como los factores externos en el proceso de predicción, para observar los patrones de crimen. Por otro lado, en el estudio realizado por Goin et al. (2018), emplearon rf y regresión de lasso para predecir la violencia armada en Estados Unidos. En este caso, identificaron que 18 variables predictoras explicaron el 77.8% de la variabilidad en las tasas de violencia armada en entornos urbanos. Entre estas variables incluyeron el nivel educativo de los veteranos, factores geográficos, características laborales familiares, variables de estado civil, modos de transporte, ingresos y situación económica, todos con un alto poder predictivo en la incidencia de violencia armada.
Entretanto, Ingilevich e Ivanov (2018) y Reier-Forradellas et al. (2020) usaron factores como la cantidad de personas en la ciudad, estaciones de policía, escuelas, centros comerciales, iglesias, licorerías y bares para pre- decir el crimen, mediante regresión lineal, logística, Gradient Boosting y un modelo Sample, Explore, Modify, Model and Assess (semma). Encontrando que, la elección de estos lugares desempeñó un papel significativo en la predicción del crimen, resaltando su relevancia en el análisis de seguridad y delincuencia. Mientras que en Alves et al. (2018) implementaron un Random Forest Regressor para anticipar la incidencia del delito y medir el impacto de los factores urbanos en los casos de homicidios. Utilizaron como predictores del crimen las variables de desempleo, analfabetismo y la población masculina, encontrando que estos tres están altamente correlacionados con este tipo de delito. Concluyendo que estas variables se relacionan con la dinámica social y la presencia de factores de riesgo asociados con el crimen. En la investigación de Lin et al. (2018) se destaca su enfoque en el uso de 84 tipos de ubicaciones geográficas para establecer características espaciotemporales en un modelo basado en cuadrículas, a partir del cual emplearon algoritmos de aprendizaje automático (ml) para analizar patrones y predecir el crimen del mes siguiente en cada cuadrícula de la ciudad de Taiwán. Entre los métodos de ml que usaron, el Deep Neural Network (dnn) demostró ser el modelo más efectivo. De igual manera, Wheeler y Steenbeek (2021) usaron cuadrículas de 200 por 200 metros para generar pronósticos de robos a largo plazo por medio de un rf en Dallas, concluyeron que el estudio permite establecer relaciones espacialmente heterogéneas entre los delitos y las variables sociodemográficas, y, al mismo tiempo, detectaron que las variables más relevantes para la predicción del crimen incluyen los lugares como apartamentos, restaurantes y grandes comercios minoristas, junto con la densidad de población.
En adición a la literatura revisada, es esencial enfocarse en investigaciones a nivel nacional. En Colombia, se han realizado diferentes investigaciones y estudios de predicción de actos de corrupción, masacres, accidentes de tránsito, conflictos Mojica-Muñoz, 2021; Ferro-Briceño et al., 2021; Gallego et al., 2022; Rojas-Guerrero & Grautoff Laverde, 2022) y víctimas de secuestro (Giraldo Alegría et al., 2020) mediante la utilización de machine learning. Por ejemplo, en el estudio de Ordoñez-Eraso et al. (2020) , los autores pronostica- ron las tendencias de homicidios violentos (vh) para los próximos cinco años (2015-2020) utilizando un modelo de Random Forest Regressor. Los resultados del modelo sugieren que el número de homicidios mostrará una tendencia a la baja en 2025, lo que representará una reducción del 60% en los delitos violentos en Colombia. Mientras que en Mojica-Muñoz (2021) y Gallego et al. (2022) utilizaron algoritmos como xgboost, rf, regresión lineal, Gra- dient Boosting Machine, lasso, Neural Networks y Super Learner, para predecir la corrupción en Colombia. En el primer estudio, se clasificaron en cinco niveles los riesgos de corrupción en la Administración Pública Municipal, encontrando que ciertas variables como procesos penales retrasados, población, establecimientos industriales, índice de conflicto y educación tenían un alto poder predictivo. Estas variables permitieron predecir con un 85% de precisión el riesgo relativo de corrupción. En el segundo estudio, se identificaron las zonas de mayor riesgo de corrupción, destacando la importancia de las variables relacionadas con el sector financiero y el sector público en la predicción, mientras que las variables vinculadas a conflictos armados, actividades ilícitas y la dependencia de recursos naturales tuvieron un impacto predictivo menor. Concluyeron que la predicción de la corrupción puede ayudar a fortalecer la transparencia y la rendición de cuentas, lo que contribuirá a una gestión pública más eficiente y a la mejora de la confianza de los ciudadanos en las instituciones gubernamentales.
Igualmente, se destaca el estudio de Bazzi et al. (2022) , quienes investigaron la predicción de conflictos en Colombia e Indonesia a través lasso, rf, Adaptive Boosting y Neural Network. Sus hallazgos revelaron que la violencia no mostraba un patrón autorregresivo. En el caso de Colombia, identificaron que el indicador de conflicto se presentaba en un tercio de los municipios cada año, con cinco o más incidentes ocurriendo alrededor del 8% del tiempo. En Indonesia, observaron un aumento en la desviación estándar de aproximadamente 4.7 actos de violencia anuales, con variaciones año tras año y entre subdistritos de alrededor del 3.3%. Del mismo modo, Rojas-Guerrero y Grautoff Laverde (2022) emplearon inteligencia artificial para prever los municipios en Colombia que podrían ser susceptibles a masacres entre 2010 y 2020. Descubrieron que el uso de rf logró una precisión media del 76% al 82%, superando al modelo binomial que obtuvo una precisión del 27% al 29%. También destacaron que el riesgo de masacres aumenta notablemente cuando la tasa de homicidios y los cultivos ilícitos empiezan a crecer.
Otra investigación relacionada es la de Gelvez-Ferreira et al. (2022) , realizada en Bucaramanga entre 2016 y 2019, en la cual utilizaron el procesamiento de señales para grafos por semanas, junto con modelos como k-Nearest Neighbors (knn) y Support Vector Machine, para predecir delitos. Hallaron que el modelo más efectivo fue knn. Además, concluyeron que el modelo de predicción de delitos resulta valioso para elaborar estrategias de prevención en grandes ciudades, aunque su utilidad podría ser limitada en ciudades de tamaño mediano con acceso restringido a datos.
Teniendo en cuenta que el presente estudio se realiza para Medellín, a continuación, se hace énfasis en los estudios relacionados con esta ciudad. Muñoz et al. (2021) analizaron datos de delitos en Medellín, estaciones meteorológicas y tasas de desempleo entre 2015 y 2019 mediante técnicas de machine learning. Descubrieron que eventos como el pago de salarios y los festivales tuvieron un impacto significativo en la tasa de delincuencia, y encontraron una correlación del 35% entre el desempleo y las fluctuaciones en la delincuencia. Contrario a algunas teorías, no encontraron una conexión directa entre la temperatura y la incidencia del crimen. Complementando, Khanna et al. (2022) examinaron cómo la participación en actividades delictivas se relaciona con los cambios en los costos de transporte y los incentivos para trabajar en empleos formales en vecindarios. Utilizaron un enfoque de equilibrio general espacial y analizaron datos geocodificados de arrestos en Medellín, junto con registros individuales de empleo y direcciones de encuestas a hogares. Sus resultados mostraron que la reducción de la delincuencia fue más notable en áreas con altas tasas iniciales de delincuencia y falta de oportunidades económicas legítimas. Sin embargo, algunas áreas de baja delincuencia, cerca de nuevas estaciones de transporte, experimentaron un ligero aumento en la delincuencia.
La revisión de literatura presentada resalta el interés frente al tema de la predicción criminal. A su vez, posibilita reunir una serie de información relevante que, además de constituir la sustentación teórica de este estudio, aporta un sistema coordinado y coherente de propuestas en el campo de la criminalística, la minería de datos y el aprendizaje automático, que permiten desarrollar sistemas de apoyo e identificar características del crimen.
En la actualidad, el análisis y predicción del crimen ha emergido como un desafío crucial en la búsqueda de estrategias eficaces para garantizar la seguridad y el bienestar de las comunidades urbanas. En este contexto, el presente estudio abarca la totalidad del área urbana de Medellín, Colombia, conocida por su historia de transformación y resiliencia, con el propósito de desarrollar un enfoque innovador para la predicción del crimen utilizando machine learning. El objetivo central de esta investigación es estudiar los patrones espaciales de delitos, a través de la implementación de varios modelos de machine learning para predecir la probabilidad de ocurrencia de diversos tipos de delitos en un barrio y grilla en Medellín anualmente, haciendo uso de datos reales de eventos delictivos, así como registros históricos y variables sociodemográficas. De tal manera que se brinde información valiosa a las autoridades encargadas de la seguridad ciudadana.
En resumen, la presente sección delineará de manera detallada los datos y la ruta a seguir para la implementación de los modelos de machine learning que se usarán en el presente trabajo. La metodología contiene unos pasos rigurosos y sistemáticos, que incluyen la preparación y transformación de los datos en un conjunto estructurado y apto para la construcción y entrenamiento de los modelos, de tal manera que finalmente se obtenga un análisis predictivo de patrones delictivos en Medellín. La metodología se ilustra en la figura 1, otorgando una visión clara y detallada del flujo de trabajo desarrollado.
En esta sección, se presentarán los datos y fuentes empleadas para llevar a cabo la predicción del crimen en la ciudad de Medellín.
Para esta investigación, se usaron datos proporcionados por el Sistema de Información para la Seguridad y la Convivencia de Medellín (sisc), que tiene como finalidad monitorear y analizar las dinámicas de seguridad y convivencia que se desarrollan en la ciudad de Medellín (Alcaldía de Medellín, s. f. a.). Esta base recopila datos georreferenciados de diversos tipos de delitos denunciados por los habitantes de Medellín; los cuales contienen, además, sexo, edad, estado civil, modalidad de robo (tipo de arma o medio) y ocupación de las víctimas. La temporalidad va desde el 1 de enero del 2008 hasta el 31 de diciembre 2018, con 99410 observaciones sobre reportes de crímenes diarios. Para su análisis, las fechas de las denuncias se transformaron en años y se registró el número de delitos ocurridos, además fueron georreferenciados y analizados mediante métodos de análisis espacial, lo que permitió identificar patrones espaciales y puntos críticos relevantes, asociándolos, finalmente, con los respectivos barrios para cada año (Departamento Administrativo Nacional de Estadística [dane], s. f.). De esta base de datos se seleccionaron las siguientes variables: latitud, longitud, tipo de crimen (conducta) y código de barrio.
Los datos del 2008 a 2018 muestran un aumento anual en el número de reportes de delitos en Medellín, como se puede observar en la figura 2, en el año 2008 se reportaron 3138 crímenes en la ciudad, llegando a 24327 denuncias delictivas en el 2018. Este incremento en las denuncias sugiere que la comunidad está cada vez más afectada por la delincuencia y siente la necesidad de reportar los incidentes. Estos datos son una clara señal de que la seguridad pública es una preocupación apremiante en la ciudad y requiere una atención inmediata por parte de las autoridades y los encarga- dos de la formulación de políticas. La magnitud de este aumento refuerza la importancia de investigar y comprender las causas subyacentes de la delincuencia y desarrollar estrategias efectivas de prevención y control para abordar este desafío creciente en Medellín.
En la figura 3 se presenta un mapa de calor en escala logarítmica que ilustra la cantidad de reportes de crímenes hechos por los ciudadanos de Medellín durante el período de estudio. En este mapa, las áreas rojas indican una mayor cantidad de reportes de crímenes en los respectivos barrios. Se observa que existe una concentración significativa de crímenes en el centro de la ciudad, en particular en el barrio La Candelaria, donde se registraron 11112 reportes de crímenes entre 2008 y 2018. Le siguen los barrios Colón (2233 reportes), Guayaquil (2010 reportes) y Villa Nueva (2003 reportes), mientras que el barrio con la menor cantidad de reportes de crímenes, entre los 249 analizados, es Los Ángeles, con un total de 101 reportes. Estos hallazgos demuestran que la incidencia delictiva varía notablemente de un barrio a otro en Medellín.

Fuente: elaboración propia con base en los datos del sisc.

Fuente: elaboración propia con base en los datos del sisc.
En la figura 4 se observa el comportamiento de los cinco tipos de crímenes más denunciados en Medellín (hurto a personas, a residencias, de carros, extorsión y homicidios) entre el 2008 y el 2018; la tendencia ha sido creciente para todos estos tipos de delitos. Durante los 11 años analizados, los reportes por los delitos de hurto a residencias, extorsión y homicidios se mantienen, en cambio, desde el 2011 en adelante hubo un crecimiento del número de reportes de hurto a personas, volviéndose más común, en comparación con los otros tipos de delitos.
Los datos empleados son del período comprendido entre el 2008 y el 2018, basados en una muestra de hogares representativos de las 16 comunas y los cinco corregimientos de Medellín. Esta muestra se obtuvo mediante un proceso de muestreo aleatorio, estratificado y conglomerado de varias etapas. La encuesta proporciona datos detallados a nivel de barrio, lo que permite un análisis más específico de los hogares. La ecvm es una herramienta diseñada para monitorear y medir la situación socioeconómica de los habitantes de Medellín. De igual manera, es un recurso estadístico para conocer de primera mano indicadores importantes relacionados con temas como población, vivienda, familia, educación, trabajo, salud y seguridad, entre otros (Alcaldía de Medellín, s. f. b.).
Para los modelos se tuvieron en cuenta las siguientes variables proporcionadas por esta encuesta: edad media en cada uno de los barrios de Medellín, media de edad de personas entre 0 y 15 años, entre 16 a 30 años, mayores de 30 años, proporción de personas que son hombres por barrio, media de personas que presentan estrato 1 y 2, estrato 3 y 4, media de personas por barrio que no tienen ningún nivel de estudios, proporción de personas desempleadas, media de personas que no saben leer y/o escribir, media de personas que tienen índice de pobreza multidimensional, media de personas que tienen déficit cuantitativo de vivienda, déficit cualitativo de vivienda, media de personas que manifestaron que habían sido atracadas en el barrio donde vivían en el último año y media de personas que dijeron que se sentían inseguras en el barrio donde actualmente vivían.
Adicionalmente, los registros en formato shapefiles (.shp) para cada barrio y comuna de la ciudad se obtuvieron a través de la página web de Geomedellín (Alcaldía de Medellín, s. f. c.). A partir de los cuales se usaron variables como: código de barrio y área en metros cuadrados de cada barrio de Medellín, junto a la geometría del límite de la parte urbana de la ciudad.
En primer lugar, se lleva a cabo una exhaustiva recopilación y limpieza de datos relacionados con incidentes criminales en Medellín. Después de tener en una sola base de datos todas las variables que se mencionaron en la sección 3.1 (99410 observaciones comprendidas entre el 01 de enero de 2008 y el 31 de diciembre de 2018), se eliminan los datos inconsistentes (na), incluidos campos vacíos (missing values), datos ruidosos o incompletos y datos duplicados, teniendo en cuenta que lo anterior es clave para mejorar la calidad de los datos, previamente al entrenamiento y prueba del algoritmo.
En segundo lugar, se realiza una intersección geoespacial para obtener los registros de crímenes correspondientes solo al casco urbano de Medellín, teniendo en cuenta los límites comunales -encontrados en el shapefile de Geomedellín, descrito en la sección 3.1.3-, con lo cual, ya se tiene la información a nivel de barrio; para el caso de grillas, se definen cuadrículas de 200x200 metros,3 las cuales se generan iterando sobre la extensión del área de estudio y se filtran solo las que pertenecen a la zona urbana de Medellín, para realizar una unión espacial y asociar cada registro de crimen con el cuadrado de la grilla en el que se encuentra. Luego, se realiza un conteo de crímenes anuales por barrio y grilla, utilizando como variables: la fecha en que se hizo la denuncia, el código del barrio, el identificador de grilla y el tipo de conducta (hurto a persona, hurto a carro, hurto a residencia, extorsión y homicidio).
Finalmente, para la selección de variables relevantes se realiza un análisis (presentado en la sección de Resultados) que muestra qué grupos de variables son los más importantes para predecir la ocurrencia de crímenes. En el contexto de los modelos basados en árboles, la importancia de las variables se evalúa mediante la ganancia de información lograda al realizar divisiones basadas en cada variable. Este criterio de importancia se mide en una escala de 0 a 100, donde 100 es el valor que toma la variable que obtiene la mayor importancia hacia la variable predicha, y los demás valores de las variables se toman a partir de la variable que ha obtenido la mayor importancia en el modelo.4
Además, se calcularon dos variables que representan la densidad de eventos delictivos en días α dentro de un barrio (ecuación 1). En atención a la literatura, dichas variables se consideraron importantes para mejorar la predicción de tipos de crímenes con una granularidad espaciotemporal más fina. Por consiguiente, para cada barrio nh, se realiza un análisis de la tendencia de los eventos delictivos, en el cual se utiliza una ventana móvil con una duración de α días, con valores de α = 7 y α = 30. Inicialmente, la ventana móvil comienza en el primer día de los datos históricos y, posteriormente, se desplaza día a día hasta llegar al punto en que su inicio es d-α. En cada punto inicial de la ventana móvil, se calcula la densidad de delitos como la proporción entre el número de delitos que ocurrieron dentro de la ventana móvil y la cantidad de días que abarca esta ventana. Además, dado que el área de cada barrio no es uniforme, se normaliza la densidad de eventos delictivos por tamaño de área. Este enfoque permite evaluar y comprender cómo la densidad de delitos varía a lo largo del tiempo en cada barrio nh, proporcionando una visión detallada de las tendencias a largo plazo en la ocurrencia de eventos delictivos en esa área específica (Rumi et al., 2018).
donde Crj(NH) es el número de delitos j que ocurren en un barrio NH durante el intervalo de tiempo ∆t, en el cual se tiene α = 7, α = 30 días y A(NH) es el área del barrio.
Por otro lado, a partir de la variable fecha, se obtienen características como fin de semana, día de la semana y estación del año, para agregar información adicional sobre las fechas en las que ocurrieron estos crímenes y, así, permitir análisis más detallados y sofisticados sobre los patrones de criminalidad.
En esta sección, se presentarán las estadísticas descriptivas de las variables, tanto independientes como dependientes, que forman parte de la implementación de los modelos de aprendizaje automático. Adicionalmente, se dará una visión completa de su distribución y características clave en Medellín durante el período 2008-2018.
Se observa que la edad promedio de la población en este lapso se sitúa en torno a los 41 años y que el 71% de los residentes se sienten seguros en sus barrios, en comparación con el 22% que manifiesta sentirse inseguro5 y el 8% que se considera muy seguro. La mayoría de la población pertenece al grupo de mayores de 30 años, representando el 62%; y del total de la población los hombres conforman el 45% (la población mayor de 30 años puede contribuir a la prevención del delito, ya que es menos probable que participe en actividades delictivas. Sin embargo, un mayor porcentaje de hombres en un área podría estar relacionado con tasas de delincuencia más altas, ya que los hombres tienen una participación delictiva más alta). Respecto a las condiciones socioeconómicas, el 82% enfrenta pobreza multidimensional, en contraste con el 41% que experimenta déficit cuantitativo y el 7% con déficit cualitativo en vivienda,6 lo cual presenta una incidencia significativamente menor. En términos de estratificación, la mayoría de los residentes se ubican en el estrato 3 o 4, caracterizados como medio y medio- bajo (64%).7 Además, un reducido 12% se encuentra desempleado y un considerable 44% no está actualmente involucrado en actividades de estudio. Estos datos proporcionan una panorámica fundamental de la población de Medellín y sus condiciones durante el período analizado (ver apéndice A).
Adicionalmente, en el apéndice B, se muestran las correlaciones que se han identificado entre las variables independientes y la variable dependiente, lo que permitirá determinar la fuerza de una relación lineal o no lineal entre las variables.8 Se observa en primer lugar, la presencia de una mayor proporción de hombres en un área podría estar relacionada con tasas de criminalidad más altas, y esto ocurre tal vez por la mayor participación de hombres en actividades delictivas actualmente. Además, áreas donde menos residentes se sienten inseguros tienden a tener niveles de criminalidad bajos, lo que refleja un ambiente pacífico y una menor incidencia de delitos. La correlación positiva con la población joven de 16 a 30 años podría implicar que esta franja de edad tiene un impacto en el aumento de la actividad delictiva, posiblemente relacionado con desafíos socioeconómicos y características propias de la juventud. Además, la correlación con la población que presenta déficit cuantitativo y cualitativo de vivienda podría señalar la influencia de limitaciones educativas y de calidad de vida en la participación en actividades delictivas. Las áreas con una mayor proporción de población en estratos socioeconómicos bajos (1 o 2) podrían experimentar tasas de criminalidad más altas, relacionadas con desafíos económicos y sociales. Además, la falta de educación, el des- empleo y la afiliación al sisben9 también podrían estar vinculados a tasas de criminalidad más altas, sugiriendo que limitaciones en oportunidades educativas, laborales, desigualdades económicas y sociales desempeñan un papel importante en la delincuencia.
En segundo lugar, se observa una correlación negativa entre el conteo de crímenes y la proporción de personas que pertenecen a los estratos 3 o 4 (medio-bajo o medio) de la población. Esto podría deberse a que la pertenencia a estos estratos socioeconómicos suele estar asociada con una mayor estabilidad económica y social. Esta mayor estabilidad, a su vez, puede ejercer una influencia indirecta en la reducción de la delincuencia en comparación con áreas en las que los niveles socioeconómicos son más bajos.
Por otro lado, un aumento en la pobreza multidimensional (ipm) podría correlacionarse con tasas más altas de criminalidad debido a que las áreas con un alto ipm a menudo albergan a comunidades en situación de vulnerabilidad socioeconómica, lo que incluye la falta de acceso a servicios básicos como educación, atención médica, la falta de oportunidades de empleo y desarrollo; estas áreas también pueden empujar a individuos, especialmente a los jóvenes, hacia actividades delictivas como medio de subsistencia. Por último, una mayor densidad criminal, particularmente en un período de siete días, llevaría a un aumento de la criminalidad en un área, debido a que a menudo estas áreas atraen a más delincuentes, lo cual hace que tengan la expectativa de encontrar más oportunidades para llevar a cabo sus actividades delictivas y pasar desapercibidos en la multitud.
Es fundamental recordar que estas interpretaciones son generales y que la relación real entre estas variables y el conteo de crímenes puede variar según el contexto específico y otros factores influyentes, ya que la correlación no implica causalidad y se necesita un análisis más profundo para comprender completamente las relaciones económicas y sociales en una región determinada. Adicionalmente, los modelos carecen de la capacidad para sugerir reformas o intervenciones específicas que contribuyan al control de la delincuencia.
En esta sección, se exponen los modelos de aprendizaje automático emplea- dos para pronosticar la probabilidad que ocurra cierto tipo de crimen. Se describe, además, el proceso de entrenamiento y las medidas utilizadas para evaluar el rendimiento de dichos modelos.
El Random Forest (rf) es una técnica de aprendizaje automático que presenta diversas ventajas en comparación con los algoritmos de aprendizaje profundo (Lu & Li, 2019). En los estudios más recientes sobre la predicción de puntos críticos de delincuencia, el algoritmo de rf ha demostrado obtener resultados pro- metedores en términos de predicción (Lim, 2007; Yao et al., 2020). Adicionalmente, Levine (2008) y Bogomolov et al. (2014) demuestran que el rf -al ser comparado con otros métodos de aprendizaje automático (como las Neural Networks)- también logra obtener resultados predictivos satisfactorios. Además, es uno de los algoritmos más populares debido a su simplicidad y su capacidad para ser utilizado tanto en tareas de clasificación como en tareas de regresión (Raza & Victor, 2021).
El xgboost es una técnica de aprendizaje automático ampliamente elogiada por su versatilidad y alto rendimiento. Su principal característica es su capacidad para mejorar constantemente la precisión de los modelos a través de un proceso de impulso, en el que combina múltiples modelos débiles, generalmente árboles de decisión, convirtiéndolo en un modelo fuerte y preciso. Esto garantiza una mejor capacidad de generalización y previene el sobreajuste a los datos de entrenamiento. Además, xgboost incorpora técnicas de regularización para evitar el sobreajuste y maneja eficientemente los datos faltantes, lo que facilita su uso en una variedad de aplicaciones. Su velocidad y eficiencia son notables, lo que lo convierte en una elección adecuada para conjuntos de datos extensos y aplicaciones en tiempo real.
La regresión de mco es una técnica estadística fundamental utilizada para modelar y comprender la relación entre una variable dependiente y una o más variables independientes (Gordon, 2010; Alves et al., 2018). Su importancia radica en su capacidad para ajustar modelos que minimizan la diferencia entre los valores observados y los predichos, lo que facilita la predicción de valores futuros y la inferencia sobre la influencia de las variables predictoras en la variable de respuesta (Zou et al., 2003).
Se utiliza el mco como punto de referencia para evaluar el rendimiento de otros métodos, como rf y xgboost, en la predicción del crimen en Medellín. La elección de estos enfoques avanzados en lugar del mco proporciona ventajas significativas en términos de precisión y capacidad predictiva. Mientras que el mco se basa en supuestos de linealidad y normalidad, lo que puede limitar su capacidad para capturar relaciones complejas en los datos, tanto rf como xgboost son métodos de aprendizaje automático que pueden manejar de manera más efectiva patrones no lineales y relaciones no convencionales, de tal manera que se tendrá una mayor precisión en la predicción de eventos delictivos. Esta adopción de enfoques más sofisticados representa una mejora sustancial en la capacidad de modelado y predicción, lo que resulta en una mayor eficacia en la comprensión y prevención de la delincuencia en Medellín.
Teniendo la base de datos completa (tabla 1) para el modelo se definieron los conjuntos de entrenamiento y de prueba, con una distribución del 80% y 20% respectivamente. Es decir, se tiene para el entrenamiento los años del 2008 al 2016 y para prueba los años 2017 y 2018, con el fin de predecir los años 2018 y 2019.
Para que las características estén en un formato específico para un rendimiento óptimo, antes de entrenar el modelo, se escalan o normalizan las características numéricas y se codifican las características categóricas. Finalmente, se importan las librerías necesarias para la implementación del modelo de rf, xgboost10 y mco.
Se crea una matriz de características completa y preparada para usar en un modelo de ml, imputando características basadas en datos históricos y sociodemográficos, como identificadores de grilla y códigos de barrios, características relacionadas con la fecha, densidad criminal y categorías o tipos de crímenes.11 El resultado es una predicción de probabilidad (entre 0 y 1) para las cinco categorías de delitos (hurto a persona, hurto a residen- cias, extorsiones, hurto a carros y homicidios), para una fecha determinada, dentro de un barrio y grilla específico.
La evaluación de cada modelo se realiza en términos de precisión, exac- titud, sensibilidad y puntuación F1-Score.
En esta sección, se exponen los principales resultados de este estudio. Inicialmente, se tiene el rendimiento general de los modelos predictivos. Después se identifican los mejores predictores y su vínculo con la literatura. Finalmente, se muestra una representación gráfica de los puntos críticos de actividad delictiva en un área determinada.
En las tablas 2 y 3 se presentan cuatro métricas: exactitud, sensibilidad, precisión y puntuación F1-Score, que permiten evaluar el rendimiento de los modelos de clasificación y la regresión de mínimos cuadrados ordinarios.
| Modelos | Precisión | Sensibilidad | F1 | Exactitud |
|---|---|---|---|---|
| Random Forest | 0.80 | 0.76 | 0.70 | 0.86 |
| xgboost | 0.79 | 0.77 | 0.71 | 0.83 |
| mco | 0.65 | 0.57 | 0.54 | 0.68 |
| Modelos | Precisión | Sensibilidad | F1 | Exactitud |
|---|---|---|---|---|
| Random Forest | 0.75 | 0.78 | 0.68 | 0.83 |
| xgboost | 0.74 | 0.76 | 0.67 | 0.81 |
| mco | 0.61 | 0.56 | 0.52 | 0.65 |
A pesar de que se obtuvieron valores muy similares, se puede observar que a nivel de barrios estos valores fueron más altos. El rf demostró un rendimiento destacado en términos de exactitud, alcanzando un valor de 86%, lo que significa que es altamente preciso en la identificación de casos positivos. El modelo tiene una precisión alta, lo que sugiere que es efectivo al prever con exactitud el resultado esperado. En términos prácticos, esto significa que aproximadamente el 80% de las veces, las predicciones del modelo son acertadas. Por otro lado, el xgboost también tuvo un buen rendimiento con una exactitud de 83%. Sin embargo, dado que se obtuvo una precisión más alta con rf a nivel de barrios, este fue el modelo que se aplicó para obtener los mapas de calor que se presentan en la sección 4.3. Al analizar el rendimiento del desempeño del modelo de mco, tanto a nivel de barrios como a nivel de grillas, se observa que alcanzó una precisión significativamente inferior. Esta baja precisión se traduce en un rendimiento global menor en comparación con los modelos de ml implementados.12 Este análisis de los modelos destaca las diferencias en la eficacia predictiva, proporcionando una visión más completa de su rendimiento en diferentes niveles de granularidad espacial.
Hay factores tanto sociales como económicos que contribuyen a que los delincuentes cometan delitos o que las víctimas sean el blanco de los deli- tos; estas características son útiles cuando se trata de predecir la ocurrencia futura de delitos, lo que puede ayudar a reducir las tasas de criminalidad en muchas comunidades, dichas características incluyen la edad, el género, la ubicación, el número de delincuentes, los ingresos, el arma utilizada, el nivel educativo, factores políticos y económicos, cultura, empleo, conceptos legales, la hora, la fecha, el día de la semana y el mes son algunos factores a considerar.
La figura 5 representa las variables individuales que poseen la mayor capacidad predictiva en cada uno de los modelos de aprendizaje automático a nivel de barrio. Es interesante resaltar que en los dos modelos de rf y xgboost la proporción de los hombres tuvo gran poder predictivo, al igual que la proporción de desempleados13. En el modelo de rf la proporción de personas que tienen pobreza multidimensional (ipm) tuvo el mayor poder predictivo14 junto con las personas que no saben leer ni escribir. En compa- ración al xgboost, en el cual, la proporción de personas que hacen parte del sisben y las que pertenecen a los estratos socioeconómicos 1 o 2 tienen un alto poder predictivo15. Además, García et al. (2012) observaron en su estudio que la mayoría de las víctimas de homicidios en Medellín provenían de entornos socioeconómicos bajos, lo cual justificaría por qué las variables del promedio de personas que hacen parte del estrato bajo aumentan la delincuencia. Explorar en detalle las razones por las cuales estas variables se convierten en indicadores significativos de la delincuencia queda fuera del alcance de esta investigación, principalmente debido a que el propósito de este análisis es puramente predictivo y no busca establecer relaciones de causalidad.
Adicionalmente, la figura 6 ilustra las características que exhiben una alta capacidad predictiva de los modelos implementados a nivel de grilla. Se observaron resultados parecidos, en los cuales las variables de la pro- porción de hombres, proporción de personas desempleadas, proporción de analfabetas y personas que no estudian tienen un alto nivel predictivo. Un aspecto relevante fue que la proporción de personas que pertenecen al estrato económico medio-bajo (3) o medio (4) y la proporción de personas que tienen déficit cuantitativo obtuvieron un poder de predicción alto en el modelo de xgboost.
En resumen, estos resultados están acorde con lo mencionado por He et al. (2017), quienes en su estudio demuestran que ciertos factores socioeconómicos pueden explicar la presencia de delitos violentos en áreas de alta criminalidad.
Los resultados de las predicciones de los modelos se materializan como un mapa de calor que muestra la distribución de los delitos según los datos disponibles, en los cuales el color rojo representa los lugares que concentran un alto nivel de delincuencia. Los expertos en análisis delictivo pueden aprovechar esta herramienta para tomar decisiones fundamentadas y elaborar estrategias efectivas.
En las figuras 7 y 8 se presenta una comparación entre los conteos de crímenes totales en los diversos barrios de Medellín y las predicciones del modelo correspondientes a los años 2018 y 2019, respectivamente. Resulta evidente que, tanto en la realidad como en las estimaciones del modelo, el centro de la ciudad se destaca como la zona con la mayor concentración de eventos delictivos (barrio La Candelaria). Las áreas cercanas al centro también registran niveles significativos de criminalidad a lo largo de todo el período de estudio, mientras que las periferias de la ciudad presentan muy poca actividad criminal.

Fuente: elaboración propia con base en los datos del sisc y de la Encuesta de Calidad de Vida (ecvm).

Fuente: elaboración propia con base en los datos del sisc y de la Encuesta de Calidad de Vida (ecvm).
En el caso de la predicción, se puede ver que se presentan eventos delictivos en los barrios cercanos al centro, lo cual se explica por diversas teorías -como la dada por Hino y Amemiya (2019), quienes mencionan que, de acuerdo con la teoría de la victimización repetida, existe una mayor probabilidad de que la conducta delictiva ocurra en el mismo lugar donde ocurrió en el pasado-, y debido a que al haber una mayor concentración en el centro de Medellín, sus barrios cercanos también se ven influenciados por la criminalidad que ocurra ahí.
De igual manera, Tobler (1979) formuló la primera ley de la geografía, que estableció que todo se relaciona con todo, pero lo que está cerca está más relacionado que lo que está lejos. Esta ley proporciona una base sólida para comprender por qué las áreas cercanas a zonas con alta incidencia de crímenes se ven más afectadas que las áreas más alejadas. Adicionalmente, Zhao y Tang (2017) y Yi et al. (2018) afirman que, características urbanas similares o proximidad geográfica entre regiones pueden dar lugar a patrones de delincuencia semejantes.
La Teoría de la Concentración Espacial de la Delincuencia -desarrollada en el investigación de Weisburd y Green (1995) y en Weisburd et al. (2023)- sugiere que los crímenes tienden a agruparse en puntos calientes, donde factores como la oportunidad delictiva y la disponibilidad de objetivos son más favorables. A medida que nos alejamos de estos puntos calientes, es probable que la tasa de criminalidad disminuya.
Adicionalmente, la Teoría de la Difusión Espacial apunta a que, una vez que ocurre un crimen en un área, es probable que ocurran más crímenes similares en áreas cercanas debido a la imitación de comportamientos delictivos y la movilidad de los delincuentes (Braga et al., 2014). Estas teorías son fundamentales para entender cómo los patrones de criminalidad se distribuyen en el espacio y cómo las estrategias de prevención pueden ser efectivas en áreas afectadas.
A pesar de que, según los resultados del modelo de predicción, se mantiene la tendencia y ubicación de los crímenes en el centro de la ciudad, el conteo es subestimado debido, principalmente, al subregistro de las víctimas16, lo cual hace que aumente el error al realizar una predicción.
Por otro lado, en las figuras 9, 10, 11 y 12 se presentan los conteos de crímenes por cada una de las cinco categorías o tipos de conducta que se tienen en la base de datos de crimen de Medellín. Se presentan tanto los conteos reales como los predichos por el modelo para los años 2018 y 2019.

Fuente: elaboración propia con base en los datos del sisc.

Fuente: elaboración propia con base en los datos del sisc.

Fuente: elaboración propia con base en los datos del sisc.

Fuente: elaboración propia con base en los datos del sisc.
De acuerdo con los mapas, se analiza que, dependiendo de las características localizadas de las diferentes modalidades delictivas y los factores circundantes, los modelos de predicción del delito generan una variedad de resultados, en los cuales los delitos de extorsión, homicidio y hurto a persona, en 2018, se concentran en el barrio La Candelaria (que es el centro de la ciudad) y en barrios circundantes; en contraste con hurto a residencia y hurto a carro que predominan al sur y oeste de la ciudad (barrios de Santa Fe, Campo Amor, San Bernardo, La Gloria, entre otros). Adicionalmente, se puede ver que el hurto a personas es el que más va a tener reportes de crímenes en toda la ciudad porque es el crimen que más tiene denuncias. En el período predicho del 2019, se observa un comportamiento similar al real, los delitos de extorsión y homicidio se presentan en el centro de la ciudad, en cambio, el hurto a persona se puede ver que en el 2019 va a crecer tanto en el centro de la ciudad como en zonas aledañas, del hurto a residencia para el 2019 puede determinarse que va a disminuir, y finalmente, el hurto a carro se va a mantener constante; es decir, se van a presentar en los barrios Belén, Los Conquistadores, Laureles y Bolivariana.
De igual forma, se analiza que la delincuencia varía de un barrio a otro y que, además, el algoritmo de rf predijo las categorías de delitos con una alta precisión, lo que permite confiar en el sistema para predecir delitos futuros. Adicionalmente, estos resultados indican que, en la zona urbana de Medellín, específicamente en los barrios con baja incidencia delictiva, la predicción del delito puede ser menos precisa debido a la limitada cantidad de eventos registrados. Es importante destacar que los hallazgos para la ciudad de Medellín no pueden extrapolarse a otras ciudades o municipios en el país. Las grillas permiten dividir un área geográfica en celdas más pequeñas, lo que brinda una mayor granularidad en la identificación de áreas de alto riesgo (figuras 13 y 14). Este enfoque puede ser de utilidad para las autoridades encargadas de hacer cumplir la ley y para la optimización de la asignación de sus recursos. Los mapas tienen la capacidad de proporcionar un análisis minucioso de los patrones delictivos, revelando tendencias y conexiones que podrían no ser evidentes a nivel de áreas geográficas más amplias. De manera adicional, esta información puede servir como base para la formulación y aplicación de políticas y estrategias en el ámbito de la seguridad pública.
Se percibe que la concentración de reportes de crímenes persiste en el centro de la ciudad de Medellín, en consonancia con lo observado a nivel de los barrios. Asimismo, el mapa demuestra que las predicciones correspondientes a los años 2018 y 2019 muestran una notable semejanza con los datos reales.

Fuente: elaboración propia con base en los datos del sisc.

Fuente: elaboración propia con base en los datos del sisc.
Los anteriores mapas representan un valioso recurso que puede ser instrumental para la detección de áreas con una mayor vulnerabilidad a la delincuencia o aquellas que han experimentado transformaciones en su perfil delictivo.
Utilizando esta información como base, se puede tomar decisiones estratégicas, como la asignación de recursos adicionales a las comunidades que presentan incrementos significativos en la probabilidad delictiva o la implementación de programas de prevención criminal específicamente diseñados para áreas identificadas.
En resumen, el enfoque presentado en este ejercicio es de naturaleza predictiva en lugar de causal. Esto implica que las herramientas presenta- das tienen la capacidad de identificar las ubicaciones en las que existe una mayor probabilidad de experimentar actos de delincuencia.
Al llegar al cierre de este estudio exhaustivo sobre la predicción del crimen mediante el empleo de técnicas de aprendizaje automático, se abre un panorama esclarecedor en el ámbito de la seguridad ciudadana y la comprensión de los patrones delictivos. A lo largo de esta investigación, se estudiaron los patrones espaciales de delitos a través de la implementación de los métodos de Mínimos Cuadros Ordinarios (mco), Random Forest (rf) y Extreme Gradient Boosting (xgboost), al igual que, se determinó la probabilidad de ocurrencia de cierto tipo de delitos en un barrio y grilla en Medellín anualmente. Así mismo, se destacó la capacidad inherente de los modelos de aprendizaje automático para analizar y procesar conjuntos de datos de delincuencia, lo que permitió revelar relaciones no lineales y tendencias sutiles, que de otro modo podrían haber pasado desapercibidas.
De acuerdo con los resultados del modelo, se pudo observar que los patrones de delincuencia intraurbana de los diferentes tipos de crímenes exhiben comportamientos distintos relacionados con el tiempo y el espacio. También se evidenció una amplia variabilidad en la frecuencia de los deli- tos, que se manifiesta de manera específica en los mapas a nivel de barrio y grilla. Otro hallazgo significativo fue la concentración de la mayoría de las denuncias de delitos en el centro de la ciudad de Medellín, particular- mente en el barrio La Candelaria, tanto a nivel de desagregación de barrios como en áreas geográficas más específicas (grillas). Esto se explica, en parte, por la alta afluencia de turismo, actividad comercial y una densa red vial en esta zona, donde circulan diariamente más de un millón de personas. Esta concentración de actividades ha generado desafíos relacionados con robos, conflictos por el control territorial en plazas de vicio y extorsión económica. Todo lo anterior, apunta a la necesidad de desarrollar políticas públicas y estrategias de intervención específicas para mejorar la seguridad y la calidad de vida en esta área crítica de la ciudad, optimizando al mismo tiempo los recursos tecnológicos y humanos disponibles.
El desempeño de los modelos es bueno, lo que facilita la comprensión de las características de los barrios que tienen una mayor capacidad predictiva para anticipar la ocurrencia de la delincuencia en Medellín. De manera sorprendente, las variables relacionadas con la proporción de hombres, proporción de personas entre 16 y 30 años de edad, proporción de personas desempleadas, proporción de personas que tienen déficit cuantitativo de vivienda, personas que pertenecen al sisben y que hacen parte del estrato socioeconómico 1 o 2, aumentan la criminalidad. Mientras que variables como la densidad criminal en las dos ventanas de tiempo en 7 y 30 días, la proporción de personas entre 0 y 15 años de edad y la proporción de perso- nas que manifestaron sentirse inseguras, en el último año, en el barrio donde vivían, tienen el menor poder predictivo hacia la delincuencia en el período de estudio, en los modelos de rf y xgboost. Por lo que se puede afirmar que los datos de las víctimas son fundamentales, ya que resultan necesarios para prever posibles futuras víctimas de delitos (Browning et al., 2010).
Adicionalmente, se observó que los modelos de rf y xgboost a nivel de barrios tuvieron una precisión similar, con una tasa de acierto del 86% y del 83%, respectivamente. Aunque estos niveles no son tan altos, igual se consideran valores aceptables, permitiendo que estos modelos puedan ser empleados por las autoridades o policymakers para prevenir la ocurrencia de delitos en Medellín. Por otro lado, en el caso del modelo de mco, se tuvo una tasa de acierto del 68% a nivel de barrios. Por tanto, el modelo con el mejor rendimiento fue el de rf.
Asimismo, los responsables de la elaboración de las políticas públicas pueden beneficiarse al utilizar estos modelos para asignar recursos de manera más eficiente, aumentar la presencia policial en áreas críticas y desarrollar estrategias de prevención del delito focalizadas. Al concentrar esfuerzos en áreas identificadas como vulnerables, Medellín puede lograr una reducción significativa en la tasa de criminalidad, mejorando la seguridad ciudadana y la calidad de vida en las comunidades. Además, estos modelos pueden ser útiles para evaluar el impacto de las intervenciones y ajustar las políticas de seguridad en consecuencia, lo que contribuye a un enfoque que esté más basado en evidencia, en la lucha contra la delincuencia en el país. Esta implicación de política pública se centra en la importancia de utilizar modelos predictivos para mejorar la eficacia de las estrategias de seguridad y prevención del delito en Colombia, lo que a su vez puede tener un impacto significativo en la reducción de la criminalidad y el fortalecimiento de la seguridad en las comunidades.
Es esencial resaltar que, si bien los resultados demuestran promesa y validez, persisten desafíos y oportunidades para la mejora continua en este campo. La selección adecuada de atributos, la gestión de datos desequilibrados y la adaptación a contextos cambiantes siguen siendo aspectos fundamentales a considerar en futuras investigaciones. Asimismo, la integración de fuentes de información adicionales y la exploración de enfoques de interpretación de modelos enriquecerán aún más la comprensión de los factores que influyen en la actividad delictiva. Finalmente, para que las predicciones sean más eficaces es necesario que los datos sean actualizados constantemente, incluso se puede trabajar en recopilar y procesar datos en tiempo real, para evitar predicciones sesgadas, teniendo en cuenta que las predicciones se basan en datos históricos.
AL Mansour, H., & Lundy, M. (2019). Crime types prediction. En A. Alfaries, H. Mengash, A. Yasar, & E. Shakshuki (Eds.), Advances in Data Science, Cyber Security and IT Applications: First International Conference on Computing, icc 2019, Riyadh, Saudi Arabia, December 10-12, 2019 , Proceedings (Part I, pp. 260-274). Springer.
H. AL Mansour M. Lundy 2019Crime types prediction A. Alfaries H. Mengash A. Yasar E. Shakshuki Advances in Data Science, Cyber Security and IT Applications: First International Conference on Computingicc2019,Riyadh, Saudi ArabiaDecember 10-12, 2019, ProceedingsI260274Springer
Alcaldía de Medellín. (s. f. a). Sistema de Información para la Seguridad y la Convivencia (sisc). https://www.medellin.gov.co/es/secretaria-seguridad/sisc/
Alcaldía de Medellín Sistema de Información para la Seguridad y la Convivencia (sisc)https://www.medellin.gov.co/es/secretaria-seguridad/sisc/
Alcaldía de Medellín. (s. f. b.). Encuesta Calidad de Vida. https://www.mede-llin.gov.co/es/centro-documental/encuesta-calidad-de-vida/
Alcaldía de Medellín Encuesta Calidad de Vidahttps://www.mede-llin.gov.co/es/centro-documental/encuesta-calidad-de-vida/
Alcaldía de Medellín. (s. f. c.). Límite Catastral de Comunas y Corregimientos. https://www.medellin.gov.co/geomedellin/datosAbiertos/1043
Alcaldía de Medellín Límite Catastral de Comunas y Corregimientoshttps://www.medellin.gov.co/geomedellin/datosAbiertos/1043
Alves, L. G., Ribeiro, H. V., & Rodrigues, F. A. (2018, septiembre). Crime prediction through urban metrics and statistical learning. Physica A: Statistical Mechanics and its Applications, 505, 435-443. https://doi.org/10.1016/j.physa.2018.03.084
L. G. Alves H. V. Ribeiro F. A. Rodrigues 092018,Crime prediction through urban metrics and statistical learningPhysica A: Statistical Mechanics and its Applications505435443https://doi.org/10.1016/j.physa.2018.03.084
Andini, M., Ciani, E., de Blasio, G., D’Ignazio, A., & Salvestrini, V. (2018, diciembre). Targeting with machine learning: An application to a tax rebate program in Italy. Journal of Economic Behavior & Organization, 156, 86-102. https://doi.org/10.1016/j.jebo.2018.09.010
M. Andini E. Ciani G. de Blasio A. D’Ignazio V. Salvestrini 122018,Targeting with machine learning: An application to a tax rebate program in ItalyJournal of Economic Behavior & Organization15686102https://doi.org/10.1016/j.jebo.2018.09.010
Bazzi, S., Blair, R. A., Blattman, C., Dube, O., Gudgeon, M., & Peck, R. (2022). The promise and pitfalls of conflict prediction: evidence from Colombia and Indonesia. Review of Economics and Statistics, 104(4), 764-779. https://doi.org/10.1162/rest_a_01016
S. Bazzi R. A. Blair C. Blattman O. Dube M. Gudgeon R. Peck 2022The promise and pitfalls of conflict prediction: evidence from Colombia and IndonesiaReview of Economics and Statistics1044764779https://doi.org/10.1162/rest_a_01016
Becker, G. S. (1968, marzo-abril). Crime and punishment: An economic approach. Journal of Political Economy, 76(2), 169-217. https://www.jstor.org/stable/1830482
G. S. Becker ,ma-abr1968,Crime and punishment: An economic approachJournal of Political Economy762169217https://www.jstor.org/stable/1830482
Blattman, C., Duncan, G., Lessing, B., Tobón, S., & Mesa-Mejía, J. P. (2020). Gobierno criminal en Medellín: panorama general del fenómeno y evidencia empírica sobre cómo enfrentarlo [Nota Política cief N.01]. Universidad eafit. https://hdl.handle.net/10784/24352
C. Blattman G. Duncan B. Lessing S. Tobón J. P. Mesa-Mejía 2020Gobierno criminal en Medellín: panorama general del fenómeno y evidencia empírica sobre cómo enfrentarloNota Política cief N.01Universidad eafithttps://hdl.handle.net/10784/24352
Bogomolov, A., Lepri, B., Staiano, J., Oliver, N., Pianesi, F., & Pentland, A. (2014, 12-16 de noviembre). Once upon a crime: towards crime prediction from demographics and mobile data. 16 th International Conference on Multimodal Interaction (pp. 427-434). Special Interest Group on Computer-Human Interaction (sigchi), Istanbul Turkey. https://doi.org/10.1145/2663204.2663254
A. Bogomolov B. Lepri J. Staiano N. Oliver F. Pianesi A. Pentland 16,12-16d2014,Once upon a crime: towards crime prediction from demographics and mobile datath16International Conference on Multimodal Interaction427434Special Interest Group on Computer-Human Interaction (sigchi)Istanbul Turkeyhttps://doi.org/10.1145/2663204.2663254
Braga, A. A., Papachristos, A. V., & Hureau, D. M. (2014). The effects of hot spots policing on crime: An updated systematic review and metaanalysis. Justice Quarterly, 31(4), 633-663. https://doi.org/10.1080/0741 8825.2012.673632
A. A. Braga A. V. Papachristos D. M. Hureau 2014The effects of hot spots policing on crime: An updated systematic review and metaanalysisJustice Quarterly314633663https://doi.org/10.1080/0741 8825.2012.673632
Browning, C. R., Byron, R. A., Calder, C. A., Krivo, L. J., Kwan, M.-P., Lee, J.-Y., & Peterson, R. D. (2010). Commercial density, residential concentration, and crime: Land use patterns and violence in neighborhood context. Journal of Research in Crime and Delinquency, 47(3), 329-357. https://doi.org/10.1177/0022427810365906
C. R. Browning R. A. Byron C. A. Calder L. J. Krivo M.-P. Kwan J.-Y. Lee R. D. Peterson 2010Commercial density, residential concentration, and crime: Land use patterns and violence in neighborhood contextJournal of Research in Crime and Delinquency473329357https://doi.org/10.1177/0022427810365906
Collazos, D., García, E., Mejía, D., Ortega, D., & Tobón, S. (2021). Hot spots policing in a high-crime environment: An experimental evaluation in Medellín. Journal of Experimental Criminology, 17(3), 473-506. https://doi.org/10.1007/s11292-019-09390-1
D. Collazos E. García D. Mejía D. Ortega S. Tobón 2021Hot spots policing in a high-crime environment: An experimental evaluation in MedellínJournal of Experimental Criminology173473506https://doi.org/10.1007/s11292-019-09390-1
Cornish, D. B., & Clarke, R. V. (1989). Crime specialisation, crime displacement and rational choice theory. En H. Wegener, F. Lösel, & J. Haisch (Eds.), Criminal Behavior and the Justice System. Psychological Perspectives (pp. 103-117). Springer.
D. B. Cornish R. V. Clarke 1989Crime specialisation, crime displacement and rational choice theory H. Wegener F. Lösel . Haisch Criminal Behavior and the Justice System. Psychological Perspectives103117Springer
Cornish, D. B., & Clarke, R. V. (2016). The rational choice perspective. En R. Wortley, & M. Townsley (Eds.), Environmental Criminology and Crime Analysis (pp. 48-80). Routledge.
D. B. Cornish R. V. Clarke 2016The rational choice perspective R. Wortley . Townsley Environmental Criminology and Crime Analysis4880Routledge
De Blasio, G., D’Ignazio, A., & Letta, M. (2022, noviembre). Gotham city. predicting ‘corrupted’ municipalities with machine learning. Technological Forecasting and Social Change, 184. https://doi.org/10.1016/j.techfore.2022.122016
G. De Blasio A. D’Ignazio M. Letta 112022,Gotham city. predicting ‘corrupted’ municipalities with machine learningTechnological Forecasting and Social Change184https://doi.org/10.1016/j.techfore.2022.122016
Deng, Y., He, R., & Liu, Y. (2023, octubre). Crime risk prediction incorporating geographical spatiotemporal dependency into machine learning models. Information Sciences, 646. https://doi.org/10.1016/j. ins.2023.119414
Y. Deng R. He Y. Liu 102023,Crime risk prediction incorporating geographical spatiotemporal dependency into machine learning modelsInformation Sciences646https://doi.org/10.1016/j. ins.2023.119414
Departamento Administrativo Nacional de Estadística. (s. f.). Descarga de datos geoestadísticos. https://www.dane.gov.co/files/geoportal-provi-sional/index.html
Departamento Administrativo Nacional de Estadística Descarga de datos geoestadísticoshttps://www.dane.gov.co/files/geoportal-provi-sional/index.html
Detotto, C., & Otranto, E. (2010, agosto). Does crime affect economic growth? Kyklos, 63(3), 330-345. https://doi.org/10.1111/j.1467-6435.2010.00477.x
C. Detotto E. Otranto 082010,Does crime affect economic growth?Kyklos633330345https://doi.org/10.1111/j.1467-6435.2010.00477.x
Duarte-Velásquez, Y. A., & Cadavid-Carmona, J. A. (2020, mayo-agosto). Análisis de umbral: técnica diferencial en la interpretación de los registros de criminalidad en Colombia (2019). Revista Criminalidad, 62(2), 9-31. http://www.scielo.org.co/pdf/crim/v62n2/1794-3108-crim-62-02-9.pdf
Y. A. Duarte-Velásquez J. A. Cadavid-Carmona ,ma-ago2020,Análisis de umbral: técnica diferencial en la interpretación de los registros de criminalidad en Colombia (2019)Revista Criminalidad622931http://www.scielo.org.co/pdf/crim/v62n2/1794-3108-crim-62-02-9.pdf
Falade, A., Azeta, A., Oni, A., & Odunayo, I. (2019, septiembre). Systematic literature review of crime prediction and data mining. Review of Computer Engineering Studies, 6(3), 56-63. https://doi.org/10.18280/RCES.060302
A. Falade A. Azeta A. Oni I. Odunayo 092019,Systematic literature review of crime prediction and data miningReview of Computer Engineering Studies635663https://doi.org/10.18280/RCES.060302
Ferro Briceño, P. V. (2021). Uso de redes neuronales para determinar la influencia del estado del pavimento en siniestros viales de la ciudad de Bogotá [Tesis de maestría, Universidad de Los Andes]. https://repositorio.uniandes.edu.co/server/api/core/bitstreams/1e7ef712-dfaa-42d0-bf90-fe652361aa33/content
P. V. Ferro Briceño 2021Uso de redes neuronales para determinar la influencia del estado del pavimento en siniestros viales de la ciudad de BogotáTesis de maestríaUniversidad de Los Andeshttps://repositorio.uniandes.edu.co/server/api/core/bitstreams/1e7ef712-dfaa-42d0-bf90-fe652361aa33/content
Gallego, J., Prem, M., & Vargas, J. F. (2022). Predicting politicians’ misconduct: Evidence from Colombia. Data & Policy, 4. https://doi.org/10.1017/dap.2022.35
J. Gallego M. Prem J. F. Vargas 2022Predicting politicians’ misconduct: Evidence from ColombiaData & Policy4https://doi.org/10.1017/dap.2022.35
García, H. I., Giraldo, C. A., López, M. V., Pastor, M. d. P., Cardona, M., Tapias, C. E., Cuartas, D., Gómez, V., & Vera, C. Y. (2012). Treinta años de homicidios en Medellín, Colombia, 1979-2008. Cadernos de Saúde Pública, 28(9), 1699-1712. https://doi.org/10.1590/S0102-311X2012000900009
H. I. García C. A. Giraldo M. V. López M. d. P. Pastor M. Cardona C. E. Tapias D. Cuartas V. Gómez C. Y. Vera 2012Treinta años de homicidios en Medellín, Colombia, 1979-2008Cadernos de Saúde Pública28916991712https://doi.org/10.1590/S0102-311X2012000900009
Gelvez-Ferreira, J.-D., Nieto-Rodríguez, M.-P., & Rocha-Ruiz, C.-A. (2022). Prediciendo el crimen en ciudades intermedias: un modelo de “machine learning” en Bucaramanga, Colombia. urvio Revista Latinoamericana de Estudios de Seguridad, (34), 82-98. https://doi.org/10.17141/urvio.34.2022.5395
J.-D. Gelvez-Ferreira M.-P. Nieto-Rodríguez C.-A. Rocha-Ruiz 2022Prediciendo el crimen en ciudades intermedias: un modelo de “machine learning” en Bucaramanga, Colombiaurvio Revista Latinoamericana de Estudios de Seguridad348298https://doi.org/10.17141/urvio.34.2022.5395
Gerber, M. S. (2014, mayo). Predicting crime using twitter and kernel density estimation. Decision Support Systems, 61, 115-125. https://doi.org/10.1016/j.dss.2014.02.003
M. S. Gerber 052014,Predicting crime using twitter and kernel density estimationDecision Support Systems61115125https://doi.org/10.1016/j.dss.2014.02.003
Giraldo Alegría, S. A., Ordoñez Palacios, L. E., Bucheli Guerrero, V., & Ordoñez Erazo, H. (2020). Modelo de redes neuronales para predecir la tendencia de víctimas de secuestro en Colombia. Investigación e Innovación en Ingenierías, 8(3), 38-49. https://doi.org/10.17081/invinno.8.3.4702
S. A. Giraldo Alegría L. E. Ordoñez Palacios V. Bucheli Guerrero H. Ordoñez Erazo 2020Modelo de redes neuronales para predecir la tendencia de víctimas de secuestro en ColombiaInvestigación e Innovación en Ingenierías833849https://doi.org/10.17081/invinno.8.3.4702
Giraldo Ramírez, J. (2008). Conflicto armado urbano y violencia homicida. el caso de Medellín. urvio Revista Latinoamericana de Estudios de Seguridad, (5), 99-113. https://doi.org/10.17141/urvio.5.2008.1098
J. Giraldo Ramírez 2008Conflicto armado urbano y violencia homicida. el caso de Medellínurvio Revista Latinoamericana de Estudios de Seguridad599113https://doi.org/10.17141/urvio.5.2008.1098
Goin, D. E., Rudolph, K. E., & Ahern, J. (2018, mayo). Predictors of firearm violence in urban communities: a machine-learning approach. Health & Place, 51, 61-67. https://doi.org/10.1016/j.healthplace.2018.02.013
D. E. Goin K. E. Rudolph J. Ahern 052018,Predictors of firearm violence in urban communities: a machine-learning approachHealth & Place516167https://doi.org/10.1016/j.healthplace.2018.02.013
Gordon, M. B. (2010). A random walk in the literature on criminality: A partial and critical view on some statistical analyses and modelling approaches. European Journal of Applied Mathematics, 21(4-5), 283-306. https://doi.org/10.1017/S0956792510000069
M. B. Gordon 2010A random walk in the literature on criminality: A partial and critical view on some statistical analyses and modelling approachesEuropean Journal of Applied Mathematics214-5283306https://doi.org/10.1017/S0956792510000069
He, L., Páez, A., & Liu, D. (2017, enero). Persistence of crime hot spots: an ordered probit analysis. Geographical analysis, 49(1), 3-22. https://doi.org/10.1111/gean.12107
L. He A. Páez D. Liu 012017,Persistence of crime hot spots: an ordered probit analysisGeographical analysis491322https://doi.org/10.1111/gean.12107
Hino, K., & Amemiya, M. (2019, julio). Spatiotemporal analysis of burglary in multifamily housing in Fukuoka City, Japan. Cities, 90, 15-23. https://doi.org/10.1016/j.cities.2019.01.030
K. Hino M. Amemiya 072019,Spatiotemporal analysis of burglary in multifamily housing in Fukuoka City, JapanCities901523https://doi.org/10.1016/j.cities.2019.01.030
Ingilevich, V., & Ivanov, S. (2018). Crime rate prediction in the urban environment using social factors. Procedia Computer Science, 136, 472-478. https://doi.org/10.1016/j.procs.2018.08.261
V. Ingilevich S. Ivanov 2018Crime rate prediction in the urban environment using social factorsProcedia Computer Science136472478https://doi.org/10.1016/j.procs.2018.08.261
Kajita, M., & Kajita, S. (2020, abril-junio). Crime prediction by data-driven green’s function method. International Journal of Forecasting, 36(2), 480- 488. https://doi.org/10.1016/j.ijforecast.2019.06.005
M. Kajita S. Kajita ,ab-jun2020,Crime prediction by data-driven green’s function methodInternational Journal of Forecasting362480 488https://doi.org/10.1016/j.ijforecast.2019.06.005
Khanna, G., Medina, C., Nyshadham, A., Ramos, D., Tamayo, J., & Tiew, A. (2022). Spatial mobility, economic opportunity, and crime [Harvard Business School Working Paper, No. 24-016]. https://www.hbs.edu/ris/Publica-tion%20Files/24-016_eb4b5875-f71d-428b-b7bc-071b7872c0f8.pdf
G. Khanna C. Medina A. Nyshadham D. Ramos J. Tamayo A. Tiew 2022Spatial mobility, economic opportunity, and crimeHarvard Business School Working Paper, No. 24-016https://www.hbs.edu/ris/Publica-tion%20Files/24-016_eb4b5875-f71d-428b-b7bc-071b7872c0f8.pdf
Kounadi, O., Ristea, A., Araujo, A., & Leitner, M. (2020). A systematic review on spatial crime forecasting. Crime Science, 9(7), 1-22. https://doi.org/10.1186/s40163-020-00116-7
O. Kounadi A. Ristea A. Araujo M. Leitner 2020A systematic review on spatial crime forecastingCrime Science97122https://doi.org/10.1186/s40163-020-00116-7
Kshatri, S. S., & Narain, B. (2020). Analytical study of some selected classification algorithms and crime prediction. International Journal of Engineering and Advanced Technology (ijeat), 9(6), 241-247. https://doi.org/10.35940/ijeat.F1370.089620
S. S. Kshatri B. Narain 2020Analytical study of some selected classification algorithms and crime predictionInternational Journal of Engineering and Advanced Technology (ijeat)96241247https://doi.org/10.35940/ijeat.F1370.089620
Levine, N. (2008). The “hottest” part of a hotspot: comments on “the utility of hotspot mapping for predicting spatial patterns of crime”. Security Journal, 21(4), 295-302. https://link.springer.com/article/10.1057/sj.2008.5#citeas
N. Levine 2008The “hottest” part of a hotspot: comments on “the utility of hotspot mapping for predicting spatial patterns of crimeSecurity Journal214295302https://link.springer.com/article/10.1057/sj.2008.5#citeas
Liang, W., Wang, Y., Tao, H., & Cao, J. (2022). Towards hour-level crime prediction: A neural attentive framework with spatial-temporal-categorical fusion. Neurocomputing, 486, 286-297. https://doi.org/10.1016/j.neu-com.2021.11.052
W. Liang Y. Wang H. Tao J. Cao 2022Towards hour-level crime prediction: A neural attentive framework with spatial-temporal-categorical fusionNeurocomputing486286297https://doi.org/10.1016/j.neu-com.2021.11.052
Lim, N. (2007). Classification by ensembles from random partitions using logistic regression models [Tesis doctoral, Stony Brook University]. sbu Academic Commons. https://commons.library.stonybrook.edu/stony-brook-theses-and-dissertations-collection/1423
N. Lim 2007Classification by ensembles from random partitions using logistic regression modelsTesis doctoralStony Brook Universityhttps://commons.library.stonybrook.edu/stony-brook-theses-and-dissertations-collection/1423
Lima, M. S. M., & Delen, D. (2020, enero). Predicting and explaining corruption across countries: A machine learning approach. Government Information Quarterly, 37(1). https://doi.org/10.1016/j.giq.2019.101407
M. S. M. Lima D. Delen 012020,Predicting and explaining corruption across countries: A machine learning approachGovernment Information Quarterly371https://doi.org/10.1016/j.giq.2019.101407
Lin, Y.-L., Yen, M.-F., & Yu, L.-C. (2018). Grid-based crime prediction using geographical features. isprs International Journal of Geo-Information, 7(8). https://doi.org/10.3390/ijgi7080298
Y.-L. Lin M.-F. Yen L.-C. Yu 2018Grid-based crime prediction using geographical featuresisprs International Journal of Geo-Information78https://doi.org/10.3390/ijgi7080298
Maloof, M. A. (2003). Learning when data sets are imbalanced and when costs are unequal and unknown. Workshop on Learning from Imbalanced Data Sets II, icml. https://www.site.uottawa.ca/~nat/Workshop2003/maloof-icml03-wids.pdf
M. A. Maloof 2003Learning when data sets are imbalanced and when costs are unequal and unknownWorkshop on Learning from Imbalanced Data Sets II, icmlhttps://www.site.uottawa.ca/~nat/Workshop2003/maloof-icml03-wids.pdf
Mejía, D., Ortega, D., & Ortiz, K. (2015). Un análisis de la criminalidad urbana en Colombia [Documento de trabajo N.o 2015/06]. Banco de desarrollo de América Latina, caf. https://scioteca.caf.com/handle/123456789/810
D. Mejía D. Ortega K. Ortiz 2015Un análisis de la criminalidad urbana en ColombiaBanco de desarrollo de América Latinahttps://scioteca.caf.com/handle/123456789/810
Merton, R. K. (1938, octubre). Social structure and anomie. American sociological review, 3(5), 672-682. https://www.jstor.org/stable/2084686
R. K. Merton 101938,Social structure and anomieAmerican sociological review35672682https://www.jstor.org/stable/2084686
Mittal, M., Goyal, L. M., Sethi, J. K., & Hemanth, D. J. (2019). Monitoring the impact of economic crisis on crime in India using machine learning. Computational Economics, 53, 1467-1485. https://doi.org/10.1007/s10614-018-9821-x
M. Mittal L. M. Goyal J. K. Sethi D. J. Hemanth 2019Monitoring the impact of economic crisis on crime in India using machine learningComputational Economics5314671485https://doi.org/10.1007/s10614-018-9821-x
Mojica-Muñoz, K. S. (2021). Inteligencia artificial para detectar corrupción en la administración pública municipal de Colombia [Documentos cede # 31]. Universidad de los Andes. https://doi.org/10.57784/1992/50541
K. S. Mojica-Muñoz 2021Inteligencia artificial para detectar corrupción en la administración pública municipal de ColombiaUniversidad de los Andeshttps://doi.org/10.57784/1992/50541
Muñoz, V., Vallejo, M., & Aedo, J. E. (2021, 25-27 de agosto). Exploratory analysis of crime behavior in the city of Medellín. 2nd Sustainable Cities Latin America Conference (scla) (pp. 1-5). ieee. https://doi.org/10.1109/SCLA53004.2021.9540095
V. Muñoz M. Vallejo J. E. Aedo 27,25-27d2021,Exploratory analysis of crime behavior in the city of Medellínnd2Sustainable Cities Latin America Conference (scla)15ieeehttps://doi.org/10.1109/SCLA53004.2021.9540095
Mustard, D. B. (2010). How do labor markets affect crime? New evidence on an old puzzle. En B. L. Benson, & P. R. Zimmerman (Eds.), Handbook on the economics of crime (pp. 342-358). Edward Elgar Publishing.
D. B. Mustard 2010How do labor markets affect crime? New evidence on an old puzzle B. L. Benson P. R. Zimmerman Handbook on the economics of crime342358Edward Elgar Publishing
Okonkwo, R. O., & Enem, F. O. (2011, 25-29 de julio). Combating crime and terrorism using data mining techniques. 10 th International Conference. Nigeria Computer Society (ncs). https://www.ncs.org.ng/wp-content/uploads/2011/08/ITePED2011-Paper10.pdf
R. O. Okonkwo F. O. Enem 29,25-29d2011,Combating crime and terrorism using data mining techniquesth10International ConferenceNigeria Computer Societyhttps://www.ncs.org.ng/wp-content/uploads/2011/08/ITePED2011-Paper10.pdf
Ordoñez-Eraso, H.-A., Pardo-Calvache, C.-J., & Cobos-Lozada, C.-A. (2020). Detection of homicide trends in Colombia using machine learning. Revista Facultad de Ingeniería, 29(54). https://dialnet.unirioja.es/servlet/articulo?codigo=7712425
H.-A. Ordoñez-Eraso C.-J. Pardo-Calvache C.-A. Cobos-Lozada 2020Detection of homicide trends in Colombia using machine learningRevista Facultad de Ingeniería2954https://dialnet.unirioja.es/servlet/articulo?codigo=7712425
Raza, D. M., & Victor, D. B. (2021, 25-27 de marzo). Data mining and region prediction based on crime using Random Forest. 2021 International Conference on Artificial Intelligence and Smart Systems (icais) (pp. 980-987). ieee. https://ieeexplore.ieee.org/document/9395989
D. M. Raza D. B. Victor 27,25-27d2021,Data mining and region prediction based on crime using Random Forest2021International Conference on Artificial Intelligence and Smart Systems (icais)980987ieeehttps://ieeexplore.ieee.org/document/9395989
Reier-Forradellas, R. F., Náñez Alonso, S. L., Jorge-Vazquez, J., & Rodriguez, M. L. (2020). Applied machine learning in social sciences: Neural Networks and crime prediction. Social Sciences, 10(1). https://doi.org/10.3390/socsci10010004
R. F. Reier-Forradellas S. L. Náñez Alonso J. Jorge-Vazquez M. L. Rodriguez 2020Applied machine learning in social sciences: Neural Networks and crime predictionSocial Sciences101https://doi.org/10.3390/socsci10010004
Rojas-Guerrero, M., & Grautoff Laverde, M. (2022). Predicción de las masacres en Colombia empleando inteligencia artificial [ Tesis de maestría en Economía Aplicada, Universidad de Los Andes]. https://repositorio.uniandes.edu.co/server/api/core/bitstreams/1726f23e-cd47-4bbc-a4de-182f44eb4ae3/content
M. Rojas-Guerrero M. Grautoff Laverde 2022Predicción de las masacres en Colombia empleando inteligencia artificialTesis de maestría en Economía AplicadaUniversidad de Los Andeshttps://repositorio.uniandes.edu.co/server/api/core/bitstreams/1726f23e-cd47-4bbc-a4de-182f44eb4ae3/content
Rosser, G., Davies, T., Bowers, K. J., Johnson, S. D., & Cheng, T. (2017). Predictive crime mapping: Arbitrary grids or street networks? Journal of Quantitative Criminology, 33, 569-594. https://doi.org/10.1007/s10940-016-9321-x
G. Rosser T. Davies K. J. Bowers S. D. Johnson T. Cheng 2017Predictive crime mapping: Arbitrary grids or street networks?Journal of Quantitative Criminology33569594https://doi.org/10.1007/s10940-016-9321-x
Rumi, S. K., Deng, K., & Salim, F. D. (2018). Crime event prediction with dynamic features. epj Data Science, 7(1). https://doi.org/10.1140/epjds/s13688-018-0171-7
S. K. Rumi K. Deng F. D. Salim 2018Crime event prediction with dynamic featuresepj Data Science71https://doi.org/10.1140/epjds/s13688-018-0171-7
Sánchez-Jabba, A. (2013, enero-junio). La reinvención de Medellín. Lecturas de Economía, (78), 185-227. https://doi.org/10.17533/udea.le.n78a15768
A. Sánchez-Jabba ,en-jun2013,La reinvención de MedellínLecturas de Economía78185227https://doi.org/10.17533/udea.le.n78a15768
Sánchez-Torres, F. J., & Núñez-Méndez, J. A. (2001). Determinantes del crimen violento en un país altamente violento: el caso de Colombia. [Documentos cede 2001-02]. Coyuntura Económica, 31(1). https://www.repository.fedesarrollo.org.co/handle/11445/2098?show=full
F. J. Sánchez-Torres J. A. Núñez-Méndez 2001Determinantes del crimen violento en un país altamente violento: el caso de ColombiaCoyuntura Económica311https://www.repository.fedesarrollo.org.co/handle/11445/2098?show=full
Stalidis, P., Semertzidis, T., & Daras, P. (2021). Examining deep learning architectures for crime classification and prediction. Forecasting, 3(4), 741-762. https://doi.org/10.3390/forecast3040046
P. Stalidis T. Semertzidis P. Daras 2021Examining deep learning architectures for crime classification and predictionForecasting34741762https://doi.org/10.3390/forecast3040046
Sun, Y., Chen, T., & Yin, H. (2023). Spatial-temporal meta-path guided explainable crime prediction. World Wide Web Internet and Web Information Systems, 26, 2237-2263. https://doi.org/10.1007/s11280-023-01137-3
Y. Sun T. Chen H. Yin 2023Spatial-temporal meta-path guided explainable crime predictionWorld Wide Web Internet and Web Information Systems2622372263https://doi.org/10.1007/s11280-023-01137-3
Thuraisingham, B. (2004). Data mining for counter-terrorism. En H. Kargupta, A. Joshi, K. Sivakumar, & Y. Yesha (Eds.), Data Mining: Next Generation Challenges and Future Directions (pp. 157-183). aaai Press.
B. Thuraisingham 2004Data mining for counter-terrorism H. Kargupta A. Joshi K. Sivakumar Y. Yesha Data Mining: Next Generation Challenges and Future Directions157183aaai Press
Tobler, W. R. (1979). Cellular geography. En S. Gale., & G. Olsson (Eds.), Philosophy in Geography. Theory and Decision Library [Series Theory and Decision Library] (pp. 379-386). Springer.
W. R. Tobler 1979Cellular geography S. Gale . Olsson Philosophy in Geography. Theory and Decision Library379386Springer
Varian, H. R. (2014, primavera). Big data: New tricks for econometrics. Journal of Economic Perspectives, 28(2), 3-28. http://dx.doi.org/10.1257/jep.28.2.3
H. R. Varian 2014Big data: New tricks for econometricsJournal of Economic Perspectives282328http://dx.doi.org/10.1257/jep.28.2.3
Wang, S., Cao, J., & Yu, P. S. (2020). Deep learning for spatio-temporal data mining: A survey. ieee Transactions on Knowledge and Data Engineering, 34(8), 3681-3700. https://doi.org/10.1109/tkde.2020.3025580
S. Wang J. Cao P. S. Yu 2020Deep learning for spatio-temporal data mining: A surveyieee Transactions on Knowledge and Data Engineering34836813700https://doi.org/10.1109/tkde.2020.3025580
Weisburd, D., & Green, L. (1995). Policing drug hot spots: The Jersey City drug market analysis experiment. Justice Quarterly, 12(4), 711-735. https://doi.org/10.1080/07418829500096261
D. Weisburd L. Green 1995Policing drug hot spots: The Jersey City drug market analysis experimentJustice Quarterly124711735https://doi.org/10.1080/07418829500096261
Weisburd, D., Maher, L., Sherman, L., Buerger, M., Cohn, E., & Petrosino, A. (2023). Contrasting crime general and crime specific theory: The case of hot spots of crime. En F. A. William, & S. Laufer (Eds.), New Directions in Criminological Theory (Cap. 3, pp. 45-70). Routledge.
D. Weisburd L. Maher L. Sherman M. Buerger E. Cohn A. Petrosino 2023Contrasting crime general and crime specific theory: The case of hot spots of crime F. A. William . Laufer New Directions in Criminological Theory4570Routledge
Wheeler, A. P., & Steenbeek, W. (2021). Mapping the risk terrain for crime using machine learning. Journal of Quantitative Criminology, 37, 445-480. https://doi.org/10.1007/s10940-020-09457-7
A. P. Wheeler W. Steenbeek 2021Mapping the risk terrain for crime using machine learningJournal of Quantitative Criminology37445480https://doi.org/10.1007/s10940-020-09457-7
Yao, S., Wei, M., Yan, L., Wang, C., Dong, X., Liu, F., & Xiong, Y. (2020, 18-22 de agosto). Prediction of crime hotspots based on spatial factors of Random Forest. 15 th International Conference on Computer Science & Education (iccse) (pp. 811-815). ieee. https://ieeexplore.ieee.org/document/9201899
S. Yao M. Wei L. Yan C. Wang X. Dong F. Liu Y. Xiong 22,18-22d2020,Prediction of crime hotspots based on spatial factors of Random Forestth15International Conference on Computer Science & Education(iccse)811815https://ieeexplore.ieee.org/document/9201899
Yi, F., Yu, Z., Zhuang, F., Zhang, X., & Xiong, H. (2018, 17-20 de noviembre). An integrated model for crime prediction using temporal and spatial factors. International Conference on Data Mining (icdm) (pp. 1386-1391). ieee. https://ieeexplore.ieee.org/document/8594999
F. Yi Z. Yu F. Zhuang X. Zhang H. Xiong 20,17-20d2018,An integrated model for crime prediction using temporal and spatial factorsInternational Conference on Data Mining (icdm)13861391ieeehttps://ieeexplore.ieee.org/document/8594999
Zaidi, N. A. S., Mustapha, A., Mostafa, S. A., & Razali, M. N. (2020). A classification approach for crime prediction. En M. I. Khalaf, D. Al-Jumeily, & A. Lisitsa (Eds.), Applied Computing to Support Industry: Innovation and Technology (pp. 68-78) [First International Conference, acrit 2019, Ramadi, Iraq, September 15-16, 2019, Revised Selected Papers]. Springer; acrit 2019. https://doi.org/10.1007/978-3-030-38752-5_6
N. A. S. Zaidi A. Mustapha S. A. Mostafa M. N. Razali 2020A classification approach for crime prediction M. I. Khalaf D. Al-Jumeily A. Lisitsa Applied Computing to Support Industry: Innovation and Technology6878First International Conference, acrit 2019, Ramadi, Iraq, September 15-16, 2019, Revised Selected Papershttps://doi.org/10.1007/978-3-030-38752-5_6
Zhang, X., Liu, L., Lan, M., Song, G., Xiao, L., & Chen, J. (2022, enero). Interpretable machine learning models for crime prediction. Computers, Environment and Urban Systems, 94. https://doi.org/10.1016/j.compen- vurbsys.2022.101789
X. Zhang L. Liu M. Lan G. Song L. Xiao J. Chen 012022,Interpretable machine learning models for crime predictionComputers, Environment and Urban Systems94https://doi.org/10.1016/j.compen- vurbsys.2022.101789
Zhao, X., & Tang, J. (2017, 06-10 noviembre). Modeling temporal-spatial correlations for crime prediction. cikm ‘ 17: Proceedings of the 2017 acm on Conference on Information and Knowledge Management (pp. 497-506). Special Interest Group on Hypertext, Hypermedia and Web (sigweb); Special Interest Group on Information Retrieval (sigir), Singapur. https://dl.acm.org/doi/pdf/10.1145/3132847.3133024
X. Zhao J. Tang ,06-10n2017,Modeling temporal-spatial correlations for crime predictioncikm ‘17Proceedings of the 2017 acm on Conference on Information and Knowledge Management497506Special Interest Group on Hypertext, Hypermedia and Web (sigweb); Special Interest Group on Information Retrieval (sigir)Singapurhttps://dl.acm.org/doi/pdf/10.1145/3132847.3133024
Zou, K. H., Tuncali, K., & Silverman, S. G. (2003). Correlation and simple linear regression. Radiology, 227(3), 617-628. https://doi.org/10.1148/radiol.2273011499
K. H. Zou K. Tuncali S. G. Silverman 2003Correlation and simple linear regressionRadiology2273617628https://doi.org/10.1148/radiol.2273011499
[4]Datos tomados del Global Organized Crime Index 2023, proyecto del Global Initiative Against Transnational Organized Crime (gi-toc), consultados en la página https://ocindex.net/report/2023/0-3-contents.html
[5]Registrando una de las tasas de homicidio más significativas a nivel global en ese momento, con un total de 6809 muertes ese año.
[6]Se definió este tamaño de celda debido a que, si el tamaño de la cuadrícula es demasiado pequeño, la probabilidad de que ocurra un delito en un lugar específico es extremadamente improbable (Lin et al., 2018).
[7]En el caso de Random Forest Classifier, la métrica utilizada para medir la importancia de las características es la reducción en la impureza (Gini impurity o entropía) y la reducción en la función de pérdida (logloss para clasificación) para xgboost.
[8]La seguridad percibida puede afectar la delincuencia, ya que, áreas con altos niveles de inseguridad pueden experimentar mayores tasas de criminalidad.
[9]Los déficit cuantitativo y cualitativo de vivienda pueden estar relacionados con la delincuencia, ya que las condiciones precarias de vivienda pueden influir en la calidad de vida y la propensión al crimen.
[10]Los estratos socioeconómicos y la pobreza multidimensional pueden influir en la delincuencia debido a las disparidades socioeconómicas.
[11]Esto arrojará luz sobre la influencia de las variables predictoras en la variable que busca predecir. El cálculo del valor de la correlación se realiza a través del coeficiente de correlación de Pearson, el cual oscila entre -1 y 1.
[12]El sisben es el Sistema de Identificación de Potenciales Beneficiarios de Programas Sociales, organización que se encarga de clasificar la población según su nivel de vida e ingresos, permitiendo así una asignación más precisa de la inversión social, con el objetivo de dirigirla hacia aquellos que tienen mayores necesidades.
[13]Para encontrar la combinación óptima de hiperparámetros del modelo de apren- dizaje automático, se empleó “RandomizedSearchCV”. Esta herramienta realiza una búsqueda aleatoria de hiperparámetros y evalúa su rendimiento utilizando validación cruzada. En este caso, se aplicó una validación cruzada de 3-folds, dividiendo los datos en subconjuntos de prueba y entrenamiento. Se realizaron 10 iteraciones para identificar la configuración que maximizará el rendimiento según la métrica seleccionada. Para la implementación del modelo de Random Forest classifier (rfc), se seleccionan los siguien- tes hiperparámetros de entrada, teniendo en cuenta que, durante el entrenamiento, el modelo aprenderá a realizar predicciones basadas en las características de entrada para clasificar las categorías: radom_state = 42; n_jobs = 1; class_weight = ‘balanced’; max_depth = 69; n_estimators = 64 y, por último, se definió min_samples_leaf = 132. Lo mencionado previamente se llevó a cabo con el objetivo de potenciar la capacidad predictiva del modelo rfc. Para el modelo de xgboost se tomaron como parámetros: el 0.3 de la tasa de aprendizaje, seguido de n_estimators con un valor de 100; un max_depth = 6, min_child_weigth = 1, un gamma con valor de cero; valores de 0 para el alpha y 1 para el lambda con el fin de controlar la complejidad del modelo y finalmente, se tomó un objetive de ‘binary: logistic’ para clasificación binaria por defecto.
[14]La imputación consiste en estimar o calcular valores para características faltantes o no disponibles en el conjunto de datos actual utilizando información histórica, para esto se utilizan las técnicas de relleno hacia adelante (forward fill) y el relleno hacia atrás (backward fill), los cuales toman los valores disponibles en las filas cercanas en el mismo conjunto de datos en función del tiempo.
[15]El hecho de que rf y el xgboost, aplicado a nivel de barrios, haya superado en precisión al modelo de mco destaca la capacidad de los modelos de machine learning para capturar patrones complejos y no lineales en los datos, especialmente en entornos más detallados.
[16]Esto debido posiblemente a que las personas que enfrentan dificultades eco- nómicas debido al desempleo a menudo experimentan estrés financiero, angustia y desesperación. En algunos casos, estas tensiones pueden llevar a comportamientos delictivos como el robo o el fraude en un intento de aliviar su situación económica.
[17] Goin et al. (2018) en su estudio, afirmaron que la pobreza puede llevar a actividades delictivas como fuente de ingresos y es relevante en la predicción del crimen, concorde a lo que se encontró sobre la pobreza multidimensional.
[18]Una hipótesis sobre este comportamiento sería que, por la falta de oportunidades, acceso limitado a educación de calidad, empleos estables y servicios de salud, entre otros, pueden aumentar las posibilidades de que las personas busquen alternativas para sobrevivir o mejorar su calidad de vida, incluyendo actividades delictivas.
[20] Agradecimientos a mi estimado profesor y jefe, Andrés Felipe García-Suaza. Su guía, apoyo y sabiduría han sido fundamentales en este proceso. Gracias por inspirarme a alcanzar mis metas y por compartir su pasión por el conocimiento. Esta tesis es un reflejo de su dedicación y compromiso con la educación.
[21] Ardila Chávarro, M. C. (2024). Crimen y factores económicos en Medellín: un estudio de predicción con Machine Learning. Revista de Economía del Rosario, 27(2), 1-57. https://doi.org/10.12804/revistas.urosario.edu.co/economia/a.14992