La IA de código abierto se ha convertido en un vasto ecosistema donde un solo producto puede extraer código de docenas de repositorios, depender de datos de entrenamiento de múltiples fuentes y ejecutarse en configuraciones de hardware especializado que pocos equipos documentan por completo. Hacer un seguimiento de estas dependencias es difícil. Comprender qué partes de ese stack están expuestas a internet es aún más complicado. El lanzamiento por parte de Current AI del Open Source AI Gap Map v0.1 intenta poner algo de orden en ese caos, y los equipos de seguridad deberían considerarlo una lectura obligatoria.
El índice cataloga 421 productos de IA de código abierto. Los divide en cuatro categorías: modelos de IA, conjuntos de datos (datasets), herramientas de software y hardware. En el fondo, todo el proyecto funciona con 1,184 archivos YAML que rastrean más de 16,000 repositorios de GitHub. Esa brecha entre 421 productos y 16,000 repositorios cuenta su propia historia. La mayoría de las aplicaciones de IA no son monolitos autónomos. Son ensamblajes de motores de inferencia, scripts de ajuste fino (fine-tuning), cargadores de datos, bancos de pruebas de evaluación (benchmarks) y capas de controladores (drivers), cada uno alojado en su propio repositorio con sus propios mantenedores, historiales de commits y perfiles de vulnerabilidad.
Current AI publicó el conjunto de datos bajo una licencia MIT y lo hizo completamente público. Ese es precisamente el objetivo. Cualquiera puede descargarlo, analizar el YAML y construir herramientas sobre él. Para los defensores, esa accesibilidad es una oportunidad. Para los atacantes, es igualmente conveniente.
Qué es lo que realmente rastrea el mapa
La mayoría de las organizaciones que utilizan IA no tienen un inventario claro de lo que han desplegado. Un equipo podría descargar un modelo de lenguaje de un hub popular, instalar algunos paquetes de Python para ejecutarlo y dar el trabajo por terminado. Pero debajo de ese flujo de trabajo tan sencillo se encuentra un conjunto anidado de dependencias. Los pesos del modelo provienen de un repositorio. La configuración del tokenizador proviene de otro. El framework de inferencia podría ser un fork de un tercer proyecto. Los controladores CUDA y las imágenes de contenedores provienen de aún más fuentes.
El Gap Map captura esto organizando sus 1,184 archivos YAML en torno a 421 productos de IA distintos. Los más de 16,000 repositorios de GitHub mapeados aquí representan el código, las configuraciones y los artefactos reales que hacen que esos productos funcionen. Al separar las entradas en modelos, datasets, herramientas de software y hardware, el índice obliga a plantearse una pregunta básica: ¿sabe usted cuál de estas cuatro capas tocan realmente sus sistemas?
Si está ejecutando un modelo de lenguaje extenso (LLM) de código abierto en producción, es probable que esté tocando las cuatro. Depende de los pesos y la arquitectura del modelo. Depende de los datasets utilizados para el preentrenamiento o el ajuste fino, incluso si nunca los descargó directamente. Depende de herramientas de software para convertir, cuantizar o servir el modelo. Y si está ejecutando en GPUs o aceleradores especializados, depende de firmware y pilas de controladores que entran en la categoría de hardware.
La espada de doble filo de la seguridad
Este conjunto de datos sirve a dos señores, y los líderes de seguridad deben entender ambas partes.
En el lado defensivo, el Gap Map funciona como una guía telefónica para su cadena de suministro de IA. Puede comparar los repositorios y herramientas de los que depende su organización con este índice y detectar brechas en su visibilidad. Si un repositorio crítico aparece en el mapa pero no en su lista de materiales de software (SBOM), es probable que haya encontrado infraestructura de IA en la sombra (shadow AI). Es algo que conviene saber antes de que un adversario lo encuentre por usted.
En el lado ofensivo, el conjunto de datos es oro puro para el reconocimiento. Los atacantes escanean constantemente en busca de infraestructura de IA expuesta, endpoints de servicio de modelos y dependencias vulnerables en pipelines de ML populares. El Gap Map les proporciona una lista estructurada y legible por máquina de objetivos, organizada exactamente por las categorías que les interesan. Un solo analizador de YAML puede extraer miles de URLs de repositorios y, desde ahí, un atacante puede cruzar vulnerabilidades conocidas, buscar instancias públicas mal configuradas o identificar objetivos de alto valor para ataques de confusión de dependencias.
Debido a que los datos tienen licencia MIT y son públicos, no hay barreras de entrada. Sin suscripciones, sin procesos de aprobación. Esa elección de diseño maximiza la utilidad para investigadores y defensores, pero también maximiza la utilidad para los actores de amenazas. El mismo archivo que le ayuda a fortalecer su stack ayuda a otra persona a construir una lista de objetivos.
Qué hacer con esta información
Trate este conjunto de datos exactamente como trataría una fuente de inteligencia de amenazas. No lo guarde en marcadores para olvidarse de él. Realice una comprobación activa en su entorno.
Start by pulling a list of every open-source AI component your teams currently use. Look beyond the obvious. Ask which repositories supply your tokenizers, your evaluation scripts, your quantization libraries, and your container base images. Then check those repositories against the 16,000 tracked in the Gap Map. If you find matches, you have confirmed that your dependencies live in one of the most prominently indexed corners of the open-source AI world. That prominence cuts both ways. It usually means active maintenance and community scrutiny, but it also means attackers know these repositories exist.
Next, look at the YAML structure itself. Each of the 1,184 files connects products to their underlying repositories in a standardized format. You can write a simple script to compare your dependency manifests, package lists, or SBOM exports against these mappings. If you discover that your production stack relies on repositories you had never heard of, dig deeper. Unknown dependencies are where supply chain attacks hide.
Pay special attention to the hardware layer. Security teams often focus on software and models while treating drivers and firmware as background noise. The Gap Map explicitly indexes hardware-related repositories, which should remind you that GPU driver stacks, compiler toolchains, and accelerator firmware are code too. They have bugs. They get updated. And when they are out of date, they can be the softest target in your pipeline.
Finally, use the
