Microsoft lanzó un framework estable de Agent Skills para Python el 15 de julio. Permite a los desarrolladores integrar capacidades solo cuando un agente impulsado por LLM realmente las necesita. Al sustituir un único y creciente system prompt por la carga de habilidades bajo demanda, este enfoque reduce el tamaño del prompt, recorta los costes de tokens y mantiene el razonamiento del agente más claro.

Por qué los prompts se inflan y por qué es importante

Los agentes de LLM dependen de un "system prompt" que agrupa políticas, runbooks y material de referencia que el modelo debe ver en cada turno. Si se añaden unos cuantos documentos de políticas, el prompt se infla hasta alcanzar varios miles de tokens. Los prompts más grandes aumentan los costes de inferencia —cada token que el modelo procesa se factura— y diluyen la señal de instrucción, haciendo que la respuesta del agente sea más difusa. En el triaje de incidentes o en la verificación de cumplimiento, un prompt impreciso puede convertir a un asistente útil en una fuente de desinformación.

El patrón Agent Skills: divulgación progresiva

El nuevo framework sustituye el prompt monolítico por un flujo de trabajo de cuatro pasos:

  1. Anunciar la habilidad – una entrada de metadatos ligera que indica a la capa de enrutamiento el nombre de la habilidad.
  2. Cargar instrucciones – una descripción concisa que el agente lee para decidir si la habilidad coincide con la solicitud.
  3. Leer recursos – archivos de políticas o de referencia opcionales que se obtienen solo después de que el agente selecciona la habilidad.
  4. Ejecutar scripts – ejecución de código que lleva a cabo la acción, condicionada por una aprobación explícita.

Solo el breve archivo SKILL.md reside en el prompt principal. Todos los documentos y scripts de mayor tamaño se encuentran en un paquete de habilidades basado en archivos que el entorno de ejecución (runtime) carga bajo demanda. La estructura de directorios se mantiene sencilla:

  • SKILL.md – descripción breve legible por humanos.
  • references/ – archivos de políticas o guías.
  • scripts/ – código ejecutable.

Debido a que el agente nunca ve el contenido completo de references/ o scripts/ hasta que ha decidido que la habilidad es la adecuada, el prompt principal se mantiene ligero sin importar cuántas habilidades registre.

Salvaguardas de seguridad integradas en el framework

El framework asume que la carga de una habilidad puede ser riesgosa y aplica reglas que los desarrolladores deben seguir:

  • Anuncio del nombre de la habilidad – automático, utilizado únicamente para el enrutamiento.
  • Carga de instrucciones – automática para listas curadas; las instrucciones no revisadas pueden cambiar el comportamiento de forma involuntaria.
  • Lectura de políticas – automática cuando los datos no son sensibles; mantenga el material sensible tras controles de acceso adicionales.
  • Ejecución de scripts – siempre requiere aprobación explícita. Un script mueve al agente de la "sugerencia" a la "acción", por lo que debe intervenir un humano o una comprobación de políticas.
  • Llamadas a sistemas externos – deben realizarse a través de herramientas separadas con permisos limitados; una habilidad en sí misma no es un mecanismo de autorización.

Estas reglas impulsan a los desarrolladores a comenzar con flujos de trabajo de solo lectura —triaje de incidentes, consulta de políticas, consultas de estado— antes de intentar acciones orientadas a la escritura, como actualizaciones de bases de datos o despliegues de código.

Higiene operativa: registro y versionado

Cuando se ejecuta una habilidad, el framework fomenta (y muchos despliegues exigen) el registro de:

  • La solicitud original y el ID de la habilidad elegida.
  • La versión del paquete de la habilidad utilizada.
  • Si el agente cargó solo la descripción o también obtuvo un archivo de recursos.
  • La decisión de aprobación para la ejecución del script.
  • Todos los argumentos de la herramienta suministrados y los resultados devueltos.

Si el agente selecciona la habilidad incorrecta, convierta ese error de selección en un caso de prueba. Eso crea una comprobación de regresión antes de que la habilidad llegue a producción.

Trate cada habilidad como una dependencia versionada con un límite claro, no como una carpeta suelta de prompts. El versionado le permite revertir un script defectuoso sin alterar el resto de la base de conocimientos del agente.

Primeros pasos: una lista de verificación pragmática

  1. Elija un flujo de trabajo de solo lectura – por ejemplo, "consultar las últimas directrices de incidentes de seguridad".
  2. Empaquete las instrucciones y los scripts por separado – mantenga SKILL.md corto; guarde los archivos de políticas pesados en references/.
  3. Cree un catálogo curado – mantenga una lista de habilidades aprobadas y exija la aprobación obligatoria para cualquier script.
  4. Establezca límites de sandbox – defina restricciones de CPU, memoria y red para la ejecución de scripts; registre cada ejecución.
  5. Realice un benchmark frente al antiguo mega-prompt – compare el uso de tokens, la latencia y las tasas de éxito para confirmar el ahorro de costes.

Qué observar a continuación

El lanzamiento de Microsoft es actualmente una implementación estable para Python.

En resumen

Agent Skills permite que los asistentes impulsados por LLM se mantengan ligeros mientras acceden a una biblioteca creciente de políticas y scripts. Al cargar únicamente la descripción al inicio y solicitar los recursos pesados solo cuando sea necesario, los prompts se mantienen cortos, los costos de inferencia disminuyen y el razonamiento del agente se mantiene enfocado.