Mejoras en skill-creator: probar, medir y perfeccionar las Agent Skills
Los autores de Skills ahora pueden verificar que sus Skills funcionan, detectar regresiones y mejorar las descripciones.
Los autores de Skills ahora pueden verificar que sus Skills funcionan, detectar regresiones y mejorar las descripciones.
Skill-creator ahora te ayuda a escribir evals, ejecutar benchmarks y mantener tus Skills funcionando a medida que los modelos evolucionan. Estas actualizaciones ya están disponibles en Claude.ai y Cowork, como plugin para Claude Code y en nuestro repositorio.
Desde el lanzamiento de las Skills de agentes el pasado mes de octubre, hemos notado que la mayoría de los autores son expertos en la materia, no ingenieros. Conocen sus flujos de trabajo, pero no cuentan con las herramientas para saber si una Skill sigue funcionando con un modelo nuevo, si se activa cuando debería o si realmente mejoró tras una edición.
Hoy anunciamos mejoras en el creador de Skills que ayudan a los autores a crear con más confianza. Estamos aplicando parte del rigor del desarrollo de software (pruebas, benchmarking y mejora iterativa) a la creación de Skills sin que nadie tenga que escribir código.
Las Skills generalmente se dividen en dos categorías:
Las Skills de aumento de capacidades capacidad ayudan a Claude a hacer algo que el modelo base no puede hacer, o no puede hacer de forma consistente. Nuestras Skills de creación de documentos son buenos ejemplos. Codifican técnicas y patrones que producen mejores resultados que solo usando prompts.
Las Skills de preferencias codificadas documentan flujos de trabajo en los que Claude ya puede hacer cada parte, pero la skill las ordena según el proceso de tu equipo. Ejemplos: una skill que guía la revisión de un NDA según criterios establecidos, o una que redacta actualizaciones semanales con datos de varios MCP.
Esta distinción es importante porque estos dos tipos de Skills pueden necesitar pruebas por diferentes razones:
En cualquier caso, las pruebas convierten una skill que parece funcionar en una que sabes que funciona.
El Skill-creator ahora te ayuda a escribir evaluaciones, que son pruebas que comprueban que Claude haga lo que esperas para un prompt determinado. Si has escrito tests de software, esto te resultará familiar: define algunos prompts de prueba (más archivos si es necesario), describe cómo debería verse un buen resultado, y skill-creator te dice si la Skill se sostiene.
Nuestra skill de PDF, por ejemplo, antes tenía dificultades para procesar formularios no rellenables. Claude tuvo que colocar texto en coordenadas exactas sin campos definidos que sirvieran de guía. Evals aisló el fallo y lanzamos una corrección que ancla el posicionamiento a las coordenadas de texto extraídas.

Las evals ayudan de muchas formas, pero dos usos importantes son detectar regresiones de calidad y comprender el progreso del modelo.
Primero, detectar regresiones en la calidad. A medida que los modelos y la infraestructura que los rodea evolucionan, una skill que funcionó bien el mes pasado podría comportarse de forma diferente hoy. Ejecutar evals con un modelo nuevo te da una señal temprana cuando algo cambia, antes de que afecte al trabajo de tu equipo.
Segundo, saber cuándo las capacidades generales del modelo han superado tu skill. Esto se aplica principalmente a las Skills de mejora de capacidades. Si el modelo base empieza a superar tus evals sin la Skill cargada, es una señal de que las técnicas de la Skill pueden haberse incorporado al comportamiento predeterminado del modelo. La skill no está rota, solo que ya no es necesaria.
También hemos añadido un modo benchmark que ejecuta una evaluación estandarizada con tus evals. Es algo que puedes ejecutar después de actualizaciones del modelo o mientras iteras sobre la propia Skill. Realiza un seguimiento de la tasa de aprobación de la eval, el tiempo transcurrido y el uso de tokens.

Tus evaluaciones y resultados permanecen contigo. Almacénalos localmente, intégralos con un panel o conéctalos a un sistema de CI.
Ejecutar evaluaciones secuencialmente puede ser lento y la acumulación de contexto puede filtrarse entre una prueba y otra. Skill-creator ahora despliega agentes independientes para ejecutar evals en paralelo gracias a la compatibilidad multiagente, cada uno se ejecuta en un contexto limpio, con sus propias métricas de tokens y tiempo. Resultados más rápidos, sin contaminación cruzada.
También hemos añadido agentes de comparación para realizar comparaciones A/B: dos versiones de Skills, o skill frente a sin skill. Juzgan los resultados sin saber cuál es cuál, para que puedas saber si un cambio realmente ayudó.

Las evals miden la calidad del resultado, pero eso solo importa si tu skill se activa cuando debería. A medida que aumenta el número de Skills, la precisión de la descripción se vuelve crucial: si es demasiado amplia, obtienes activaciones falsas; si es demasiado restrictiva, nunca se activa. Skill-creator ahora te ayuda a ajustar las descripciones para lograr una activación más fiable: analiza tu descripción actual frente a prompts de ejemplo y sugiere cambios que reducen tanto los falsos positivos como los falsos negativos.
Lo ejecutamos en nuestras Skills de creación de documentos y observamos una mejora en la activación en 5 de las 6 skills públicas.

A medida que los modelos mejoran, la línea entre "skill" y "especificación" podría difuminarse. Hoy en día, un archivo SKILL.md es esencialmente un plan de implementación que ofrece instrucciones detalladas para indicarle a Claude cómo hacer algo. Con el tiempo, una descripción en lenguaje natural de lo que la skill debería hacer puede ser suficiente, mientras el modelo se encarga del resto.
El marco de evaluación que publicamos hoy es un paso en esa dirección. Las evaluaciones ya describen el "qué". Con el tiempo, esa descripción puede ser la skill en sí.
Todas las actualizaciones del creador de Skills ya están disponibles en Claude.ai y Cowork. Pide a Claude que use el skill-creator para empezar.
Los usuarios de Claude Code pueden instalar el plugin o descargarlo desde nuestro repositorio.
Recibir el boletín para desarrolladores
Actualizaciones de productos, guías prácticas, aspectos destacados de la comunidad y más. Enviado mensualmente a tu bandeja de entrada.