Mejoras en skill-creator: probar, medir y perfeccionar las Agent Skills

Los autores de Skills ahora pueden verificar que sus Skills funcionan, detectar regresiones y mejorar las descripciones.

Skill-creator ahora te ayuda a escribir evals, ejecutar benchmarks y mantener tus Skills funcionando a medida que los modelos evolucionan. Estas actualizaciones ya están disponibles en Claude.ai y Cowork, como plugin para Claude Code y en nuestro repositorio.

Desde el lanzamiento de las Skills de agentes el pasado mes de octubre, hemos notado que la mayoría de los autores son expertos en la materia, no ingenieros. Conocen sus flujos de trabajo, pero no cuentan con las herramientas para saber si una Skill sigue funcionando con un modelo nuevo, si se activa cuando debería o si realmente mejoró tras una edición.

Hoy anunciamos mejoras en el creador de Skills que ayudan a los autores a crear con más confianza. Estamos aplicando parte del rigor del desarrollo de software (pruebas, benchmarking y mejora iterativa) a la creación de Skills sin que nadie tenga que escribir código. 

Dos tipos de Skills

Las Skills generalmente se dividen en dos categorías:

Las Skills de aumento de capacidades capacidad ayudan a Claude a hacer algo que el modelo base no puede hacer, o no puede hacer de forma consistente. Nuestras Skills de creación de documentos son buenos ejemplos. Codifican técnicas y patrones que producen mejores resultados que solo usando prompts.

Las Skills de preferencias codificadas documentan flujos de trabajo en los que Claude ya puede hacer cada parte, pero la skill las ordena según el proceso de tu equipo. Ejemplos: una skill que guía la revisión de un NDA según criterios establecidos, o una que redacta actualizaciones semanales con datos de varios MCP.

Esta distinción es importante porque estos dos tipos de Skills pueden necesitar pruebas por diferentes razones:

  • Las Skills de mejora de capacidades pueden ser menos necesarias a medida que mejoren los modelos. Las evals te indican cuando eso ha sucedido. 
  • Las Skills de preferencias codificadas son más duraderas, pero solo tan valiosas como su fidelidad a tu flujo de trabajo real. Las evals verifican esa fidelidad. 

En cualquier caso, las pruebas convierten una skill que parece funcionar en una que sabes que funciona. 

Uso de evaluaciones para probar y mejorar Skills

El Skill-creator ahora te ayuda a escribir evaluaciones, que son pruebas que comprueban que Claude haga lo que esperas para un prompt determinado. Si has escrito tests de software, esto te resultará familiar: define algunos prompts de prueba (más archivos si es necesario), describe cómo debería verse un buen resultado, y skill-creator te dice si la Skill se sostiene.

Nuestra skill de PDF, por ejemplo, antes tenía dificultades para procesar formularios no rellenables. Claude tuvo que colocar texto en coordenadas exactas sin campos definidos que sirvieran de guía. Evals aisló el fallo y lanzamos una corrección que ancla el posicionamiento a las coordenadas de texto extraídas.

__wf_reserved_inherit

Las evals ayudan de muchas formas, pero dos usos importantes son detectar regresiones de calidad y comprender el progreso del modelo.

Primero, detectar regresiones en la calidad. A medida que los modelos y la infraestructura que los rodea evolucionan, una skill que funcionó bien el mes pasado podría comportarse de forma diferente hoy. Ejecutar evals con un modelo nuevo te da una señal temprana cuando algo cambia, antes de que afecte al trabajo de tu equipo. 

Segundo, saber cuándo las capacidades generales del modelo han superado tu skill. Esto se aplica principalmente a las Skills de mejora de capacidades. Si el modelo base empieza a superar tus evals sin la Skill cargada, es una señal de que las técnicas de la Skill pueden haberse incorporado al comportamiento predeterminado del modelo. La skill no está rota, solo que ya no es necesaria.

También hemos añadido un modo benchmark que ejecuta una evaluación estandarizada con tus evals. Es algo que puedes ejecutar después de actualizaciones del modelo o mientras iteras sobre la propia Skill. Realiza un seguimiento de la tasa de aprobación de la eval, el tiempo transcurrido y el uso de tokens.

__wf_reserved_inherit

Tus evaluaciones y resultados permanecen contigo. Almacénalos localmente, intégralos con un panel o conéctalos a un sistema de CI.

Evaluación más rápida y coherente con soporte multiagente

Ejecutar evaluaciones secuencialmente puede ser lento y la acumulación de contexto puede filtrarse entre una prueba y otra. Skill-creator ahora despliega agentes independientes para ejecutar evals en paralelo gracias a la compatibilidad multiagente, cada uno se ejecuta en un contexto limpio, con sus propias métricas de tokens y tiempo. Resultados más rápidos, sin contaminación cruzada.

También hemos añadido agentes de comparación para realizar comparaciones A/B: dos versiones de Skills, o skill frente a sin skill. Juzgan los resultados sin saber cuál es cuál, para que puedas saber si un cambio realmente ayudó.

__wf_reserved_inherit

Obtener Skills para activar en el momento adecuado

Las evals miden la calidad del resultado, pero eso solo importa si tu skill se activa cuando debería. A medida que aumenta el número de Skills, la precisión de la descripción se vuelve crucial: si es demasiado amplia, obtienes activaciones falsas; si es demasiado restrictiva, nunca se activa. Skill-creator ahora te ayuda a ajustar las descripciones para lograr una activación más fiable: analiza tu descripción actual frente a prompts de ejemplo y sugiere cambios que reducen tanto los falsos positivos como los falsos negativos.

Lo ejecutamos en nuestras Skills de creación de documentos y observamos una mejora en la activación en 5 de las 6 skills públicas.

__wf_reserved_inherit

Mirando hacia adelante

A medida que los modelos mejoran, la línea entre "skill" y "especificación" podría difuminarse. Hoy en día, un archivo SKILL.md es esencialmente un plan de implementación que ofrece instrucciones detalladas para indicarle a Claude cómo hacer algo. Con el tiempo, una descripción en lenguaje natural de lo que la skill debería hacer puede ser suficiente, mientras el modelo se encarga del resto.

El marco de evaluación que publicamos hoy es un paso en esa dirección. Las evaluaciones ya describen el "qué". Con el tiempo, esa descripción puede ser la skill en sí.

Primeros pasos

Todas las actualizaciones del creador de Skills ya están disponibles en Claude.ai y Cowork. Pide a Claude que use el skill-creator para empezar.

Los usuarios de Claude Code pueden instalar el plugin o descargarlo desde nuestro repositorio.

No se encontraron elementos.
Anterior
0/5
Next
Libro electrónico

Preguntas frecuentes

No se encontraron elementos.

Transforma la forma en que opera tu organización con Claude

Ver tarifas
Contactar con ventas

Recibir el boletín para desarrolladores

Actualizaciones de productos, guías prácticas, aspectos destacados de la comunidad y más. Enviado mensualmente a tu bandeja de entrada.

Suscribirse

Indica tu dirección de correo electrónico si quieres recibir nuestro boletín mensual para desarrolladores. Puedes cancelar tu suscripción en cualquier momento

¡Gracias! Está suscrito.
Lo sentimos, hubo un problema con su envío, inténtelo de nuevo más tarde.
Claude Code