TL;DR. Claude Sonnet 5 es el modelo de nivel Sonnet más potente de Anthropic, lanzado el 30 de junio de 2026. Su rendimiento se acerca al de Opus 4.8, pero cuesta significativamente menos: $2/$10 por millón de tokens de entrada/salida hasta el 31 de agosto de 2026 (luego $3/$15). La ventana de contexto es de 1 millón de tokens, con una salida máxima de 128K tokens. Su principal ventaja es una mejor relación precio/rendimiento en tareas de agente (codificación, trabajo con herramientas, uso de computadora) en comparación con su predecesor Sonnet 4.6 y competidores como GPT-5.5.
Contenido
- Novedades en Claude Sonnet 5
- Arquitectura del modelo
- Nuevas capacidades de programación
- Capacidades de agente
- Trabajo con contexto largo
- Velocidad de generación
- Costo de la API
- Pruebas de programación
- Pruebas de análisis de documentos
- Limitaciones del modelo
- Cuándo Sonnet 5 es mejor que GPT-5.5
- Quién debería migrar
- Preguntas frecuentes
Novedades en Claude Sonnet 5
El 30 de junio de 2026, Anthropic lanzó Claude Sonnet 5, un modelo que la compañía denomina directamente como el más "agente" de su línea Sonnet. Esta es una formulación importante: si las generaciones anteriores de Sonnet (3.5, 3.6, 3.7) abrieron la era de la codificación de agentes, y los logros de agentes más notables del último año se obtuvieron con modelos de nivel Opus, Sonnet 5 devuelve este liderazgo al segmento de precio medio.
Según datos oficiales de Anthropic, Sonnet 5 mejora significativamente el rendimiento en comparación con Sonnet 4.6 en razonamiento, trabajo con herramientas, codificación y tareas de conocimiento (knowledge work), y su rendimiento se acerca al de Opus 4.8, siendo considerablemente más económico. El modelo se convirtió inmediatamente en el predeterminado para los planes Free y Pro de Claude.ai y está disponible en Max, Team, Enterprise, Claude Code y a través de la API de Claude bajo el identificador claude-sonnet-5.
Otro cambio significativo es el tokenizador actualizado (similar al que apareció en Opus 4.7): el mismo texto ahora puede convertirse en un mayor número de tokens, aproximadamente 1.0–1.35 veces dependiendo del tipo de contenido. Anthropic afirma que el precio inicial se ha ajustado para que la transición sea aproximadamente neutral en costos.
Arquitectura del modelo
Sonnet 5 se basa en el mismo concepto que las generaciones anteriores de Claude: una arquitectura de pensamiento adaptativo (adaptive thinking), donde el modelo asigna dinámicamente un "presupuesto de razonamiento" a la complejidad de una consulta específica, en lugar de utilizar una profundidad de razonamiento fija para cualquier tarea. En Sonnet 5, este mecanismo ha recibido un rango ampliado de niveles de esfuerzo (effort levels): low, medium, high, max y un nuevo nivel superior xhigh (extra high).
Técnicamente, el nivel de esfuerzo es un parámetro de la consulta que controla cuántos tokens se permite que el modelo gaste en razonamiento interno (tokens de pensamiento) antes de generar la respuesta final, y con qué agresividad verifica sus propios pasos intermedios en el ciclo del agente. En los niveles inferiores (low, medium), el modelo está optimizado para velocidad y costo, adecuado para clasificación, respuestas cortas y llamadas a herramientas simples. En los niveles superiores (high, max, xhigh), gasta más tokens en análisis paso a paso, verificación repetida de la lógica y exploración del contexto antes de la acción, lo que afecta directamente la calidad en escenarios de agente complejos, pero aumenta proporcionalmente el costo y la latencia de la consulta.
Es importante comprender la mecánica de selección: el nivel de esfuerzo no es un interruptor entre "diferentes modelos" dentro de Sonnet 5, sino un parámetro del mismo checkpoint que cambia el presupuesto computacional durante la inferencia. Este es un enfoque fundamentalmente diferente en comparación con cuando el equipo elegía entre Sonnet y Opus como dos modelos separados; ahora, el mismo checkpoint puede manejar tareas de alto volumen y bajo costo, así como tareas complejas que antes requerían pasar a un modelo más caro. Una descripción detallada del parámetro se encuentra en la documentación de la API de Claude sobre niveles de esfuerzo.
Anthropic ilustra el efecto económico de este enfoque en gráficos de costo-rendimiento para dos evaluaciones: búsqueda de agente BrowseComp (el modelo debe buscar información de forma autónoma en la web, construyendo una cadena de consultas y refinamientos) y uso de computadora OSWorld-Verified (el modelo controla un entorno de escritorio real: abre aplicaciones, hace clic, completa formularios). En ambos benchmarks, la curva de Sonnet 5 se encuentra significativamente por encima de la curva de Sonnet 4.6 en cualquier nivel de gasto, lo que significa que no es simplemente "un modelo nuevo más caro pero mejor", sino una mejora estricta en la frontera de costo-rendimiento. En el nivel de esfuerzo máximo (xhigh), Sonnet 5 se acerca en tareas individuales al rendimiento de Opus 4.8, operando en un nivel de esfuerzo medio-alto, aunque ejecutar Sonnet 5 en xhigh puede ser más caro que Opus 4.8 en un nivel comparable; por lo tanto, para las tareas más difíciles, Opus 4.8 con un nivel de esfuerzo más bajo sigue siendo a menudo la opción económicamente más viable.
Un consejo práctico para sistemas de producción: no fije un nivel de esfuerzo globalmente para toda la aplicación. Es más inteligente enrutar las consultas dinámicamente: mantenga las llamadas a herramientas simples y la clasificación en low/medium, y eleve las complejas cadenas de agentes de múltiples pasos (refactorización, uso de computadora, tareas de investigación) a high o max solo cuando la complejidad de la tarea lo justifique.
A nivel de modalidades e interfaces, Sonnet 5 admite entradas de texto, gráficos (visión) y archivos, salidas estructuradas con esquema JSON, caché de prompts, búsqueda web integrada y uso de computadora completo: control del navegador y la terminal como parte del ciclo del agente, donde el modelo decide cuándo llamar a una herramienta y cuándo continuar razonando. Para escenarios en los que el agente realiza acciones potencialmente peligrosas (ejecución de código, interacción con sistemas externos), Sonnet 5 tiene activados por defecto los salvaguardas cibernéticos en tiempo real: un circuito separado que monitorea y bloquea patrones de uso explícitamente maliciosos durante la inferencia, sin necesidad de un filtro adicional por parte del desarrollador.
Nuevas capacidades de programación
Los cambios más notables para los desarrolladores no se refieren al "conocimiento de lenguajes de programación", donde la diferencia entre generaciones de modelos hace tiempo que no es lo principal, sino al comportamiento del modelo durante el trabajo prolongado y de múltiples pasos en el código. Esto lo confirman tanto los benchmarks como las mediciones independientes en IDEs reales.
Según las cifras publicadas, en SWE-bench Verified, Sonnet 5 muestra un 85,2%, un salto significativo respecto a Sonnet 4.6. En la variante más compleja y resistente a la contaminación de SWE-bench Pro (tareas de repositorios activamente mantenidos sin fugas en los datos de entrenamiento), el resultado es del 63,2%, cinco puntos por encima de Sonnet 4.6 (58,1%) y seis puntos por debajo de Opus 4.8 (69,2%). Es importante no mezclar estas dos variantes del benchmark: Verified y Pro miden diferente complejidad de tareas, y comparar un número de uno con un número de otro no es correcto.
El resultado en Terminal-Bench 2.1 es particularmente digno de atención: un benchmark que verifica la ejecución de tareas realistas de línea de comandos en un entorno contenedorizado: instalación de dependencias, ejecución de conjuntos de pruebas, trabajo con configuraciones. Sonnet 5 obtiene aquí un 80,4%, superior al rendimiento del propio Opus 4.8 (74,6%). Este es el primer caso registrado en el que un modelo de nivel Sonnet supera a un modelo Opus superior en el mismo hardware de la misma generación, y el trabajo en terminal ha sido históricamente una fortaleza de la línea Sonnet desde los tiempos de 3.5 y 3.6.
La confirmación independiente de la mejora directa proviene de CursorBench, un benchmark interno del equipo de Cursor medido en su hardware de producción: Sonnet 5 muestra un 57% frente al 49% de Sonnet 4.6, el mayor aumento entre lanzamientos consecutivos de Sonnet que Cursor ha registrado.
Según los comentarios de los primeros socios de Anthropic, Sonnet 5 completa tareas complejas con más frecuencia allí donde las versiones anteriores de Sonnet se detenían a mitad de camino, y verifica de forma autónoma su propio resultado sin una solicitud explícita. En uno de los ejemplos citados, el modelo, al investigar un error, escribió una prueba que reproducía el problema sin instrucciones adicionales, implementó una corrección y luego la revirtió temporalmente (stash) para confirmar que sin la corrección el error realmente volvía.
Esto concuerda con las observaciones de los ingenieros que probaron el modelo en código "brownfield": condiciones de carrera, pruebas ocultas, secciones de código que nadie quiere tocar. Según Domenic Elm, ingeniero fundador de uno de los socios de acceso temprano, el modelo rastrea mejor la causa raíz real del error en dicho código en lugar de parchear el síntoma, y no solo propone la solución visible más rápida.
Una consecuencia práctica para los equipos: si el principal cuello de botella hoy son precisamente las tareas de agente de terminal (scripts de CI, automatización de DevOps, trabajo con Docker), vale la pena probar Sonnet 5 como una alternativa completa a Opus 4.8 en este escenario específico; según las cifras oficiales, aquí no solo alcanza al buque insignia, sino que lo supera con un costo de token significativamente menor.
Capacidades de agente
La agentividad es la tesis central del lanzamiento, y es aquí donde la diferencia entre Sonnet 5 y Sonnet 4.6 es mayor en cifras absolutas. El modelo es capaz de construir un plan de acción, utilizar herramientas como el navegador y la terminal, y operar de forma autónoma a un nivel que hace unos meses requería modelos más grandes y caros.
En OSWorld-Verified, un benchmark de uso de computadora donde el modelo controla un entorno de escritorio real (abre aplicaciones, completa formularios, navega por interfaces que nunca antes había visto), Sonnet 5 obtiene un 81,2%, acercándose mucho a Opus 4.8 (83,4%). En la búsqueda de agente BrowseComp, que requiere la construcción de una cadena de consultas web de refinamiento para responder a una pregunta fáctica compleja, el resultado es del 84,7%.
El resultado más inesperado se observa en GDPval-AA v2, un benchmark de trabajo de conocimiento económicamente significativo (informes analíticos, documentos profesionales, tareas de negocios): Sonnet 5 obtiene 1.618 Elo frente a 1.615 de Opus 4.8. La diferencia de tres puntos es estadísticamente insignificante y se encuentra dentro del margen de error de la medición, pero el simple hecho de que un modelo de precio medio haya igualado por primera vez al buque insignia de la generación en tareas de conocimiento es una señal importante de cómo Anthropic ve el posicionamiento de Sonnet 5 dentro de la línea.
Un ejemplo ilustrativo de autonomía de agente del anuncio oficial: a un equipo se le asignó un proceso de negocio de dos pasos: actualizar los niveles de suscripción de los clientes en Salesforce y enviar un anuncio de lanzamiento a los contactos corporativos. Anteriormente, tareas similares se detenían a mitad de camino; Sonnet 5 completó el proceso de forma autónoma, sin intervención humana intermedia. Un patrón similar lo describe un representante del proveedor de flujos de trabajo de seguros Pace: el modelo selecciona secuencialmente la acción correcta y la ejecuta rápidamente en tareas de recepción de solicitudes, primera notificación de siniestro y procesamiento de informes de siniestros, precisamente la clase de trabajo de múltiples pasos con el navegador y sistemas internos que mide OSWorld-Verified.
A nivel de seguridad del comportamiento del agente, Anthropic también señala avances: el modelo rechaza mejor las solicitudes maliciosas y es más resistente a los intentos de secuestro de control a través de inyección de prompts, lo cual es crítico para escenarios de agente donde el modelo lee y procesa de forma autónoma contenido externo potencialmente hostil (páginas, documentos, respuestas de API) como parte de su ciclo de trabajo. El nivel de alucinaciones y sico-fanía (adaptación excesiva al usuario) también es menor que en Sonnet 4.6, y los salvaguardas cibernéticos en tiempo real están activados por defecto: un circuito que monitorea y bloquea patrones de uso explícitamente maliciosos durante la inferencia.
Cabe tener en cuenta los límites de las capacidades: en el corredor más difícil de tareas de agente (SWE-bench Pro, escenarios xhigh más complejos), Opus 4.8 todavía lidera con una ventaja de seis puntos. Sonnet 5 no reemplaza completamente a Opus 4.8; traslada el umbral de autonomía de agente "suficientemente buena" a un nivel de precio significativamente más bajo, dejando el buque insignia para casos donde el costo del error es mayor que la diferencia en el costo del token.
Trabajo con contexto largo
Claude Sonnet 5 trabaja con una ventana de contexto de 1 millón de tokens, y este no es un modo opcional, sino el valor predeterminado y máximo a la vez: no existe una variante separada del modelo con un contexto más estrecho, a diferencia de algunas generaciones anteriores donde el contexto de 1 millón se activaba con un encabezado beta separado. El volumen máximo de salida es de 128K tokens en consultas normales (hasta 300K a través del modo beta extendido Batch API).
La diferencia fundamental con el enfoque de algunos competidores es la ausencia de un recargo por la longitud de la consulta: una consulta de 900 mil tokens se tarifa al mismo precio por token que una consulta de 9 mil. La ventana de contexto incluye todo lo que entra en la consulta y se genera en la respuesta: prompt del sistema, historial de mensajes, resultados de llamadas a herramientas, imágenes y documentos, así como los tokens gastados por el modelo en razonamiento interno (pensamiento extendido); es decir, no hay pensamiento "gratuito" fuera del presupuesto de contexto.
Para sesiones de agente prolongadas, donde el historial de diálogo y los resultados intermedios de las herramientas llenan gradualmente la ventana, Sonnet 5 admite la conciencia de contexto (context awareness): el modelo rastrea automáticamente el saldo de su presupuesto de tokens durante la conversación y recibe actualizaciones después de cada llamada a herramienta (por ejemplo, Token usage: 35000/1000000; 965000 remaining), lo que le permite planificar por sí mismo cuánto contexto aún se puede gastar en investigar el problema y cuánto dejar para la respuesta final. Para casos en los que la conversación se acerca al límite de la ventana, la plataforma ofrece compresión de contexto del lado del servidor (context compaction) como estrategia principal para gestionar flujos de trabajo de agente largos, sin necesidad de recortar manualmente el historial en el lado de la aplicación.
La economía del contexto largo mejora significativamente gracias al prompt caching: la reutilización de un prefijo grande y estable (instrucciones del sistema, plantilla de documento, contexto de la base de código) cuesta significativamente menos que un token de entrada normal; la lectura de la caché se tarifa a una tasa significativamente más baja que el token de entrada base, lo que en la práctica puede generar hasta un 90% de ahorro en contexto repetido. Para tareas masivas no urgentes, también está disponible la Batch API con un descuento del 50% en tokens de entrada y salida.
Para tareas prácticas, esto significa la posibilidad de cargar en una sola consulta una gran base de código, un documento técnico extenso o un paquete completo de materiales legales para su análisis, sin dividirlo en fragmentos y sin penalización en el precio por el tamaño de la consulta. Uno de los ejemplos de uso citados por Anthropic es el trabajo de investigación legal, donde el contexto largo y la relación precio/rendimiento hicieron que la migración al nuevo modelo fuera una solución obvia para el equipo.
Un matiz técnico a tener en cuenta al planificar: debido al nuevo tokenizador, el mismo texto se convierte en aproximadamente un 30% más de tokens que en Sonnet 4.6. Esto no reduce la capacidad efectiva de la ventana en tokens (sigue siendo de 1 millón), pero reduce cuánto texto cabe realmente en la misma ventana; por lo tanto, los límites de max_tokens establecidos para Sonnet 4.6 deben recalcularse, no transferirse directamente.