Claude Sonnet 5: revisión completa del modelo Anthropic

Actualizado:
Preguntarle a la IA sobre este artículo
Claude Sonnet 5: revisión completa del modelo Anthropic
TL;DR. Claude Sonnet 5 es el modelo de nivel Sonnet más potente de Anthropic, lanzado el 30 de junio de 2026. Su rendimiento se acerca al de Opus 4.8, pero cuesta significativamente menos: $2/$10 por millón de tokens de entrada/salida hasta el 31 de agosto de 2026 (luego $3/$15). La ventana de contexto es de 1 millón de tokens, con una salida máxima de 128K tokens. Su principal ventaja es una mejor relación precio/rendimiento en tareas de agente (codificación, trabajo con herramientas, uso de computadora) en comparación con su predecesor Sonnet 4.6 y competidores como GPT-5.5.

Contenido

Novedades en Claude Sonnet 5

El 30 de junio de 2026, Anthropic lanzó Claude Sonnet 5, un modelo que la compañía denomina directamente como el más "agente" de su línea Sonnet. Esta es una formulación importante: si las generaciones anteriores de Sonnet (3.5, 3.6, 3.7) abrieron la era de la codificación de agentes, y los logros de agentes más notables del último año se obtuvieron con modelos de nivel Opus, Sonnet 5 devuelve este liderazgo al segmento de precio medio.

Según datos oficiales de Anthropic, Sonnet 5 mejora significativamente el rendimiento en comparación con Sonnet 4.6 en razonamiento, trabajo con herramientas, codificación y tareas de conocimiento (knowledge work), y su rendimiento se acerca al de Opus 4.8, siendo considerablemente más económico. El modelo se convirtió inmediatamente en el predeterminado para los planes Free y Pro de Claude.ai y está disponible en Max, Team, Enterprise, Claude Code y a través de la API de Claude bajo el identificador claude-sonnet-5.

Otro cambio significativo es el tokenizador actualizado (similar al que apareció en Opus 4.7): el mismo texto ahora puede convertirse en un mayor número de tokens, aproximadamente 1.0–1.35 veces dependiendo del tipo de contenido. Anthropic afirma que el precio inicial se ha ajustado para que la transición sea aproximadamente neutral en costos.

Arquitectura del modelo

Sonnet 5 se basa en el mismo concepto que las generaciones anteriores de Claude: una arquitectura de pensamiento adaptativo (adaptive thinking), donde el modelo asigna dinámicamente un "presupuesto de razonamiento" a la complejidad de una consulta específica, en lugar de utilizar una profundidad de razonamiento fija para cualquier tarea. En Sonnet 5, este mecanismo ha recibido un rango ampliado de niveles de esfuerzo (effort levels): low, medium, high, max y un nuevo nivel superior xhigh (extra high).

Técnicamente, el nivel de esfuerzo es un parámetro de la consulta que controla cuántos tokens se permite que el modelo gaste en razonamiento interno (tokens de pensamiento) antes de generar la respuesta final, y con qué agresividad verifica sus propios pasos intermedios en el ciclo del agente. En los niveles inferiores (low, medium), el modelo está optimizado para velocidad y costo, adecuado para clasificación, respuestas cortas y llamadas a herramientas simples. En los niveles superiores (high, max, xhigh), gasta más tokens en análisis paso a paso, verificación repetida de la lógica y exploración del contexto antes de la acción, lo que afecta directamente la calidad en escenarios de agente complejos, pero aumenta proporcionalmente el costo y la latencia de la consulta.

Es importante comprender la mecánica de selección: el nivel de esfuerzo no es un interruptor entre "diferentes modelos" dentro de Sonnet 5, sino un parámetro del mismo checkpoint que cambia el presupuesto computacional durante la inferencia. Este es un enfoque fundamentalmente diferente en comparación con cuando el equipo elegía entre Sonnet y Opus como dos modelos separados; ahora, el mismo checkpoint puede manejar tareas de alto volumen y bajo costo, así como tareas complejas que antes requerían pasar a un modelo más caro. Una descripción detallada del parámetro se encuentra en la documentación de la API de Claude sobre niveles de esfuerzo.

Anthropic ilustra el efecto económico de este enfoque en gráficos de costo-rendimiento para dos evaluaciones: búsqueda de agente BrowseComp (el modelo debe buscar información de forma autónoma en la web, construyendo una cadena de consultas y refinamientos) y uso de computadora OSWorld-Verified (el modelo controla un entorno de escritorio real: abre aplicaciones, hace clic, completa formularios). En ambos benchmarks, la curva de Sonnet 5 se encuentra significativamente por encima de la curva de Sonnet 4.6 en cualquier nivel de gasto, lo que significa que no es simplemente "un modelo nuevo más caro pero mejor", sino una mejora estricta en la frontera de costo-rendimiento. En el nivel de esfuerzo máximo (xhigh), Sonnet 5 se acerca en tareas individuales al rendimiento de Opus 4.8, operando en un nivel de esfuerzo medio-alto, aunque ejecutar Sonnet 5 en xhigh puede ser más caro que Opus 4.8 en un nivel comparable; por lo tanto, para las tareas más difíciles, Opus 4.8 con un nivel de esfuerzo más bajo sigue siendo a menudo la opción económicamente más viable.

Un consejo práctico para sistemas de producción: no fije un nivel de esfuerzo globalmente para toda la aplicación. Es más inteligente enrutar las consultas dinámicamente: mantenga las llamadas a herramientas simples y la clasificación en low/medium, y eleve las complejas cadenas de agentes de múltiples pasos (refactorización, uso de computadora, tareas de investigación) a high o max solo cuando la complejidad de la tarea lo justifique.

A nivel de modalidades e interfaces, Sonnet 5 admite entradas de texto, gráficos (visión) y archivos, salidas estructuradas con esquema JSON, caché de prompts, búsqueda web integrada y uso de computadora completo: control del navegador y la terminal como parte del ciclo del agente, donde el modelo decide cuándo llamar a una herramienta y cuándo continuar razonando. Para escenarios en los que el agente realiza acciones potencialmente peligrosas (ejecución de código, interacción con sistemas externos), Sonnet 5 tiene activados por defecto los salvaguardas cibernéticos en tiempo real: un circuito separado que monitorea y bloquea patrones de uso explícitamente maliciosos durante la inferencia, sin necesidad de un filtro adicional por parte del desarrollador.

Nuevas capacidades de programación

Los cambios más notables para los desarrolladores no se refieren al "conocimiento de lenguajes de programación", donde la diferencia entre generaciones de modelos hace tiempo que no es lo principal, sino al comportamiento del modelo durante el trabajo prolongado y de múltiples pasos en el código. Esto lo confirman tanto los benchmarks como las mediciones independientes en IDEs reales.

Según las cifras publicadas, en SWE-bench Verified, Sonnet 5 muestra un 85,2%, un salto significativo respecto a Sonnet 4.6. En la variante más compleja y resistente a la contaminación de SWE-bench Pro (tareas de repositorios activamente mantenidos sin fugas en los datos de entrenamiento), el resultado es del 63,2%, cinco puntos por encima de Sonnet 4.6 (58,1%) y seis puntos por debajo de Opus 4.8 (69,2%). Es importante no mezclar estas dos variantes del benchmark: Verified y Pro miden diferente complejidad de tareas, y comparar un número de uno con un número de otro no es correcto.

El resultado en Terminal-Bench 2.1 es particularmente digno de atención: un benchmark que verifica la ejecución de tareas realistas de línea de comandos en un entorno contenedorizado: instalación de dependencias, ejecución de conjuntos de pruebas, trabajo con configuraciones. Sonnet 5 obtiene aquí un 80,4%, superior al rendimiento del propio Opus 4.8 (74,6%). Este es el primer caso registrado en el que un modelo de nivel Sonnet supera a un modelo Opus superior en el mismo hardware de la misma generación, y el trabajo en terminal ha sido históricamente una fortaleza de la línea Sonnet desde los tiempos de 3.5 y 3.6.

La confirmación independiente de la mejora directa proviene de CursorBench, un benchmark interno del equipo de Cursor medido en su hardware de producción: Sonnet 5 muestra un 57% frente al 49% de Sonnet 4.6, el mayor aumento entre lanzamientos consecutivos de Sonnet que Cursor ha registrado.

Según los comentarios de los primeros socios de Anthropic, Sonnet 5 completa tareas complejas con más frecuencia allí donde las versiones anteriores de Sonnet se detenían a mitad de camino, y verifica de forma autónoma su propio resultado sin una solicitud explícita. En uno de los ejemplos citados, el modelo, al investigar un error, escribió una prueba que reproducía el problema sin instrucciones adicionales, implementó una corrección y luego la revirtió temporalmente (stash) para confirmar que sin la corrección el error realmente volvía.

Esto concuerda con las observaciones de los ingenieros que probaron el modelo en código "brownfield": condiciones de carrera, pruebas ocultas, secciones de código que nadie quiere tocar. Según Domenic Elm, ingeniero fundador de uno de los socios de acceso temprano, el modelo rastrea mejor la causa raíz real del error en dicho código en lugar de parchear el síntoma, y no solo propone la solución visible más rápida.

Una consecuencia práctica para los equipos: si el principal cuello de botella hoy son precisamente las tareas de agente de terminal (scripts de CI, automatización de DevOps, trabajo con Docker), vale la pena probar Sonnet 5 como una alternativa completa a Opus 4.8 en este escenario específico; según las cifras oficiales, aquí no solo alcanza al buque insignia, sino que lo supera con un costo de token significativamente menor.

Capacidades de agente

La agentividad es la tesis central del lanzamiento, y es aquí donde la diferencia entre Sonnet 5 y Sonnet 4.6 es mayor en cifras absolutas. El modelo es capaz de construir un plan de acción, utilizar herramientas como el navegador y la terminal, y operar de forma autónoma a un nivel que hace unos meses requería modelos más grandes y caros.

En OSWorld-Verified, un benchmark de uso de computadora donde el modelo controla un entorno de escritorio real (abre aplicaciones, completa formularios, navega por interfaces que nunca antes había visto), Sonnet 5 obtiene un 81,2%, acercándose mucho a Opus 4.8 (83,4%). En la búsqueda de agente BrowseComp, que requiere la construcción de una cadena de consultas web de refinamiento para responder a una pregunta fáctica compleja, el resultado es del 84,7%.

El resultado más inesperado se observa en GDPval-AA v2, un benchmark de trabajo de conocimiento económicamente significativo (informes analíticos, documentos profesionales, tareas de negocios): Sonnet 5 obtiene 1.618 Elo frente a 1.615 de Opus 4.8. La diferencia de tres puntos es estadísticamente insignificante y se encuentra dentro del margen de error de la medición, pero el simple hecho de que un modelo de precio medio haya igualado por primera vez al buque insignia de la generación en tareas de conocimiento es una señal importante de cómo Anthropic ve el posicionamiento de Sonnet 5 dentro de la línea.

Un ejemplo ilustrativo de autonomía de agente del anuncio oficial: a un equipo se le asignó un proceso de negocio de dos pasos: actualizar los niveles de suscripción de los clientes en Salesforce y enviar un anuncio de lanzamiento a los contactos corporativos. Anteriormente, tareas similares se detenían a mitad de camino; Sonnet 5 completó el proceso de forma autónoma, sin intervención humana intermedia. Un patrón similar lo describe un representante del proveedor de flujos de trabajo de seguros Pace: el modelo selecciona secuencialmente la acción correcta y la ejecuta rápidamente en tareas de recepción de solicitudes, primera notificación de siniestro y procesamiento de informes de siniestros, precisamente la clase de trabajo de múltiples pasos con el navegador y sistemas internos que mide OSWorld-Verified.

A nivel de seguridad del comportamiento del agente, Anthropic también señala avances: el modelo rechaza mejor las solicitudes maliciosas y es más resistente a los intentos de secuestro de control a través de inyección de prompts, lo cual es crítico para escenarios de agente donde el modelo lee y procesa de forma autónoma contenido externo potencialmente hostil (páginas, documentos, respuestas de API) como parte de su ciclo de trabajo. El nivel de alucinaciones y sico-fanía (adaptación excesiva al usuario) también es menor que en Sonnet 4.6, y los salvaguardas cibernéticos en tiempo real están activados por defecto: un circuito que monitorea y bloquea patrones de uso explícitamente maliciosos durante la inferencia.

Cabe tener en cuenta los límites de las capacidades: en el corredor más difícil de tareas de agente (SWE-bench Pro, escenarios xhigh más complejos), Opus 4.8 todavía lidera con una ventaja de seis puntos. Sonnet 5 no reemplaza completamente a Opus 4.8; traslada el umbral de autonomía de agente "suficientemente buena" a un nivel de precio significativamente más bajo, dejando el buque insignia para casos donde el costo del error es mayor que la diferencia en el costo del token.

Trabajo con contexto largo

Claude Sonnet 5 trabaja con una ventana de contexto de 1 millón de tokens, y este no es un modo opcional, sino el valor predeterminado y máximo a la vez: no existe una variante separada del modelo con un contexto más estrecho, a diferencia de algunas generaciones anteriores donde el contexto de 1 millón se activaba con un encabezado beta separado. El volumen máximo de salida es de 128K tokens en consultas normales (hasta 300K a través del modo beta extendido Batch API).

La diferencia fundamental con el enfoque de algunos competidores es la ausencia de un recargo por la longitud de la consulta: una consulta de 900 mil tokens se tarifa al mismo precio por token que una consulta de 9 mil. La ventana de contexto incluye todo lo que entra en la consulta y se genera en la respuesta: prompt del sistema, historial de mensajes, resultados de llamadas a herramientas, imágenes y documentos, así como los tokens gastados por el modelo en razonamiento interno (pensamiento extendido); es decir, no hay pensamiento "gratuito" fuera del presupuesto de contexto.

Para sesiones de agente prolongadas, donde el historial de diálogo y los resultados intermedios de las herramientas llenan gradualmente la ventana, Sonnet 5 admite la conciencia de contexto (context awareness): el modelo rastrea automáticamente el saldo de su presupuesto de tokens durante la conversación y recibe actualizaciones después de cada llamada a herramienta (por ejemplo, Token usage: 35000/1000000; 965000 remaining), lo que le permite planificar por sí mismo cuánto contexto aún se puede gastar en investigar el problema y cuánto dejar para la respuesta final. Para casos en los que la conversación se acerca al límite de la ventana, la plataforma ofrece compresión de contexto del lado del servidor (context compaction) como estrategia principal para gestionar flujos de trabajo de agente largos, sin necesidad de recortar manualmente el historial en el lado de la aplicación.

La economía del contexto largo mejora significativamente gracias al prompt caching: la reutilización de un prefijo grande y estable (instrucciones del sistema, plantilla de documento, contexto de la base de código) cuesta significativamente menos que un token de entrada normal; la lectura de la caché se tarifa a una tasa significativamente más baja que el token de entrada base, lo que en la práctica puede generar hasta un 90% de ahorro en contexto repetido. Para tareas masivas no urgentes, también está disponible la Batch API con un descuento del 50% en tokens de entrada y salida.

Para tareas prácticas, esto significa la posibilidad de cargar en una sola consulta una gran base de código, un documento técnico extenso o un paquete completo de materiales legales para su análisis, sin dividirlo en fragmentos y sin penalización en el precio por el tamaño de la consulta. Uno de los ejemplos de uso citados por Anthropic es el trabajo de investigación legal, donde el contexto largo y la relación precio/rendimiento hicieron que la migración al nuevo modelo fuera una solución obvia para el equipo.

Un matiz técnico a tener en cuenta al planificar: debido al nuevo tokenizador, el mismo texto se convierte en aproximadamente un 30% más de tokens que en Sonnet 4.6. Esto no reduce la capacidad efectiva de la ventana en tokens (sigue siendo de 1 millón), pero reduce cuánto texto cabe realmente en la misma ventana; por lo tanto, los límites de max_tokens establecidos para Sonnet 4.6 deben recalcularse, no transferirse directamente.

Claude Sonnet 5: revisión completa del modelo Anthropic

Velocidad de generación

Anthropic no publica un punto de referencia independiente de "tokens por segundo" en su comunicado de prensa, sino que se centra en otro aspecto de la velocidad: la velocidad de consecución de resultados en un ciclo de agente: la misma calidad de salida en menos pasos. Según los comentarios de uno de los equipos que utiliza el modelo en agentes analíticos para el procesamiento de datos, Sonnet 5 "piensa" en pasos más compactos, lo que reduce directamente el tiempo para obtener información: una diferencia que sienten los usuarios finales del producto.

Para evaluar la velocidad de generación "bruta", vale la pena consultar rastreadores independientes, ya que estas métricas dependen de la infraestructura de alojamiento y pueden variar entre la API de Anthropic, AWS Bedrock y Google Vertex AI. Según las mediciones de Artificial Analysis para la configuración con el nivel de esfuerzo máximo (xhigh), el modelo genera alrededor de 73,7 tokens por segundo, lo que está por debajo de la mediana (80,7 t/s) entre los modelos de razonamiento de un segmento de precio comparable. El tiempo hasta el primer token (TTFT) en esta configuración es significativamente superior a la mediana, una consecuencia directa de que, en el nivel de esfuerzo máximo, el modelo primero gasta un presupuesto considerable en razonamiento interno antes de comenzar a generar una respuesta visible.

Conclusión práctica para los desarrolladores: estas cifras se refieren específicamente a la configuración xhigh y no reflejan el comportamiento típico del modelo en los niveles de esfuerzo low o medium, donde tanto el TTFT como el rendimiento son significativamente mejores. El nivel de esfuerzo influye directamente en la velocidad percibida: si la latencia es crítica para el producto (por ejemplo, una interfaz de chat en tiempo real), vale la pena probar conscientemente niveles de esfuerzo más bajos en lugar del modo adaptativo predeterminado, en lugar de basarse en puntos de referencia tomados con el esfuerzo máximo.

Costo de la API

Período Tokens de entrada (por 1M) Tokens de salida (por 1M)
Precio de lanzamiento (hasta el 31.08.2026) $2 $10
Precio estándar (a partir del 01.09.2026) $3 $15

En comparación, Opus 4.8 cuesta $5 por millón de tokens de entrada y $25 por millón de tokens de salida, lo que significa que incluso al precio estándar, Sonnet 5 sigue siendo notablemente más barato con un rendimiento similar en algunas tareas. Anthropic también anunció un aumento en los límites de tasa en Chat, Cowork, Claude Code y Claude Platform para compensar el mayor consumo de tokens en niveles de esfuerzo altos.

Vale la pena considerar el matiz del tokenizador: el mismo texto después de cambiar a Sonnet 5 puede requerir entre un 0 y un 35% más de tokens. Esto no es un aumento de precio oculto: el precio de lanzamiento está diseñado precisamente para compensar este efecto, pero al planificar el presupuesto, es mejor incluir esta diferencia en los cálculos.

Pruebas de programación

Según los datos publicados inmediatamente después del lanzamiento, Sonnet 5 muestra un crecimiento significativo en la codificación de agentes: según TechCrunch, en uno de los puntos de referencia, el modelo obtiene un 63,2% frente al 69,2% de Opus 4.8 y el 58,1% de Sonnet 4.6, lo que significa que la brecha con el modelo insignia se ha reducido significativamente en comparación con la generación anterior.

El mayor salto se registró en Terminal-bench, una evaluación que verifica la ejecución de tareas de varios pasos en una terminal real: según informes basados en materiales de lanzamiento oficiales, la métrica aumentó aproximadamente 20 puntos en comparación con Sonnet 4.6. Esto se correlaciona directamente con lo que describen los primeros probadores: el modelo mantiene el enfoque en tareas complejas durante más tiempo y realiza investigaciones más exhaustivas de la base de código antes de realizar cambios.

Advertencia importante: Opus 4.8 sigue siendo la mejor opción para tareas donde la máxima precisión es crítica, especialmente en niveles de esfuerzo altos. Sonnet 5 no intenta reemplazar a Opus, sino que amplía el rango de compromisos disponibles entre precio y calidad.

Pruebas de análisis de documentos

Anthropic no ha publicado un punto de referencia público específico para el "análisis de documentos" para Sonnet 5; aquí, los datos más reveladores son cualitativos más que cuantitativos. En el ejemplo de un bufete de abogados, el equipo señaló que Sonnet 5 muestra los mejores resultados precisamente en investigación y análisis legal, y fue la relación precio-calidad lo que hizo que la transición al nuevo modelo fuera una decisión obvia.

En la práctica, para tareas de trabajo con documentos extensos (contratos, documentación técnica, archivos), los factores clave siguen siendo: una ventana de contexto de 1 millón de tokens sin recargo por longitud, soporte para entradas de archivos y gráficos, y la posibilidad de aumentar el nivel de esfuerzo para casos de análisis más complejos. Si se necesitan métricas numéricas reproducibles para escenarios RAG y document-QA, es sensato ejecutar su propio conjunto de documentos a través de un pipeline de evaluación, en lugar de depender únicamente de puntos de referencia generales de agentes.

Por esta misma razón, no me baso únicamente en puntos de referencia de otros al evaluar un nuevo modelo para document QA: en mi propio proyecto AskYourDocs, una plataforma autoalojada para trabajar con documentos basada en Spring AI, Ollama y pgvector, aplico regularmente nuevos modelos a pipelines RAG reales de clientes. Un caso ilustrativo que ya describí: para un cliente abogado con un archivo de documentos escaneados, la calidad de extracción de respuestas aumentó del 17% al 50% solo cambiando el enfoque de OCR y embeddings, y son precisamente estos experimentos prácticos, y no los puntos de referencia generales de agentes, los que dan una imagen real de cómo se comporta el modelo en archivos escaneados "sucios", y no en conjuntos de datos de texto limpios.

Cuando esté disponible el acceso a Claude Sonnet 5 en el pipeline de producción de AskYourDocs, planeamos ejecutar el mismo conjunto de documentos reales y comparar la precisión de las respuestas con los modelos anteriores; agregaré los resultados aquí como una actualización separada.

Limitaciones del modelo

  • No supera a Opus 4.8 en las tareas más complejas. En SWE-bench Pro, la variante más difícil y resistente a la contaminación del benchmark de código, la brecha con el buque insignia es de seis puntos (63,2% frente al 69,2%). Esta es una brecha sistémica, no aleatoria: en el nivel de esfuerzo más alto (xhigh), Sonnet 5 puede ser incluso más caro que Opus 4.8 con un nivel de esfuerzo comparable, sin alcanzar su calidad; es decir, para tareas al límite de las capacidades del modelo, "ajustar" Sonnet 5 con configuraciones máximas no siempre es económicamente justificable.
  • Capacidades cibernéticas más débiles, intencionalmente. Anthropic informa directamente que el modelo tiene una capacidad significativamente menor para realizar tareas de ciberseguridad en comparación con los modelos Opus actuales. En una prueba conjunta con Mozilla de desarrollo de exploits en vulnerabilidades reales de Firefox 147, Sonnet 5 no creó un exploit completamente funcional ni una sola vez. Matiz importante: Sonnet 5 está incluido en el Cyber ​​Verification Program, un programa de acceso verificado para organizaciones con tareas legítimas de prueba de ciberseguridad, pero incluso dentro de este programa, Anthropic recomienda oficialmente Opus 4.8 para trabajos de ciberseguridad que requieren guardarraíles reducidos. Es decir, esta es una división consciente de la línea por propósito, no un descuido en el entrenamiento.
  • Cambio de costo debido al nuevo tokenizador. Según datos oficiales de Anthropic, el mismo texto de entrada se convierte en aproximadamente un 30% más de tokens que en Sonnet 4.6 (rango 1.0-1.35× dependiendo del tipo de contenido: el lenguaje natural se convierte de manera diferente al código o a los datos estructurados). Esto no es un cambio oculto en la política de precios: el precio de lanzamiento de $2/$10 está diseñado para que la transición sea aproximadamente neutral en costos, pero después del 31 de agosto, cuando entre en vigor la tarifa estándar de $3/$15, el efecto del tokenizador se sumará al aumento del precio base, y el aumento total del costo de la solicitud puede ser más notable de lo que parece a primera vista.
  • Ausencia de benchmarks específicos para document QA y escritura. Anthropic no publica métricas numéricas estandarizadas específicamente para el análisis de documentos o la calidad de la escritura editorial; estas categorías están parcialmente cubiertas por benchmarks generales de knowledge work (por ejemplo, GDPval-AA v2), pero no hay una correspondencia directa de "número del comunicado de prensa → calidad en mis documentos". Para estos escenarios, tendrá que confiar en sus propias pruebas con datos reales, en lugar de cifras oficiales.
  • Precio de introducción temporal. Después del 31 de agosto de 2026, el costo de los tokens aumenta un 50% (de $2/$10 a $3/$15 por millón de tokens de entrada/salida). Para los equipos que planifican presupuestos para finales de 2026, esto debe incluirse en los cálculos con anticipación, y no como una sorpresa en la factura de septiembre.
  • No hay Priority Tier. A diferencia de algunos otros modelos de la línea, para Sonnet 5, el Priority Tier no está disponible actualmente: un nivel de servicio con rendimiento garantizado y procesamiento prioritario de solicitudes durante los períodos de alta carga. Para sistemas de producción con requisitos estrictos de latencia en momentos de tráfico pico, esta puede ser una limitación práctica que debe verificarse antes de la transición.

Conclusión: ¿qué significa esto en la práctica?

Ninguna de las limitaciones enumeradas anula el valor principal del lanzamiento: una mejor economía en la gran mayoría de las tareas de agentes y codificación. Pero en conjunto, definen un perímetro claro donde Sonnet 5 no es un reemplazo universal para todo lo que se usaba anteriormente:

  • Para tareas al límite de la complejidad (los escenarios de agentes más difíciles, pruebas de ciberseguridad con restricciones mínimas), Opus 4.8 sigue siendo la opción correcta, tanto por indicación directa de Anthropic como por las cifras de los benchmarks.
  • Para presupuestar la transición, es importante calcular no el "precio por token", sino el "precio por tarea": el efecto del nuevo tokenizador (+30% de tokens) y la finalización del período de introducción (+50% a la tarifa después del 31 de agosto) se suman, y el cambio total en el costo de una solicitud típica puede diferir significativamente de lo que muestra una lista de precios desnuda.
  • Para escenarios sin benchmarks oficiales (document QA, escritura), la única forma confiable de tomar una decisión es ejecutar su propio conjunto de tareas reales en ambos modelos en paralelo, en lugar de confiar en las cifras generales de agentes del comunicado de prensa.

Conclusión práctica para un equipo que decide si migrar o no: Sonnet 5 debe considerarse como el modelo predeterminado para nuevos flujos de trabajo de producción, pero con una prueba A/B obligatoria en tareas reales antes de la migración completa, especialmente donde antes se usaba Opus y se planea ahorrar precisamente reduciendo el nivel del modelo.

Cuándo Sonnet 5 es mejor que GPT-5.5

GPT-5.5 de OpenAI se lanzó antes, el 23 de abril de 2026, y también se posiciona como un modelo de agente para codificación, trabajo con computadoras y knowledge work. Ningún laboratorio ha publicado oficialmente una comparación directa de benchmarks "uno a uno" entre Sonnet 5 y GPT-5.5: los modelos se evaluaron en diferentes conjuntos de benchmarks y en diferentes momentos, por lo que cualquier comparación directa de cifras debe tomarse con precaución.

Donde la comparación es correcta e inequívoca es en el precio. GPT-5.5 cuesta $5 por millón de tokens de entrada y $30 por millón de tokens de salida. Sonnet 5, incluso al precio estándar ($3/$15), resulta entre 1,7 y 2 veces más barato, y al precio de lanzamiento ($2/$10), entre 2,5 y 3 veces más barato. Ambos modelos tienen una ventana de contexto de 1 millón de tokens, por lo que en este parámetro están igualados.

Conclusión práctica: si el presupuesto para tokens es una limitación real (flujos de trabajo de agentes de alta frecuencia, solicitudes RAG masivas, automatización de producción), Sonnet 5 ofrece una economía significativamente mejor con un nivel comparable de capacidades de agente. Si la prioridad es exclusivamente la máxima precisión en las tareas más complejas, independientemente del costo, vale la pena probar ambos modelos (y Opus 4.8) en su propio conjunto de tareas.

Comparación detallada de benchmarks con cifras específicas para codificación, búsqueda de agentes y uso de computadoras, en un artículo separado: Claude Sonnet 5 vs GPT-5.5: comparación detallada

Claude Sonnet 5: revisión completa del modelo Anthropic

A quién le conviene migrar

Aquí no solo hablaré desde la perspectiva del análisis de benchmarks ajenos, sino también desde mi propia experiencia migrando modelos a sistemas de producción; he pasado por esto varias veces en mis pipelines RAG en Spring AI, y los criterios a continuación son las mismas preguntas que me hago antes de cualquier cambio a un nuevo modelo.

  • Equipos con Sonnet 4.6. Esta es una actualización directa y casi gratuita en términos de esfuerzo: el aumento en tareas de agente es sustancial, y el precio inicial para el período de transición compensa el efecto del nuevo tokenizador. Migraría sin pensarlo mucho, pero con una prueba A/B obligatoria en una docena de tareas reales antes de cambiar completamente a producción; así es como verifico cualquier cambio de modelo en mis propios pipelines, y nunca ha sido innecesario.
  • Equipos con Opus 4.8, donde el presupuesto es una limitación. Si las tareas actuales no requieren la máxima precisión, probaría Sonnet 5 con un alto nivel de esfuerzo: el ahorro puede ser sustancial con una pérdida aceptable de calidad. En mi práctica personal, veo regularmente que para el 60-70% de las tareas reales, "el modelo más caro disponible" es excesivo, y la diferencia de calidad es imperceptible para el usuario final.
  • Agentes de producción y automatización. Flujos de trabajo de varios pasos (actualización de CRM, procesamiento de tickets, uso de computadora) son precisamente el escenario donde Anthropic demuestra un aumento más notable, y es precisamente allí donde personalmente espero el mayor beneficio en mis proyectos, donde los agentes realizan acciones secuenciales con sistemas externos, en lugar de simplemente responder a una pregunta.
  • Equipos con GPT-5.5, sensibles al costo de los tokens. Probaría Sonnet 5 como una alternativa económica en mis propias tareas, especialmente si la ventana de contexto de 1M de tokens es un requisito crítico. La diferencia de precio aquí no es marginal, sino varias veces mayor; para mí, esta es siempre la primera señal para probar una alternativa, incluso si la solución actual es formalmente aceptable.
  • A quién aún le falta tiempo para migrar: equipos con tareas que requieren la máxima precisión al límite de las capacidades del modelo (matemáticas complejas, escenarios de agente más difíciles), aquí, en mi opinión, Opus 4.8 sigue siendo la mejor opción, y yo mismo no cambiaría un pipeline Opus que funciona de manera confiable por un ahorro donde el costo de un error es mayor que la diferencia en el costo de los tokens.

Mi regla general para cualquier cambio de modelo en producción: primero, una prueba paralela en tareas reales, y solo después, una migración completa. Los benchmarks del comunicado de prensa dan una idea de dónde mirar, pero siempre tomo la decisión final basándome en mis propios datos, no en cifras ajenas.

Preguntas frecuentes

¿Cuál es el precio de Claude Sonnet 5 a través de la API?
$2 por millón de tokens de entrada y $10 por millón de tokens de salida hasta el 31 de agosto de 2026, luego $3/$15.

¿Qué identificador de modelo debo usar en la API?
claude-sonnet-5. Más detalles en la documentación oficial de los modelos Claude.

¿Es Claude Sonnet 5 un reemplazo para Claude Opus 4.8?
No. Sonnet 5 reduce significativamente la brecha con Opus 4.8 en tareas de agente a un precio considerablemente menor, pero en los escenarios más complejos que requieren la máxima precisión, Opus 4.8 sigue siendo la mejor opción.

¿Cuál es la ventana de contexto de Claude Sonnet 5?
1M de tokens de entrada, hasta 128K tokens de salida, sin cargo adicional por contexto largo.

¿Necesito cambiar los prompts después de migrar de Sonnet 4.6?
No hay una necesidad directa, pero debido al tokenizador actualizado, vale la pena recalcular el presupuesto de tokens y probar los flujos de trabajo críticos antes de la migración completa a producción.


Lea también: