En resumen. Gemini 3.1 Pro gana en razonamiento "puro" (ARC-AGI-2, GPQA) y es el único de los tres que trabaja nativamente con audio y video, no solo con texto e imágenes. Sonnet 5 gana en tarificación predecible de contexto largo y codificación de agentes al estilo SWE-bench. No se debe comparar un solo modelo Gemini, sino dos: explico por qué a continuación.
Ya he escrito un análisis técnico completo de Sonnet 5 —arquitectura, niveles de esfuerzo, benchmarks, limitaciones— en una revisión separada. Aquí, solo una comparación directa con la línea Gemini 3.
Contenido
Dos modelos Gemini en lugar de uno
A diferencia de las comparaciones con GPT-5.5 o Kimi K2.5, aquí no hay un único modelo competidor obvio. La línea Gemini 3 alberga simultáneamente Gemini 3.1 Pro, el modelo insignia de razonamiento lanzado el 19 de febrero de 2026, y Gemini 3.5 Flash, un modelo más económico de mediados de 2026 enfocado específicamente en tareas de agente y código. Comparar Sonnet 5 solo con uno de ellos sería incompleto: Pro es el competidor más cercano en la clase "flagship", Flash es el más cercano en posicionamiento de precio y enfoque en codificación.
Por lo tanto, en adelante, donde se discuta razonamiento profundo y multimodalidad, compararé con Gemini 3.1 Pro. Donde se discuta codificación de agentes y precio, compararé con Gemini 3.5 Flash. Esto no es un intento de "forzar" una comparación favorable en cada sección, sino un reconocimiento honesto de que Google no tiene un análogo directo de Sonnet 5 en el posicionamiento de "segmento medio enfocado en la agencia".
Precio y tarificación de contexto largo
| Modelo |
Entrada (por 1M, ≤200K) |
Salida (por 1M, ≤200K) |
Más de 200K tokens |
| Claude Sonnet 5 |
$2 (luego $3) |
$10 (luego $15) |
Sin recargo |
| Gemini 3.1 Pro |
$2 |
$12 |
Tarifa más alta para toda la solicitud |
| Gemini 3.5 Flash |
$1.50 |
$9 |
— |
A la tarifa base de hasta 200K tokens, Gemini 3.1 Pro y Sonnet 5 (al precio inicial) son casi iguales en tokens de entrada, pero Gemini es más caro en la salida. La diferencia clave está en la mecánica de tarificación del contexto largo: Google tarifica toda la solicitud a una tarifa más alta tan pronto como la entrada supera los 200 mil tokens; es decir, a diferencia de Sonnet 5, donde el precio por token es el mismo en toda la ventana de 1M, Gemini tiene un umbral claro después del cual cada token de la solicitud (no solo los excedentes) cuesta más.
Este es el tercer enfoque diferente para la tarificación de contexto largo que analizo en esta serie de artículos: Sonnet 5 tiene un precio fijo para todo el 1M, GPT-5.5 tiene un umbral en 272K, Gemini 3.1 Pro tiene un umbral en 200K. Si su solicitud típica cruza regularmente el umbral de un proveedor específico, esto afectará su presupuesto más que la diferencia en la tarifa base por token.
Ventana de contexto y multimodalidad
Formalmente, las ventanas de contexto son similares: 1M de tokens en Gemini 3.1 Pro frente a 1M en Sonnet 5, aunque la salida máxima en Gemini es significativamente menor: 64K tokens frente a 128K en Sonnet 5.
La diferencia real no está en el tamaño de la ventana, sino en lo que se puede poner en ella. Gemini 3 es un modelo nativamente multimodal que trabaja con texto, imágenes, audio y video en una sola solicitud. Sonnet 5 acepta texto, imágenes y archivos, pero no audio o video directamente. No se trata de "mejor/peor", sino de una clase diferente de tareas: si necesita analizar una grabación de video de una hora de una reunión o una grabación de audio de una llamada sin una etapa de transcripción separada, Gemini 3.1 Pro técnicamente puede hacerlo en una sola solicitud, mientras que para Sonnet 5 se necesitaría una herramienta de transcripción separada al principio del pipeline. Para más detalles sobre las características de las ventanas de contexto de LLM, lea el artículo Ventana de contexto de LLM: por qué la IA olvida y cuánto cuesta.
Para la gran mayoría de las tareas con las que trabajo en mis propios proyectos (documentos de texto, código, RAG sobre PDF), esta diferencia no es crítica: ambos modelos se desempeñarán igual de bien. Pero si su producto trabaja, aunque sea parcialmente, con audio o video, este es el único criterio en esta comparación que puede cerrar la cuestión incluso antes de considerar los benchmarks.
Benchmarks de programación
| Benchmark |
Claude Sonnet 5 |
Gemini 3.1 Pro |
Gemini 3.5 Flash |
| SWE-bench Pro |
63,2% |
—* |
55,1% |
| SWE-bench Verified |
85,2% |
80,6% |
—* |
| Terminal-Bench 2.1 |
80,4% |
—* |
76,2% |
* Google no ha publicado una cifra comparable para este benchmark y versión específicos; no invento un número que no esté en los materiales oficiales.
En SWE-bench Verified, Sonnet 5 supera a Gemini 3.1 Pro (80,6%) en aproximadamente 4,5 puntos. Con el competidor de precios Gemini 3.5 Flash, la brecha en SWE-bench Pro y Terminal-Bench es ligeramente mayor, 8 y 4 puntos respectivamente, lo cual es lógico, ya que Flash se posiciona claramente como un modelo económico y no como un modelo insignia para codificación.
Importante: Google reconoce explícitamente que en benchmarks de código especializados (Terminal-Bench 2.0, SWE-Bench Pro), los competidores lideran, no Gemini 3.1 Pro. La propia empresa centra sus afirmaciones de liderazgo en benchmarks de razonamiento, no de codificación. Esto concuerda con las cifras anteriores y les añade credibilidad: cuando un laboratorio no reclama el liderazgo en áreas donde pierde, es una buena señal de que las demás cifras declaradas tampoco están manipuladas.
Razonamiento y tareas científicas
Aquí, la ventaja está claramente del lado de Google. En ARC-AGI-2, un benchmark de razonamiento abstracto considerado uno de los más difíciles para los LLM, Gemini 3.1 Pro muestra un 77,1%, lo que supera en más del doble el resultado de la versión anterior Gemini 3 Pro (31,1%). En GPQA Diamond (preguntas científicas a nivel de doctorado), el resultado es del 94,3%.
No hay una cifra comparable directa para Sonnet 5 en ARC-AGI-2 en los materiales oficiales de Anthropic; no puedo comparar estas cifras específicas de manera correcta. Pero la propia priorización de las dos empresas aquí es reveladora: Anthropic optimiza claramente Sonnet 5 para la utilidad de agentes (completar tareas, codificación, uso de computadoras), mientras que Google en este lanzamiento claramente se enfoca en el razonamiento "puro" y las tareas científico-matemáticas. Para equipos de investigación donde la métrica de éxito es la respuesta correcta a una pregunta científica compleja, y no la ejecución de un proceso de negocio de varios pasos, esta es una razón real para considerar Gemini 3.1 Pro en primer lugar.
Capacidades de agente y Google Antigravity
Google promueve las capacidades de agente de Gemini 3 a través de la plataforma separada Antigravity, un entorno donde el modelo controla directamente un editor de código, una terminal y un navegador para la ejecución de tareas de extremo a extremo, conceptualmente similar a lo que Claude hace a través del uso de computadoras y Claude Code.
En OSWorld (uso de computadoras), Gemini 3.1 Pro muestra un 78,4%, cerca del resultado de Sonnet 5 (81,2%) en la misma clase de tareas, con una diferencia de unos pocos puntos. En flujos de trabajo de agentes (MCP Atlas), Gemini declara un 83,6%, aunque no hay un análogo directo de este benchmark en los materiales de Anthropic para compararlo directamente.
En la práctica, ambos ecosistemas ofrecen actualmente un conjunto similar de primitivas de agente: control de navegador, terminal, integraciones MCP. La elección entre ellos en términos de "quién ejecuta mejor una tarea de agente" está ahora más cerca de la paridad que de la diferencia de 5-10 puntos que a menudo se destaca en los materiales de marketing de ambas empresas.
Integración del ecosistema
Este es un factor no técnico pero prácticamente importante que no estaba en la comparación con GPT-5.5 o Kimi. Gemini 3 está profundamente integrado en el ecosistema de Google: Workspace (Docs, Sheets, Gmail), Vertex AI, Android Studio, NotebookLM. Si un equipo ya trabaja en Google Workspace, conectar Gemini no requiere un trabajo de integración separado: el modelo ya está "dentro" de las herramientas familiares.
En mi propia práctica, construyo pipelines de agente sobre Spring AI utilizando varios proveedores de modelos precisamente porque la vinculación a un solo ecosistema es una compensación que vale la pena considerar de antemano. Anthropic, por el contrario, no intenta ser parte de un stack de productividad más amplio: Sonnet 5 está disponible a través de API, Bedrock, Vertex AI, y la integración siempre se realiza en el lado del desarrollador. Para un equipo que ya está profundamente inmerso en Google Workspace, este es un argumento real a favor de Gemini más allá de cualquier benchmark. Para un equipo con un stack de agente independiente y personalizado (como el mío), esta ventaja no tiene importancia: ambos modelos están igualmente disponibles a través de una llamada API normal.
Tabla comparativa resumida
| Criterio |
Ganador |
| Precio por token (tarifa base) |
Paridad aproximada |
| Tarificación de contexto largo |
Claude Sonnet 5 (sin límite) |
| Multimodalidad (audio/vídeo) |
Gemini 3.1 Pro (único de los tres) |
| SWE-bench Verified/Pro |
Claude Sonnet 5 |
| Razonamiento abstracto (ARC-AGI-2, GPQA) |
Gemini 3.1 Pro |
| Uso de computadora (OSWorld) |
Paridad aproximada |
| Integración del ecosistema |
Depende del stack existente del equipo |
Esta tabla deliberadamente no se reduce a un solo ganador más que cualquier otra en este clúster; incluso tiene menos victorias claras que la comparación con GPT-5.5 o Kimi. Esto refleja honestamente la situación: Gemini 3 y Sonnet 5 están optimizados para diferentes prioridades (razonamiento + multimodalidad frente a utilidad de agente + economía predecible), en lugar de competir en la misma categoría.
Qué elegir para tareas multimodales
Si un producto trabaja directamente con video o audio (análisis de grabaciones de reuniones, procesamiento de archivos multimedia sin transcripción separada), Gemini 3.1 Pro es el único de los tres modelos en esta comparación que lo hace de forma nativa con una sola consulta. Aquí la elección no requiere mucha reflexión.
Qué elegir para tareas científicas/de investigación
Para tareas con un alto peso de razonamiento abstracto "puro", como hipótesis científicas, matemáticas complejas, tareas del tipo ARC-AGI-2, las cifras de Gemini 3.1 Pro son más sólidas según los datos oficiales de ambas empresas. Consideraría Gemini 3.1 Pro como la primera opción para flujos de trabajo de investigación, no para agentes de producción.
Qué elegir para codificación de agentes en producción
En SWE-bench Verified/Pro y Terminal-Bench, Sonnet 5 está por delante de ambos modelos Gemini, y la tarificación de contexto largo sin umbral proporciona una economía más predecible para agentes que utilizan activamente una gran ventana de contexto. Para agentes de codificación de producción, comenzaría las pruebas precisamente con Sonnet 5, y mantendría Gemini 3.1 Pro como candidato para tareas donde se necesita un razonamiento más fuerte, no una velocidad bruta de ejecución de cambios de código.
Preguntas frecuentes
¿Con qué modelo de Gemini se debe comparar correctamente Sonnet 5?
Con ambos, dependiendo de la tarea. Gemini 3.1 Pro es un competidor directo en la clase "buque insignia": compárelo con él si le interesa el razonamiento, las tareas científicas o la multimodalidad. Gemini 3.5 Flash es un competidor en posicionamiento de precios y codificación de agentes: compárelo con él si el criterio principal es el costo por token en uso masivo de agentes. No vale la pena tomar un "promedio" entre los dos modelos Gemini como único punto de comparación: esto dará una imagen distorsionada, ya que Pro y Flash están optimizados para diferentes escenarios, y ninguna cifra individual describe a ambos simultáneamente.
¿Funciona Sonnet 5 con video y audio?
No, no los acepta directamente; el modelo se limita a texto, imágenes y entradas de archivos. Gemini 3.1 Pro es el único de los tres modelos en esta comparación con soporte nativo para audio y video en una sola consulta, sin una etapa separada de transcripción o preprocesamiento del archivo multimedia. Si necesita procesar video o audio a través de Sonnet 5, tendrá que agregar una herramienta de transcripción separada (por ejemplo, Whisper o similar) en la entrada de su propio pipeline; esto es técnicamente posible, pero agrega un paso y una dependencia separada que no existe al trabajar directamente con Gemini.
¿Qué modelo es mejor para codificar?
Según los benchmarks oficiales (SWE-bench Verified — 85,2% frente a 80,6%; SWE-bench Pro — 63,2% frente a 55,1% en Gemini 3.5 Flash; Terminal-Bench 2.1 — 80,4% frente a 76,2%), Sonnet 5 está por delante de ambos modelos Gemini con una diferencia de aproximadamente 4-8 puntos dependiendo del benchmark específico. Es importante tener en cuenta el contexto: Google no declara liderazgo en estos benchmarks de codificación especializados y centra sus afirmaciones de marketing en los indicadores de razonamiento; es decir, esta no es una imagen contradictoria, sino coherente desde ambos lados. Si la codificación es el escenario de uso principal, comenzaría las pruebas precisamente con Sonnet 5, no con los modelos Gemini.
¿Tiene Gemini un recargo por contexto largo?
Sí, y esta es una de las diferencias más prácticas en esta comparación. Tan pronto como la consulta de entrada excede el umbral de 200 mil tokens, Google tarifa *toda* la consulta a una tasa más alta, no solo los tokens por encima del umbral. Sonnet 5 no tiene este umbral en absoluto: el precio por token es el mismo en toda la ventana de 1 millón de tokens, desde el primero hasta el último. Este es el tercer enfoque diferente para la tarificación de contexto largo entre los modelos que analizo en esta serie de artículos (GPT-5.5 tiene un umbral de 272 mil). Consecuencia práctica: si sus consultas típicas cruzan regularmente la marca de 200K, calcule no el precio nominal por token, sino el costo esperado de una consulta típica teniendo en cuenta el umbral, de lo contrario, el presupuesto para Gemini puede resultar mayor de lo que parece a primera vista en la lista de precios.
Lea también: