Google vuelve a reclamar protagonismo en la carrera por los modelos de inteligencia artificial más avanzados. Gemini 4 Argon ha irrumpido con resultados que lo colocan en la parte alta de las principales pruebas de evaluación y que, según los datos publicados por la propia compañía y mediciones independientes, lo sitúan cerca de los modelos más potentes de OpenAI y Anthropic. El problema es que todavía hay una distancia importante entre lo que dicen los benchmarks y lo que puede comprobarse en el uso cotidiano.
Un estreno que llega con resultados espectaculares
Los primeros datos han colocado a Gemini 4 Argon en una posición especialmente llamativa. Artificial Analysis le otorga 53 puntos en su Intelligence Index, la misma puntuación que GPT-6 Astra. Google, por su parte, asegura que su nuevo modelo supera a Opus 5.5 y Fable 5.1 en diferentes evaluaciones internas. Sobre el papel, los resultados apuntan a un salto considerable y permiten a la compañía volver a situarse en la conversación sobre los modelos de frontera.
Sin embargo, todavía no existe acceso generalizado al sistema que permita comprobar esas cifras en condiciones reales. Argon se está poniendo inicialmente a disposición de un grupo limitado de probadores y especialistas en ciberseguridad a través del programa Fairwind, mientras el Gobierno de Estados Unidos también analiza el modelo. Esa disponibilidad restringida hace que, por ahora, buena parte de la valoración dependa de pruebas controladas y de los datos proporcionados por terceros.
Los empleados de Google introducen una dosis de realidad
Las primeras experiencias internas tampoco ofrecen una imagen completamente uniforme. Según informaciones recogidas por Bloomberg, algunos trabajadores de Google consideran que el comportamiento de Gemini 4 Argon en determinadas tareas de programación no está a la altura de lo que sugieren sus resultados en los benchmarks. La compañía rechaza esa interpretación y Sundar Pichai ha defendido que sus equipos están utilizando el modelo de manera intensiva con buenos resultados.
La diferencia entre ambas percepciones pone sobre la mesa uno de los grandes problemas actuales de la evaluación de la inteligencia artificial: un modelo puede destacar en una batería concreta de pruebas y encontrarse con dificultades cuando tiene que desenvolverse en entornos mucho menos previsibles. Programar sobre un repositorio real, trabajar con documentación incompleta o manejar dependencias complejas no se parece necesariamente a resolver una tarea diseñada específicamente para medir una determinada capacidad.

La gran trampa de los benchmarks
Por eso, las cifras de Gemini 4 Argon necesitan contexto. Los benchmarks son útiles para comparar sistemas bajo unas condiciones determinadas, pero no pueden reproducir toda la variedad de situaciones a las que se enfrenta un usuario. Una herramienta puede obtener una puntuación extraordinaria en una prueba de programación o automatización y ofrecer una experiencia menos convincente cuando entra en un flujo de trabajo real.
Algo parecido ocurre con las alucinaciones. Artificial Analysis sitúa a Gemini 4 Argon en un 15% en su prueba AA-Omniscience, frente al 50% de GPT-6 Astra. La diferencia parece enorme, pero el dato no significa necesariamente que uno de los modelos sea cinco veces más fiable. En este caso, parte de la explicación está en que Gemini 4 tiende a reconocer que no dispone de suficiente información en lugar de generar una respuesta cuando no puede asegurarla. Eso reduce las respuestas inventadas, aunque también cambia la forma en la que debe interpretarse el resultado.
Google también juega la carta del precio
La batalla no se limita al rendimiento. Google pretende que Gemini 4 Argon sea competitivo también por coste, especialmente en un momento en el que los modelos se utilizan durante largos periodos para ejecutar tareas complejas y agentes autónomos. El precio promocional inicial será de 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida.
Según las estimaciones de Artificial Analysis, con esas tarifas el modelo puede resultar alrededor de un 40% más barato por tarea que GPT-6 Astra. No obstante, Google tiene previsto elevar posteriormente el precio hasta los 4 dólares por millón de tokens de entrada y los 20 dólares por millón de salida. Esa subida puede cambiar considerablemente la comparación económica para quienes utilizan estos sistemas de manera intensiva.
Gemini 4 Argon, por tanto, devuelve a Google a una carrera de la que durante los últimos meses parecía haberse alejado en términos de percepción pública. Sus resultados iniciales son suficientemente sólidos como para colocarlo de nuevo entre los nombres relevantes de la IA de frontera, pero todavía queda la prueba decisiva: comprobar si ese rendimiento se mantiene cuando el modelo salga de los benchmarks y se enfrente al trabajo real de millones de usuarios.