Gemini 4 Argon retorna Google a la lluita per la IA de frontera: els benchmarks disparen les expectatives

El nou model de Google assoleix resultats de primer nivell en diverses proves, tot i que el seu rendiment real encara genera dubtes entre alguns empleats de la companyia

02 d'octubre de 2026 a les 13:28h
| Actualitzat: 02 d'octubre de 2026 a les 13:31h
images
images

Google torna a reclamar protagonisme en la cursa pels models d’intel·ligència artificial més avançats. Gemini 4 Argon ha irromput amb resultats que el col·loquen a la part alta de les principals proves d’avaluació i que, segons les dades publicades per la mateixa companyia i mesuraments independents, el situen prop dels models més potents d’OpenAI i Anthropic. El problema és que encara hi ha una distància important entre el que diuen els benchmarks i el que es pot comprovar en l’ús quotidià.

Una estrena que arriba amb resultats espectaculars

Les primeres dades han col·locat Gemini 4 Argon en una posició especialment cridanera. Artificial Analysis li atorga 53 punts en el seu Intelligence Index, la mateixa puntuació que GPT-6 Astra. Google, per la seva banda, assegura que el seu nou model supera Opus 5.5 i Fable 5.1 en diferents avaluacions internes. Sobre el paper, els resultats apunten a un salt considerable i permeten a la companyia tornar a situar-se en la conversa sobre els models de frontera.

No obstant això, encara no hi ha accés generalitzat al sistema que permeti comprovar aquestes xifres en condicions reals. Argon s’està posant inicialment a disposició d’un grup limitat de provadors i especialistes en ciberseguretat a través del programa Fairwind, mentre el Govern dels Estats Units també analitza el model. Aquesta disponibilitat restringida fa que, per ara, bona part de la valoració depengui de proves controlades i de les dades proporcionades per tercers.

Els empleats de Google introdueixen una dosi de realitat

Les primeres experiències internes tampoc ofereixen una imatge completament uniforme. Segons informacions recollides per Bloomberg, alguns treballadors de Google consideren que el comportament de Gemini 4 Argon en determinades tasques de programació no està a l’altura del que suggereixen els seus resultats en els benchmarks. La companyia rebutja aquesta interpretació i Sundar Pichai ha defensat que els seus equips estan utilitzant el model de manera intensiva amb bons resultats.

La diferència entre ambdues percepcions posa sobre la taula un dels grans problemes actuals de l'avaluació de la intel·ligència artificial: un model pot destacar en una bateria concreta de proves i trobar-se amb dificultats quan ha de desenvolupar-se en entorns molt menys previsibles. Programar sobre un repositori real, treballar amb documentació incompleta o gestionar dependències complexes no s'assembla necessàriament a resoldre una tasca dissenyada específicament per mesurar una determinada capacitat.

La gran trampa dels benchmarks

Per això, les xifres de Gemini 4 Argon necessiten context. Els benchmarks són útils per comparar sistemes sota unes condicions determinades, però no poden reproduir tota la varietat de situacions a les quals s'enfronta un usuari. Una eina pot obtenir una puntuació extraordinària en una prova de programació o automatització i oferir una experiència menys convincent quan entra en un flux de treball real.

Una cosa semblant passa amb les al·lucinacions. Artificial Analysis situa a Gemini 4 Argon en un 15% en la seva prova AA-Omniscience, enfront del 50% de GPT-6 Astra. La diferència sembla enorme, però la dada no significa necessàriament que un dels models sigui cinc vegades més fiable. En aquest cas, part de l'explicació està en què Gemini 4 tendeix a reconèixer que no disposa de suficient informació en lloc de generar una resposta quan no pot assegurar-la. Això redueix les respostes inventades, encara que també canvia la forma en la qual ha d'interpretar-se el resultat.

Google també juga la carta del preu

La batalla no es limita al rendiment. Google pretén que Gemini 4 Argon sigui competitiu també per cost, especialment en un moment en què els models s'utilitzen durant llargs períodes per executar tasques complexes i agents autònoms. El preu promocional inicial serà de 2 dòlars per milió de tokens d'entrada i 10 dòlars per milió de tokens de sortida.

Segons les estimacions de Artificial Analysis, amb aquestes tarifes el model pot resultar al voltant d'un 40% més barat per tasca que GPT-6 Astra. No obstant això, Google té previst elevar posteriorment el preu fins als 4 dòlars per milió de tokens d'entrada i els 20 dòlars per milió de sortida. Aquesta pujada pot canviar considerablement la comparació econòmica per a aquells que utilitzen aquests sistemes de manera intensiva.

Gemini 4 Argon, per tant, retorna a Google a una cursa de la qual durant els últims mesos semblava haver-se allunyat en termes de percepció pública. Els seus resultats inicials són prou sòlids com per a col·locar-lo de nou entre els noms rellevants de la IA de frontera, però encara queda la prova decisiva: comprovar si aquest rendiment es manté quan el model surti dels benchmarks i s'enfronti a la feina real de milions d'usuaris.

El més llegit