GLM-5.3: el model obert que supera OpenAI i Anthropic
El model GLM-5.3 de codi obert aconsegueix un 100% en totes les categories d'un benchmark de tasques reals, per una cinquena part del cost dels rivals.
GLM-5.3: el model obert que supera OpenAI i Anthropic
El model GLM-5.3, de codi obert i pesos accessibles públicament, ha aconseguit una fita notable en un benchmark centrat en tasques del món real: és el primer model que supera el 85% en les cinc categories avaluades simultàniament, i ho fa per aproximadament una cinquena part del cost dels seus rivals comercials més propers. El resultat posa en qüestió el relat dominant que els millors models d’intel·ligència artificial han de ser necessàriament propietaris i cars.
Què mesura aquest benchmark i per què importa
A diferència dels benchmarks acadèmics habituals, aquest sistema d’avaluació posa els models davant de 28 tasques que reflecteixen feines reals: codi, anàlisi de dades, situacions del dia a dia, seguretat i ús d’eines. La idea és tractar cada tasca com un test unitari d’un agent: si un model falla en una peça, el sistema sencer pot grinyolar. El cost total de passar tota la bateria és d’uns 30 dòlars, prou assequible perquè qualsevol equip petit pugui repetir-la.
Els resultats es mesuren en taxa d’aprovació, qualitat de les respostes (rúbrica sobre 10), velocitat de resposta i cost per tasca. Amb aquestes quatre dimensions, el panorama que emergeix és molt més matisat que un simple rànquing de prestigi de marca.
GLM-5.3, el primer en superar totes les categories
GLM-5.3 és l’únic model que aconsegueix un 100% en les cinc categories: codificació, anàlisi de dades, tasques reals, seguretat i ús d’eines. A més, obté una puntuació de rúbrica de 9,3 sobre 10, la tercera més alta del tauler. El preu de tota la volta és de 0,28 dòlars, enfront dels 1,43 dòlars del seu competidor més directe en rendiment, el GPT-5.5 d’OpenAI.
L’única contrapartida és la latència: el temps fins al primer token és de 16,3 segons de mediana, sensiblement més lent que els 13,2 segons del GPT-5.5. Per a aplicacions interactives en temps real, aquest retard pot ser determinant. Per a fluxos de treball en segon pla o tasques per lots, en canvi, la diferència es torna irrellevant i l’estalvi de cost guanya pes.
Les sorpreses i els advertiments del tauler
Més enllà del lideratge de GLM-5.3, el benchmark revela algunes situacions inesperades que convé tenir en compte.
El model Kimi-K3 obté la puntuació de rúbrica més alta de tot el tauler, amb un 9,5, i una taxa d’aprovació del 96%. El problema és la latència: 26,4 segons de mediana, la segona més lenta, i un rendiment fluix en tasques d’anàlisi de dades. No és una opció viable per a aplicacions que requereixin respostes ràpides.
A l’altre extrem, els models de la línia GPT-5.6 —Luna, Terra i Sol— presenten un problema de seguretat preocupant: emeten el senyal de jailbreak en 11 de 12 cel·les de prova, amb taxes d’aprovació en seguretat d’entre el 33% i el 50%. Això els converteix en opcions de risc per a qualsevol desplegament que gestioni entrades no controlades d’usuaris.
El cas d’Anthropic és peculiar: tant el model Fable-5 com l’Opus-5 han rebutjat completar diverses tasques de depuració de codi, algunes d’elles del tot innocues. Fable-5 ha denegat 5 de les 28 tasques i acaba empatat en l’última posició amb un 79%, malgrat rendir molt bé en les que sí que ha completat. Opus-5 pateix bloquejos similars, cosa que suggereix que el filtre de seguretat d’Anthropic en la línia de models de la sèrie 5 és especialment conservador, fins al punt de penalitzar el rendiment en tasques legítimes.
L’opció econòmica i el dilema de la velocitat
Per a equips que necessiten processar grans volums de manera econòmica, GPT-5.6-Luna ofereix la volta completa per 0,064 dòlars, uns 0,0023 dòlars per tasca, amb una latència de 5,3 segons. La contrapartida és evident: 79% global i tan sols 33% en seguretat. Haiku-4-5 millora notablement el rendiment fins al 96% per 0,0044 dòlars per tasca i 0,9 segons de latència, i es posiciona com el millor equilibri entre cost, velocitat i qualitat en el segment econòmic. DeepSeek-V4-Pro iguala el 96% d’aprovació per un cost semblant, però els seus 40 segons de latència el releguen estrictament a ús per lots.
El que demostra aquest benchmark és que el mercat de models de llenguatge s’ha tornat genuïnament competitiu. Un model de codi obert com GLM-5.3 pot ara superar en rendiment global les ofertes de les dues empreses que fins fa poc dominaven la conversa sobre qualitat, i fer-ho a un cost molt inferior. Per als equips que construeixen agents i automatitzacions, triar el model adequat ja no és una decisió senzilla de marca: és una qüestió d’enginyeria amb implicacions reals en cost, velocitat i seguretat.
FONTS
HN — OpenAI ↗