Överraskningen med nya Claude Opus 4.8 är inte att den är (lite) bättre. Överraskningen är "Jag vet bara att jag ingenting vet"
Vi förväntade oss det inte så snart, men här är Claude Opus 4.8, den nya versionen av Anthropics frontiermodell. Det har bara gått 41 dagar sedan lanseringen av Claude Opus 4.7, vilket verkar tydliggöra att företaget inte var helt nöjda med nämnda modell, som inte heller fick särskilt bra recensioner. Med Claude Opus 4.8 är det riktigt märkliga inte att det återigen sätter rekord i de flesta riktmärken.
Överraskningen är hans ärlighet. Det är bättre, ja, men det är inte det som spelar roll. I de interna resultaten av benchmarks som publicerats av Anthropic är det tydligt att Opus 4.8 ligger över Opus 4.7, men även GPT 5.5 och Gemini 3.1 Pro (märkligt att de inte jämför det med den senaste Gemini 3.5 Flash.
Den överträffar dem alla i dessa tester utom i TerminalBench 2.1, i vilket GPT faktiskt förväntas vara något nytt. modell överträffar sin föregångare, men det som är slående här är modellens tillvägagångssätt framför allt Boris Cherny, chef för Claude Code på Anthropic, förklarade att modellen inte bara programmerar bättre: "den är betydligt mer ärlig om sitt eget arbete. Den säger till dig när den inte är säker på något och upptäcker sina egna misslyckanden i stället för att deklarera en annan, Wu-motorn." "personlighet" av Claude Opus 4.8, som är kapabel att erkänna att den inte vet något i stället för att svara på sina svar och förbise fel i sina svar eller i koden som den genererar att inse att de inte vet allt Det är väldigt viktigt... och väldigt mänskligt. Det mycket kompletta "Systemkortet" innehåller många mätvärden som verkligen visar att vi står inför en mycket mer polerad modell på det här området.
Claude Sonnet 4.6 släpptes den 17 februari 2026, men sedan dess har det inte blivit ännu värre för Claude Haiku, vars senaste version är 4.5, släppt den 15 oktober 2025. Dessa modeller var mer blygsamma i funktioner men mycket billigare, eftersom det inte har nytta av dem vill ha det bästa, du kan bara ha det bästa och det dyraste, men inte det bästa i sin "prisvärda" version:"349"} Mythos kapacitetsmodeller kommer snart. I det officiella antropiska tillkännagivandet gjorde de det klart att "Användare kommer att upptäcka att Opus 4.8 är en blygsam men påtaglig förbättring jämfört med dess föregångare, men de kommer också att ha något som kommer att vara viktigt under veckan. modeller med funktioner som liknar Claude Mythos, men tillgängliga för allmänheten: "Vi planerar att lansera en ny klass av modeller med ännu större intelligens än Opus.
Som en del av Project Glasswing använder ett litet antal organisationer för närvarande Claude Mythos Preview för cybersäkerhetsarbete. Modeller med den här kapacitetsnivån kräver mer robusta cybersäkerhetsåtgärder innan de offentliggörs. Vi går snabbt framåt i utvecklingen av dessa åtgärder och vi hoppas kunna erbjuda Mythos-klassmodeller till alla våra kunder under de kommande veckorna. ('huvud')[0]; if (_JS_MODULES.instagram) { var instagramScript = ('script'); ;https://platform.instagram.com/en_US/embeds.js Nyheten Överraskningen med nya Claude Opus 4.8 är inte att den är (lite) bättre.
Överraskningen är att "Jag vet bara att jag inte vet någonting" som ursprungligen publicerades i Xataka av Javier Pastor.
Originalkälla
Publicerad av Xataka
29 maj 2026, 09:06
Denna artikel har översatts automatiskt från spanska. Klicka på länken ovan för att läsa originaltexten.
Visa originaltext (spanska)
Rubrik
La sorpresa del nuevo Claude Opus 4.8 no es que sea (un poco) mejor. La sorpresa es el "solo sé que no sé nada"
Beskrivning
No lo esperábamos tan pronto, pero aquí está Claude Opus 4.8, la nueva versión del modelo frontera de Anthropic. Han pasado tan solo 41 días desde el lanzamiento de Claude Opus 4.7, lo que parece dejar claro que la empresa no estaba del todo contenta con dicho modelo, que no acabó tampoco de conquistar muy buenas críticas. Con Claude Opus 4.8 lo realmente curioso no es que vuelva a establecer récords en la mayoría de benchmarks. La sorpresa es su honestidad. Es mejor, sí, pero es no es lo que importa. En los resultados internos de los benchmarks publicados por Anthropic queda claro que Opus 4.8 está por encima de Opus 4.7, pero también de GPT 5.5 y de Gemini 3.1 Pro (curioso, no lo comparan con el reciente Gemini 3.5 Flash. Supera a todos ellos en esas pruebas salvo en TerminalBench 2.1, en la que GPT-5.5 es algo superior. Es en realidad esperable que cada nuevo modelo supere a su antecesor, pero aquí lo llamativo es el enfoque del modelo. Honestidad ante todo. Boris Cherny, máximo responsable de Claude Code en Anthropic, explicaba que el modelo no solo programa mejor: "es significativamente más honesto sobre su propio trabajo. Te dice cuándo no está seguro de algo y detecta sus propios fallos en lugar de declarar demasiado pronto la victoria". Solo sé que no sé nada. Otra de las ingenieras de Anthropic, Catherine Wu, incidía en esa nueva "personalidad" de Claude Opus 4.8, que es capaz de admitir que no sabe algo en lugar de contestar por contestar y de pasar por alto errores en sus respuestas o en el código que genera. Quienes lo han probado coinciden en que es un modelo más "alineado", es decir, que se ajusta a los valores, intenciones, éticas y objetivos humanos. Menos alucinaciones, más humanidad. Desde hace tiempo estamos viendo cómo los nuevos modelos de IA son mejores en benchmarks, pero también ha habido saltos significativos en la disminución de alucinaciones. No solo inventan y se equivocan menos: comienzan a reconocer que no lo saben todo. Eso es muy importante... y muy humano. La completísima "Tarjeta de Sistema" incluye numerosas métricas que desde luego parecen demostrar que estamos ante un modelo mucho más pulido que sus antecesores en este ámbito. Flujos de trabajo. Una de las novedades presentadas junto al modelo son los flujos de trabajo dinámicos (Dynamic Workflows), que están disponibles en versión preliminar y que están orientados a una sola cosa: lograr trabajar con tareas más complejas en Claude Code. Gracias a esta opción es posible desplegar cientos de agentes paralelos en una única sesión, algo por ejemplo útil para analizar y migrar repositorios de código de cientos de miles de líneas. Nada de Sonnet y Haiku. Claude Sonnet 4.6 se lanzó el 17 de febrero de 2026, pero desde entonces Anthropic no ha actualizado este modelo. La cosa es aún peor para Claude Haiku, cuya última versión es la 4.5, lanzada el 15 de octubre de 2025. Estos modelos eran versiones más modestas en prestaciones pero mucho más baratas (sobre todo Haiku), y de momento Anthropic no los ha actualizado. Eso beneficia sus intereses, porque si quieres lo mejor, solo puedes tener lo mejor y lo más caro, pero no lo mejor en su versión "asequible". {"videoId":"xa4n2g8","autoplay":false,"title":"An initiative to secure the world's software | Project Glasswing", "tag":"", "duration":"349"} Los modelos de la capacidad de Mythos llegarán pronto. En el anuncio oficial Anthropic dejaban claro que "Los usuarios detectarán que Opus 4.8 es una mejora modesta pero tangible sobre su predecesor", pero además señalaban algo importante, y es que en las próximas semanas tendremos modelos de IA con capacidades similares a Claude Mythos, pero disponibles públicamente: "Planeamos lanzar una nueva clase de modelo con una inteligencia aún mayor que la de Opus. Como parte del Proyecto Glasswing, un pequeño número de organizaciones está utilizando actualmente Claude Mythos Preview para trabajos de ciberseguridad. Los modelos con este nivel de capacidad requieren medidas de ciberseguridad más sólidas antes de su lanzamiento general. Estamos avanzando rápidamente en el desarrollo de estas medidas y esperamos poder ofrecer modelos de la clase Mythos a todos nuestros clientes en las próximas semanas".En Xataka | Bienvenidos al duopolio de la IA: el sector ya factura 80.000 millones al año, pero OpenAI y Anthropic se llevan el 89% de los ingresos (function() { window._JS_MODULES = window._JS_MODULES || {}; var headElement = document.getElementsByTagName('head')[0]; if (_JS_MODULES.instagram) { var instagramScript = document.createElement('script'); instagramScript.src = 'https://platform.instagram.com/en_US/embeds.js'; instagramScript.async = true; instagramScript.defer = true; headElement.appendChild(instagramScript); } })(); - La noticia La sorpresa del nuevo Claude Opus 4.8 no es que sea (un poco) mejor. La sorpresa es el "solo sé que no sé nada" fue publicada originalmente en Xataka por Javier Pastor .