Teknik • 1 maj 2026

Nvidia är inte bara AI:s lim: den har nu en allsmäktig modell som läser, ser och lyssnar. Allt på en gång

För åtta år sedan, när Nvidia fortfarande var ett företag som gjorde grafik för tv-spel, pekade företaget på något som börjar komma in i konversationen: fysisk robotik. De är robotar med inbyggd artificiell intelligens för att bete sig autonomt. Som en ChatGPT med armar, öron och ögon.

Det har regnat mycket sedan dess och det är nu vi börjar gå in i den framtiden. Nvidia har dock fortsatt att experimentera med det sättet att få den fysiska och digitala världen att konvergera, och dess senaste produkt är Nemotron 3 Nano Omni. En AI-modell som ser, hör och läser den fysiska världen.

Omni modeller. Dessa modeller är multimodala, men i mycket striktare mening. Medan de modeller vi använder varje dag kräver separata kanaler för att bearbeta och generera ljud, text, bild och video, är en omnimodell designad för att vara i sig multimodal.

Detta innebär att de använder en unik neural nätverksarkitektur som tränas från slut till ände så att interaktionen mellan modeller och stimuli är mer naturlig, snabbare och kapabel att känna igen fler nyanser. Ett exempel är en AI som kan ”se” vad en kamera fångar, analysera hela situationen och ge feedback till användaren snabbare än en som kan göra detsamma, men vars textmodell måste fråga videomodellen vad den har sett och sedan generera innehållet. Med ännu färre ord: det imiterar bättre hur människor uppfattar och reagerar på världens stimuli.

I Engadget NVIDIA har så mycket pengar att det håller på att bli något annat: den största startup-inkubatorn i världen Integration. Och det är vad Nvidia hävdar att Nemotron 3 Nano Omni kan göra. I samma arkitektur är det en modell som integrerar syn-, ljud- och språkkapacitet för att eliminera det fragmenterade arbetsflödet hos nuvarande AI-agenter.

Enligt företaget är det byggt på en hybridarkitektur av blandningsexperter (AI: er utbildade i olika ämnen) med 30 miljarder parametrar, varav 3 miljarder är för slutledning. Den har designats som en modell som är nio gånger snabbare än separata modeller och har tre gånger så bra prestanda som andra öppna omni-modeller, som förbrukar 2,75 gånger mindre datorkraft i uppgifter som att resonera från en video.

Okej, men varför. Det är nyckelfrågan, bortom siffrorna och de råa kapaciteterna hos denna teknik.

Användningsfallen som specificeras av företaget är följande: Agenter: driver de agenter som navigerar i användarens grafiska gränssnitt, resonerar utifrån innehållet på skärmen och förstår vad de ser i realtid och ihärdigt. Inbyggd ingångsupplösning är 1920 x 1080 för den visuella förståelsen i HD. Dokument: Tolkar grafer, tabeller, dokument, skärmdumpar och blandad mediainmatning.

Ljud- och bildförståelse: Kunna förstå vad du ser och hör för att bibehålla konsekvens i din tolkning snarare än resonemang baserat på frånkopplade modeller. I Engadget Det finns en sak som heter "Ornn prisindex", det är utom kontroll och det är dåliga nyheter för alla.

För proffs. Det som är tydligt är att Nemotron 3 Nano Omni inte är något som lanseras med målet att vara något för massorna som andra AI-modeller som vi ser varje dag. Nvidia fokuserar det på något företag, ett verktyg som kan nås via plattformar som Hugging Face och som ska distribueras på lokala system som DGX Spack eller Jetson.

Det vill säga att det inte är något som är tillgängligt för alla. Det intressanta är att det är en teknik som starkt driver berättelsen om agenter som allsmäktiga enheter, och det stämmer med det senaste talet av Jensen Huang, VD för företaget, att AI inte kommer att ta bort våra jobb, utan för att "mikromanagera" oss. Bild | Nvidia i Xataka | Det finns ett företag som har vuxit med 3 000 % på aktiemarknaden och till och med överträffat Nvidias resultat: Sandisk

Nvidia är inte bara AI:s lim: den har nu en allsmäktig modell som läser, ser och lyssnar. Allt på en gång

Originalkälla

Publicerad av Xataka

1 maj 2026, 16:16

Läs original

Denna artikel har översatts automatiskt från spanska. Klicka på länken ovan för att läsa originaltexten.

Visa originaltext (spanska)

Rubrik

Nvidia no solo es el pegamento de la IA: ahora tiene un modelo omnipotente que lee, ve y escucha. Todo a la vez

Beskrivning

Hace ocho años, cuando Nvidia aún era una compañía que hacía gráficas para videojuegos, la compañía apuntó a algo que está empezando a entrar en la conversación: la robótica física. Son los robots con inteligencia artificial integrada para comportarse de forma autónoma. Como un ChatGPT con brazos, oídos y ojos. Ha llovido mucho desde entonces y es ahora cuando estamos empezando a entrar en ese futuro. Sin embargo, Nvidia ha seguido experimentando con esa forma de hacer que el mundo físico y digital converjan, y su último producto es Nemotron 3 Nano Omni. Un modelo de IA que ve, escucha y lee el mundo físico. Modelos Omni. Estos modelos son multimodales, pero en un sentido mucho más estricto. Mientras los modelos que solemos usar a diario necesitan de canales separados para procesar y generar audio, texto, imagen y vídeo, un modelo omni está diseñado para ser intrínsecamente multimodal. Esto implica que utilizan una arquitectura de red neuronal única entrenada de extremo a extremo para que la interacción entre modelos y estímulos sea más natural, veloz y capaz de reconocer más matices. Un ejemplo es una IA que puede “ver” lo que captura una cámara, analizar toda la situación y dar un feedback al usuario de una forma más rápida que una que puede hacer lo mismo, pero cuyo modelo de texto tiene que preguntar al de vídeo qué ha visto para, después, generar el contenido. En menos palabras aún: imita mejor la forma en la que los humanos percibimos y respondemos a los estímulos del mundo. En Xataka NVIDIA tiene tantísimo dinero que está convirtiéndose en algo distinto: la mayor incubadora de startups del mundo Integración. Y eso es lo que Nvidia afirma que puede hacer Nemotron 3 Nano Omni. En la misma arquitectura, es un modelo que integra capacidades de visión, audio y lenguaje para eliminar el flujo de trabajo fragmentado de los actuales agentes de IA. Según la compañía, está construido sobre una arquitectura híbrida de mezcla de expertos (las IAs entrenadas en diversas materias) con 30.000 millones de parámetros, de los cuales 3.000 millones son para inferencia. Se ha diseñado como un modelo nueve veces más rápido que los modelos separados y que tiene tres veces más rendimiento que otros modelos omni abiertos consumiendo 2,75 veces menos capacidad de cómputo en tareas como el razonamiento a partir de un vídeo. {"videoId":"x9xm9vi","autoplay":true,"title":"Cómo China ha alcanzado a EEUU en la carrera de la IA en tan poco tiempo", "tag":"", "duration":"544"} Vale, pero para qué. Esa es la pregunta clave, más allá de los números y de las capacidades en bruto de esta tecnología. Los casos de uso que detalla la compañía son los siguientes: Agentes: impulsar esos agentes que navegan por las interfaces gráficas del usuario, razonando en base al contenido en pantalla y entendiendo lo que está viendo en tiempo real y de forma persistente. La resolución de entrada nativa es de 1.920 x 1.080 para lograr esa comprensión visual en HD.Documentos: interpreta gráficos, tablas, documentos, capturas de pantalla y entradas de medios mixtos.Comprensión de audio y vídeo: es capaz de comprender lo que ve y escucha para mantener una coherencia en su interpretación en lugar de razonar en base a modelos desconectados. En Xataka Hay una cosa llamada "índice de precios de Ornn", está fuera de control y son malas noticias para todo el mundo Para profesionales. Lo que está claro es que Nemotron 3 Nano Omni no es algo que se lance con el objetivo de que sea algo para las masas como otros modelos de IA que vemos a diario. Nvidia lo enfoca en algo empresarial, una herramienta a la que acceder a través de plataformas como Hugging Face y para implementarse en sistemas locales como DGX Spack o Jetson. Es decir, no es algo al alcance de cualquiera. Lo interesante es que es una tecnología que está empujando fuerte la narrativa de los agentes como entes omnipotentes, y cuadra con el discurso más reciente de Jensen Huang, CEO de la compañía, de que la IA no llegará para quitarnos el trabajo, sino para ‘micromanagearnos’. Imagen | Nvidia En Xataka | Hay una empresa que ha crecido un 3.000% en bolsa batiendo incluso el rendimiento de Nvidia: Sandisk (function() { window._JS_MODULES = window._JS_MODULES || {}; var headElement = document.getElementsByTagName('head')[0]; if (_JS_MODULES.instagram) { var instagramScript = document.createElement('script'); instagramScript.src = 'https://platform.instagram.com/en_US/embeds.js'; instagramScript.async = true; instagramScript.defer = true; headElement.appendChild(instagramScript); } })(); - La noticia Nvidia no solo es el pegamento de la IA: ahora tiene un modelo omnipotente que lee, ve y escucha. Todo a la vez fue publicada originalmente en Xataka por Alejandro Alcolea .

73 visningar
Dela:

Svep för att byta artikel

Tryck Enter för att söka ESC

Vi använder cookies

Vi använder cookies för att förbättra din upplevelse på vår webbplats. Genom att klicka "Acceptera alla" samtycker du till användningen av alla cookies. Läs mer i vår cookiepolicy och integritetspolicy.