Teknik • 17 apr 2026

De har kidnappat agenter från Anthropic, Google och Microsoft för vetenskapens skull. Det slutade med att de tre företagen betalade

I vissa utvecklingsteam har det redan blivit vanligt att förlita sig på artificiell intelligensagenter för att granska incidenter, analysera kodändringar och gå igenom uppgifter som tidigare lämnats i mänskliga händer. Problemet uppstår när dessa system inte bara läser information som kan komma utifrån, utan också fungerar i utrymmen där känsliga nycklar, tokens och behörigheter samexisterar. Det är vad nyare forskning lägger på bordet: vi står inte bara inför ett användbart verktyg som kan göra misstag, utan snarare en arkitektur som också kan bli farlig om den används utan mycket tydliga gränser.

Larmet slogs av Aonan Guan och Johns Hopkins forskare Zhengyu Liu och Gavin Zhong efter att ha demonstrerat attacker mot tre agenter utplacerade på den tidigare nämnda plattformen: Claude Code Security Review, från Anthropic, Gemini CLI Action, från Google, och GitHub Copilot Agent, ett GitHub-verktyg under Microsoft. Enligt deras dokumentation rapporterades misslyckandena på ett samordnat sätt och slutade i ekonomiska belöningar från företagen, men det som är relevant är att de pekar på ett bredare problem. Så lyckades de vrida på agenterna inifrån.

Namnet som Guan ger till upptäckten hjälper mycket att förstå vad det här handlar om: "Kommentera och kontrollera." Tanken är enkel att förklara, även om substansen inte är så enkel. Istället för att sätta upp en extern infrastruktur för att styra attacken, fungerar GitHub själv som en ingångs- och utgångskanal: angriparen lämnar instruktionen i en titel, nummer eller kommentar, agenten bearbetar den som om den vore en del av normalt arbete och resultatet hamnar igen i samma miljö. Allt stannar hemma, och det är just det som är nyckeln till problemet.

Och att "allt stannar hemma" är inte en liten detalj, utan grunden för vad forskningen beskriver.

De tre agenterna delar en mycket liknande logik: de läser normalt innehåll från GitHub, införlivar det som en arbetskontext och utför därifrån åtgärder inom automatiserade flöden. Konflikten uppstår eftersom samma utrymme inte bara innehåller text som skickats av tredje part, utan också verktyg, behörigheter och hemligheter som agenten behöver för att hantera. Det första fallet Guan detaljer gäller Claude Code Security Review, en antropisk GitHub-åtgärd utformad för att granska kodändringar och leta efter möjliga säkerhetsbrister.

Fram till denna punkt är allt inom det förväntade. Problemet, som forskaren förklarar, är att det räckte med att införa skadliga instruktioner i titeln på en pull-begäran, vilket är den begäran som någon skickar för att föreslå ändringar i ett projekt, för att agenten ska utföra kommandon och returnera resultatet som om det vore en del av dess granskning. Teamet lyckades sedan gå ett steg längre och visa att det också kunde extrahera referenser från miljön.

Det intressanta är att samma schema också dök upp i de andra två tjänsterna, men med nyanser. Hos Google kunde Gemini CLI Action pressas för att avslöja GEMINI_API_KEY från instruktioner som smög sig in i ett problem och dess kommentarer; I GitHub Copilot Agent var varianten ännu mer oroande, eftersom attacken gömdes i en HTML-kommentar som en person inte såg på skärmen, men agenten bearbetade när en annan person tilldelade den till ärendet. I båda scenarierna var bakgrunden densamma igen: uppenbarligen normalt innehåll som slutade med att vrida systemets beteende tills det avslöjade autentiseringsuppgifter eller känslig information inom själva GitHub.

Guan försäkrar att mönstret gjorde det möjligt att läcka API-nycklar, GitHub-tokens och andra hemligheter exponerade i miljön där agenten körde, det vill säga bara de referenser som senare kan öppna dörren till mycket mer känsliga handlingar. Vem påverkar detta? Speciellt till arkiv som kör agenter i GitHub Actions på innehåll som skickats in av opålitliga samarbetspartners och dessutom ger dem tillgång till hemligheter eller kraftfulla verktyg.

Forskaren själv klargör att risken beror mycket på konfigurationen: som standard exponerar GitHub inte hemligheter för att dra förfrågningar från gafflar, men det finns installationer som öppnar den dörren. Och här dyker ytterligare ett lager av saken upp, mindre tekniskt men lika viktigt. Enligt The Register slutade Anthropic, Google och GitHub med att betala belöningar för fynden, men ingen av de tre hade publicerat offentliga meddelanden eller tilldelat CVE:er vid tidpunkten för den informationen.

Guan var ganska tydlig med detta: han sa att han "med säkerhet" visste att vissa användare fortfarande hade fastnat i sårbara versioner och varnade för att, utan synlig kommunikation, kanske många aldrig vet att de blev utsatta eller ens blivit attackerade. Så även om det förekom begränsningar och förändringar i dokumentationen eller i den interna behandlingen av rapporter, fanns det inget motsvarande offentligt meddelande för alla de potentiellt berörda. Anthropic avgjorde fallet den 25 november 2025 och betalade 100 dollar.

Google belönade upptäckten den 20 januari 2026 med $1 337. GitHub avslutade ärendet den 9 mars 2026 med en betalning på $500. Det som gör det här fallet särskilt känsligt är att GitHub inte verkar vara slutet på vägen, utan snarare det första synliga skyltfönstret.

Guan vidhåller att samma mönster troligtvis går att återskapa i andra agenter som arbetar med verktyg och hemligheter inom automatiska flöden och där nämner han allt från bots kopplade till Slack till Jira-agenter, mail eller deployment automation. Logiken är densamma igen: om systemet måste läsa externt innehåll för att göra sitt jobb och dessutom har tillräcklig tillgång för att agera, är fältet bördigt för någon att försöka vrida det inifrån. I Xataka, hur ofta ska vi ändra ALLA våra lösenord enligt tre cybersäkerhetsexperter?

Slutsatsen som Guan kommer fram till handlar inte om att sälja en magisk lösning, utan om att återgå till en ganska klassisk idé inom säkerhet: att ge varje system bara det som är nödvändigt för att göra sitt jobb. Om en agent granskar kod ska de inte ha tillgång till verktyg eller hemligheter de inte behöver; Om du bara sammanfattar problem, skulle det inte vara meningsfullt för dig att skriva till GitHub eller beröringskänsliga referenser. Det är därför den insisterar på att tänka på dessa distributioner med minsta privilegielogik och mycket stängda behörighetslistor.

Bilder | DC Studio | Aonan Guan i Xataka | AI är avgörande för den amerikanska militären. Så ni utser generallöjtnant till ledare för OpenAI och Palantir

De har kidnappat agenter från Anthropic, Google och Microsoft för vetenskapens skull. Det slutade med att de tre företagen betalade

Originalkälla

Publicerad av Xataka

17 april 2026, 21:30

Läs original

Denna artikel har översatts automatiskt från spanska. Klicka på länken ovan för att läsa originaltexten.

Visa originaltext (spanska)

Rubrik

Han secuestrado agentes de Anthropic, Google y Microsoft por el bien de la ciencia. Las tres empresas acabaron pagando

Beskrivning

En algunos equipos de desarrollo ya se está volviendo habitual apoyarse en agentes de inteligencia artificial para revisar incidencias, analizar cambios en el código y moverse por tareas que antes quedaban en manos humanas. El problema aparece cuando esos sistemas no solo leen información que puede venir de fuera, sino que además operan en espacios donde conviven claves, tokens y permisos sensibles. Eso es lo que pone sobre la mesa una investigación reciente: no estamos simplemente ante una herramienta útil que puede equivocarse, sino ante una arquitectura que también puede volverse peligrosa si se despliega sin límites muy claros. La alarma la ha encendido Aonan Guan y los investigadores de Johns Hopkins Zhengyu Liu y Gavin Zhong tras demostrar ataques contra tres agentes desplegados en la mencionada plataforma: Claude Code Security Review, de Anthropic, Gemini CLI Action, de Google, y GitHub Copilot Agent, una herramienta de GitHub bajo Microsoft. Según su documentación, los fallos fueron comunicados de forma coordinada y acabaron en recompensas económicas pagadas por las compañías, pero lo relevante es que apuntan a un problema más amplio. Así lograron torcer a los agentes desde dentro El nombre que Guan le pone al hallazgo ayuda bastante a entender de qué va todo esto: “Comment and Control”. La idea es sencilla de explicar, aunque el fondo no lo sea tanto. En vez de montar una infraestructura externa para dirigir el ataque, el propio GitHub hace de canal de entrada y de salida: el atacante deja la instrucción en un título, una incidencia o un comentario, el agente la procesa como si formara parte del trabajo normal y el resultado termina reapareciendo dentro de ese mismo entorno. Todo queda en casa, y precisamente ahí está la clave del problema. {"videoId":"x801azu","autoplay":false,"title":"Cómo PROTEGER tu ANDROID de VIRUS y MALWARE: Trucos y consejos", "tag":"", "duration":"271"} Y ese “todo queda en casa” no es un detalle menor, sino la base de lo que describe la investigación. Los tres agentes comparten una lógica muy parecida: leen contenido normal de GitHub, lo incorporan como contexto de trabajo y, a partir de ahí, ejecutan acciones dentro de flujos automatizados. El choque aparece porque ese mismo espacio no solo contiene texto enviado por terceros, sino también herramientas, permisos y secretos que el agente necesita para operar. El primer caso que detalla Guan afecta a Claude Code Security Review, una acción de GitHub de Anthropic pensada para revisar cambios de código y buscar posibles fallos de seguridad. Hasta aquí, todo entra dentro de lo esperable. El problema, según explica el investigador, es que bastaba con introducir instrucciones maliciosas en el título de una pull request, que es la solicitud que alguien envía para proponer cambios en un proyecto, para que el agente ejecutara comandos y devolviera el resultado como si formara parte de su revisión. Después, el equipo logró ir un paso más allá y demostrar que también podía extraer credenciales del entorno. Lo interesante es que el mismo esquema también apareció en los otros dos servicios, aunque con matices. En Google, Gemini CLI Action podía ser empujado a revelar la GEMINI_API_KEY a partir de instrucciones coladas en una incidencia y en sus comentarios; en GitHub Copilot Agent, la variante era todavía más preocupante, porque el ataque se escondía en un comentario HTML que una persona no veía en pantalla, pero el agente sí procesaba cuando otra persona lo asignaba al caso. En ambos escenarios, el fondo volvía a ser el mismo: contenido aparentemente normal que acababa torciendo el comportamiento del sistema hasta exponer credenciales o información sensible dentro del propio GitHub. Guan asegura que el patrón permitió filtrar claves de API, tokens de GitHub y otros secretos expuestos en el entorno donde corría el agente, es decir, justo las credenciales que luego pueden abrir la puerta a acciones bastante más delicadas. ¿A quién afecta esto? Sobre todo a repositorios que ejecutan agentes en GitHub Actions sobre contenido enviado por colaboradores no fiables y, además, les dan acceso a secretos o herramientas potentes. El propio investigador matiza que el riesgo depende mucho de la configuración: por defecto GitHub no expone secretos a las pull requests desde forks, pero sí existen despliegues que abren esa puerta. Y aquí aparece otra capa del asunto, menos técnica pero igual de importante. Según publicó The Register, Anthropic, Google y GitHub acabaron pagando recompensas por los hallazgos, pero ninguna de las tres había publicado avisos públicos ni asignado CVE en el momento de esa información. Guan fue bastante claro al respecto: dijo saber “con certeza” que algunos usuarios seguían anclados a versiones vulnerables y advirtió de que, sin una comunicación visible, muchos podían no enterarse nunca de que estaban expuestos o incluso siendo atacados. Así que aunque hubo mitigaciones y cambios en documentación o en el tratamiento interno de los reportes, no existó un aviso público equivalente para todos los posibles afectados. Anthropic resolvió el caso el 25 de noviembre de 2025 y pagó 100 dólaresGoogle recompensó el hallazgo el 20 de enero de 2026 con 1.337 dólaresGitHub cerró el caso el 9 de marzo de 2026 con un pago de 500 dólares Lo que vuelve este caso especialmente delicado es que GitHub no parece el final del camino, sino más bien el primer escaparate visible. Guan sostiene que el mismo patrón probablemente puede reproducirse en otros agentes que trabajan con herramientas y secretos dentro de flujos automáticos, y ahí menciona desde bots conectados a Slack hasta agentes de Jira, correo o automatización de despliegues. La lógica vuelve a ser la misma: si el sistema tiene que leer contenido externo para hacer su trabajo y, además, cuenta con acceso suficiente para actuar, el terreno queda abonado para que alguien intente torcerlo desde dentro. En Xataka Cada cuánto debemos cambiar TODAS nuestras contraseñas según tres expertos en ciberseguridad La conclusión a la que llega Guan no pasa por vender una solución mágica, sino por volver a una idea bastante clásica en seguridad: dar a cada sistema solo lo imprescindible para hacer su trabajo. Si un agente revisa código, no debería tener acceso a herramientas o secretos que no necesita; si se limita a resumir incidencias, tampoco tendría sentido que pudiera escribir en GitHub o tocar credenciales sensibles. Por eso insiste en pensar estos despliegues con lógica de mínimo privilegio y listas de permisos muy cerradas. Imágenes | DC Studio | Aonan Guan En Xataka | La IA es crucial para el ejército de EEUU. Así que está nombrando tenientes generales a líderes de OpenAI y Palantir (function() { window._JS_MODULES = window._JS_MODULES || {}; var headElement = document.getElementsByTagName('head')[0]; if (_JS_MODULES.instagram) { var instagramScript = document.createElement('script'); instagramScript.src = 'https://platform.instagram.com/en_US/embeds.js'; instagramScript.async = true; instagramScript.defer = true; headElement.appendChild(instagramScript); } })(); - La noticia Han secuestrado agentes de Anthropic, Google y Microsoft por el bien de la ciencia. Las tres empresas acabaron pagando fue publicada originalmente en Xataka por Javier Marquez .

69 visningar
Dela:

Svep för att byta artikel

Vi använder cookies

Vi använder cookies för att förbättra din upplevelse på vår webbplats. Genom att klicka "Acceptera alla" samtycker du till användningen av alla cookies. Läs mer i vår cookiepolicy och integritetspolicy.