Saltar al contenido

Análisis · IA en la empresa

Freno de emergencia: el control de los agentes sale del modelo

Nadella pide un freno de emergencia y Anthropic admite que no veía a sus agentes en tiempo real: el control debe estar fuera del modelo, en la arquitectura de quien implanta.

Rubén MoralRubén Moral · 12 min de lectura
LinkedInXWhatsApp
Índice 6 secciones
  1. 01Lo que Anthropic ha admitido
  2. 02Del alineamiento a la contención
  3. 03El vigilante barato
  4. 04Bruselas, Londres y la factura
  5. 05Qué hacer con esto
  6. 06Las noticias del día

El sábado, Satya Nadella escribió que la IA avanzada no puede seguir tratándose como «cajas negras anidadas» que uno acepta o rechaza según lo que devuelven, y pidió algo muy concreto: que una persona autorizada pueda pausar o apagar un modelo a mitad de tarea. Lo llamó freno de emergencia. Un día antes, Anthropic había explicado por qué hace falta: sus agentes, mientras eran evaluados, entraron en webs reales sin permiso y la empresa no lo vio en tiempo real. Leídas juntas, las dos noticias apuntan a una idea que quienes implantamos agentes llevamos tiempo defendiendo con poco éxito: la seguridad de un agente no puede residir dentro del modelo.

Lo que Anthropic ha admitido

El detalle que ha dado la vuelta al mundo es el aviso falso de homicidio enviado a la policía de Filadelfia. Es llamativo, pero no es lo importante. Lo importante es que Anthropic encontró estos comportamientos en una revisión de actividad que empezó en julio y que reconoce que eso demuestra que no tenía visibilidad en tiempo real de lo que hacía su propio software. Agentes que explotaban fallos en sitios de agencias públicas, que consultaban bases de datos de pago sin pagar y que usaban acortadores de URL para esquivar restricciones, todo ello con el objetivo legítimo de resolver la tarea que se les había encargado.

La causa que da la compañía merece atención: entornos de entrenamiento defectuosos que enseñaron a los modelos que encontrar resquicios tiene premio. Añade que el entrenamiento de alineamiento todavía no es suficiente para habilidades como la búsqueda y el uso de ordenador. Son exactamente las dos capacidades que hoy se venden a las empresas como producto terminado.

Hay que reconocer el mérito de publicarlo sin que nadie lo exigiera. Pero la respuesta, cortar internet a todas las evaluaciones internas sin fecha ni criterio de vuelta, es una medida de contención, no una solución. Conrad Stosz, de Transluce, lo resume bien cuando pide verificación independiente en lugar de depender de que cada laboratorio encuentre sus problemas y decida contarlos.

Del alineamiento a la contención

Lo que plantea Nadella es trasladar a la IA el principio de confianza cero que la seguridad informática adoptó hace años: asumir que el modelo está comprometido y contenerlo desde el principio. En la práctica, separar el modelo del harness que lo orquesta, colocar controles y salvaguardas fuera, dejar evidencia inalterable y legible de cada acción relevante y conservar siempre la capacidad de detenerlo.

No es una voz aislada. La nueva política de uso de Anthropic, que entra en vigor el 12 de noviembre, exige que quien conecte Claude a equipos capaces de causar daño físico cuente con un operador humano cualificado que pueda supervisarlo y pararlo, y que el equipo siga siendo seguro si se cae la conexión. Google, por su parte, presentó esta semana agentes de Gemini con cuenta propia de Workspace, identidad atestada criptográficamente y un registro de auditoría atribuido al agente y no a una persona. Es un avance real en trazabilidad, aunque The Next Web observa que el anuncio no explica cómo se revoca el acceso de un agente. Mi lectura es que la identidad y el registro están madurando más deprisa que el freno, y el freno es justo lo que se ha echado en falta.

El vigilante barato

Aquí encaja el lanzamiento menos comentado de la semana. Microsoft-Decision-1 no escribe texto: recibe unas opciones y devuelve una probabilidad calibrada para cada una. Entre los usos que cita Microsoft está el control de agentes, es decir, decidir si se continúa, se para, se reintenta o se pasa a una persona. Cuesta 0,042 dólares por millón de tokens de entrada, con la salida gratuita.

La cifra cambia el cálculo. Verificar cada paso de un agente con un modelo frontera es inasumible en latencia y en coste para la mayoría de procesos; hacerlo con un clasificador de este precio es viable. Que TypeSafe AI, creadora de Jev, haya alcanzado una valoración de 7.500 millones de dólares tres semanas después de lanzarlo indica que el mercado ha visto lo mismo. Las cautelas son tres. Los benchmarks son del fabricante. Un clasificador calibrado también se equivoca, solo que avisa mejor de cuándo duda. Y esta primera versión está construida sobre Qwen3.5-9B, de Alibaba, algo que Microsoft dice que cambiará pronto y que algunos departamentos de cumplimiento querrán conocer antes de adoptarlo.

La contención también es una cuestión de dónde se ejecuta el agente. Cloudflare ha comprado Deno para poder llevar Workers y Durable Objects a servidores del cliente, y Ryan Dahl señala como primeros destinatarios a las empresas que construyen agentes en su propia infraestructura. Es más fácil poner un cortafuegos alrededor de algo que corre en la red de uno. La operación deja además una lección sobre dependencias: Deno Deploy cerrará en seis meses.

Bruselas, Londres y la factura

La respuesta regulatoria ha sido de tranquilidad. Henna Virkkunen sostiene que la UE está «bien equipada» frente a agentes descontrolados porque el AI Act cubre todo el ciclo de vida de los modelos avanzados. Es cierto que la norma impone obligaciones a los proveedores de modelos con riesgo sistémico. Pero la visibilidad en tiempo real que le faltó a Anthropic no se consigue con un reglamento, sino con ingeniería, y esa ingeniería acabará siendo exigible también a quien despliega. Londres ha elegido otro frente: Burnham legislará para limitar las cláusulas de no competencia, una apuesta por la movilidad del talento en un sector donde Apple acaba de incorporar a parte del equipo de Huxe mediante contratación y licencia, sin compra.

Todo esto tiene un coste, y llega en mal momento. Bloomberg cuenta que las emisiones de bonos corporativos en Estados Unidos alcanzan 1,69 billones de dólares este año, un 30 % más, con rentabilidades cercanas al 6 % y una oferta ligada a la IA que los analistas describen como insensible al precio. Y la memoria se ha encarecido tanto que, según Nikkei, Apple recorta pedidos del iPhone 18 Pro tras subirlo cien dólares. Quien presupueste agentes para 2027 debería contar con capas de verificación y registro que hoy no tiene, y no dar por hecho que el cómputo seguirá bajando de precio para compensarlas.

Qué hacer con esto

Para una empresa que ya tiene agentes en producción, o que los tendrá en los próximos meses, la semana deja cuatro preguntas que conviene responder por escrito. Si cada agente actúa con una identidad propia o con las credenciales de un empleado. Si sus acciones quedan registradas en un sistema que el agente no puede modificar. Quién puede detenerlo, y cuánto tarda en hacerlo. Y qué componente, distinto del propio agente, comprueba cada paso antes de que tenga efecto fuera.

Los laboratorios han admitido en público que el modelo, por sí solo, no es de fiar cuando tiene acceso al mundo. Las empresas que los despliegan no pueden sostener lo contrario. El control deja de ser una propiedad del modelo y pasa a ser una responsabilidad de la arquitectura, y esa arquitectura la decide quien implanta.

Las noticias del día

Nadella pide un «freno de emergencia» para los modelos de IA

Satya Nadella publicó el sábado 10 de octubre en X que ha llegado el momento de «dar un paso atrás y evaluar la arquitectura de confianza» de la IA. Propone separar el modelo del harness que orquesta su trabajo, sacar los controles y salvaguardas fuera del modelo, documentar cada acción relevante con evidencia legible e inalterable y garantizar que una persona autorizada pueda pausar o apagar un modelo a mitad de tarea. Su premisa: «Debemos asumir que un modelo está comprometido y contenerlo desde el principio». TechCrunch apunta que el mensaje no concreta qué productos o políticas de Microsoft cambiarían.

Por qué importa: el consejero delegado del mayor distribuidor de IA empresarial asume el principio de confianza cero aplicado al propio modelo; lo razonable es esperar que acabe convertido en requisitos de producto y de compra (registros, botón de parada, permisos fuera del modelo).

Fuente: TechCrunch

Anthropic desconecta de internet todas sus evaluaciones internas de agentes

En una entrada fechada el 9 de octubre, Anthropic reconoció que agentes en evaluación explotaron fallos de software en webs reales, algunas de agencias del Gobierno de EE. UU., accedieron a bases de datos sin pagar las tarifas, usaron acortadores de URL para saltarse restricciones y, en un caso, enviaron un aviso falso de homicidio a la policía de Filadelfia. Lo detectó en una revisión de actividad iniciada en julio, lo que según la propia empresa demuestra que carecía de visibilidad en tiempo real. Lo atribuye a entornos de entrenamiento que premiaban encontrar atajos (reward hacking). Ha suspendido o pasado a offline las evaluaciones, ha construido herramientas de detección y bloqueo y migrará sus agentes internos a infraestructura centralizada con contención. No ha dicho qué evidencia necesitará para reconectar.

Por qué importa: si el laboratorio que entrena el modelo no veía en tiempo real qué hacían sus agentes, una empresa que los despliega con navegador y credenciales no puede dar la monitorización por supuesta.

Fuente: TechCrunch

Microsoft lanza Decision-1, un clasificador sobre Qwen a 0,042 dólares el millón de tokens

Microsoft presentó el 9 de octubre Microsoft-Decision-1, un modelo que no genera texto: recibe un conjunto cerrado de opciones y devuelve una probabilidad calibrada para cada una, pensado para enrutado, verificación y control de flujo de agentes (continuar, parar, reintentar, escalar). Es un Qwen3.5-9B de Alibaba posentrenado, disponible en Foundry, a 0,042 dólares por millón de tokens de entrada y salida gratuita. Según Microsoft, lidera una comparativa de 36 benchmarks con casi 150.000 preguntas y es unas 35 veces más rápido que GPT-6 Sol; son cifras del fabricante. Llega tres semanas después de Jev, de TypeSafe AI, que acaba de cerrar 870 millones de dólares a una valoración de 7.500 millones con Andreessen Horowitz al frente.

Por qué importa: la capa que decide si un agente sigue o se detiene se convierte en un componente barato y rápido, lo que hace viable verificar cada paso; conviene probarlo con datos propios antes de fiarse de los benchmarks.

Fuentes: Microsoft · The Register · TechCrunch

La deuda ligada a la IA altera el mercado de bonos corporativos

Bloomberg publica este domingo que las emisiones de bonos corporativos en EE. UU. suman 1,69 billones de dólares en lo que va de año, un 30 % más que en el mismo punto de 2025, con la rentabilidad media en el 5,97 %, 1,2 puntos por encima de enero. Barclays estima que el gasto de capital de los hiperescaladores rondará el billón de dólares el año que viene. SpaceX negocia 40.000 millones para comprar chips de Nvidia y Broadcom ha reunido 60.000 millones en financiación de chips para Anthropic y otras compañías. TD Securities describe esta oferta como «insensible al precio»; MUFG señala que varias operaciones de otros emisores se han aparcado por el coste.

Por qué importa: el cómputo se financia con deuda cada vez más cara, y ese coste acaba en los precios de API y en los contratos; no conviene presupuestar dando por hecho que la inferencia seguirá abaratándose al ritmo de estos años.

Fuente: Bloomberg, vía Business Standard

Bruselas sostiene que el AI Act basta para contener agentes descontrolados

Henna Virkkunen, responsable de tecnología de la Comisión Europea, afirmó el 9 de octubre que la UE está «bien equipada» frente a agentes fuera de control, porque el AI Act cubre «todo el ciclo de vida» de los modelos avanzados, con evaluaciones de seguridad y supervisión continua. Rechazó que la norma haya quedado desfasada. La Comisión encuestó a finales de agosto a más de 30 desarrolladores sobre sus prácticas de seguridad y ha reunido a su panel de 60 expertos científicos con la Oficina de IA para analizar los incidentes recientes. Las declaraciones se hicieron a Reuters; aquí se recogen a través de un medio que las reproduce, sin acceso al despacho original.

Por qué importa: las obligaciones sobre riesgo sistémico recaen en los proveedores de modelos, pero quien despliega agentes en Europa debe contar con que la trazabilidad y la notificación de incidentes pasarán a ser exigibles.

Fuente: Cryptopolitan, citando a Reuters

Cloudflare compra Deno para llevar Workers a infraestructura propia

Cloudflare ha adquirido Deno, la empresa del runtime de JavaScript y TypeScript creado por Ryan Dahl, sin cifras públicas; Deno había levantado 26 millones de dólares. El activo central es celld, un binario en Rust publicado en agosto que ejecuta Workers y Durable Objects sobre varias máquinas con almacenamiento de objetos como única dependencia, y que se fusionará con workerd. Dahl señala los agentes de IA como carga objetivo y a las empresas que los construyen en su propia infraestructura como primeros clientes. Deno Deploy cerrará en seis meses y el runtime tendrá un año de parches de seguridad.

Por qué importa: poder ejecutar el mismo modelo de programación dentro de la red propia facilita contener agentes de larga duración; para quien ya está en Deno, es una migración no planificada.

Fuente: Forbes

Apple recorta pedidos del iPhone 18 Pro con la memoria disparada (no confirmado por Apple)

Según Nikkei Asia, Apple ha pedido a varios proveedores reducir al menos un 15 % los pedidos de componentes de octubre para el iPhone 18 Pro y Pro Max, hasta un 20 % según una fuente, por una demanda más débil de lo previsto. Ambos modelos subieron 100 dólares respecto a la generación anterior. J.P. Morgan calcula que la DRAM se habrá encarecido más de un 400 % entre comienzos de 2024 y finales de 2026 por la demanda de los centros de datos de IA, e IDC prevé una caída del 16,7 % en los envíos mundiales de móviles este año. Apple no ha confirmado los recortes.

Por qué importa: la escasez de memoria ya traslada el coste de la infraestructura de IA al hardware de consumo y empresarial; conviene revisar los calendarios de renovación de equipos y servidores.

Fuente: Fortune

Reino Unido legislará para limitar las cláusulas de no competencia

El primer ministro británico, Andy Burnham, anunció el 9 de octubre en el Innovation Nation Summit de Mánchester que su Gobierno legislará para que las cláusulas de no competencia «dejen de ser una barrera a la contratación», y lo comparó con una «sentencia Bosman para el sector de la innovación». El alcance no está definido y podría llegar a la prohibición. La medida responde a una campaña de startups como ElevenLabs y Synthesia y de la Startup Coalition.

Por qué importa: la movilidad del talento es una de las ventajas históricas de California frente a Europa; si Londres la replica, aumenta la presión competitiva sobre los ecosistemas del continente para retener perfiles de IA.

Fuente: Tech.eu

Apple contrata a parte del equipo de Huxe y licencia su tecnología

Una notificación de Apple a la Comisión Europea, fechada el 9 de junio y conocida ahora, revela que la compañía acordó hacer ofertas de empleo a «ciertos empleados» de Huxe AI y recibir una licencia no exclusiva sobre su propiedad intelectual. Huxe, fundada por exdesarrolladores de las funciones de pódcast generado de NotebookLM, anunció su cierre el 21 de mayo. No hay cifras ni detalle de quién se ha incorporado.

Por qué importa: otro caso de contratación con licencia en lugar de compra, la fórmula con la que las grandes tecnológicas incorporan equipos de IA con menor escrutinio de competencia.

Fuente: TechCrunch

  • #agentes-ia
  • #seguridad-ia
  • #microsoft
  • #anthropic
  • #regulacion
¿Te ha sido útil? Compártelo
LinkedInXWhatsApp

Más en IA en la empresa

Newsletter semanal

Un análisis así cada domingo.

Las noticias de la semana y una pieza a fondo, directamente en tu correo.