Saltar al contenido

Análisis · IA en la empresa

El modelo ya no es el cuello de botella

Con Haiku 5.5 y GPT-6 Luna a diez céntimos el millón de tokens, el coste de un proyecto de IA se desplaza a la evaluación, el aislamiento de agentes, la interfaz y los permisos.

Rubén MoralRubén Moral · 10 min de lectura
LinkedInXWhatsApp
Índice 5 secciones
  1. 01Diez céntimos el millón
  2. 02La interfaz y el arnés
  3. 03Lo que no baja de precio
  4. 04Dónde poner el esfuerzo
  5. 05Las noticias del día

Diez céntimos el millón

Ayer Anthropic puso Claude Haiku 5.5 a diez céntimos de dólar el millón de tokens de entrada y cincuenta el de salida para peticiones de hasta 100.000 tokens. Su antecesor costaba uno y cinco dólares. La cifra iguala la de GPT-6 Luna, el modelo pequeño de OpenAI, y eso es lo que la convierte en noticia de mercado y no solo de producto: los dos principales proveedores han fijado el mismo suelo para la gama de entrada, y lo han hecho con modelos que hace un año habrían pasado por gama alta. Según los datos de la propia Anthropic, Haiku 5.5 resuelve el 72,4 % de OSWorld 2.1, la prueba que mide si un agente sabe manejar un ordenador, frente al 15,7 % de Haiku 4.5. Son cifras del fabricante y hay que tratarlas como tales, pero el orden de magnitud dice bastante.

Conviene leer la letra pequeña antes de rehacer presupuestos. El descuento del 90 % solo se aplica por debajo de 100.000 tokens por petición; por encima, el precio se multiplica por cinco y el ahorro se queda en el 50 %. El modelo estrena tokenizador y consume algo más de tokens por tarea, aunque Anthropic asegura que sus cálculos ya lo descuentan. Y el anuncio incluye un detalle que para cargas agénticas pesa tanto como el titular: la lectura de caché de Sonnet 5.5 baja a la mitad. Quien tenga agentes en producción sabe que la factura no la hace el precio de lista, sino cuántas veces se relee el mismo contexto.

Aun con esos matices, la conclusión es difícil de esquivar. La inteligencia suficiente para clasificar, resumir, consultar una base de datos o actuar como subagente ha dejado de ser una partida relevante del coste de un proyecto. Y cuando un recurso se abarata tanto, la escasez se muda a otra parte. El resto de las noticias del día son, leídas juntas, un mapa de adónde se ha mudado.

La interfaz y el arnés

OpenAI extendió ayer GPT-6 a los planes de pago de ChatGPT y hoy lo lleva a los gratuitos, y lo relevante no es el modelo sino lo que lo acompaña: «Intelligent UI», respuestas con botones, calculadoras, gráficos interactivos y diagramas editables en lugar de párrafos. Es una decisión que solo tiene sentido si se asume que la calidad de la respuesta ya no diferencia lo bastante y que la batalla está en cómo se entrega. Para quien haya desplegado un asistente interno basado en texto, la consecuencia es incómoda: sus usuarios van a llegar con otra expectativa de lo que es una respuesta.

Microsoft dijo lo mismo con otras palabras. En la presentación de los Surface con el chip RTX Spark de Nvidia, Satya Nadella afirmó que tener un modelo, por sí solo, no sirve de mucho, y que los agentes necesitan orquestación, memoria externa y un arnés. Lo respaldó con producto: Windows 11 incorpora «Execution Containers» para aislar agentes, y los nuevos equipos, desde 2.600 dólares, están pensados para ejecutar modelos en local sin coste por uso. A mi juicio, esta es la pieza más infravalorada del día. Un sandbox a nivel de sistema operativo responde a una objeción que en proyectos reales bloquea más despliegues que el precio: qué puede tocar el agente y qué no.

La financiación apunta en la misma dirección. Nous Research confirmó una valoración de 1.500 millones de dólares y lanzó Hermes for Businesses, la versión empresarial de un agente de código abierto. El dinero está pagando el arnés, no los pesos.

Lo que no baja de precio

Mientras el token se desploma, hay tres cosas que se encarecen. La primera es física. La autoridad finlandesa de supervisión ordenó a la empresa que representa a Google detener los trabajos en dos emplazamientos de centros de datos, Muhos y Kajaani, mientras investiga si se despejaron cientos de hectáreas sin la evaluación de impacto ambiental obligatoria. Google reconoció que no estuvo a la altura de sus propios estándares, y la ministra de Medio Ambiente da por probables los retrasos. Hablamos de un país en el que la compañía anunció en septiembre una inversión de 13.000 millones de euros. El cómputo europeo no depende solo de chips y megavatios; depende de expedientes administrativos, y esos no siguen la curva de precios de nadie.

La segunda es la confianza. Common Sense Media probó más de 4.000 prompts en cuentas de adolescentes de ChatGPT y calificó el producto de «riesgo inaceptable»: el sistema no dio instrucciones dañinas en general, pero falló en más de uno de cada cuatro casos en los que debía derivar a ayuda externa, y las alertas a padres no saltaron en conversaciones de hasta una hora. OpenAI discute la metodología, y algunos de sus argumentos son atendibles. Pero la lección para cualquier empresa es independiente de quién tenga razón: un control anunciado no es un control verificado, y la verificación la acaba haciendo un tercero, en público, si no la haces tú antes.

La tercera es la más europea. Según Politico, el buscador alemán Ecosia abandona Mistral por modelos de código abierto, algunos chinos, y su consejero delegado lo explica sin diplomacia: están decepcionados con la calidad. Ocurre la misma semana en que Mistral presenta Large 4, un modelo de un billón de parámetros entrenado en Europa cuyos pesos se abrirán a finales de mes y que, según lo publicado, queda todavía por detrás de los mejores modelos abiertos chinos. La soberanía es un argumento de compra legítimo, pero no sustituye a la evaluación. Un cliente que apostó por el proveedor europeo se ha ido por rendimiento, y eso debería preocupar más en Bruselas que cualquier clasificación.

Dónde poner el esfuerzo

Queda una última señal. Bloomberg informa de que Isomorphic Labs, la filial de descubrimiento de fármacos de Alphabet, negocia financiación a una valoración de al menos 40.000 millones de dólares. Son conversaciones iniciales y pueden cambiar, pero la dirección del capital es coherente con todo lo anterior: se paga por el dominio vertical y los datos propios, no por la capacidad genérica de razonar.

Para una empresa que implementa IA, el día deja una instrucción bastante concreta. Hay que reabrir los casos de uso que se descartaron por coste, porque muchos ya salen, y hay que hacerlo midiendo con las cargas propias y no con el precio de lista. Pero el presupuesto que se libera en tokens no es ahorro: es lo que toca invertir en lo que no se abarata, es decir, en evaluación con datos reales, en permisos y aislamiento de agentes, en una interfaz que la gente quiera usar y en controles que resistan una auditoría externa. Elegir modelo se ha convertido en la decisión más barata y más reversible del proyecto. Las caras son las otras, y son las que casi nadie está presupuestando.

Las noticias del día

Anthropic lanza Claude Haiku 5.5 y recorta su precio hasta un 90 %

Anthropic presentó el 7 de octubre Claude Haiku 5.5 a 0,10 dólares por millón de tokens de entrada y 0,50 de salida en peticiones de hasta 100.000 tokens (0,50 y 2,50 por encima), frente a 1 y 5 dólares de Haiku 4.5. La compañía cifra el ahorro medio en torno al 75 % y el precio iguala el de GPT-6 Luna, de OpenAI. Según sus propios datos, pasa del 15,7 % al 72,4 % en OSWorld 2.1 y es el primer Haiku con nivel de esfuerzo ajustable. En el mismo anuncio, la lectura de caché de Sonnet 5.5 baja de 0,20 a 0,10 dólares por millón.

Por qué importa: un modelo capaz de manejar un ordenador pasa a costar lo que un clasificador, así que toca recalcular los casos de uso descartados por precio; con dos cautelas: el tramo superior a 100.000 tokens cuesta cinco veces más y el nuevo tokenizador consume algo más por tarea.

Fuente: Anthropic

OpenAI lleva GPT-6 a todos los planes de ChatGPT con «Intelligent UI»

OpenAI desplegó el 7 de octubre GPT-6 para los planes Pro, Plus, Business y Enterprise de ChatGPT, y el 8 de octubre lo extiende a Free y Go. Llega con «Intelligent UI»: las respuestas incluyen botones, calculadoras específicas para la tarea, gráficos interactivos y diagramas editables. El usuario puede reducir la cantidad de elementos visuales. Aarush Selvan, responsable de producto, recordó que ChatGPT «ha sido predominantemente una interfaz de texto».

Por qué importa: la respuesta deja de ser un párrafo y pasa a ser una pequeña aplicación generada al vuelo; los asistentes internos basados en chat de texto van a competir con esa expectativa.

Fuente: TechCrunch

Microsoft presenta los Surface con RTX Spark y aísla agentes en Windows 11

Microsoft anunció el Surface Laptop Ultra, con el chip RTX Spark de Nvidia, en dos configuraciones base desde 2.600 y 3.700 dólares (hasta 5.900 con ampliaciones), y el Surface RTX Spark Dev Box para desarrolladores desde 6.000 dólares. Ambos están pensados para ejecutar modelos en local sin coste por uso. Windows 11 incorpora «Execution Containers» para aislar agentes, que según Satya Nadella llegará a todos los usuarios. Nadella añadió que «tener solo un modelo no sirve de mucho» sin orquestación, memoria externa y arnés.

Por qué importa: inferencia local más un sandbox del propio sistema operativo es la combinación que faltaba para llevar agentes a datos que no pueden salir de la empresa.

Fuente: TechCrunch

Common Sense Media califica ChatGPT para adolescentes de «riesgo inaceptable»

El Youth AI Safety Institute de Common Sense Media probó más de 4.000 prompts en cuentas registradas a nombre de usuarios de 13 a 17 años. ChatGPT no dio, en general, instrucciones dañinas, pero no derivó a ayuda externa en más de uno de cada cuatro casos en que los evaluadores lo consideraban necesario, y en más de una docena de cuentas vinculadas a padres no saltó ninguna alerta en conversaciones de hasta una hora sobre autolesiones. OpenAI rechaza que las pruebas reflejen el funcionamiento real y alega que muchas se hicieron antes de completarse la vinculación de cuentas.

Por qué importa: un control anunciado no es un control verificado; cualquier despliegue ante público vulnerable necesita pruebas propias antes de que las haga un tercero.

Fuente: Axios

Finlandia ordena detener obras en dos centros de datos de Google

La agencia finlandesa de supervisión (LVV) ordenó el 6 de octubre a Tuike Finland, que representa a Google, suspender los trabajos preparatorios en Muhos y Kajaani mientras investiga si se despejaron cientos de hectáreas sin la evaluación de impacto ambiental obligatoria. La empresa debe presentar un plan antes del 14 de octubre y parar como muy tarde el día 23. Google admitió que «no estuvo a la altura» de sus estándares, y la ministra de Medio Ambiente, Sari Multala, da por probables los retrasos. Google había anunciado en septiembre una inversión de 13.000 millones de euros en Finlandia.

Por qué importa: en Europa, el calendario del cómputo lo marcan ya los permisos tanto como los chips o la energía.

Fuente: Courthouse News (AFP)

Ecosia abandona Mistral, según Politico, la semana en que se presenta Mistral Large 4

Según una información de Politico recogida por AI Weekly, el buscador alemán Ecosia sustituye a Mistral por modelos de código abierto, entre ellos algunos chinos. Su consejero delegado, Christian Kroll, declaró: «Estamos decepcionados con la calidad de Mistral». No se ha precisado qué modelos ha elegido ni con qué pruebas. La noticia llega dos días después de que Mistral presentara Large 4, de un billón de parámetros (49.000 millones activos), entrenado en centros de datos europeos y con pesos abiertos previstos para finales de octubre.

Por qué importa: la soberanía es un criterio de compra legítimo, pero no sustituye a la evaluación con cargas propias; un cliente europeo se ha ido por rendimiento.

Fuente: Politico · AI Weekly · El Español

Isomorphic Labs negocia financiación a una valoración de al menos 40.000 millones (no cerrada)

Según Bloomberg, citado por RuntimeWire, Isomorphic Labs, la filial de descubrimiento de fármacos de Alphabet surgida de DeepMind, mantiene conversaciones iniciales para captar fondos a una valoración de al menos 40.000 millones de dólares, que según una fuente podría llegar a 50.000. La operación no está cerrada y las condiciones pueden cambiar. La compañía cerró en mayo una Serie B de 2.100 millones liderada por Thrive Capital.

Por qué importa: el capital está pagando dominio vertical y datos propios, no capacidad genérica de razonar.

Fuente: Bloomberg · RuntimeWire

Nous Research confirma una valoración de 1.500 millones y lanza Hermes for Businesses

Nous Research confirmó una Serie B de 90 millones de dólares liderada por Robot Ventures, con Nvidia, Union Square Ventures, Menlo Ventures, Samsung y 1789 Capital, que eleva su financiación total a 158 millones. Lanza Hermes for Businesses, para desplegar agentes personalizados sobre flujos de varios pasos manteniendo los datos en privado. La empresa estima que su agente de código abierto Hermes se ha clonado más de 24 millones de veces y supone en torno al 2,5 % del uso mundial de tokens.

Por qué importa: el arnés de agentes, independiente del modelo que haya debajo, se consolida como capa con valor propio.

Fuente: TechCrunch

  • #precios-ia
  • #agentes-ia
  • #anthropic
  • #openai
  • #soberania-digital
¿Te ha sido útil? Compártelo
LinkedInXWhatsApp

Más en IA en la empresa

Newsletter semanal

Un análisis así cada domingo.

Las noticias de la semana y una pieza a fondo, directamente en tu correo.