ai-powered-markdown-translatorArtículo traducido del francés al español con gpt-5.6-sol.
Meta lanza Muse, un agente personal que proporciona a cada usuario su propia máquina Linux en la nube, y publica ese mismo día la arquitectura de seguridad que lo rodea, con un programa de recompensas por errores (bug bounty) abierto a todos de hasta 300.000 dólares. Mistral anuncia una Serie D de 3.000 millones de euros, la mayor ronda de financiación mediante acciones cerrada hasta ahora por una empresa tecnológica europea. Por su parte, OpenAI publica una demostración de singularidad en tiempo finito para las ecuaciones de Navier-Stokes, producida por un sistema de agentes, y Google DeepMind calcula previamente el efecto de los 9.000 millones de mutaciones posibles del ADN humano.
Meta lanza Muse, su agente personal, y publica su arquitectura de seguridad
8 de septiembre — Meta lanza Muse, un agente personal disponible como aplicaciones para iOS y Android, mediante una interfaz web y en WhatsApp, impulsado por Muse Spark 1.3. El modelo no es nuevo: llegó el 2 de septiembre a Muse Code y a la Meta Model API, y su nivel máximo de razonamiento se hizo público el 4 de septiembre. Lo novedoso es el producto de consumo construido a su alrededor.
La arquitectura se basa en una idea sencilla de enunciar y compleja de implementar: cada usuario recibe su propio ordenador en la nube. Muse Secure VM es una máquina Linux persistente y aislada, dotada de un sistema de archivos, un terminal y un navegador completo, con almacenamiento, procesador y memoria suficientes para compilar código, desarrollar skills a medida y ejecutar subagentes en paralelo. Es esta máquina, y no una infraestructura centralizada de Meta, la que actúa como sistema de referencia para los datos y las credenciales de los servicios conectados. Cuando falta una herramienta para una tarea, el agente la escribe por sí mismo y produce objetos manipulables en lugar de bloques de texto: itinerarios, PDF, páginas web y paneles de control, que Meta denomina Artifacts.
La segunda ruptura reivindicada es que el agente trabaja en segundo plano con la aplicación cerrada, de forma programada y como reacción a acontecimientos, y después decide si el resultado merece una notificación. La memoria es persistente, legible y modificable por el usuario, y una pestaña Objetivos ofrece una visión general de aquello a lo que el agente hace seguimiento. Queda lo que Meta no dice: no se ha publicado ningún precio y el lanzamiento no viene acompañado de una lista de países donde estará disponible.
Veinte minutos después del anuncio del producto, Meta publicó un documento de ingeniería firmado por Tarek Sheasha, ingeniero de software y vicepresidente de Meta Superintelligence Labs, sobre la seguridad de este sistema. El principio rector se establece desde el inicio: el sistema está diseñado bajo el supuesto de que el agente será atacado. El arnés agéntico, llamado Hatch en el código, se ejecuta en un contenedor systemd-nspawn cuyo root está asignado a un usuario sin privilegios del host, con llamadas al sistema filtradas y capacidades del kernel retiradas. Cuatro servicios residen deliberadamente fuera de este contenedor para impedir que un atacante que comprometa el agente pueda desactivarlos: los clasificadores de seguridad, los workers con privilegios separados, el daemon de almacenamiento de credenciales y Sentinel.
Sentinel es la pieza central: como única autoridad capaz de permitir una acción de un conector o una salida de red, evalúa cada solicitud en las capas 4 y 7 y comprueba la dirección resuelta realmente. Sobre todo, el agente solo maneja tokens sustitutivos, que se reemplazan por las credenciales reales en la frontera de la red. Hacer que el agente revele un secreto mediante prompt injection deja de tener sentido, puesto que nunca ha tenido acceso a él. A esto se suma un seguimiento de flujo en el kernel, el tainted egress: cualquier proceso que lea datos del usuario queda marcado y pierde su autorización automática. La implementación combina programas eBPF vinculados a los cgroups y hooks de Linux Security Module añadidos por Meta.
| Elemento de la arquitectura | Opción elegida |
|---|---|
| Contenedor del arnés agéntico | systemd-nspawn, root asignado a un usuario sin privilegios |
| Autoridad de autorización | Sentinel, fuera del contenedor, capas 4 y 7 |
| Credenciales visibles para el agente | únicamente tokens sustitutivos |
| Conector de correo electrónico | filtrado de códigos de un solo uso y enlaces de restablecimiento |
| Subagente navegador | árbol de accesibilidad, sin DOM sin procesar ni JavaScript dentro de la página |
| Pagos | Stripe Link en el lanzamiento, Shop Pay después, tarjeta de un solo uso |
| Bug bounty, máximo por informe válido | 300.000 dólares |
| Bug bounty, prompt injection | hasta 130.000 dólares |
El documento viene acompañado de dos anuncios. El programa de recompensas por errores se abre a todos desde el lanzamiento, con hasta 300.000 dólares por informe válido según el impacto demostrado, incluidos hasta 130.000 dólares por una prompt injection exitosa que afecte a un usuario. Además, Muse Confidential VM, previsto para antes de finales de año, deberá impedir de forma criptográfica y verificable que Meta acceda a los datos de una máquina virtual, con un diseño y un código fuente que ya se han sometido a auditores externos. La conclusión del texto es inusualmente franca para una publicación empresarial: la prompt injection sigue siendo un problema abierto en la industria y Muse cometerá errores.
🔗 Lanzamiento de Muse · 🔗 Seguridad y protección de los agentes, Meta
Mistral recauda 3.000 millones de euros, la mayor ronda mediante acciones de la tecnología europea
8 de septiembre — Mistral anuncia una Serie D de 3.000 millones de euros, con una valoración post-money superior a 21.000 millones de euros. La empresa presenta esta ronda como la mayor financiación mediante acciones cerrada hasta ahora por una compañía tecnológica europea, tres años después de su creación.
Samsung Electronics lidera la operación. Scaleup Europe Fund, gestionado por EQT, y PSG Equity, que ya era accionista, la colideran. Tres nuevos participantes se incorporan a la ronda: Advent, fondos y cuentas gestionados por BlackRock y el Gran Ducado de Luxemburgo. La lista de inversores existentes es larga y abarca tres continentes, desde a16z hasta Salesforce Ventures, pasando por ASML, BNP Paribas CIB, Bpifrance, DST Global, General Catalyst, Index Ventures, Korelya Capital, Lightspeed y NVIDIA.
El detalle que merece atención es la naturaleza de los dos líderes sucesivos. ASML lideró la Serie C y Samsung Electronics lidera la Serie D: dos empresas industriales de fabricación avanzada, no fondos tecnológicos generalistas. Mistral lo interpreta como una señal de confianza en su capacidad para implementar modelos de vanguardia dentro de entornos industriales complejos, donde el control de los datos y de la infraestructura condiciona la adopción.
| Indicador | Valor |
|---|---|
| Importe recaudado | 3.000 millones de euros |
| Valoración post-money | más de 21.000 millones de euros |
| Antigüedad de la empresa | 3 años |
| Líder de la ronda | Samsung Electronics |
| Colíderes de la ronda | Scaleup Europe Fund gestionado por EQT, PSG Equity |
| Países donde opera | 20 |
| Grandes clientes | más de 125, entre ellos Airbus, ASML y HSBC |
En cuanto al uso de los fondos, la empresa menciona en primer lugar la investigación de frontera, seguida del aumento de la capacidad de cómputo para el entrenamiento, la ampliación de la infraestructura y la aceleración comercial internacional. El argumento retoma la postura defendida desde el verano: la pregunta que se plantean las organizaciones ya no sería quién construye el modelo más potente, sino cómo aprovechar la IA sin ceder el control de su infraestructura. Mistral se describe como la única empresa del sector que reúne el stack completo necesario, desde modelos de pesos abiertos hasta productos, pasando por la capacidad de cómputo.
Today marks a major step for Mistral: we’re announcing a €3B Series D, the largest equity round ever raised by a European tech company, just three years after launch.
🇪🇸 Hoy marca un hito importante para Mistral: anunciamos una Serie D de 3.000 millones de euros, la mayor ronda de financiación mediante acciones realizada hasta ahora por una empresa tecnológica europea, apenas tres años después de nuestro lanzamiento. — @MistralAI en X
Los agentes científicos de OpenAI: una demostración sobre Navier-Stokes y qubits calibrados en el MIT
8 de septiembre — OpenAI publica una demostración de formación de singularidades en tiempo finito para las ecuaciones tridimensionales de Navier-Stokes, acompañada de una formalización en el asistente de demostración Lean. El resultado anunciado es que un fluido tridimensional inicialmente liso y en reposo, sometido a una fuerza externa lisa, puede experimentar un crecimiento ilimitado de su velocidad en un tiempo finito, aunque la viscosidad tienda a suavizar el movimiento y la energía del sistema permanezca finita. En la formulación oficial del Clay Mathematics Institute, esto corresponde a los enunciados «C» y «D», los que constituyen una refutación y no una demostración de regularidad.
Conviene precisar qué afirma OpenAI y qué no afirma. La demostración fue producida por un sistema de agentes coordinados respaldado por un modelo interno sin nombre público, descrito por la empresa como significativamente más capaz que GPT-6 Astra y cuyo entrenamiento continúa desde el 28 de agosto. La única verificación descrita es la formalización en Lean, encargada a GPT-6 Astra y completada en 17 horas tras la resolución. El anuncio no menciona ninguna revisión por pares ni validación por parte del Clay Mathematics Institute, y OpenAI declara que no tiene intención de reclamar el premio del milenio, pues presenta su resultado como una instantánea y no como una culminación.
El método es al menos tan notable como el resultado. El esfuerzo comenzó el 1 de septiembre, después de que surgieran rumores de que acababan de resolverse dos problemas del milenio. Distintos grupos de agentes recibieron diferentes variantes del enunciado: las versiones «A» y «B» orientadas hacia una demostración y las versiones «C» y «D» hacia una refutación. En un problema relacionado, la regularidad de las ecuaciones de Euler no forzadas, cerca de 100 agentes produjeron una refutación en unas cincuenta horas; este resultado se volvió a introducir en los prompts de los agentes que trabajaban en Navier-Stokes.
| Métrica | Valor |
|---|---|
| Agentes concurrentes, grupo Navier-Stokes | del orden de 10.000 |
| Tiempo hasta la resolución | aproximadamente 88 horas |
| Formalización y verificación en Lean | 17 horas adicionales, mediante GPT-6 Astra |
| Mensajes intercambiados, Navier-Stokes | 2,7 millones |
| Tokens de salida, Navier-Stokes | aproximadamente 130.000 millones |
| Mensajes intercambiados, todos los problemas | 4,9 millones |
| Tokens de salida, todos los problemas | aproximadamente 300.000 millones |
| Refutación de la regularidad de Euler no forzada | cerca de 100 agentes, aproximadamente 50 horas |
Un trabajo paralelo complica el panorama. Levent Alpöge, empleado de Anthropic, y Tristan Buckmaster, profesor de matemáticas en NYU, tenían un resultado sobre las ecuaciones de Euler en su versión forzada. OpenAI se puso en contacto con ellos el 6 de septiembre, una vez finalizado y verificado su proyecto, para proponer una publicación conjunta y reconocer su prioridad, antes de descubrir que su resultado se refería a un enunciado distinto del suyo.
This model represents a step-function improvement on many benchmarks, and its training is ongoing. Our internal model group arrived at the Navier–Stokes solution in 88 hours, using around 10,000 coordinating AI agents. Throughout the effort, we maintained the strict safeguards—including monitoring and isolation—that we apply to all our frontier evaluations.
🇪🇸 Este modelo representa una mejora escalonada en numerosos benchmarks, y su entrenamiento continúa. Nuestro grupo de modelos internos alcanzó la solución de Navier-Stokes en 88 horas, con aproximadamente 10.000 agentes de IA coordinados. Durante todo el esfuerzo mantuvimos las estrictas medidas de protección, incluidas la supervisión y el aislamiento, que aplicamos a todas nuestras evaluaciones de modelos de frontera. — @OpenAI en X
Ese mismo día, OpenAI publica un estudio de caso mucho más modesto y mucho más verificable. Beatriz Yankelevich, doctoranda del grupo Engineering Quantum Systems del MIT, conectó Codex, controlado por GPT-5.6 Sol, al software que coordina sus experimentos para calibrar un chip sin calibrar con seis qubits superconductores. Los agentes recibieron skills específicas para cada tipo de medición, que describían cómo realizarla y cómo evaluarla. Con señales claras, Codex llevó a cabo una secuencia completa con poca intervención: identificación de las frecuencias de transición, calibración de los pulsos de control y lectura y medición del tiempo de conservación de la información cuántica. Con señales débiles o ruidosas, tarda más en encontrar parámetros aprovechables y a veces requiere el criterio de un investigador experimentado, que sigue siendo más rápido que el modelo. Por tanto, la ventaja no es la velocidad, sino la ausencia de supervisión permanente: caracterizar uno de estos chips estándar le cuesta varios días a un investigador, y el grupo ahora confía las mediciones rutinarias a agentes.
🔗 Solución de Navier-Stokes, OpenAI · 🔗 Codex y experimentos cuánticos, OpenAI
ChatGPT Images 2.5, con Sketch y dos modelos de imagen en la API
8 de septiembre — OpenAI lanza ChatGPT Images 2.5 en sus productos y en la API. La cifra de uso indicada al comienzo muestra la magnitud de lo que está en juego: cada semana se crean más de 3.000 millones de imágenes en ChatGPT Images y con los modelos GPT-Image de la API. La mejora más concreta es la latencia, reducida hasta un 50 por ciento respecto a Images 2.0; el resto se centra en la fidelidad a las fotos de referencia y en la coherencia a lo largo de una conversación extensa, donde las modificaciones anteriores se conservan mejor.
Tres funcionalidades llegan a ChatGPT. Sketch permite dibujar directamente en la conversación para proporcionar una guía visual escribiendo «@Sketch». Las templates abarcan formatos habituales, como carteles o merchandising. Es posible añadir comentarios sobre la imagen para indicar una modificación concreta. Al compartir una imagen, ahora también se puede incluir el prompt que la produjo. El despliegue abarca a todos los usuarios de ChatGPT, ChatGPT Work y Codex, en desktop, dispositivos móviles y web, en todos los niveles.
| Modelo en la API | Posicionamiento anunciado | Latencia |
|---|---|---|
| GPT-Image-2.5 Flare | opción predeterminada, contenido social, generación a gran escala | hasta un 50 por ciento menos que Images 2.0 |
| GPT-Image-2.5 Sunburst | precisión, campañas listas para publicar | tiempos de generación más largos |
Ambos modelos admiten los nuevos ajustes de calidad xhigh y max y mantienen las tarifas de tokens de GPT Image 2: en el nivel Standard, 8,00 dólares por millón de tokens de entrada de imagen, 30,00 dólares por los de salida de imagen y 5,00 dólares por los de entrada de texto. Se mantienen los metadatos C2PA y la marca de agua invisible, y el lanzamiento viene acompañado de una system card.
Manus integra el modelo ese mismo día
Manus incorpora GPT-Image-2.5 a su plataforma la noche del anuncio, citando el mensaje de OpenAI publicado una hora y media antes. El laboratorio de agentes, que volvió a ser independiente el 1 de septiembre, aporta una cifra procedente de sus propias evaluaciones y no de las de OpenAI: el modelo al que denomina Flare produce imágenes de alta calidad a una velocidad entre dos y cuatro veces superior a la de GPT-Image-2. Para un agente que genera contenido visual a lo largo de una conversación, este factor importa más que una mejora marginal de la calidad, ya que determina si la generación permanece dentro del flujo de trabajo o impone una espera. Manus también destaca una generación mejorada de fondos transparentes, que evita la fase de recorte manual que rompe la automatización completa.
AlphaGenome Atlas, el mapa predictivo de los 9.000 millones de mutaciones del ADN humano
8 de septiembre — Google DeepMind lanza AlphaGenome Atlas, una base de datos que predice el efecto molecular de cada posible mutación de una sola letra en el ADN humano. El genoma humano cuenta con aproximadamente 3.000 millones de pares de bases, de los cuales solo el 2 por ciento codifica proteínas; el 98 por ciento restante continúa en gran medida sin explorar, aunque un simple cambio de letra puede desactivar en él un regulador biológico esencial.
El método consiste en invertir la carga. En lugar de dejar que cada laboratorio consulte el modelo variante por variante, Google DeepMind ha calculado previamente las predicciones del modelo AlphaGenome para los 9.000 millones de sustituciones posibles. El resultado es un conjunto de datos de 1 petabyte, presentado como más de treinta veces el tamaño de AlphaFold Database. Para hacer aprovechable este volumen, el Atlas introduce la puntuación AVI (AlphaGenome Variant Impact), un único número que agrega las predicciones sobre las regiones codificantes y no codificantes e indica qué procesos biológicos altera una variante, con atribuciones por característica. A esto se suma un catálogo de más de 2.500 motivos de secuencia recurrentes, las unidades reguladoras que Google describe como las «palabras» del genoma.
| Métrica | Valor |
|---|---|
| Variantes calculadas previamente | 9.000 millones, todos los cambios de una letra |
| Tamaño del conjunto de datos | 1 petabyte, más de 30 veces AlphaFold Database |
| Motivos de secuencia catalogados | más de 2.500 |
| Participantes de UK Biobank analizados | más de 54.000 |
| Asociaciones no codificantes adicionales | un 22 por ciento más |
| Regiones genéticas vinculadas al IMC identificadas | 19 |
Dos usos documentados muestran la magnitud de la mejora. En el Broad Institute, Laura Covill y su equipo utilizaron la puntuación AVI para priorizar variantes candidatas en enfermedades raras que seguían sin diagnóstico: la herramienta destacó una variante del gen DNM1 al predecir que creaba un sitio de splicing incorrecto, lo que proporcionó el elemento decisivo para resolver el caso. En la University of Exeter, Gareth Hawkes aplicó el Atlas a los datos de más de 54.000 participantes de UK Biobank y obtuvo un 22 por ciento más de asociaciones genéticas no codificantes; después identificó 19 regiones genéticas vinculadas al índice de masa corporal limitándose al 1 por ciento de las variantes con mayor impacto.
El acceso es el segundo punto destacable. El Atlas está disponible mediante un portal web que no requiere escribir código, dirigido a médicos y biólogos que no programan, pero también a través de la API AlphaGenome, en Cloud mediante Model Garden, con los datos de investigación publicados en GitHub. Un detalle que interesará a los desarrolladores que siguen el ecosistema de agentes de Google: el Atlas también se distribuye como skill en Google Antigravity, por lo que un agente de programación puede utilizarlo directamente.
🔗 AlphaGenome Atlas, Google DeepMind
NVIDIA lanza CUDA Rust y Cosmos arrasa en el AI City Challenge de ECCV
8 de septiembre — NVIDIA publica CUDA Rust, su respuesta a una carencia que se ha vuelto evidente: la capa de sistemas de la IA se escribe cada vez más en Rust, pero el kernel de GPU seguía siendo la excepción. Ya era posible ejecutar un kernel desde Rust, pero había que escribirlo en otro lenguaje. CUDA Rust cierra esta brecha compilando los kernels de Rust de forma nativa a PTX, mediante dos vías distintas alineadas con los dos modelos de programación que CUDA ya ofrece en C++ y Python.
| Elemento | cuda-oxide, vía SIMT | cutile-rs, vía Tile |
|---|---|---|
| Madurez | alpha temprana | publicado en crates.io |
| Cadena de Rust requerida | nightly fijada (nightly-2026-04-03) | stable 1.89 o posterior |
| Versión de CUDA | 12.x o posterior | 13.3 |
| LLVM que debe proporcionarse | sí, además de clang y libclang | no |
| Compilación | a PTX durante la construcción | JIT mediante CUDA Tile IR |
| Usos externos citados | ninguno | Grout de Hugging Face, mistral.rs |
La recomendación de NVIDIA es explícita: comenzar por Tile, porque así el código fuente no codifica ninguna elección específica de una arquitectura, y descender a SIMT cuando resulte necesario controlar con precisión los threads y la memoria. Actualmente, esta decisión tiene un coste, ya que en SIMT la memoria compartida, fundamento de los kernels rápidos, todavía requiere unsafe. El argumento de fondo es la seguridad de la memoria durante la compilación: ambas vías rechazan el aliasing clásico en el que un búfer sirve a la vez como entrada y salida, con error[E0502] en SIMT y error[E0382] en Tile. Respecto a la madurez, NVIDIA no exagera: ninguno de los dos proyectos está listo para producción, y el compromiso anunciado se extiende hasta 2027 y más allá, con un trabajo conjunto con los responsables de mantenimiento de rust-cuda.
Ese mismo día, NVIDIA publica el palmarés del AI City Challenge de ECCV 2026. En la pista 5, dedicada a la predicción generativa en vídeo de escenas de tráfico, cuatro de las cinco mejores soluciones utilizan versiones de los modelos fundacionales de mundo Cosmos. El equipo Qyn gana la clasificación pública con CosmosAlign, que adapta el modelo congelado Cosmos3-Nano de 16.000 millones de parámetros mediante una receta LoRA en dos etapas, genera cuatro predicciones, selecciona el medoide y vuelve a incorporar las regiones estables del historial observado: 76,39 frente a 76,04 del equipo SSUPER, es decir, una ventaja de 0,35 puntos. NVIDIA precisa que se trata de una receta de adaptación e inferencia, no de una arquitectura nueva. Cosmos también aparece como juez: en las dos clasificaciones fuera de dominio de la pista 3, el equipo UWIPL_ETRI se impone con UniTraffic, que hace que un verificador independiente Cosmos-Reason1 compruebe las afirmaciones controvertidas.
🔗 CUDA Rust, NVIDIA · 🔗 Palmarés del AI City Challenge
Cognition recauda más de 2.000 millones de dólares y alcanza una valoración de 48.000 millones
8 de septiembre — Cognition, la empresa creadora del agente de desarrollo Devin, anuncia una ronda de financiación de más de 2.000 millones de dólares con una valoración de 48.000 millones. La ronda está liderada por dos nuevos participantes, Andreessen Horowitz y Accel, junto con los inversores ya presentes Founders Fund, General Catalyst y Avenir. Una treintena de participantes completan la ronda, entre ellos NVIDIA, Benchmark, Bessemer, Kleiner Perkins, Greylock, Lightspeed, T. Rowe Price y Bain Capital Ventures.
| Indicador | Mayo de 2026 | Septiembre de 2026 |
|---|---|---|
| Importe recaudado, total de la ronda | más de 1.000 millones de dólares | más de 2.000 millones |
| Valoración | 26.000 millones de dólares | 48.000 millones |
| Ingresos anualizados | 492 millones de dólares | cerca de 900 millones |
| Inversores principales | Lux Capital, General Catalyst, 8VC | Andreessen Horowitz, Accel |
Por tanto, la valoración casi se ha duplicado en cuatro meses y se ha multiplicado casi por cinco en un año, con unos ingresos anualizados que siguen la misma tendencia. Cognition detalla los usos que impulsan este crecimiento: Devin trabaja en el diseño de chips en NVIDIA, en aviación en GE Aerospace, en servicios financieros en Citi, en automoción en Mercedes-Benz y en infraestructura de IA en Modal. El hecho de que NVIDIA sea a la vez cliente e inversor de la ronda ilustra cómo estas empresas aseguran el acceso a las herramientas que utilizan internamente. Tres capacidades recientes llevan a Devin de la ejecución de tareas a la acción autónoma: Auto-Triage para la primera fase de investigación de incidentes, Security Swarm para clasificar vulnerabilidades y Automations, activado mediante eventos de Slack, GitHub o Linear. En un año se han abierto seis oficinas, cinco de ellas fuera de Estados Unidos, además de los centros de San Francisco, New York y Austin.
In the next chapter of software engineering, agents will become proactive by default, software will improve itself, and compute will automatically get allocated toward the highest impact use cases. We’re still at the dawn of the self-driving software era.
🇪🇸 En el próximo capítulo de la ingeniería de software, los agentes serán proactivos de forma predeterminada, el software se mejorará a sí mismo y la capacidad de computación se asignará automáticamente a los usos de mayor impacto. Todavía estamos en los albores de la era del software autónomo. — @cognition en X
Suno firma con Believe y TuneCore, que hasta ayer se negaban a distribuir su música
8 de septiembre — Suno anuncia una asociación estratégica mundial con Believe, empresa de desarrollo de artistas, y con su plataforma de autodistribución TuneCore. El acuerdo abarca dos aspectos distintos. En primer lugar, Believe participa en el diseño de los nuevos modelos musicales que Suno desarrolla con la industria. En segundo lugar, y este es el punto concreto para los usuarios, las canciones creadas con este nuevo modelo asociado podrán distribuirse mediante Believe y TuneCore y, por tanto, llegar a Spotify, Apple Music, Amazon Music y YouTube.
El contexto muestra el alcance del anuncio. Suno recuerda sin rodeos que, a principios de este año, Believe y TuneCore habían anunciado que no distribuirían música producida con modelos que no cumplieran sus criterios, incluidos los modelos que Suno tenía entonces. El cambio se presenta como resultado de conversaciones que revelaron valores compartidos: ofrecer opciones reales a los artistas y abrir vías de distribución e ingresos.
El acuerdo forma parte de una secuencia coherente. Prolonga Spark, el programa de Suno destinado a artistas independientes y emergentes, y complementa los acuerdos existentes con Warner Music Group y BMG incorporando sellos independientes y artistas autoproducidos. Suno también lo vincula explícitamente con sus medidas de protección recientes: la marca de agua de audio y la huella acústica destinadas a identificar sus canciones fuera de la plataforma, así como los límites de descarga que entraron en vigor el 3 de septiembre para impedir la distribución masiva a servicios de streaming. Estas protecciones se aplicarán a la música distribuida por Believe y TuneCore. El anuncio concluye con un calendario: Suno anuncia el lanzamiento muy próximo de sus nuevos modelos, cuya familia recibió el nombre de v6 el 4 de septiembre.
🔗 Asociación con Believe, Suno
Cohere abre un motor de servicio (serving) construido en torno a un megakernel, 1,58x más rápido que vLLM
8 de septiembre — Cohere publica un motor de servicio de inferencia construido íntegramente en torno a un megakernel de decodificación, bajo licencia Apache 2.0. La empresa reivindica una primicia: no una demostración de velocidad en laboratorio, sino un servidor completo capaz de procesar solicitudes reales detrás de un endpoint compatible con OpenAI, con procesamiento por lotes continuo, atención paginada, caché de prefijos y llamada a herramientas. El modelo servido es North Mini Code, una mezcla de expertos de 30 mil millones de parámetros, de los cuales solo 3,3 mil millones están activos por token.
El problema abordado se resume en una frase: durante la decodificación, la GPU pasa mucho tiempo esperando en lugar de calculando. Una pila clásica lanza un núcleo (kernel) por operación, y cada límite de núcleo impone una barrera en toda la cuadrícula de cálculo. Sin embargo, la decodificación autorregresiva está limitada por el ancho de banda de memoria: en cada paso, North Mini Code transfiere 6,6 GB de pesos desde la memoria HBM, más aproximadamente 0,5 GB de caché clave-valor con un contexto de 8K, lo que sitúa el límite teórico en torno a 470 tokens por segundo con los 3,35 TB/s de una H100. Un megakernel elimina estos límites lanzando un único núcleo persistente que permanece residente durante todo el paso de decodificación, con dependencias reducidas a contadores en la memoria global.
| Medición | Megakernel | vLLM v0.24 | Mejora |
|---|---|---|---|
| Decodificación, lote de tamaño 1, contexto 8K (tok/s) | 292 | 185 | 1,58x |
| AIME 2025, de extremo a extremo (tok/s) | 935 | 661 | 1,41x |
| SciCode, de extremo a extremo (tok/s) | 711 | 560 | 1,37x |
| MMLU-Pro, subconjunto de informática (tok/s) | 948 | 713 | 1,33x |
| LiveCodeBench v6, de extremo a extremo (tok/s) | 803 | 625 | 1,28x |
| GPQA, de extremo a extremo (tok/s) | 787 | 631 | 1,25x |
Los 292 tokens por segundo con un lote de tamaño 1 representan el 62 por ciento del límite teórico, frente al 39 por ciento de vLLM. La calidad no cambia: 38,9 por ciento frente a 38,2 en SciCode y 70,3 por ciento en ambos casos en LiveCodeBench v6, con promedios de siete ejecuciones. Un detalle merece atención: la ventaja depende de la distribución de los expertos, con 1,32x bajo el enrutamiento real del modelo frente a 1,14x bajo un enrutamiento uniforme simulado, lo que convierte las mediciones uniformes en el caso desfavorable. Por último, Cohere insiste en un punto contraintuitivo: escribir un megakernel sería más sencillo de lo que su reputación sugiere, con un único archivo CUDA en el que dieciséis códigos de operación cubren todo el paso de decodificación. Las limitaciones se reconocen y se califican como límites de implementación: solo decodificación, ya que el prellenado sigue ejecutándose con núcleos PyTorch convencionales; únicamente H100 y BF16; y tamaños de lote de 1 a 8.
Anthropic documenta cómo reducir la factura de Claude Platform sin perder rendimiento
8 de septiembre — Anthropic publica una guía de ingeniería que contradice la idea extendida de que reducir la factura de un agente implica aceptar peores resultados. En ella se documentan tres palancas: maximizar la tasa de aciertos de la caché de prompts, eliminar los anti-patterns de prompt al pasar a un modelo de frontera y calibrar el esfuerzo según la tarea. El método se presenta en forma de comandos ejecutables en Claude Code, con /claude-api prompt-audit y /claude-api hillclimb que se incorporan a /claude-api cost-optimize.
| Banco de pruebas, base Sonnet 5 | Reducción de costes | Detalle medido |
|---|---|---|
| LegalBench | alrededor del 58 por ciento | tokens de razonamiento de 102 779 a 8 284 |
| tau2-bench retail | alrededor del 73 por ciento | caché de prompts con puntos de corte explícitos |
| OfficeQA Pro | alrededor del 52 por ciento | de 136,20 a 64,87 dólares |
| SWE-bench Verified | alrededor del 55 por ciento | pasos medianos de 29 a 17, tokens de prompt reducidos a menos de la mitad |
La cifra más práctica no aparece en esta tabla. En CursorBench 3.2, Claude Fable 5.1 con esfuerzo low iguala a Fable 5 con esfuerzo high por un tercio del coste, en parte gracias a la tarifa de las lecturas de caché, facturadas a 0,25 dólares por millón de tokens frente a 1,00 dólar anteriormente. Por el contrario, en Humanity’s Last Exam sin herramientas, el último nivel de esfuerzo aporta aproximadamente medio punto a cambio de un 46 por ciento más de coste, una mejora ahogada en el ruido del benchmark.
🔗 Reducir los costes en Claude Platform
Claude Code 2.1.265: carpetas de plugins, límite de 1 GB y reparación de la caché de prompts
8 de septiembre — Claude Code pasa a la versión 2.1.265 con cincuenta entradas en el changelog, incluidas treinta y cuatro correcciones, dos días después de una versión 2.1.263 que solo contenía una. La opción --plugin-dir acepta ahora una carpeta completa de plugins; se carga cada subcarpeta provista de un manifiesto y se detectan las adiciones y eliminaciones realizadas durante la ejecución. Se aplica un límite de 1 GB a los resultados de herramientas escritos en disco, y la vista previa indica cuándo se ha truncado un archivo.
La parte más densa se refiere a la caché de prompts, en consonancia con la guía publicada el mismo día. Dos correcciones distintas solucionan casos en los que Claude Code impedía por sí mismo la reutilización de la caché: la reanudación de un subagente iniciado en primer plano modificaba su lista de herramientas y el prefijo de su prompt de sistema, mientras que los compañeros de equipo de los agentes y los subagentes reanudados desplazaban fuera del prefijo el contexto de los hooks SubagentStart y las skills precargadas. Otras dos correcciones están relacionadas con la seguridad: una ruta de plugin que contenía una barra invertida eludía la comprobación de confinamiento de enlaces simbólicos en macOS y Linux, y en Windows las herramientas de lectura y escritura rechazaban cualquier archivo situado en un AppContainer o en un sandbox con token restringido. La lectura de un artifact escrito por un tercero se trata ahora como contenido no fiable.
Amp sustituye la cola de mensajes por la dirección en tiempo real
8 de septiembre — Amp cambia el comportamiento predeterminado de su agente ante los mensajes enviados mientras está trabajando. Hasta ahora, un mensaje escrito mientras el agente se ejecutaba se ponía en cola y solo se procesaba una vez finalizado el turno; ahora se entrega en cuanto surge la primera oportunidad. El editor señala dos ventajas: el agente tiene en cuenta antes los comentarios y deja de iniciar pasos de verificación que la nueva instrucción vuelve innecesarios, lo que ahorra tiempo y tokens en el caso habitual en que se observa que el agente está tomando una dirección equivocada.
El cambio no está exento de efectos secundarios, y Amp los documenta. Si la dirección resulta demasiado brusca, el editor aconseja formular las solicitudes como «When done, then…» en lugar de «Now, …», para indicar explícitamente que la instrucción se aplica después de la tarea en curso. Ship, Review y las demás acciones integradas conservan el comportamiento anterior y siguen poniéndose en cola, ya que por lo general se desea que el trabajo termine antes de entregarlo o iniciar una revisión. La puesta en cola manual sigue estando disponible, tanto en la aplicación como en el CLI.
🔗 Dirigir, no poner en cola, Amp
Muse Spark 1.3 llega a Cursor con la mejor relación entre puntuación y coste de CursorBench
8 de septiembre — Cursor añade Muse Spark 1.3, el modelo de agentes de Meta Superintelligence Labs, seis días después de su presentación. Las cifras publicadas no cuentan una historia de rendimiento bruto, sino de coste. En CursorBench 3.2, el banco de pruebas interno construido a partir de tareas reales con múltiples archivos, el nivel Max obtiene un 67,9 por ciento por 1,31 dólares por tarea y ocupa el duodécimo puesto.
| Modelo y nivel | Puntuación CursorBench 3.2 | Coste por tarea, en dólares | Tokens por tarea | Puesto |
|---|---|---|---|---|
| Fable 5.1 Max | 73,4 por ciento | 9,64 | 72 060 | 1 |
| Grok 4.6 Extra High | 70,8 por ciento | 2,81 | 41 136 | 3 |
| Opus 5 Max | 70,0 por ciento | 8,23 | 61 838 | 5 |
| Gemini 3.8 Flash High | 69,2 por ciento | 2,38 | 81 524 | 9 |
| Muse Spark 1.3 Max | 67,9 por ciento | 1,31 | 33 034 | 12 |
| GPT-5.6 Sol Max | 67,2 por ciento | 5,69 | 28 320 | 13 |
| Muse Spark 1.3 Low | 55,0 por ciento | 0,45 | 12 181 | 49 |
Por tanto, el modelo de Meta queda muy por detrás de Claude Fable 5.1 Max en puntuación, pero este último cuesta más de siete veces más por tarea. Sobre todo, supera a GPT-5.6 Sol en su nivel Max con un coste más de cuatro veces inferior. Cursor mantiene su método, que consiste en publicar sistemáticamente la puntuación y el coste por tarea de cada modelo añadido, en lugar de limitarse a anunciar su disponibilidad.
Grok Bot permite rellenar formularios y credenciales desde el chat, y Grok Imagine obtiene control mediante imágenes clave
8 de septiembre — SpaceXAI permite ahora rellenar formularios y páginas de inicio de sesión para su Grok Bot sin abandonar la conversación, con compatibilidad anunciada con cualquier gestor de contraseñas. La función responde a un punto de fricción propio de los agentes persistentes: en cuanto el agente debe atravesar una pantalla de inicio de sesión o enviar un formulario que contiene información personal, necesita credenciales almacenadas o la intervención del usuario. Trasladar este paso al hilo de conversación en lugar de realizarlo en una sesión separada del navegador es una decisión tanto de ergonomía como de seguridad.
Dos horas más tarde, Grok Imagine obtiene control sobre las imágenes inicial y final de una escena de vídeo, así como generación de bucles fluidos, con un mejor seguimiento de las instrucciones y una calidad de vídeo anunciada como superior. El control mediante imágenes clave cambia la naturaleza de la herramienta para quienes producen planos sucesivos: fijar la última imagen de un plano permite reutilizarla como primera imagen del siguiente y, por tanto, encadenar secuencias cuya continuidad ya no depende del azar de la generación. El anuncio llega tres días después de la puesta en servicio del agente Grok Imagine Video 1.5, impulsado por el modelo Image 2.0.
🔗 Rellenado de formularios en Grok Bot · 🔗 Imágenes clave en Grok Imagine
Tres artículos de investigación en el blog de Hugging Face
8 de septiembre — Tres publicaciones de la comunidad de Hugging Face merecen una lectura el mismo día, sobre meteorología, seguridad de los modelos y modelos inspirados en los seres vivos.
Ejecutar un modelo meteorológico abierto sin GPU
Hugging Face y Earthmover publican un artículo conjunto sobre un problema poco tratado: los modelos meteorológicos basados en aprendizaje son lo bastante ligeros como para ejecutarse en un ordenador portátil y, aun así, casi nadie los utiliza. Se identifican tres obstáculos: el cálculo —varios modelos, entre ellos AIFS, dependen de flash attention, limitada a determinadas arquitecturas de tarjetas gráficas—, el almacenamiento y, sobre todo, el ancho de banda, con aproximadamente 1 GB de condiciones iniciales por pronóstico. La respuesta se concreta en tres artefactos públicos: un espacio de demostración, un depósito de almacenamiento (bucket) y un tutorial reproducible que ejecuta Aurora, el modelo de Microsoft, en su versión preentrenada de 0,25 grados, con condiciones iniciales ERA5 servidas por el mercado de datos de Earthmover. No se requiere ninguna GPU: entre dos y tres minutos por paso de cálculo en procesador, unos segundos en tarjeta gráfica y cuatro pasos de seis horas para un pronóstico a veinticuatro horas que después se compara con ERA5.
🔗 Modelos meteorológicos abiertos con Earthmover
Un modelo considerado más seguro que rechaza tres cuartas partes de las preguntas inofensivas
Multiverse Computing publica un resultado que debería difundirse mucho más allá de la investigación sobre alineación. Al entrenar Qwen3-8B para rechazar solicitudes de manipulación política, el equipo obtiene cifras que parecen una victoria clara: la tasa media de respuestas peligrosas en HarmBench, StrongREJECT y WildJailbreak cae del 26,26 al 0,14 por ciento. En el mismo punto de control, el rechazo excesivo en XSTest sube del 2,00 al 74,00 por ciento. En otras palabras, la configuración más segura sobre el papel es una máquina de rechazar, y nada en las mediciones habituales permite detectarlo. Dos correcciones resuelven el problema: sustituir las respuestas de cumplimiento externas por respuestas verificadas del modelo objetivo reduce el rechazo excesivo de XSTest del 15,20 al 5,20 por ciento, y añadir pares benignos de frontera reduce el rechazo excesivo en el lado que debe atenderse del 32,94 al 4,16 por ciento, mientras que el rechazo en el lado dañino solo pierde cuatro puntos.
🔗 Seguridad para quién, Multiverse Computing
Un conectoma de mosca no supera a su propio cableado mezclado
Oruk publica una lección metodológica que trasciende los modelos inspirados en conectomas. El equipo copió 499 neuronas fuertemente conectadas de la reconstrucción pública MaleCNS de una mosca en una red recurrente utilizada como reservorio, con una única lectura ridge entrenada sobre ella. El cableado de la mosca obtiene un 16,84 por ciento de precisión media en la prueba, frente al 16,88 por ciento de un cableado mezclado: la diferencia es de menos 0,04 puntos, con un intervalo de confianza que atraviesa el cero. El segundo experimento podría haber parecido una prueba de lo contrario, ya que eliminar las 50 neuronas con las mayores normas de peso de lectura reduce la precisión del 16,91 al 10,83 por ciento. Los autores explican por qué no hay contradicción: una ablación espectacular nunca demuestra que una topología biológica fuera necesaria. Cabe señalar que el propio artículo indica haber sido preparado por un agente de IA a partir de un artículo no revisado por pares, y que el conjunto completo de evaluación sigue siendo privado.
🔗 Conectoma y cableado mezclado, Oruk
Runway contrata al equipo del laboratorio parisino Kinetix
8 de septiembre — Runway anuncia que el equipo de Kinetix, un laboratorio de investigación en IA con sede en París, se incorpora a la empresa. El laboratorio trabajaba en el movimiento humano en 3D y en la generación de vídeo basada en la física, dos áreas que Runway vincula directamente con su investigación sobre modelos de mundo aplicados a la robótica. El equipo se integra en la división parisina de la empresa, que también está contratando personal de investigación e ingeniería en la ciudad.
El argumento técnico se resume en una frase del anuncio: un robot realmente útil debe comprender y gestionar entornos, tareas y situaciones inéditos, y el preentrenamiento de vídeo a gran escala ofrece, según Runway, la vía más eficaz para resolver estos problemas de generalización. Es la continuación directa de Solaris, presentado el 31 de agosto, y de GWM Worlds 2, presentado el 3 de septiembre: después de enseñar a los modelos a simular el mundo, Runway quiere enseñarles a actuar en él. Yassine Tahi, director general de Kinetix, sitúa la apuesta fundacional del laboratorio seis años atrás. No se comunica ningún importe ni estructura de la operación.
Sarah Friar cuantifica la escala de OpenAI y el efecto de sus modelos en sus costes
8 de septiembre — Sarah Friar publica un artículo de opinión sobre cómo OpenAI convierte sus avances de investigación en actividad económica. El interés del texto reside más en tres cifras inéditas que en su argumentación.
| Indicador | Valor |
|---|---|
| Usuarios activos semanales | más de mil millones |
| Empresas clientes | 2,5 millones |
| Mensajes diarios a los seis meses, planes individuales | alrededor de un 50 por ciento más que durante el primer mes |
| Tareas distintas probadas a los seis meses | aproximadamente el doble |
| Costes integrales del servicio tras la optimización | un 20 por ciento menos |
| Eficiencia de generación de tokens | más de un 15 por ciento |
La tercera cifra cierra un círculo interesante. GPT-5.6 Sol se utilizó para mejorar el software de servicio en producción de OpenAI, lo que permitió reducir los costes de servicio un 20 por ciento, además de obtener más de un 15 por ciento de eficiencia en la generación de tokens. Dicho de otro modo, el modelo financia parte de su propia infraestructura optimizando la capa que lo sirve. La trayectoria del uso individual también responde a una pregunta frecuente y pocas veces documentada: la de la retención.
🔗 El trabajo ahora al alcance, OpenAI
OpenAI destina 5 millones de dólares a la investigación independiente sobre adolescentes
8 de septiembre — OpenAI abre un programa de subvenciones de 5 millones de dólares destinado a la investigación independiente sobre los efectos de la IA generativa en jóvenes de 13 a 17 años, con especial énfasis en el desarrollo social y emocional. Las subvenciones individuales ascienden hasta 1 millón de dólares por proyecto. Las solicitudes se cierran el 6 de octubre de 2026, los proyectos seleccionados recibirán la notificación como máximo el 13 de noviembre de 2026, se espera una actualización de progreso en el primer trimestre de 2027 y los gastos generales están limitados al 10 por ciento de cada subvención.
Hay dos detalles que merecen atención. El primero se refiere a la independencia reivindicada: entre los criterios de evaluación figura la capacidad del proyecto para producir resultados fiables, sean o no favorables para los proveedores de productos de IA, y se fomenta su publicación sin que esta sea una condición para obtener financiación. El segundo es administrativo, pero importa, ya que las subvenciones son financiadas y gestionadas por OpenAI Group PBC, la entidad comercial, y no por la OpenAI Foundation. El calendario no es neutral: el 31 de agosto, OpenAI había expresado su apoyo al proyecto de ley de California sobre la seguridad de los menores frente a la IA, y la publicación señala que pretende servir de base para las decisiones de los reguladores.
🔗 Subvenciones de investigación sobre adolescentes
Breves
- Boris Cherny evalúa públicamente a otros laboratorios sobre el riesgo de inyección de prompt — el creador de Claude Code sitúa el nuevo modelo de OpenAI al nivel de Gemini Flash y Opus 4.8 en materia de inyección de prompt y afirma que seguirá nombrando públicamente a los laboratorios mientras no se tomen más en serio la seguridad. Matiza el tono unos veinte minutos después en una respuesta a su propio hilo. 🔗 Publicación
- Anthropic publica un vídeo de fundadores que desarrollan sobre Claude Managed Agents — entrevistas con los fundadores de Wispr Flow, Actively y Pendo sobre el uso de outcomes, el sandbox y la memoria para escalar. 🔗 Publicación
- RelayShield escanea los archivos de instrucciones en lugar del código de los repositorios — servicio de pago que lee AGENTS.md, CLAUDE.md, .cursorrules y mcp.json para detectar instrucciones hostiles en lenguaje natural que el análisis estático no identifica. Una cifra de repositorios maliciosos citada en la publicación no concuerda con su propia fuente. 🔗 Artículo
- Ai2 anuncia su presencia en ECCV 2026 — artículos e intervenciones repartidos a lo largo de la conferencia, sin que se hayan comunicado títulos ni programa. 🔗 Publicación
- Prismberry publica un ensayo sobre la capa de herramientas de los agentes empresariales — texto de posicionamiento que distingue entre herramientas de información, análisis y acción, sin anuncios ni mediciones, y que promociona el producto Agent IQ de su editor. 🔗 Artículo
- Un cuaderno de mantenimiento de hardware publicado en el blog de Hugging Face — diagnóstico del desgaste de un rodamiento en el ventilador de una fuente de alimentación de 650 W, sin contenido relacionado con la inteligencia artificial. 🔗 Artículo
- Misuri abre Gemini for Education a 1,1 millones de alumnos y estudiantes — colaboración en todo el estado que ofrece a cerca de 100 000 docentes y más de 1,1 millones de alumnos acceso gratuito a Gemini for Education, Gemini Notebook y las certificaciones de Google, con los datos excluidos del entrenamiento y la adopción sujeta a la decisión de cada centro. 🔗 Anuncio
- Dependabot lee los registros privados de GitHub sin un token personal — el
GITHUB_TOKENde Dependabot puede solicitar el permisopackages: ready descargar desde registros privados de GitHub Packages. La funcionalidad, lanzada y posteriormente retirada en junio, regresa con las credenciales automáticas relegadas a una función de respaldo. 🔗 Registro de cambios - El portal de soporte de GitHub se traslada a help.github.com — soporte, documentación, aprendizaje, comunidad y recursos de cuenta reunidos en un mismo lugar, con una búsqueda impulsada por Copilot que no requiere iniciar sesión. 🔗 Registro de cambios
- Genspark abre Spark House durante la SF Tech Week con acceso anticipado a GenTeam — iniciativa comunitaria que ofrece a los participantes acceso anticipado a GenTeam y conversaciones privadas entre fundadores e inversores. 🔗 Publicación
- Ethan Tandowsky se convierte en director financiero de ElevenLabs — segundo nombramiento directivo en seis días en ElevenLabs, después del de Ashley Kramer como directora de ingresos el 2 de septiembre. 🔗 Publicación
- MiniMax reúne en Tokio a figuras japonesas del entretenimiento y a cuatro actores de la IA generativa — evento del 11 de septiembre en Shibuya con el productor Yasushi Akimoto, KADOKAWA, KAGAMIAI, Higgsfield, Krea, Runway y HeyGen, sin lanzamientos ni cifras. 🔗 Publicación
- Dos emisiones de Nemotron Labs el mismo día, sobre OpenShell y Domyn — 49 minutos y 44 segundos sobre cómo proteger agentes autónomos mediante OpenShell, 54 minutos y 20 segundos sobre el uso de Nemotron por parte de Domyn, sin texto descriptivo ni transcripción. 🔗 Publicación
- HeyGen contrapone dos avatares del mismo rostro sin nombrar ninguna herramienta ni modelo — comparación de marketing sin mencionar ninguna herramienta competidora, modelo ni medición. 🔗 Publicación
- OpenAI amplía su programa de periodismo a las facultades de periodismo — más de 400 suscripciones a ChatGPT Edu para estudiantes de máster y docentes de la Newmark J-School de CUNY y la Medill School de Northwestern durante 2026-2027. 🔗 Anuncio
- Perplexity publica una guía sobre el retorno de la inversión de integrar la IA — artículo educativo sin anuncios de productos, cuyas cifras proceden íntegramente de terceros o testimonios de clientes. 🔗 Artículo
Qué significa
El agente personal se convierte en un producto de infraestructura, y su seguridad pasa a ser un producto por derecho propio. Meta no se limita a lanzar Muse: el mismo día publica la descripción más detallada hasta la fecha sobre cómo contener a un agente que dispone de un shell, un navegador y acceso a un buzón de correo. La elección más instructiva es la de los tokens sustitutivos, que vuelve irrelevante la inyección de prompt para el robo de credenciales, no porque el modelo resista mejor, sino porque nunca ha tenido acceso al secreto. El tainted egress responde a la misma lógica: no se confía en el modelo, sino que se instrumenta el kernel. El bug bounty de 300 000 dólares y la franqueza de la conclusión, que reconoce que Muse cometerá errores, dicen lo mismo que Boris Cherny cuando evalúa públicamente a otros laboratorios sobre este riesgo. La seguridad de los agentes ya no es una casilla que marcar, sino una superficie de ingeniería que se publica y por cuya vulneración se paga.
La jornada también ofrece una lección sobre economía de la IA, y la unidad de cuenta ya no es la puntuación, sino el coste por tarea. Mistral recauda 3 000 millones de euros con una valoración superior a los 21 000 millones, y Cognition más de 2 000 millones con una valoración de 48 000 millones; en ambos casos, con industriales y clientes en la mesa en lugar de únicamente fondos tecnológicos. Al mismo tiempo, Cursor publica una tabla en la que Muse Spark 1.3 obtiene un 67,9 por ciento por 1,31 dólares por tarea, mientras que el primero de la clasificación paga 9,64 dólares por seis puntos más, y Anthropic documenta reducciones de costes del 52 al 73 por ciento sin pérdida de rendimiento, demostrando que un modelo más potente con menor esfuerzo suele superar a uno más débil llevado al límite. Sarah Friar cuantifica el otro extremo de la cadena, con una reducción del 20 por ciento en los costes de servicio obtenida al hacer que GPT-5.6 Sol optimice la capa que lo sirve. Son cuatro formas de decir que la disyuntiva se ha desplazado de la capacidad al precio de esa capacidad.
En el ámbito científico, la pregunta ya no es si los agentes producen resultados, sino cómo se verifican. OpenAI anuncia una prueba de singularidad para Navier-Stokes producida por unos 10 000 agentes en 88 horas, formalizada en Lean, sin que se mencionen una revisión por pares ni una validación institucional, y con un modelo interno al que nadie externo puede consultar. La prudencia de la empresa, que renuncia al premio del milenio y habla de una instantánea, constituye en sí misma una información. Los otros dos trabajos de la jornada ponen de relieve el contraste: en el MIT, Codex cumple protocolos bien definidos, pero tropieza con señales ambiguas, y un investigador experimentado sigue siendo más rápido; en Google DeepMind, AlphaGenome Atlas no pretende demostrar nada, sino que precalcula 9 000 millones de predicciones y desplaza el esfuerzo hacia la validación experimental. El artículo de Oruk completa la demostración al mostrar que una ablación espectacular no demuestra nada sin una comparación emparejada, y el de Multiverse Computing recuerda que una cifra de seguridad carece de significado mientras el lado benigno no se mida con el mismo rigor.
Queda la capa inferior, aquella en la que las mejoras ya no proceden de los pesos. Cohere abre un motor de servicio completo cuyo único cambio consiste en eliminar las fronteras entre kernels, logrando 1,58x el rendimiento de vLLM con la misma calidad, y se ocupa de señalar que la dificultad de escribir un megakernel está sobrevalorada. NVIDIA abre dos vías para escribir kernels de GPU en Rust, una de las cuales ya se utiliza fuera de la empresa en el motor de inferencia Grout de Hugging Face y en mistral.rs, y reconoce que nada está listo para producción. En el AI City Challenge, cuatro de las cinco mejores soluciones de vídeo se basan en modelos Cosmos adaptados mediante LoRA, y el equipo ganador insiste en que se trata de una receta de adaptación, no de una arquitectura nueva. El tutorial meteorológico de Earthmover cuenta lo mismo desde el otro extremo: el modelo Aurora funciona en un procesador; el obstáculo no era el cálculo, sino el gigabyte de condiciones iniciales que había que descargar. En todos los casos, el valor se encuentra en la ingeniería que rodea al modelo, y esta se publica.
Fuentes
- Lanzamiento de Muse, Meta
- Seguridad y protección de los agentes con Muse, Meta
- Serie D de Mistral
- Anuncio de la Serie D en X
- Solución del problema de Navier-Stokes, OpenAI
- Hilo de OpenAI sobre el modelo interno
- Codex y experimentos de computación cuántica en el MIT
- ChatGPT Images 2.5, OpenAI
- Manus integra GPT-Image-2.5
- AlphaGenome Atlas, Google DeepMind
- CUDA Rust, NVIDIA
- AI City Challenge de ECCV 2026, NVIDIA
- Serie E de Cognition
- Hilo de Cognition en X
- Colaboración entre Suno, Believe y TuneCore
- Megakernel de decodificación, Cohere
- Reducción de costes en Claude Platform, Anthropic
- Claude Code 2.1.265
- Control en directo del agente, Amp
- Muse Spark 1.3 en Cursor
- Cumplimentación de formularios en Grok Bot
- Fotogramas clave y bucles en Grok Imagine
- Modelos meteorológicos abiertos con Earthmover, Hugging Face
- Seguridad para quién, Multiverse Computing
- Conectoma de mosca y cableado mezclado, Oruk
- Kinetix se une a Runway
- Artículo de opinión de Sarah Friar, OpenAI
- Subvenciones de investigación sobre adolescentes, OpenAI
- Boris Cherny sobre el riesgo de inyección de prompt
- Fundadores que desarrollan sobre Claude Managed Agents
- RelayShield y los archivos de instrucciones
- Ai2 en ECCV 2026
- La capa de herramientas de los agentes, Prismberry
- Cuaderno de mantenimiento de hardware
- Gemini for Education en Misuri
- Dependabot y los registros privados de GitHub
- Nuevo portal de soporte de GitHub
- Spark House durante la SF Tech Week, Genspark
- Ethan Tandowsky, director financiero de ElevenLabs
- Evento de MiniMax en Tokio
- Emisiones de Nemotron Labs
- Comparación de avatares de HeyGen
- Programa de periodismo de OpenAI
- Guía sobre el retorno de la inversión de la IA, Perplexity