ai-powered-markdown-translatorArtículo traducido del fr al es con gpt-5.4-mini.
Cincuenta y un anuncios en veinticuatro horas, repartidos en nueve áreas: la jornada del 25 de agosto es la más cargada de la semana. De ahí salen cuatro movimientos. OpenAI publica los primeros resultados medidos de Jalapeño, su chip de inferencia propio, y lanza enseguida un hackathon de diez días en torno a WebMCP con Chrome, Cloudflare, Shopify, Vercel, Render y Netlify. Perplexity traslada la totalidad de su agente Computer a la máquina del usuario. IBM abre Granite 4.2, su primera familia de modelos de razonamiento. Y Anthropic unifica la memoria de Claude entre el chat y Cowork, haciéndola legible y modificable archivo por archivo. El resto —WeatherNext Cyclones en servicio en el National Hurricane Center, la Serie B de Stability AI, una veintena de actualizaciones de herramientas— sigue a continuación.
WebMCP: un estándar, su soporte de producto, su uso interno y un concurso para impulsarlo
25 de agosto — OpenAI lanza el WebMCP Challenge, un hackathon de diez días dedicado a un estándar abierto aún experimental que cambia la forma en que los agentes interactúan con la web. El problema al que apunta es concreto: hoy, un agente que debe realizar una tarea en un sitio tiene que adivinar cómo moverse en una interfaz diseñada para ojos y ratón. WebMCP invierte la lógica: el sitio expone por sí mismo herramientas estructuradas que el agente llama directamente.
El concurso no es lo más notable del anuncio. Es la alineación que revela: Chrome (Google), Cloudflare, Shopify, Vercel, Render y Netlify se asocian todos con OpenAI en el mismo estándar. El jurado lo refleja, con Sarah Drasner (Distinguished Engineer, Chrome), Andrew Galloni (VP Research & Innovation, Cloudflare), Jude Gao (equipo Next.js Core, Vercel), Ilya Grigorik (Distinguished Engineer, Shopify), Sean Roberts (VP of Applied AI, Netlify), Justin Rushing (Browser Agent Lead, OpenAI) y Alex Nahas, creador de MCP-B.
The WebMCP Challenge is here. We’ve teamed up with @ChromiumDev, @CloudflareDev, @ShopifyDevs, @vercel, @render, and @Netlify for a 10-day hackathon. Up for grabs: $35,000 in cash prizes, Codex Micros, ChatGPT Pro subscriptions, and more prizes from our supporters.
🇪🇸 El WebMCP Challenge ya está en marcha. Nos hemos asociado con @ChromiumDev, @CloudflareDev, @ShopifyDevs, @vercel, @render y @Netlify para un hackathon de diez días. En juego: 35 000 dólares en premios en efectivo, Codex Micro, suscripciones a ChatGPT Pro y otros premios ofrecidos por nuestros socios. — @OpenAIDevs en X
El calendario es ajustado y los criterios de evaluación son explícitos: utilidad, originalidad, ejecución, uso reflexivo de WebMCP y calidad de la experiencia humano-agente. Las inscripciones y las entregas pasan por Devpost. OpenAI también publica aplicaciones de demostración nativas para agentes para impulsar los proyectos —modelado 3D guiado por el agente, escritura colaborativa en la que el agente comenta bajo su propia identidad, generador de crucigramas personalizados, Wandernote para transformar notas de viaje en itinerario, y exploración de datos mediante DuckDB-Wasm en el navegador. Empezar desde una aplicación existente y añadirle WebMCP está admitido.
| Elemento del concurso | Detalle anunciado |
|---|---|
| Duración anunciada | 10 días |
| Apertura de las entregas | 25 de agosto de 2026, 12 h PT |
| Fecha límite de entrega | 3 de septiembre de 2026, 13 h PT |
| Anuncio de los ganadores | 23 de septiembre de 2026 (fecha indicativa) |
| Dotación total | 35 000 dólares |
| Premio por ganador (top 10) | 3 000 dólares, un año de ChatGPT Pro, un teclado Codex Micro, merchandising |
| Plataforma de entrega | Devpost |
La pieza de producto que hace que el estándar sea utilizable en el día a día llega el mismo día: el navegador integrado de la aplicación de escritorio de ChatGPT y ChatGPT Sites ya saben consumir WebMCP. Cuando ChatGPT o Codex visitan un sitio compatible, el agente detecta las herramientas expuestas por la página y las utiliza automáticamente en lugar de ir tanteando por la interfaz —es necesaria la actualización a la última versión de la aplicación de escritorio. La otra mitad del circuito está del lado de la producción: ahora se puede pedir a Codex que cree una aplicación compatible con WebMCP y luego desplegarla directamente en Sites. A destacar, la asimetría de soporte con Chrome, donde WebMCP sigue detrás de una bandera experimental o de un origin trial, mientras que el navegador de ChatGPT lo gestiona de forma nativa.
Queda el tercer tramo, el más instructivo: OpenAI documenta su propio uso interno. Un ingeniero de la empresa cuenta cómo dejó de escribir una automatización por tarea para construir Runme, una aplicación web de notebooks open source pensada para colaborar con Codex. En ella escribe un objetivo corto con instrucciones explícitas —consultar una ejecución anterior, redactar un plan detallado, esperar validación antes de empezar, documentar los comandos ejecutados y su interpretación— y Codex lee y luego actualiza el notebook a medida que avanza el trabajo. Dos decisiones de arquitectura merecen atención. La persistencia, primero: los notebooks se guardan en Google Drive, y Runme genera en paralelo un índice Markdown compañero *.index.md que Drive sabe indexar, lo que permite a un agente encontrar una ejecución pasada como contexto operativo. La exposición de capacidades, después: Runme es una aplicación cliente servida de forma estática, y añadir un servidor solo para exponer un punto de acceso MCP clásico habría introducido infraestructura y desplazado el tratamiento de los datos del notebook. WebMCP permite a la aplicación registrar sus herramientas directamente desde el navegador.
🔗 WebMCP Challenge · Compatibilidad en ChatGPT desktop y Sites · Codex, Runme y WebMCP en OpenAI
Jalapeño: OpenAI publica las primeras cifras de su chip de inferencia y asume su estrategia compute
25 de agosto — OpenAI publica los primeros resultados medidos de Jalapeño, el primer chip de inferencia que ha diseñado por sí misma. El interés del anuncio no reside solo en las mejoras brutas, sino en la naturaleza del compromiso que pretende eliminar: los sistemas de inferencia existentes suelen tener que arbitrar entre rendimiento y latencia, mientras que Jalapeño reclama ambos en una sola arquitectura.
Las mediciones se apoyan en InferenceX, un benchmark público de SemiAnalysis que simula el procesamiento completo de una consulta. Se probaron tres modelos abiertos —GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T— frente a sistemas comerciales. La decisión de normalizar por vatio y no por chip es explícita y cómoda: Jalapeño consume dos veces menos que los sistemas con los que se compara. Jalapeño se anuncia con 700 W, y el consumo sostenido medido se mantuvo en 550 W o menos en las cargas probadas, frente a 1 200 W para el GB200 y 1 400 W para el GB300.
| Modelo evaluado (sistema comparado) | Rendimiento pico por kW | Latencia de extremo a extremo | TBT mínimo |
|---|---|---|---|
| GPT-OSS 120B (GB200, 1 200 W) | ≈1,9x (85 448 vs 44 960) | ≈1,7x (1,03 s vs 1,80 s) | ≈2,7x (0,69 vs 1,87 ms) |
| DeepSeek R1 670B (GB300, 1 400 W) | ≈1,7x (19 641 vs 11 781) | ≈3,6x (1,65 s vs 5,99 s) | ≈4,1x (1,43 vs 5,90 ms) |
| Kimi K2.5 1T (GB300, 1 400 W) | ≈1,5x (18 195 vs 11 862) | ≈3,4x (1,56 s vs 5,31 s) | ≈3,8x (1,44 vs 5,48 ms) |
En el conjunto de los tres modelos, OpenAI anuncia entre 1,5 y 1,9 veces más trabajo de IA por vatio en rendimiento pico y entre 1,7 y 3,6 veces menos latencia de extremo a extremo que los sistemas de comparación, y hasta 2,1 a 4,1 veces más rendimiento en cargas muy interactivas. Técnicamente, las mejoras vienen de una co-diseño del chip, la memoria, la red, el software y el sistema a escala de rack. La inferencia atraviesa dos fases con cuellos de botella distintos: el prefill, que procesa el prompt y satura el cálculo, y la generación (decode), que produce los tokens uno a uno y depende sobre todo del ancho de banda de memoria. Jalapeño busca minimizar los desplazamientos de datos, pudiendo situarse explícitamente el estado del modelo —incluida la caché KV— y mantenerse local mientras el sistema activa la combinación adecuada de cálculo, memoria y red según la fase.
El aspecto más interesante para un desarrollador concierne al papel de la IA en el diseño del propio chip. OpenAI indica que pasó del diseño inicial al paso a fabricación (tapeout) en nueve meses, acortando los ciclos de diseño, medición y verificación. El chip se concibió como un objetivo de programación previsible tanto para la IA como para los humanos: trabajo descrito mediante tensores locales, comunicación explícita, sincronización previsible. Con Codex y GPT-Astra, el equipo llevó en dos meses tres modelos de pesos abiertos ausentes del plan de producción inicial, y sobre bloques de atención y de mixture-of-experts seleccionados de GPT-OSS, los núcleos generados por IA funcionan entre 1,5 y 1,8 veces más rápido que las implementaciones escritas por expertos humanos. Conviene conservar el matiz: esas cifras se refieren a los bloques seleccionados, no al modelo completo. El calendario sigue siendo prudente: calificación de producción en curso, software por madurar, despliegue en la infraestructura de OpenAI anunciado para finales de año, Gen 2 en desarrollo avanzado y Gen 3 perfilándose.
El mismo día, Sarah Friar publica el texto que da la lógica económica detrás de todo esto. En él reivindica una cartera de compute amplia —Microsoft y NVIDIA como base, completadas por AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy y SoftBank— con un argumento tanto comercial como técnico: preservar una elección creíble entre proveedores permite dirigir cada carga de trabajo hacia la mejor relación rendimiento-precio y mantener una disciplina tarifaria. Un dato concreto acompaña al argumento: en el Artificial Analysis Coding Agent Index, GPT-5.6 Sol en razonamiento máximo alcanza un nuevo récord mientras consume un 54 % menos de tokens de salida que otro modelo de primer nivel. El texto asume además la paradoja de Jevons: abaratar la inteligencia no reduce su consumo, sino que amplía el campo de usos rentables. En infraestructura, Project Camellia en Georgia se presenta con un circuito cerrado para el agua y compromisos sometidos a una auditoría pública independiente anual. OpenAI precisa que seguirá desplegando ampliamente los aceleradores de NVIDIA y de sus otros socios, tanto para entrenamiento como para inferencia.
🔗 Jalapeño — primeros resultados · The full stack behind abundant intelligence
Perplexity Portable Computer: todo se ejecuta en la máquina, con benchmarks incluidos
25 de agosto — Perplexity lanza Portable Computer, una variante de su agente Computer que se ejecuta íntegramente en la máquina del usuario. El cambio es más arquitectónico que cosmético: no solo el modelo se ejecuta en local, sino toda la cadena de orquestación — orquestador, planificador, enrutador de herramientas, programador, cola de tareas persistente e índice de búsqueda local.
Hoy lanzamos Portable Computer en @NVIDIA DGX Spark.
Portable Computer is a fully local version of Perplexity Computer, where the entire runtime: orchestrator LLM, subagent LLM, agent harness all run on your local hardware. No cloud dependency.
🇪🇸 Hoy lanzamos Portable Computer en el @NVIDIA DGX Spark. Portable Computer es una versión totalmente local de Perplexity Computer, en la que todo el entorno de ejecución — el LLM orquestador, el LLM de los subagentes, el arnés de agente — se ejecuta en tu hardware local. Sin dependencia de la nube. — @perplexity_ai en X
El anuncio se hace conjuntamente con NVIDIA y apunta primero al DGX Spark — plataforma Grace Blackwell GB10, CPU Arm de 20 núcleos, GPU NVIDIA, 128 GB de memoria unificada — con una extensión anunciada a los PC equipados con GPU RTX. Se ofrecen dos modelos a elección, Qwen 3.8 27B o PPLX 27B, la versión posentrenada del modelo Qwen por Perplexity, y NVIDIA Nemotron 3.5 Lightning, un modelo abierto de 30B, debe incorporarse al selector. El trabajo tratado localmente no consume ningún crédito. La escalada a la nube sigue siendo posible — información actualizada, navegador, aplicaciones conectadas, o uno de los 15 modelos frontier y más — pero está sujeta a la autorización explícita del usuario. Los conectores Google Drive, Gmail, Slack y GitHub funcionan desde el dispositivo, el dictado se ejecuta en local mediante el NVIDIA Nemotron 3.5 ASR Model sin que el audio salga de la máquina, y la ejecución de código se realiza en un entorno aislado (sandbox). Portable Computer está reservado para los suscriptores Pro y Max que dispongan de un DGX Spark, primero en Linux y después en Windows, con una instalación con un clic desde la aplicación.
El mismo día, el equipo de ingeniería publica las cifras que documentan este lanzamiento. La tesis es que el modelo y el arnés (harness) deben diseñarse juntos: los arneses genéricos presuponen un modelo frontier capaz de absorber largos contextos y planificar en un horizonte amplio, algo que los modelos locales resuelven peor.
| Benchmark medido | Computer (Qwen 3.8 27B) | Pi | Hermes | Computer + PPLX 27B |
|---|---|---|---|---|
| Local Knowledge Work Bench (53 tareas) | 82,6 % | 77,6 % | 74,0 % | 85,4 % |
| BrowseComp (1 266 tareas) | 66,7 % | 50,2 % | 43,9 % | — |
| ParseBench-100 (documentos multimodales) | 65,1 % | 13,9 % | 34,6 % | — |
En BrowseComp, Computer consume de paso un 61 % menos de tiempo y un 16 % menos de tokens que Hermes, y un 51 % menos de tiempo y un 70 % menos de tokens que Pi. Cuatro decisiones de diseño explican la diferencia: un prompt del sistema mínimo, capacidades modularizadas en skills que se cargan y descargan a lo largo de la trayectoria, conectores muy usados (Gmail, GitHub, Outlook, Google Calendar) convertidos en herramientas de línea de comandos compactas en lugar de exponerse como servidores MCP cuyas definiciones se comen el contexto, y un entorno aislado siempre activo y no configurable — si no está disponible, el arnés se desactiva antes de cualquier llamada a herramientas en lugar de pasar a una ejecución no aislada. Perplexity señala también una observación práctica útil: Qwen 3.8 27B anuncia una ventana de 260K tokens, pero empieza empíricamente a rendir peor por encima de 100K.
| Terminal Bench 2.1 (89 tareas) | Puntuación | Coste de API por ejecución |
|---|---|---|
| Qwen 3.8 27B, 100 % local | 59,6 % | aproximadamente 0 |
| Qwen 3.8 27B + consejo Claude Opus 5 | 73,0 % | 0,415 USD |
| Claude Opus 5 solo | 82,4 % | 0,65 USD |
El mecanismo de escalada a un modelo consejero (advisor) es el punto más interesante del informe: recupera alrededor de tres quintos de la diferencia respecto al frontier por aproximadamente dos tercios de su coste, y el arbitraje sigue en manos del usuario. Antes de cada llamada, el arnés selecciona el contexto pertinente, aplica un clasificador de datos personales y muestra al usuario qué saldría del dispositivo; el modelo consejero solo devuelve texto y no tiene acceso directo a los archivos ni a las herramientas. El posentrenamiento de PPLX 27B, por último, combina un ajuste fino por rechazo (rejection fine-tuning) y después aprendizaje por refuerzo sobre entornos sintéticos ejecutados en contenedores Docker, sin ningún dato real de usuario. Se anuncia un informe técnico y la apertura del benchmark de evaluación en código abierto.
🔗 Benchmarks del arnés local · Portable Computer — entrada de Perplexity
Claude: una sola memoria entre el chat y Cowork, legible archivo por archivo
25 de agosto — Anthropic elimina la frontera entre dos memorias que coexistían hasta ahora. Lo que Claude retiene de tus conversaciones en el chat es ahora exactamente lo que tiene disponible en Claude Cowork, y lo contrario también es cierto. En la práctica, cuando Cowork ejecuta una tarea en la nube, comienza con el contexto acumulado a lo largo de los meses: las prioridades del trimestre, el estado de avance de los proyectos, las preferencias de redacción de un interlocutor. Anthropic da ejemplos deliberadamente terrenales — pedir un punto de avance para tu responsable sin tener que precisar de quién se trata ni cómo le gusta a esa persona recibir la información.
El segundo cambio es más discreto, pero modifica el comportamiento cotidiano: la memoria se actualiza a lo largo de la conversación en lugar de mediante un resumen generado después. Mencionar que un plazo se pospone a septiembre basta para que la conversación siguiente lo tenga en cuenta. La fórmula «recuerda esto» sigue disponible para forzar el registro de un elemento concreto, y la memoria puede ponerse en pausa o restablecerse en cualquier momento.
En cuanto a la transparencia, Anthropic ha elegido una representación legible en lugar de una caja negra: todo lo que Claude retiene aparece en forma de archivos breves, clasificados por tema, en Ajustes y luego Memoria. Cada uno puede leerse, corregirse o eliminarse. El interés práctico es inmediato — corregir el antiguo nombre de tu empresa en un solo archivo basta para que todas las conversaciones siguientes usen el correcto.
El tratamiento de los temas sensibles es el punto más interesante desde el punto de vista de las decisiones de producto. De forma predeterminada, Claude no memoriza nada relacionado con la salud, el origen, la etnicidad, las creencias religiosas, las opiniones políticas o la identidad de género. Anthropic reconoce, sin embargo, que la frontera es personal y propone un ajuste opcional para incluir estos temas — suficiente para que Claude recuerde una intolerancia al gluten al proponer recetas. Este ajuste no es retroactivo y puede desactivarse en cualquier momento. Una categoría queda excluida independientemente del ajuste: números de identificación, antecedentes penales, estatus migratorio y, en términos más amplios, todo lo que contravenga la Política de uso aceptable. Claude señala explícitamente cuando no puede registrar una información de este tipo, una decisión de diseño que privilegia la negativa visible frente al filtrado silencioso.
| Aspecto de la memoria | Comportamiento descrito |
|---|---|
| Alcance | Memoria única compartida entre el chat y Claude Cowork |
| Momento de actualización | Durante la conversación, en lugar de mediante un resumen al final antes |
| Formato de almacenamiento | Archivos breves clasificados por tema, legibles y modificables uno a uno |
| Temas sensibles | No memorizados por defecto, activables mediante ajuste, sin efecto retroactivo |
| Exclusiones permanentes | Números de identificación, antecedentes penales, estatus migratorio |
| Planes Free, Pro y Max | Memoria activa por defecto en la web, el escritorio y el móvil |
| Planes Team y Enterprise | Abierta por el administrador, desactivada por usuario hasta su activación |
🔗 La memoria de Claude funciona en todas partes · Anuncio @claudeai
IBM abre Granite 4.2, su primera familia de razonamiento, y dos modelos ASR de 470M
25 de agosto — IBM publica Granite 4.2, presentada como su primera familia de modelos de lenguaje densos, solo decodificador, diseñados explícitamente para el razonamiento. Mientras las generaciones anteriores apuntaban a la eficiencia y a las tareas empresariales clásicas, esta versión coloca el razonamiento en el centro y lo hace modulable: cada modelo expone tres modos — thinking, non-thinking y low-effort — que la aplicación elige según el presupuesto de latencia y tokens que acepta pagar. Los tres tamaños (3B, 8B, 30B) comparten la misma arquitectura y el mismo pipeline, lo que hace que el paso de uno a otro sea indoloro en lo relativo a la integración.
La arquitectura sigue siendo clásica: atención GQA de 40 cabezas para 8 cabezas KV, RoPE con un θ de 10 millones para sostener los 131 072 tokens de contexto, MLP SwiGLU, normalización RMSNorm, entrenamiento en bfloat16 sobre un clúster NVIDIA GB200 NVL72 alojado por CoreWeave. El preentrenamiento parte de cero sobre unos 15 000 millones de tokens repartidos en cinco fases. Lo que realmente distingue a Granite 4.2 es el posentrenamiento: un pipeline de refuerzo en cadena de etapas especializadas en lugar de una sola pasada, en GRPO asíncrono con muestreo de importancia truncado, de modo que las mitades de generación y entrenamiento del bucle nunca se bloquean entre sí. El currículo encadena tres pasadas de RLVR con recompensas verificables, amplificadores centrados en el seguimiento de instrucciones y el código, dos etapas de software engineering en contexto 128K, una etapa terminal, una etapa de investigación y, por último, la alineación RLHF. El bloque de refuerzo agéntico solo se aplica a los modelos 8B y 30B, lo que explica la diferencia de rendimiento en codificación agéntica entre el 3B y sus hermanos mayores.
| Benchmark publicado por IBM | 3B Dense | 8B Dense | 30B Dense |
|---|---|---|---|
| SWE-Bench Verified | — | 47,67 | 57,00 |
| SWE-Bench Multilingual | — | 30,78 | 41,89 |
| Terminal-Bench 2.1 | — | 20,56 | 29,24 |
| τ³-bench | 45,78 | 58,06 | 62,00 |
| AIME25 | 78,33 | 86,67 | 89,17 |
| GPQA | 54,80 | 64,14 | 66,41 |
| LiveCodeBench v6 | 69,71 | 73,24 | 75,77 |
| MMLU-Pro | 67,84 | 74,04 | 77,60 |
| RULER 128K | 55,30 | 71,41 | 81,38 |
La publicación no se limita a los pesos bfloat16: cuatro variantes cuantificadas acompañan el lanzamiento para vLLM — FP8 por canal dinámico sin calibración, NVFP4 y MXFP4 mediante GPTQ calibrado con 2 000 muestras SFT — así como catorce formatos GGUF para llama.cpp, de Q2_K a Q8_0. Se admiten doce idiomas, incluido el francés, y tres arneses de codificación agéntica se documentan desde el primer día: OpenCode, Pi y OpenHands. Sobre la calidad de los datos, IBM detalla una cadena en la que GPT-OSS-120B y Gemma 4 sirven de jueces para puntuar las muestras SFT, antes de una deduplicación local y global mediante hash SHA-256.
El mismo día, IBM publica Granite Speech 5.0 Turbo CTC, dos modelos de reconocimiento de voz en inglés de 470 millones de parámetros que solo difieren por sus datos de entrenamiento y su licencia — Apache 2.0 para la variante estándar, CC-BY-NC-SA-4.0 para la variante entrenada con datos adicionales. El cambio de arquitectura es notable: los Granite Speech anteriores combinaban un codificador acústico, un proyector y un LLM; estos son solo codificador. La pila apila 16 bloques Conformer, aplica autocondicionamiento a la salida del octavo bloque, reemplaza la atención producto-escalar por una atención por bloques (chunkwise) para evitar la escala cuadrática, y optimiza directamente la pérdida CTC. La verdadera novedad es la tasa de tokens: operaciones de submuestreo hacen pasar el flujo de 100 tramas por segundo a la salida del espectrograma log-Mel a 12,5 por segundo, lo que explica el «Turbo» del nombre. Los resultados se publican en el OpenASR Leaderboard y el FFASR Leaderboard para campo lejano, con gráficos de Pareto velocidad/precisión en lugar de puntuaciones aisladas, y una demostración de reconocimiento continuo ejecutada en el navegador mediante WebGPU, limitada a Chrome y Edge.
🔗 Granite 4.2 — recorrido técnico · Granite Speech 5.0 Turbo CTC
WeatherNext Cyclones, el primer modelo de IA utilizado en tiempo real por el National Hurricane Center
25 de agosto — Google AI detalla WeatherNext Cyclones, un modelo de predicción de ciclones tropicales surgido de Google DeepMind y Google Research. El anuncio es notable menos por el rendimiento bruto que por lo que cuenta sobre el paso de la IA meteorológica del laboratorio a la operación.
El problema abordado es estructural. Hasta ahora, seguir un ciclón obligaba a un arbitraje: los modelos físicos que se ejecutan en superordenadores capturan bien las grandes estructuras atmosféricas que barren el planeta, pero comprender la física local e intensa que determina la fuerza de una tormenta obligaba a cambiar a modelos regionales totalmente distintos. WeatherNext Cyclones elimina ese ir y venir al predecir de una sola vez la trayectoria, la intensidad y el tamaño.
La mejora anunciada es de un día completo de anticipación respecto a los sistemas anteriores. Google formula la comparación de manera elocuente: las previsiones a tres días alcanzan ahora la precisión de las antiguas previsiones a dos días, un avance que históricamente exigía una década de progresos metodológicos. El segundo aporte es probabilístico: el modelo es lo bastante rápido como para producir hasta 1.000 simulaciones por tormenta, lo que sustituye la trayectoria única «más probable» por un abanico de escenarios. Esto hace más legible la intensificación rápida, definida por un aumento de los vientos máximos sostenidos de al menos 30 nudos en 24 horas. Este año, se proporcionan 1.000 predicciones probabilísticas por tormenta a los pronosticadores a través de WeatherLab.
El elemento más significativo sigue siendo el despliegue real. Durante la temporada de huracanes de 2025, WeatherNext Cyclones fue puesto a prueba en el National Hurricane Center estadounidense — la primera vez que esta institución utiliza modelos de IA en operaciones en tiempo real. Los meteorólogos lo usaron para establecer la previsión del impacto de categoría 5 del huracán Melissa en Jamaica, dando a las autoridades locales tiempo adicional de preparación. Ha aparecido un artículo en Nature, y Google anuncia la publicación del código y los pesos del modelo en open source en GitHub.
| Aspecto del modelo | Aporte de WeatherNext Cyclones |
|---|---|
| Magnitudes previstas | Trayectoria, intensidad y tamaño en una sola pasada |
| Ganancia de anticipación | Un día; previsión a 3 días = precisión de la antigua a 2 días |
| Simulaciones por tormenta | Hasta 1.000 |
| Despliegue operativo | U.S. National Hurricane Center, temporada de huracanes 2025 |
| Caso de uso documentado | Impacto de categoría 5 del huracán Melissa en Jamaica |
| Umbral de intensificación | Más de 30 nudos de vientos máximos sostenidos en 24 horas |
| Modalidades de disponibilidad | WeatherLab; código y pesos en open source en GitHub |
🔗 Anuncio @GoogleAI · Entrada de Google DeepMind
Stability AI cierra una Serie B de 76 millones de dólares con EA, Sony Music, Universal y Warner
25 de agosto — Stability AI anuncia el cierre de su Serie B: 76 millones de dólares de capital fresco, que elevan la financiación total a 232 millones desde la toma de control de la empresa por Prem Akkaraju en junio de 2024, contando dos rondas en acciones y obligaciones convertibles. La cifra sigue siendo modesta a escala del sector, pero la composición de la ronda es el verdadero tema.
Cuatro pesos pesados del entretenimiento entran en el capital: Electronic Arts para el videojuego, Sony Music Group, Universal Music Group y Warner Music Group para la música. Las tres majors del disco son ahora accionistas del mismo laboratorio. A ello se suman AMD Ventures y Pacific Alliance Ventures. Estos inversores no aparecen de la nada: EA, Universal y Warner ya eran socios estratégicos de Stability AI desde el otoño de 2025. La ronda convierte, por tanto, acuerdos comerciales existentes en participaciones de capital.
La otra señal está en la fidelidad de los inversores financieros. Coatue, Greycroft, Kadmos Capital, Sean Parker y Eric Schmidt vuelven a aportar en la segunda ronda consecutiva bajo la nueva dirección — lo que, tras la etapa turbulenta que atravesó Stability AI en 2023 y 2024, vale como confirmación. Thomas Laffont, cofundador de Coatue, se une al consejo de administración, donde ya figuran James Cameron, Sean Parker, Dana Settle y Prem Akkaraju.
This unmatched group of investors is an affirmation of our vision where generative AI empowers every producer, musician, and storyteller. Stability is unique in the AI field because we are creative people making tools for creatives.
🇪🇸 Este grupo de inversores sin equivalente confirma nuestra visión, la de una IA generativa que da herramientas a cada productor, músico y narrador. Stability es única en el ámbito de la IA porque somos creativos que fabricamos herramientas para creativos. — Prem Akkaraju, CEO de Stability AI, comunicado del 25 de agosto
La estrategia asumida es la de un laboratorio de nicho: no un modelo generalista, sino herramientas para profesionales de la creación, construidas con los titulares de derechos en lugar de contra ellos. Es exactamente la línea de Stable Audio 3.0, familia de modelos de pesos abiertos entrenada con datos completamente licenciados, ampliada el 18 de agosto por un plugin para estaciones de trabajo de audio. El dinero debe financiar la siguiente versión del producto, la investigación aplicada y el área de servicios profesionales.
ChatGPT en el ámbito empresarial: plugin Admin, extensión mult navegador y puesto Premium a 100 dólares
25 de agosto — Tres anuncios de OpenAI convergen hacia el mismo público: las organizaciones que despliegan ChatGPT y Codex a gran escala.
El más sustancial es el plugin Admin para ChatGPT Work y Codex, que reúne en una conversación aquello que hasta ahora obligaba a navegar entre paneles de analítica, pantallas de configuración e informes. El alcance cubre las tareas diarias: comprender la adopción y el consumo de créditos, detectar a los miembros o grupos cercanos a sus límites, gestionar altas y bajas, examinar los permisos efectivos y diagnosticar un problema de acceso, ajustar los límites de uso y arbitrar las solicitudes de gasto confrontándolas con el consumo real. La parte más interesante es la automatización sin escribir código: las solicitudes de uso pendientes pueden ser dirigidas a Slack o Microsoft Teams para su aprobación en la herramienta que los validadores ya utilizan, y las solicitudes de acceso a una función pueden concederse automáticamente cuando cumplen criterios predefinidos, mientras las excepciones se remiten a una persona. Punto estructural en materia de seguridad: el plugin opera dentro del rol y los permisos existentes del usuario y no amplía ningún acceso, y cada instrucción se asigna a una acción de lectura o escritura compatible con un resultado estructurado. OpenAI cita su propio uso — un agente de ChatGPT Work en Slack tramita las solicitudes IT internas, y los flujos de trabajo desplegados resuelven alrededor del 45 % del volumen de tickets, con el backlog eliminado mientras el volumen de soporte prácticamente se había duplicado.
Segundo anuncio, la extensión del navegador ChatGPT sale del ámbito de Chrome y da soporte a Microsoft Edge, Brave, Opera y Vivaldi. El cambio importa para quien trabaja en un navegador alternativo por elección de privacidad o por obligación empresarial. Se destacan dos usos: llevar el contexto de las pestañas abiertas a una tarea mediante la mención @ tab en ChatGPT Desktop, de modo que Codex trabaje a partir de la documentación o del ticket ya mostrados; y dejar que el agente pilote el navegador para ejecutar tareas web concretas, figurando la cancelación de suscripciones entre los ejemplos dados.
Tercer anuncio, más lacónico: un puesto Premium a 100 dólares se suma a la oferta de ChatGPT Business, orientado a pequeñas empresas y startups con un plan presentado como flexible y escalable según el tamaño del equipo. El anuncio se hizo en X sin una entrada de blog detallada, y la composición exacta del puesto no se precisa en el mensaje.
🔗 Plugin Admin · Extensión mult navegador · Puesto Premium de ChatGPT Business
NVIDIA: la Gamescom para RTX Spark, y SANA que divide por 27 la latencia de MiniMax H3
25 de agosto — NVIDIA aprovecha la Gamescom, que se celebra esta semana en Colonia, para ampliar el catálogo de RTX Spark, su plataforma de PC Windows prevista para este otoño. Electronic Arts, Embark Studios y Ubisoft se suman a KRAFTON, NetEase, Riot Games y XBOX, que ya se habían comprometido desde el COMPUTEX en mayo. Los títulos nombrados abarcan exigencias técnicas variadas: EA SPORTS F1 25 y Apex Legends del lado de EA, Anno 117: Pax Romana en Ubisoft, ARC Raiders y THE FINALS en Embark Studios.
El punto más concreto se refiere al anti-trampas. Ejecutar un juego no basta: los grandes títulos en línea dependen de sistemas anti-trampas que deben adaptarse a cada plataforma, o de lo contrario el juego sigue siendo injugable en multijugador. NVIDIA anuncia que trabaja con EA para llevar EA Javelin Anticheat de forma nativa a RTX Spark — el tipo de detalle de infraestructura que decide la adopción real de una nueva plataforma PC. En cuanto al renderizado, DLSS 4.5 Ray Reconstruction está disponible de inmediato, con un modelo transformer de segunda generación que sustituye los denoisers clásicos por una red entrenada en superordenador. El path tracing llega a CONTROL Resonant y 007 First Light, Gears of War: E-Day incorpora RTX Mega Geometry, y las tecnologías NVIDIA ACE se anuncian en Aniimo para comienzos de 2027.
La otra cara del mismo actor, el 24 de agosto, es más técnica. MiniMax difunde los resultados obtenidos por el equipo SANA de NVIDIA sobre Sol Engine aplicado a su modelo de vídeo H3: diez segundos de vídeo en 768p generados en un solo GB200 pasan de 414 segundos a 14,93 segundos, lo que supone una aceleración de 27,7 veces. El método no se basa en una optimización de kernels, sino en dividir la generación en dos pasadas — un borrador en baja resolución producido por H3 en 4 pasos, y luego una pasada de refinamiento a la resolución objetivo confiada a LTX en 3 pasos con Sol-Attn. Siete pasos en total. Como segundo impulso, los costosos decodificados VAE se sustituyen por TAEH3 y TAEHV, decodificadores aligerados, manteniendo al mismo tiempo los latents estables para la pasada de refinamiento.
| Medida sobre MiniMax H3 | Valor medido |
|---|---|
| Carga medida | 10 s de vídeo en 768p, un solo GB200 |
| Latencia antes | 414 s |
| Latencia después | 14,93 s |
| Factor de aceleración | 27,7x |
| Pasos de generación | 4 (borrador H3 en baja resolución) + 3 (LTX) |
| Decodificadores sustituidos | TAEH3 y TAEHV en sustitución de los decodificadores VAE |
| Rendimiento proyectado por nodo | 378.000 vídeos al mes, más del 97 % de margen GPU |
El rendimiento proyectado es una estimación de MiniMax, no una medida de producción, y merece leerse como tal. Pero la dirección es clara: a quince segundos por diez segundos de vídeo, la generación de vídeo de alta fidelidad sale del renderizado por lotes asíncrono para entrar en una infraestructura casi interactiva.
🔗 NVIDIA en la Gamescom · SANA y Sol Engine en H3
Los modelos abiertos chinos se convierten en la referencia de la investigación, y Qwen3.8-27B entra en el top 10 de Code Arena
25 de agosto — Qwen difunde dos resultados la misma mañana, y el segundo da sentido al primero.
El primero es una clasificación. Qwen3.8-27B entra en el ranking Code Arena: WebDev, que evalúa los modelos en la generación de interfaces web, en la 9.ª posición general con 1595 puntos. Es el único modelo de su categoría de tamaño en el top 10, y solo se sitúa seis puestos por detrás de Qwen3.8-Max, mucho mayor. Arena subraya que redibuja la frontera de Pareto de la clasificación, y aporta una referencia elocuente: Gemma 4-31B, de tamaño comparable pero lanzado en abril, ocupa la 80.ª posición.
| Modelo evaluado | Puesto en Code Arena: WebDev | Puntos obtenidos | Observación de la clasificación |
|---|---|---|---|
| GLM-5.3 (Max) | 8.º en general | 1597 | Registro del 20 de agosto, 2.º entre los abiertos |
| Qwen3.8-27B | 9.º en general | 1595 | Único modelo de su tamaño en el top 10 |
| Qwen3.8-Max | Seis puestos por delante del 27B | n.c. | Modelo mucho más grande de la misma familia |
| Gemma 4-31B | 80.º en general | n.c. | Lanzado en abril de 2026 |
El segundo resultado es una medida de uso. Nathan Lambert, que co-dirigió el proyecto Olmo en Ai2, encargó a Codex el análisis de 500.000 artículos de arXiv en IA y aprendizaje automático publicados desde la salida de ChatGPT, para identificar los modelos abiertos efectivamente utilizados en investigación. El giro está en dos cifras: en 2024, alrededor del 30 % de los artículos mencionaban un modelo abierto estadounidense frente al 10 % que mencionaba un modelo chino; hoy, alrededor del 40 % cita un LLM abierto chino y solo el 25 al 30 % uno estadounidense.
| Familia de modelos | Proporción de artículos que citan un LLM |
|---|---|
| OpenAI (modelos cerrados) | alrededor del 37 % |
| Qwen | alrededor del 33 % |
| Gemini, Claude | 10 a 15 % |
| Gemma, Mistral | 5 a 10 % |
| Olmo | alrededor del 1 % |
En detalle, Qwen se menciona en un tercio de los artículos que citan un LLM, sea cual sea. Llama alcanzó su pico hacia abril de 2025 con un 30 %, justo en el momento del lanzamiento de Llama 4, y desde entonces retrocede. Lambert señala él mismo una limitación importante: las publicaciones van por detrás de los lanzamientos de modelos, porque la investigación lleva tiempo — estas cifras describen el estado de los trabajos en curso más que las preferencias del momento. Se aprecia en paralelo una tendencia de fondo, distinta del duelo abierto contra cerrado: la proporción de artículos de IA que mencionan un LLM pasó del 10,43 % en enero de 2023 a más del 50 % en 2026.
🔗 Qwen3.8-27B en Code Arena · Difusión de Qwen del análisis arXiv · Análisis @natolambert
Claude Code pasa a 2.1.245, y la renderización de Claude en la web se vuelve 4 veces más fluida
Han salido dos versiones de Claude Code en la ventana, y su contenido apunta claramente a los despliegues en organizaciones. El CHANGELOG no lleva fechas, pero el historial Git las sitúa: la 2.1.243 aparece en el commit del 24 de agosto a las 23:40 UTC, la 2.1.245 en el del 25 de agosto a las 05:13 UTC.
| Ajuste añadido | Versión afectada | Interés práctico |
|---|---|---|
modelPricing | 2.1.243 | Tarifas contractuales en /cost, la barra de estado y la telemetría |
modelPicker | 2.1.243 | Lista de modelos ordenada y etiquetada para /model |
promptCacheTtl / subagentPromptCacheTtl | 2.1.243 | Caché de prompt de una hora sobre la conversación, 5 min sobre los subagentes |
Ventilation Loops en /usage | 2.1.243 | Detectar las tareas /loop que se desvían |
| Conexión sin clave vía Console | 2.1.243 | Organizaciones que prohíben las claves de API |
| Corrección de glibc 2.44 | 2.1.245 | Fallo al arrancar en Arch Linux, CachyOS y Fedora Rawhide |
El ajuste más estructurante es modelPricing : hasta ahora, los costes mostrados razonaban al precio público; ahora una organización puede inyectar sus tarifas contractuales por modelo y su coeficiente de descuento, lo que hace que las cifras sean directamente utilizables para la refacturación interna. El dúo promptCacheTtl y subagentPromptCacheTtl trata un compromiso económico concreto para los usuarios por clave de API: mantener una caché de una hora sobre la conversación principal, donde el contexto permanece estable, y dejar a los subagentes con cinco minutos, ya que sus contextos son más volátiles. En cuanto a las correcciones, los servidores MCP remotos en modo no interactivo ya no se quedan bloqueados tras una interrupción, /resume ya no se limita a las cincuenta sesiones más recientes, y las sesiones silenciosas durante más de diez minutos expiran ahora al cabo de unos tres minutos antes de un reintento y un error explícito.
El 24 de agosto, Anthropic anuncia además haber reescrito el motor que muestra las respuestas mientras se generan en Claude web y escritorio. El principio es clásico en renderizado de interfaz: tocar solo lo que sigue cambiando, en lugar de volver a dibujar toda la respuesta con cada nuevo fragmento. En una respuesta larga, la diferencia es estructural: el coste de renderizado deja de crecer con la longitud del texto ya mostrado. Las mejoras anunciadas son coherentes: unas 4 veces más fluidez, 9 veces menos bloqueos en un portátil poco potente, un peor congelamiento de la interfaz 4,5 veces más corto, y 120 imágenes por segundo mantenidas de principio a fin en un MacBook de 120 Hz. El detalle interesante es el público objetivo: son las configuraciones modestas las que más ganan.
🔗 CHANGELOG Claude Code · Renderizado 4x más fluido, @ClaudeDevs
Los agentes de código se industrializan: Warp publica el formato de sus factories, Rohlik hace escribir el 90 % de su código por agentes
24 de agosto al final del día — Warp deja ver la mecánica interna de Warp Factories, su plataforma de agentes en la nube anunciada el 18 de agosto: el formato de configuración elegido y la apertura de un acceso anticipado. El punto de partida es explícito: Warp desplaza sus propios agentes fuera de las máquinas locales, por razones de calidad y coste, y necesitaba describir entornos, arneses y permisos de seguridad como código versionado.
| Elemento de configuración | Valor retenido |
|---|---|
| Archivo de definición | factory.yaml, schemaVersion: v1alpha1 |
| Claves principales | name, repositories (owner / name), agentDefaults.model |
| Definición de un agente | agents/<nom>/agent.md con agentType (FOREMAN, REVIEW…) y model |
| Desencadenantes | automations/<nom>/automation.md : agent, triggers (proveedor, evento) |
| Interfaces disponibles | CLI (warp agent run-cloud), API REST, SDK TypeScript, servidor MCP |
| Acceso anticipado | Hasta 10 000 USD de uso ofrecido a clientes cualificados |
La separación es interesante: los agentes no se describen en un único YAML, sino en archivos Markdown dedicados, de modo que la definición de un agente se convierte en un documento legible y difeable. Warp aplica la receta a sí mismo: su factory interna, bautizada «wilson», cubre repositorios como warp-server o warp-terraform, declara sus secretos y sus servidores MCP, y organiza sus agentes por rol (code-review, foreman, implementation, spec, triage) en 34 líneas. Las cifras avanzadas en la página de solicitud de acceso son argumentos comerciales no verificables desde fuera: 200 000 ejecuciones de agentes al día, más del 30 % de pull requests fusionadas sin retoques, un 20 % menos de coste por pull request.
El 25 de agosto, Cognition publica por su parte un estudio de caso mucho más documentado que el anterior. Rohlik Group es un distribuidor alimentario en línea nacido en la República Checa, presente en cinco países, rentable, con más de 1,3 mil millones de dólares de facturación el año pasado; entrega una compra semanal completa de 17 000 productos en menos de una hora o en franjas de quince minutos. La cifra que estructura el artículo: alrededor del 90 % del código allí se genera hoy mediante agentes, y la organización de ingeniería se describe como «agent-mostly».
No es un resultado obtenido simplemente conectando una herramienta. Rohlik dice haber empezado hace un año, con una primera experiencia con Devin considerada defectuosa. Lo que cambió la situación fueron los cimientos puestos del lado del cliente: más de cincuenta integraciones MCP internas y externas, con el principio de que toda nueva herramienta debe ser accesible para los agentes desde el primer día, una capa semántica por encima del almacén de datos Snowflake, y una base de conocimientos que da a los agentes el contexto que se transmitiría a un nuevo colega. El trabajo llega a Devin desde donde nace, una conversación de Slack sobre un bug o un documento de especificación de Linear desplegado hasta la pull request. Los resultados reivindicados —doble rendimiento de ingeniería desde noviembre, integración de la robótica AutoStore entregada en ocho meses donde el sector tarda dos o tres años, prototipado reducido de un mes a un día— siguen siendo los de una página de cliente publicada por el proveedor. El efecto más elocuente está en otra parte: los mejores ingenieros pasan ahora el 80 % de su tiempo revisando código, y alrededor del 30 % del uso de Devin en Rohlik es análisis de datos por parte de usuarios de negocio.
🔗 Formato de factory.yaml, @warpdotdev · Estudio de caso de Rohlik, @cognition · Página de cliente de Devin
GitHub: cuatro ejercicios sobre los flujos de trabajo agentivos y la pestaña Customize en disponibilidad general
25 de agosto — GitHub publica cuatro nuevos ejercicios en su plataforma de aprendizaje GitHub Skills. El enfoque es explícito: en lugar de documentar las novedades agentivas del año, GitHub propone practicarlas en un repositorio de demostración, con instrucciones entregadas a medida que avanzan las pull requests.
| Ejercicio publicado | Objeto del ejercicio |
|---|---|
| Agent Orchestration Build Your AI Dream Team | Agentes personalizados en Copilot CLI: planificar, diseñar, construir, validar, transmitir |
| Agentic Workflows that Read the Room | Extensión gh aw, flujo de trabajo agentivo en Markdown, cambios enviados vía pull requests |
| Idea to Merge with the Copilot App | De una sesión a una pull request fusionada, totalmente dentro de la app GitHub Copilot |
| Ship with Quality | Señales de calidad automatizadas, cobertura de pruebas, verificaciones impuestas sobre las pull requests |
Lo más destacable de los cuatro es el primero: es la primera vez que GitHub propone un recorrido guiado sobre la orquestación multiagente en su CLI, un tema documentado hasta ahora solo en prosa. El segundo introduce la extensión gh aw, con un punto importante para la seguridad: las modificaciones propuestas por el flujo de trabajo pasan por pull requests en lugar de aplicarse directamente, lo que conserva un punto de revisión humana.
El mismo día, la app GitHub Copilot gana una pestaña Customize en disponibilidad general. Su función es reunir en una sola superficie los cuatro mecanismos de extensión introducidos por separado en los últimos meses: servidores MCP, plugins, skills y canvases. Una vista Featured presenta una selección editorial tomada de cada categoría, para el usuario que sabe lo que quiere hacer pero no qué tipo de extensión le responde, y los servidores MCP se benefician de una navegación propia con opciones destacadas según su popularidad y un recorrido por categorías. El changelog ilustra el interés de los canvases con un caso concreto: un canvas Azure DevOps para clasificar issues, priorizar un backlog, asignar seguimientos y luego confiar una tarea a Copilot para que investigue, implemente o prepare la revisión.
🔗 Cuatro ejercicios GitHub Skills · Pestaña Customize en disponibilidad general
El conjunto de herramientas de Google para desarrolladores: Gemini CLI 0.57.0 y Antigravity 2.10.0
25 de agosto — Google publica la versión estable 0.57.0 de Gemini CLI, seguida un cuarto de hora antes por la preview 0.58.0. El contenido de esta versión dice menos sobre nuevas funcionalidades que sobre la manera en que Google mantiene su herramienta: de las 24 entradas del changelog, 13 están prefijadas con [SSR Agent] Issue Fix y remiten a números de issues a menudo antiguos, de 19239 a 28518. Estas correcciones tratan los irritantes acumulados en el backlog: un bloqueo indefinido de la interfaz terminal al que se añaden tiempos de espera, un mensaje de error administrativo engañoso para cuentas personales, la ausencia de espacio después de las sugerencias de autocompletado, el renderizado del terminal que no se refrescaba al salir de un editor externo. En otras palabras, Google hace que un agente pase sobre su propia deuda técnica y el resultado llega directamente a la versión estable.
| Versión publicada | Fecha y hora (UTC) | Canal de publicación | Puntos destacados |
|---|---|---|---|
| v0.57.0 | 25 de agosto, 18:37:14 | Estable | 13 correcciones [SSR Agent], validación de evals, reintentos contextuales |
| v0.58.0-preview.0 | 25 de agosto, 18:22:01 | Preview | Aislamiento Docker en el perfil Seatbelt de macOS, verificadores de seguridad |
En cuanto a funcionalidades, el esfuerzo se centra en la evaluación, con un comando de validación de evals y un formateador de llamadas a herramientas que integra resúmenes de fallos. La fiabilidad también mejora: los errores de capacidad activan reintentos silenciosos que tienen en cuenta el contexto, y la cancelación de una solicitud multivuelta provoca un rollback completo en lugar de un estado parcial. A tener en cuenta para quien busque las notas de versión: el archivo docs/changelogs/index.md del repositorio no se ha actualizado más allá de la v0.54.0 del 6 de agosto.
Cuatro días después de la 2.9.1 y su Remote Control, Google Antigravity pasa a 2.10.0 el 24 de agosto y cubre dos carencias que obligaban a salir de la herramienta: un terminal integrado y un control de versiones Git nativo, ambos situados directamente en la barra lateral. La agrupación es coherente con la trayectoria del producto: Antigravity se posiciona como un entorno en el que se pilotan agentes en lugar de editar código línea a línea; aún así, hay que poder lanzar un comando e inspeccionar un diff sin cambiar de ventana. El resto de la versión amplía lo que se puede enviar a un agente y lo que se ve de su trabajo: los archivos de audio se suman a los adjuntos admitidos, el comentario interactivo sobre imágenes permite anotar un visual para orientar al agente, y las vistas previas enriquecidas de ejecución de herramientas MCP hacen legible lo que un servidor de herramientas ha hecho realmente. Google cifra la versión en 13 mejoras y 8 correcciones, con un despliegue progresivo.
🔗 Gemini CLI v0.57.0 · Changelog de Antigravity
Anthropic financia 5 millones de dólares en evaluaciones independientes sobre el bienestar
25 de agosto — Anthropic abre un programa de becas de 5 millones de dólares destinado a financiar investigaciones independientes sobre el efecto de la IA en el bienestar de sus usuarios. Los ganadores reciben financiación directa, acceso a los modelos y soporte técnico, pero trabajan con total independencia: sus evaluaciones se publican en open source y pueden ser reutilizadas por toda la industria. Las candidaturas están abiertas hasta el 21 de septiembre, y los candidatos seleccionados para presentar una propuesta completa serán avisados antes del 5 de octubre.
El argumento técnico explica por qué este ámbito resiste los métodos de evaluación habituales. Para la mayoría de los comportamientos de un modelo, basta con examinar una respuesta aislada para juzgar si es exacta y adecuada. El bienestar exige contexto: un usuario en situación de angustia no menciona necesariamente de entrada pensamientos autolesivos, y unos consejos sobre equilibrio alimentario razonables en un caso pueden volverse potencialmente peligrosos si la persona ha mostrado antecedentes de trastornos alimentarios. El equipo Safeguards publica en paralelo cinco criterios de rigor: enunciar claramente qué se mide, asociar clínicos y especialistas del dominio al diseño, probar a la vez las precauciones y los daños —es decir, evaluar el riesgo de excesiva complacencia como el de exceso de rechazo—, reflejar el uso real mediante escenarios multivuelta, y validar los correctores automáticos frente a verdaderos expertos. Este tercer criterio, la simetría entre sobreconformidad y sobrerrechazo, es el que distingue este enfoque de un simple endurecimiento de los guardarraíles.
🔗 Becas de investigación sobre el bienestar
Curación consciente de la cuantización: un modelo de 4 bits que supera a su original en precisión completa
25 de agosto — El flujo estándar para hacer desplegable un gran modelo encadena tres etapas: comprimir la arquitectura, cuantizar el resultado y luego reparar la pérdida de calidad. La receta dominante para esta última etapa es QAT (quantization-aware training), que inserta operaciones de falsa cuantización y vuelve a entrenar; una alternativa, QAD, destila a partir del modelo comprimido en precisión completa. En ambos casos, el alumno como mucho puede alcanzar a su maestro comprimido, y por tanto hereda el techo fijado por la compresión.
Multiverse Computing propone un cambio de una sola línea: destilar directamente desde el modelo original, el de antes de la compresión. La cuantización deja entonces de ser un posprocesado con pérdidas para convertirse en una etapa de aprendizaje de pleno derecho. El resultado es contraintuitivo: aplicada a GPT-OSS 120B comprimido a 60B y luego cuantizado en MXFP4, la metodología produce un modelo de 4 bits que iguala o supera a su propia fuente bfloat16 en siete de nueve benchmarks, con las ganancias más marcadas donde la compresión más duele: +7,4 puntos en AA-LCR en razonamiento de contexto largo y +5,6 en AIME 2025. Las dos únicas caídas, en MMLU-Pro y SciCode, se mantienen por debajo de un punto y medio.
La comparación directa con QAT con un pipeline idéntico es quizá el resultado más útil en la práctica. En GPT-OSS 9B cuantizado en MXFP4, ambos métodos alcanzan un pico comparable, 54,9 frente a 54,6, pero no al mismo precio: QAH llega ahí en unas cien etapas y se mantiene, mientras que QAT tarda alrededor de 700 etapas en alcanzarlo y luego se degrada. La consecuencia concreta es un riesgo de despliegue distinto: un punto de control QAT exige una supervisión atenta de la parada anticipada, un punto de control QAH mucho menos.
🔗 Curación consciente de la cuantización
Gradio integra gr.Workflow, un constructor de pipelines de IA en grafo
25 de agosto — Hugging Face publica una guía que presenta gr.Workflow, una primitiva ahora integrada en Gradio. El punto de partida es simple: la mayoría de las aplicaciones de IA interesantes no son una llamada a un modelo, sino una cadena —se genera una imagen, se recorta su fondo, se obtiene una voz en off, se pide un título a un LLM. Hasta ahora, cablear esa cadena y exponerla correctamente exigía escribir tanto la lógica como la interfaz. gr.Workflow fusiona ambas: se describen los pasos como un grafo de nodos tipados, y el grafo se convierte en la interfaz.
El interés para los desarrolladores va más allá de la demostración visual. Cada salida del grafo obtiene automáticamente su propio punto de acceso REST: el estudio de medios dado como ejemplo, que encadena una generación FLUX, un recorte, una síntesis de voz y un LLM, expone tres rutas distintas (/sticker, /voiceover, /episode_title) invocables desde código sin pasar por la interfaz. Los nodos saben hablar a cuatro mundos: los modelos alojados mediante los Inference Providers de Hugging Face, otros Spaces Gradio públicos reutilizados como bloques, una fila de un conjunto de datos del Hub y Python arbitrario. Este último punto abre más puertas: un nodo operador decorado con @spaces.GPU reserva una GPU ZeroGPU durante el tiempo de su ejecución, lo que permite ejecutar sus propios pesos. Cinco aplicaciones realmente desplegadas en Spaces acompañan la guía, entre ellas un perfilador de conjuntos de datos y una demostración que anima una imagen fija con Lightricks/LTX-Video.
ElevenLabs lanza Composer, un editor de canciones sección por sección
25 de agosto — ElevenLabs anuncia Composer, un editor de canciones que trabaja sección por sección. El principio rompe con el modo dominante de generación de los modelos de música: en lugar de producir una pieza completa de una sola vez y volver a lanzarlo todo cuando un pasaje no conviene, Composer permite retomar un verso, un estribillo o un puente por separado. Se proponen cuatro puntos de partida —tus propias letras, una pista existente que aportas, una página en blanco o un simple prompt— y luego la pieza se construye mediante retoques sucesivos.
Es el segundo movimiento de ElevenLabs hacia la música después de Eleven Music, y llega en una semana cargada para la empresa, con la CLI v1 lanzada la víspera. El posicionamiento es coherente con el resto del sector de audio: Suno lanzó Studio 2.0 el 13 de agosto, Pika sacó su gama Pika Music el 18 de agosto, y Stability AI entregó su plugin para estaciones de trabajo de audio el mismo día. El control fino sobre la estructura de la pieza, más que la calidad bruta de generación, se ha convertido en el terreno de competencia. Una reserva, sin embargo: ningún artículo de blog acompaña el anuncio, y no hay nada disponible sobre los planes que dan acceso a Composer, los formatos de exportación o el acceso API.
🔗 Anuncio de Composer, @ElevenLabs
LiveAvatar elimina cualquier límite de concurrencia y baja a 0,01 USD por minuto
25 de agosto — HeyGen anuncia la eliminación de los límites de concurrencia en LiveAvatar, su producto de avatares en tiempo real. La formulación insiste en la naturaleza del cambio: los límites no se elevan, desaparecen. Una sesión o diez mil se ejecutan sobre la misma API, sin negociación previa de cuota. Dos parámetros acompañan el anuncio: el renderizado sigue siendo de cuerpo entero en 1080p, y el precio baja hasta 0,01 USD por minuto a escala.
Este nivel de precio cambia la naturaleza de los usos posibles: a un céntimo el minuto, un avatar en tiempo real se vuelve viable para soporte al cliente a gran escala, formación o kioscos interactivos, casos en los que el coste unitario decidía hasta ahora la factibilidad. La supresión del límite de concurrencia es el punto técnicamente interesante. Las plataformas de avatares en tiempo real suelen poner un tope al número de sesiones simultáneas porque cada sesión moviliza GPU de forma continua; levantar ese tope supone o bien un margen de capacidad importante o bien una ganancia de eficiencia en el modelo. HeyGen publica un artículo explicando su enfoque, cuyos detalles técnicos no estaban accesibles en el momento del rastreo.
🔗 Concurrencia ilimitada en LiveAvatar
Grok 4.6 llega a OpenCode Go
25 de agosto — Grok 4.6 se suma a OpenCode Go, la fórmula de suscripción del agente de código open source OpenCode. El anuncio llega desde OpenCode al final del día, y la cuenta @grok lo difunde media hora más tarde. El punto concreto para los desarrolladores es la cuota: 169 solicitudes por cada tramo de 5 horas para los usuarios de la fórmula Go. Es un techo deslizante, no un recuento mensual, lo que encaja con el uso en ráfagas típico de las sesiones de codificación asistida.
Esta integración se inscribe en una serie de aperturas de Grok 4.6 hacia herramientas de terceros: el modelo llegó a GitHub Copilot el 14 de agosto, a Amazon Bedrock el 19 de agosto y luego a la Gemini Enterprise Agent Platform de Google el 21 de agosto. xAI ya había conectado OpenCode a sus suscripciones SuperGrok y X Premium en mayo de 2026; por tanto, la aportación de hoy no es el acceso a OpenCode en sí, sino la presencia del modelo 4.6 en la fórmula Go, con una cuota incluida en lugar de una suscripción xAI que aportar uno mismo.
🔗 Difusión de @grok · Anuncio de @opencode
Cohere publica un estudio de IDC sobre la adopción de la IA soberana en 2026
25 de agosto — Cohere publica los resultados de un InfoBrief encargado a IDC sobre la adopción de la IA soberana en los sectores regulados. El estudio entrevistó a más de 500 responsables sénior de empresas con más de mil millones de dólares de facturación en Canadá, Estados Unidos, Reino Unido y Alemania, entre abril y mayo de 2026.
El resultado más notable tiene que ver menos con la adopción que con la confusión conceptual. Uno de cada tres directivos tiene dificultades para describir la IA soberana con sus propias palabras, y solo el 13 % declara estar muy ampliamente sensibilizado con el tema. Entre quienes logran dar una definición, el 52 % la formula en términos de control local o nacional y el 35 % menciona la independencia digital. La brecha también atraviesa el organigrama: los responsables de TI muestran una sensibilización el doble de alta que la de los responsables de negocio.
| Sector encuestado | Fuga de datos y cumplimiento como principal preocupación | Ventaja competitiva como motor |
|---|---|---|
| Servicios financieros | 82 % | 21 % |
| Industria | 77 % | 32 % |
| Telecomunicaciones | 75 % | 37 % |
| Salud | 74 % | 28 % |
| Energía | 70 % | 21 % |
En cuanto a las motivaciones, el consenso es claro y transversal: la fuga de datos, la confidencialidad y el cumplimiento ocupan los primeros puestos en todos los sectores encuestados. La ventaja competitiva aparece como un motor secundario pero en progresión, más destacado en Canadá (35 %) y Estados Unidos (28 %) que en Alemania (23 %) o Reino Unido (18 %). El estudio, evidentemente, sirve al posicionamiento de Cohere, cuya plataforma agéntica North se ejecuta en la infraestructura y la jurisdicción elegidas por el cliente; queda, no obstante, que las cifras se atribuyen a una fuente identificada. IDC prevé además que, de aquí a 2028, los CIO de las multinacionales aumentarán un 65 % sus inversiones en entornos cloud soberanos modulares y en la localización de datos.
🔗 State of Sovereign AI Adoption 2026
Breves
- Bain & Company se une al Claude Partner Network — La consultora se convierte en socio Global Premier, respaldado por un despliegue de Claude entre sus 19 000 empleados; más de 7 000 usuarios activos desde la fase piloto, y más de dos tercios de los participantes han adoptado Claude for Excel. 🔗 Entrada de Anthropic
- Amp explica qué son los orbs — Nota de Thorsten Ball en respuesta a la confusión sobre el nombre: un orb es un agente remoto, controlable desde la web, el teléfono o la CLI. Dos precisiones útiles sobre el coste: el sueño ilimitado no se factura y el número de orbs simultáneos no tiene tope. 🔗 Nota de Amp
- Together AI abre Qwen3.8 27B al fine-tuning y a la inferencia dedicada — El modelo pasa a estar disponible tanto para el ajuste con datos propios como para Dedicated Model Inference en hardware reservado. 🔗 Tweet @togethercompute
- FINAL-Bench abre FINCHAL, un concurso de previsión financiera para agentes — Dotado con 2 000 dólares, pide posiciones más que predicciones y publica un techo de suerte (luck ceiling) para separar la pericia del azar. 🔗 Entrada de FINAL-Bench
- Au-Zone publica el EdgeFirst Model Zoo — Cuatro familias YOLO en detección y segmentación medidas sobre silicio embebido real, y cada cifra publicada remite a la sesión de validación que la produjo, frente a la opacidad de los TOPS anunciados por los fabricantes. 🔗 Entrada de EdgeFirst
- La dictada inteligente de Gemini para macOS — Dictar en cualquier ventana del escritorio, con supresión automática de las vacilaciones y toma en cuenta de las correcciones en mitad de frase; la voz también sirve para resumir archivos y reescribir un texto. 🔗 Guía de blog.google
- Las push rules aceptan excepciones de ruta — En previsualización pública, las reglas Restrict file paths y Restrict file size pueden eximir rutas precisas, por ejemplo bloquear los JAR en todas partes salvo
**/gradle/wrapper/*.jar. 🔗 Registro de cambios de GitHub - Bloqueo de un usuario desde un aviso de seguridad — La acción pasa por el menú de tres puntos de la descripción o de un comentario, en repositorios públicos, sin volver a la configuración; el aviso permanece intacto. 🔗 Registro de cambios de GitHub
- Manus señala una fuerte demanda en la restauración de datos — Las restauraciones que no se completan deben reintentarse más tarde ese mismo día; instrucción explícita de conservar los paquetes de copia de seguridad intactos e inalterados. 🔗 Tweet @ManusAI
- Kling publica tres guías sobre su servidor MCP — Conectar Kling a un asistente compatible con MCP para reproducir una configuración creativa validada y generar variantes en lote; dos de los tres tutoriales citan Claude Code como cliente. 🔗 Blog de Kling
- Wan 3.0 llega a Runway y Replicate — Runway lo integra el 24 de agosto con múltiples entradas de referencia en imagen, vídeo y audio; Replicate le sigue el 25 destacando los 30 segundos nativos en una sola toma con audio sincronizado. 🔗 Tweet @runwayml
- Runway anuncia nuevos ponentes para su AI Summit — Programa ampliado a robótica, vehículos autónomos, marketing e infraestructura para el evento de septiembre en San Francisco. 🔗 Tweet @runwayml
- MiniMax publica un índice de integraciones de H3 — Awesome MiniMax H3 Integrations recopila lo que se construye alrededor del modelo de vídeo abierto, incluidas configuraciones que funcionan con 24 GB de VRAM. 🔗 Tweet @MiniMax_AI
- Luma lanza Dream Lab Weekly — Primer episodio de una serie de vídeo dedicada a los profesionales creativos de Luma y a su trabajo semanal sobre el producto. 🔗 Tweet @LumaLabsAI
- NVIDIA difunde una sesión de Nemotron Labs sobre el enrutamiento de modelos abiertos — Emisión en directo de 55 minutos titulada Get Started with Open Model Routing, prolongación del trabajo sobre Nemotron 3.5 Lightning y NeMo Switchyard. 🔗 Tweet @NVIDIAAI
- Una semana restante para el concurso Grok Imagine sobre la Odisea — Hay que componer una escena extraída de la Odisea que ponga en valor las capacidades de vídeo y voz de la herramienta; premios de 100 000, 50 000 y 25 000 dólares. 🔗 Tweet @grok
- Banco de reinicios de límites para suscriptores Plus y Pro — En lugar de esperar la ventana de reinicio, el usuario consume un reinicio reservado; uno gratuito al lanzamiento y otros mediante referidos, con créditos compartidos de workspace por el lado Business. 🔗 Registro de cambios de ChatGPT y Codex
Lo que significa
El silicio vuelve a ser un tema de laboratorio de modelos. OpenAI publica el mismo día las primeras cifras medidas de su propia chip de inferencia y la entrada que expone su estrategia de compute. No es una coincidencia de calendario: un proveedor de modelos que diseña su silicio, lo mide en un benchmark público de terceros y asume públicamente una cartera de diez socios cambia la naturaleza de la competencia. La pregunta deja de ser «qué modelo es el mejor» para convertirse en «a qué coste por tarea completada», y la respuesta se juega tanto en el rack como en los pesos. Quizá el detalle más significativo esté en otra parte: la IA sirvió para diseñar el chip y escribir sus kernels, con una puesta en fabricación en nueve meses y implementaciones generadas que superan a las de expertos humanos en los bloques seleccionados. El ciclo se cierra: los modelos diseñan el hardware que los hará funcionar.
La IA vuelve al dispositivo, y las cifras empiezan a seguirla. Tres señales el mismo día apuntan en la misma dirección. Perplexity hace funcionar la totalidad de su agente en local en un DGX Spark, sin consumir créditos, con una escalada a la nube que sigue siendo decisión del usuario. Multiverse Computing publica un método en el que un modelo de 4 bits iguala o supera a su fuente en precisión completa, lo que elimina el argumento habitual contra la cuantificación agresiva. Au-Zone publica mediciones de visión mediante silicio integrado, reprochando a los TOPS anunciados que no dicen nada de lo que un modelo dado hará realmente. Ninguno de estos tres trabajos pretende igualar al frontier: la cifra honesta de Perplexity es 59,6 % en local frente a 82,4 % para Claude Opus 5 solo en Terminal Bench 2.1. Pero la escalada hacia un modelo asesor recupera tres quintas partes de la brecha por dos tercios del coste, y es ese arbitraje, más que la paridad, lo que hace defendible la ejecución local.
La apertura de los pesos se instala como posición de referencia. El análisis de 500 000 artículos de arXiv difundido por Qwen documenta un giro ya perceptible: los modelos abiertos chinos han pasado del 10 % a alrededor del 40 % de las menciones, mientras que los modelos abiertos estadounidenses se estancan entre el 25 y el 30 %. Qwen3.8-27B entrando en el top 10 de Code Arena siendo el único de su tamaño, GLM-5.3 superando a GPT-5.6 Sol y Claude Fable 5 en DeepSWE en ensayos múltiples a un coste entre 2,1 y 5,4 veces inferior, IBM abriendo Granite 4.2 con cuatro variantes cuantificadas y catorce formatos GGUF desde el primer día: la misma lógica se repite. Abrir los pesos ya no es un gesto de recuperación, sino una forma de convertirse en la infraestructura por defecto de los demás, con el matiz que el propio Nathan Lambert señala: las publicaciones van por detrás de los lanzamientos, y esas curvas describen el trabajo en curso más que las preferencias del momento.
Y la web se prepara para ser leída por agentes más que por ojos. El WebMCP Challenge es un concurso dotado con 35 000 dólares, lo cual es poco; lo que revela vale mucho más. Chrome, Cloudflare, Shopify, Vercel, Render y Netlify se alinean con OpenAI en torno a un estándar que pide a los sitios exponer herramientas estructuradas en lugar de dejar que los agentes adivinen una interfaz. El mismo día, ChatGPT desktop puede consumir WebMCP de forma nativa, Codex puede producir y desplegar una aplicación compatible, y OpenAI documenta su uso interno del protocolo en una herramienta de notebooks. Esta convergencia se suma a lo que Rohlik describe por su parte con más de cincuenta integraciones MCP y el principio de que toda nueva herramienta debe ser accesible para los agentes desde el primer día. La capa de interfaz para agentes deja de ser un tema de investigación para convertirse en una exigencia de ingeniería.
Fuentes
- OpenAI — WebMCP Challenge
- OpenAI — anuncio del WebMCP Challenge en X
- OpenAI — WebMCP en ChatGPT desktop y Sites
- OpenAI — automatizar el trabajo repetitivo con Codex, Runme y WebMCP
- OpenAI — Jalapeño, primeros resultados
- OpenAI — The full stack behind abundant intelligence
- OpenAI — plugin Admin para ChatGPT Work y Codex
- OpenAI — extensión del navegador ampliada a Edge, Brave, Opera y Vivaldi
- OpenAI — asiento Premium de ChatGPT Business
- ChatGPT y Codex — changelog
- Perplexity — lanzamiento de Portable Computer
- Perplexity — entrada sobre Portable Computer
- Perplexity — benchmarks del arnés local
- Anthropic — la memoria de Claude funciona en todas partes
- Anthropic — anuncio de memoria en X
- Anthropic — CHANGELOG Claude Code
- Anthropic — renderizado en streaming 4x más fluido
- Anthropic — becas de investigación sobre el bienestar
- Anthropic — Bain & Company se une a Claude Partner Network
- IBM — Granite 4.2
- IBM — Granite Speech 5.0 Turbo CTC
- Multiverse Computing — Quantization-Aware Healing
- Hugging Face — guía gr.Workflow
- FINAL-Bench — concurso FINCHAL
- Au-Zone — EdgeFirst Model Zoo
- Together AI — Qwen3.8 27B en fine-tuning e inferencia dedicada
- Google AI — WeatherNext Cyclones
- Google DeepMind — WeatherNext Cyclones
- Google — Gemini CLI v0.57.0
- Google — changelog de Antigravity
- Google — dictado inteligente de Gemini para macOS
- Stability AI — Serie B de 76 millones de dólares
- Stability AI — anuncio en X
- NVIDIA — Gamescom y RTX Spark
- MiniMax — SANA y Sol Engine en H3
- MiniMax — índice de integraciones de H3
- NVIDIA — sesión Nemotron Labs sobre el enrutamiento de modelos abiertos
- Qwen — Qwen3.8-27B en Code Arena WebDev
- Qwen — difusión del análisis de arXiv
- Nathan Lambert — 500 000 artículos de arXiv pasados por el tamiz
- Warp — formato factory.yaml y acceso anticipado
- Cognition — estudio de caso de Rohlik Group
- Devin — página de cliente Rohlik Group
- Amp — explicación de los orbs
- GitHub — cuatro nuevos ejercicios GitHub Skills
- GitHub — pestaña Customize en disponibilidad general
- GitHub — excepciones de ruta en las push rules
- GitHub — bloqueo desde un aviso de seguridad
- Manus — actualización sobre la restauración de datos
- ElevenLabs — Composer
- HeyGen — competencia ilimitada en LiveAvatar
- Kling — guías sobre el servidor MCP
- Runway — Wan 3.0 disponible en la plataforma
- Runway — nuevos ponentes de la AI Summit
- Luma — Dream Lab Weekly
- xAI — Grok 4.6 en OpenCode Go
- OpenCode — Grok 4.6 en la fórmula Go
- xAI — concurso Grok Imagine en Odyssey
- Cohere — State of Sovereign AI Adoption 2026