ai-powered-markdown-translatorArtículo traducido del fr al es con gpt-5.4-mini.
Cuarenta y siete anuncios seleccionados en nueve áreas para la jornada del 27 de agosto. Tres de ellos destacan. Anthropic abre la primera fase de una previsualización de investigación (research preview) del Model Hardware Standard, una especificación que permite a agentes controlar instrumentos de laboratorio y reduce su integración de varias semanas a unas pocas horas. OpenAI publica una tribuna en la que llama a una ciberdefensa colectiva, junto a organizaciones entre las que figuran Anthropic, AWS, Google, Microsoft y Oracle. Y Ai2 despliega AutoDiscovery en un centro de oncología en funcionamiento, publicando el mismo día un hallazgo sobre el cáncer de mama validado en laboratorio. El resto — GLM-5.3 Flash en Together AI y el anuncio de la apertura de los pesos de GLM-5.3, Gemini Omni 1.1 Flash, Cohere Parse, el primer CPU Vera entregado a AWS, una veintena de actualizaciones de herramientas — sigue a continuación.
Anthropic abre el Model Hardware Standard y 10 000 plazas de Claude para científicos
27 de agosto — Anthropic lanza la primera fase de una previsualización de investigación del Model Hardware Standard (MHS), una especificación compartida que permite a agentes de IA controlar equipos físicos. El acceso, por ahora, sigue reservado a un primer grupo de laboratorios de investigación e industriales avanzados. El estándar nació de una colaboración entre Alek Kemeny, del equipo Beneficial Deployments de Anthropic, y Arco Bast, investigador posdoctoral en HHMI Janelia Research Campus, quien realizaba experimentos de imagen cerebral sobre un banco que combinaba láseres, motores de enfoque y cámaras sin una interfaz común.
El problema abordado es prosaico y costoso: cada dispositivo expone su propia interfaz de programación, y no existía una forma estándar de hacerlos dialogar. MHS introduce un driver construido sobre primitivas deliberadamente mínimas, del tipo «read» (por ejemplo «get temperature») y «write» (por ejemplo «set temperature»), que hace que cada dispositivo sea detectable en un formato común. Etiquetas redactadas en lenguaje natural describen lo que el código no dice — el peso de un brazo robótico, por ejemplo — y el driver deriva de ello un archivo de referencia que enumera lo que mide el dispositivo, lo que puede ajustarse y los límites de seguridad aplicados. Coexisten tres mecanismos de control: MCP, la interfaz en línea de comandos y archivos de código expuestos como API.
Los resultados de los socios dan la medida de la ganancia. Genentech automatizó la cuantificación de proteínas BCA coordinando un manipulador de líquidos, un brazo robótico y un lector de placas. En Carnegie Mellon, las curvas dosis-respuesta por dilución en serie se ejecutan aproximadamente tres veces más rápido, con un agente que orquesta cuatro familias de equipos distribuidas en tres ordenadores con interfaces incompatibles. QuEra Computing dejó que un agente desarrollara un controlador que restablece el bloqueo en frecuencia de los láseres de un ordenador cuántico en el 99,3 % de los casos sin intervención humana. En cuanto al ecosistema, AWS respaldará MHS a través de su biblioteca Strands Robots, y Hugging Face, así como Raspberry Pi, se unirán a la siguiente fase, la segunda después de pruebas concluyentes con su Camera MHS Driver.
Anthropic asume los límites: Claude aprende el mundo físico a través del texto y la imagen, su razonamiento espacial sigue siendo limitado y requiere supervisión experta. En Genentech, los investigadores tuvieron que hacerle entender que los errores de espumado de las muestras eran fallos físicos y no errores de software. El estándar se publicará posteriormente como open source.
El mismo día, Anthropic abre 10 000 plazas de Claude a científicos de todo el mundo mediante un nuevo plan Claude Team para investigadores. Las plazas Standard son gratuitas; las plazas Premium — con límites de uso multiplicados por cinco — cuestan 15 dólares al mes durante un año, lo que la cuenta oficial presenta como un descuento del 80 %. El acceso se realiza mediante la verificación del estatus de investigador principal en una institución académica o en una organización sin ánimo de lucro. El programa AI for Science, hasta ahora centrado en las ciencias biológicas, se amplía a otras disciplinas y sube a 50 000 dólares en créditos por proyecto. Permanece una restricción: los investigadores en biología y química siguen limitados a los modelos de clase Opus, y los modelos Claude Fable continúan bloqueando las solicitudes de biología profesional y desarrollo de fármacos.
| Elemento medido | Valor anunciado |
|---|---|
| Tiempo de integración antes de MHS | Semanas a meses |
| Tiempo de integración con MHS | Horas a minutos |
| Aceleración dosis-respuesta (Carnegie Mellon) | Aproximadamente 3x |
| Recuperación del bloqueo láser sin humano (QuEra) | 99,3 % |
| Programas de fabricantes unificados (HHMI Janelia) | 7 |
| Plazas Claude abiertas a científicos | 10 000, durante un año |
| Plaza Premium (límites x5) | 15 dólares al mes, descuento del 80 % |
| Créditos AI for Science | Hasta 50 000 dólares por proyecto |
Connecting AI to hardware requires days or weeks of bespoke integration, with no standard way for agents to operate equipment safely. MHS cuts integration to hours or minutes, provides an interface that makes devices discoverable, and enables agents to operate them safely.
🇪🇸 Conectar la IA con el hardware requiere días o semanas de integración a medida, sin una forma estándar para que los agentes controlen los equipos con seguridad. MHS reduce la integración a horas o minutos, ofrece una interfaz que hace que los dispositivos sean detectables y permite a los agentes controlarlos con seguridad. — @AnthropicAI en X
🔗 Model Hardware Standard · Ampliar el apoyo a los científicos
Ai2 instala AutoDiscovery en un centro de oncología y publica un hallazgo validado sobre el cáncer de mama
27 de agosto — Ai2 saca AutoDiscovery de los conjuntos de datos públicos para instalarlo en una institución en funcionamiento: el Paul G. Allen Research Center del Providence Swedish Cancer Institute desplegará la plataforma sobre sus propios datos de investigación y clínicos. El anuncio llega acompañado de lo que lo justifica, un resultado científico producido por la herramienta y luego validado de forma independiente.
El trabajo se centró en The Cancer Genome Atlas, uno de los conjuntos de datos más estudiados del campo. AutoDiscovery genera y evalúa hipótesis con grandes modelos de lenguaje, priorizando las observaciones que resultan al mismo tiempo sorprendentes respecto a las expectativas establecidas y reproducibles de un análisis a otro. Con estos datos, la plataforma sacó a la luz una señal inesperada: el carcinoma lobulillar invasivo, un subtipo de cáncer de mama durante mucho tiempo clasificado como inmune frío (immune cold) y por tanto considerado insensible a la inmunoterapia, presenta en realidad una actividad inmunitaria más fuerte de lo reconocido.
Es la continuación lo que da peso al anuncio. Los investigadores validaron la observación en un conjunto de datos independiente de pacientes y luego la confirmaron en laboratorio mediante análisis de muestras tumorales, con imágenes de inmunofluorescencia que mostraban a los linfocitos T rodeando el tumor. El artículo surgido de este trabajo, «Surprisal-based large language models reveal immunologic insights in breast cancer», fue publicado el mismo día por un equipo conjunto dirigido por la Dra. Kelly Paulson (PARC) y la Dra. Sasha Stanton (Earle A. Chiles Research Institute), con Bodhisattwa Majumder, investigador sénior en Ai2. Según Ai2, la conclusión sugiere que una clase entera de pacientes — alrededor del 15 % de los cánceres de mama diagnosticados cada año en Estados Unidos — debería volver a examinarse desde la perspectiva de la inmunoterapia.
El despliegue local es el segundo frente: Providence instala AutoDiscovery en su propio entorno cloud, lo que mantiene los datos protegidos dentro de la institución, mientras el equipo de investigación computacional del PARC se encarga de la instalación, la ejecución y el acompañamiento. Ai2 insiste en el posicionamiento: la plataforma no está diseñada para funcionar sola, sino para ser orientada por los investigadores, que deciden las líneas a explorar.
🔗 Asociación Ai2 y Providence Swedish
OpenAI llama a una ciberdefensa colectiva con Anthropic, AWS, Google, Microsoft y Oracle
27 de agosto — OpenAI publica una tribuna titulada «A call for collective action on cyber defense», junto a organizaciones entre las que figuran Anthropic, AWS, Google, Microsoft y Oracle — la formulación del mensaje oficial es «including», por lo que la lista no es exhaustiva. El texto parte de un hecho de calendario: los próximos meses ofrecen una ventana limitada en la que los defensores pueden tomar la delantera, antes de que los ataques asistidos por IA se vuelvan mucho más generalizados y sofisticados a medida que los modelos progresan en todo el mundo. Los objetivos mencionados no son abstractos: hospitales, estaciones de tratamiento de agua, la infraestructura que hace funcionar Internet.
El argumento central es que los avances actuales ya dan a los defensores herramientas para corregir debilidades acumuladas durante años — errores antiguos, permisos excesivos, fallos de configuración, software sin parches, autenticación débil, deuda técnica de sistemas heredados — mientras que los equipos de seguridad de las infraestructuras críticas han estado históricamente infradotados.
Tres principios estructuran la propuesta: reconocer que el statu quo en seguridad no bastará, dotar a más defensores de una IA capaz en ciberseguridad y movilizar una respuesta colectiva, bajo la constatación de que ninguna empresa por sí sola debería controlar ese futuro. A continuación, siguen cuatro listas de peticiones dirigidas a objetivos concretos. Cada organización debe tratar la ciberdefensa como una prioridad de la dirección, corregir sus debilidades más arriesgadas y elevar el nivel exigido a lo que compra, construye y despliega, incluido el código generado por IA. Se invita a las empresas de ciberseguridad a probar sus defensas de forma continua frente a las capacidades de frontera y a medir sus progresos por el número de organizaciones protegidas más que por indicadores de actividad. Se pide a los gobiernos que financien la ciberdefensa empezando por los servicios esenciales sin presupuesto ni personal. Por último, los laboratorios de IA de frontera deben proporcionar acceso responsable a los modelos y hacer que las identidades agénticas sean trazables y responsables.
Este último punto vincula la tribuna con la actualidad del día anterior: el informe de investigación sobre el incidente de Hugging Face, en el que un modelo de investigación interno había obtenido un acceso a Internet no previsto y comprometido workers de producción. La trazabilidad de los agentes figura ahí como un compromiso, no solo como una recomendación dirigida a los demás.
We have a limited window to strengthen cyber defenses, and together with organizations including @AnthropicAI, @awscloud, @Google, @Microsoft, and @Oracle, we’re calling for a global effort to give defenders the tools, resources, and support to protect the infrastructure we all depend on. If we act decisively, we can turn today’s AI advances into lasting improvements in security and make our digital world safer for everyone.
🇪🇸 Tenemos una ventana limitada para reforzar las ciberdefensas, y junto con organizaciones entre las que figuran @AnthropicAI, @awscloud, @Google, @Microsoft y @Oracle, hacemos un llamamiento a un esfuerzo mundial para dar a los defensores las herramientas, los recursos y el apoyo necesarios para proteger la infraestructura de la que todos dependemos. Si actuamos con decisión, podemos transformar los avances actuales de la IA en mejoras duraderas de la seguridad y hacer que nuestro mundo digital sea más seguro para todos. — @OpenAI en X
🔗 A call for collective action on cyber defense
Claude Cowork incorpora su propio navegador
26 de agosto — Claude Cowork integra su propio navegador en la aplicación de escritorio. En cuanto una tarea implica un sitio web, se abre un navegador en el panel lateral y Claude navega por él, lee las páginas, hace clic y rellena formularios. La idea es delegar la parte web de un trabajo sin salir de lo que se está haciendo: extraer cifras de un panel de control o atravesar un portal de proveedor para el que no existe ningún conector.
La separación es el punto central del anuncio. El navegador integrado es el de Claude, no el del usuario: Claude no ve ni las pestañas, ni los marcadores, ni las contraseñas. Para seguir conectado a sus servicios, se importan las sesiones sitio por sitio, desde Chrome, Edge o Firefox en macOS, y desde Firefox en Windows y Linux. Los sitios bancarios, de mensajería y de autenticación única (SSO) se dejan de lado salvo decisión explícita de incluirlos.
Anthropic traza una frontera de uso clara con la extensión Claude in Chrome, que pasó a disponibilidad general el mismo día. El navegador integrado sirve para confiar una tarea web mientras se continúa trabajando; Claude in Chrome sirve la página ya abierta, con las cuentas ya conectadas. Si la extensión está instalada, sigue siendo la opción predeterminada; el ajuste se cambia en Settings → Cowork → Preferred browser, y del lado del administrador en Organization settings → Cowork → Built-in browser.
En materia de seguridad, el anuncio no promete nada absoluto. El navegador integrado comporta los mismos riesgos de prompt injection que cualquier agente que actúe en un navegador, cuando instrucciones ocultas en una página intentan desviar a Claude. Aplica las mismas protecciones que Claude in Chrome, incluidos los controles que comparan las acciones de Claude con lo que se había solicitado. Anthropic escribe que estas medidas reducen el riesgo de forma significativa sin eliminarlo, y recomienda empezar en sitios de confianza.
| Aspecto del despliegue | Detalle |
|---|---|
| Planes afectados | Pro, Max, Team; Enterprise con activación del administrador |
| Plataformas compatibles | macOS, Windows, Linux (en beta) |
| Calendario de despliegue | Durante la semana posterior al anuncio, activo por defecto |
| Importación de conexiones | Chrome, Edge, Firefox en macOS; Firefox en Windows y Linux |
| Sitios excluidos por defecto | Banca, mensajería, autenticación única |
🔗 El navegador integrado de Cowork
GLM-5.3 Flash llega a Together AI, y Z.ai anuncia la apertura de los pesos de GLM-5.3
27 de agosto — Together AI pone en línea GLM-5.3 Flash, el primer modelo nativamente multimodal de la serie GLM-5 de Z.ai, con sus pesos disponibles públicamente. La ficha técnica es inusualmente detallada: arquitectura Mixture-of-Experts de 320 mil millones de parámetros, de los cuales 18 mil millones activos, 45 capas, ventana de contexto de un millón de tokens. La comparación destacada por Z.ai es interna a su propia línea: a tamaño total comparable, el modelo reduce casi a la mitad el número de parámetros activos y la profundidad de GLM-4.5.
La arquitectura es el verdadero tema. El modelo combina una atención lineal que captura las dependencias locales mediante modelado de estado y una atención sparse que recupera el contexto global mediante un indexador ligero. IndexPool además comprime cuatro vectores clave del indexador en uno solo mediante pooling ponderado. El resultado anunciado por Z.ai, medido frente a GLM-5.3: tres veces menos cálculo de atención y una caché KV 4,4 veces más pequeña en la ventana de un millón de tokens. Es este ahorro el que justifica el posicionamiento tarifario, a 0,15 dólar por millón de tokens de entrada y 0,50 dólar de salida, frente a 1,40 y 4,40 dólares para GLM-5.2 en el mismo proveedor. El modelo había sido previsualizado de forma anónima bajo el nombre Ox Alpha antes de su lanzamiento.
Lo multimodal no es aquí un añadido periférico, sino un elemento del ciclo de codificación: el modelo inspecciona sus propias salidas renderizadas en pantalla y las afina de manera iterativa. El entrenamiento sigue la misma lógica, con aprendizaje por refuerzo (reinforcement learning) con retroalimentación del entorno para el código frontend y verificación agéntica anclada en recorridos reales de usuarios para las interfaces gráficas.
El mismo día, Z.ai anuncia en un mensaje muy breve que los pesos de GLM-5.3 —el modelo principal, accesible por API desde el 18 de agosto— se publicarán al día siguiente, a través de una ficha de Hugging Face zai-org/GLM-5.3 ya activa pero marcada como «Upcoming release». La apertura había sido preparada dos semanas antes por un artículo titulado «Preparing GLM-5.3 for Open Release: A Responsible Path to Cyber Defense». El laboratorio encadena así el lanzamiento de una variante rápida y la apertura de los pesos del modelo principal con menos de veinticuatro horas de intervalo.
| Benchmark evaluado | GLM-5.3 Flash | GLM-5.2 |
|---|---|---|
| Terminal Bench 2.1 | 84,3 | 81,0 |
| DeepSWE v1.1 | 63,4 | 46,2 |
| Toolathlon Verified | 78,4 | 59,9 |
| AutomationBench | 48,8 | 26,2 |
| Humanity’s Last Exam (con herramientas) | 55,3 | — |
| GDPval-AA v2 Elo (Artificial Analysis) | 1773 | — |
| Tarifa Together AI (dólares por millón de tokens) | GLM-5.3 Flash | GLM-5.2 |
|---|---|---|
| Entrada | 0,15 | 1,40 |
| Entrada en caché | 0,03 | 0,26 |
| Salida | 0,50 | 4,40 |
GLM-5.3 Flash has arrived. @Zai_org’s first natively multimodal GLM-5 model packs 320B parameters, 18B active, 1M context, and hybrid attention.
On DeepSWE, it nearly MATCHES Luna’s performance while getting more than TWICE as much work done for the same budget.
🇪🇸 GLM-5.3 Flash ha llegado. El primer modelo GLM-5 nativamente multimodal de Z.ai incorpora 320 mil millones de parámetros, 18 mil millones activos, un contexto de un millón de tokens y una atención híbrida. En DeepSWE, casi iguala el rendimiento de Luna mientras realiza más del doble de trabajo con el mismo presupuesto. — @togethercompute en X
🔗 Ficha del modelo en Together AI · Anuncio de @Zai_org sobre los pesos
Gemini Omni 1.1 Flash: 10 segundos de contexto para prolongar un plano, borradores 360p y salida 4K
27 de agosto — Google publica Gemini Omni 1.1 Flash, una actualización de su modelo multimodal de generación y edición de vídeo, firmada por Anish Nangia y Alisa Fortin, Product Managers de Google DeepMind.
El cambio más sustancial concierne a la extensión de escena. Hasta ahora, prolongar un vídeo generado equivalía a pedirle al modelo que continuara a partir del último segundo solamente, lo que provocaba rupturas de coherencia en cuanto la escena incluía personajes o un decorado complejo. Omni 1.1 analiza ahora hasta 10 segundos de contexto anterior, en bloques de 10 segundos, hasta una duración acumulada de 40 segundos.
El segundo eje es el control de encuadre: la especificación de la primera y la última imagen pide al modelo que genere el vídeo intermedio entre dos imágenes clave, lo que apunta a movimientos de cámara complejos y bucles sin empalme visible. El tercer eje es económico, con una resolución de borrador en 360p anunciada como hasta un 60 % más rápida y a un tercio del coste del 720p estándar —la medida de velocidad se basa, precisa Google, en el rendimiento del sistema comparado entre ambas resoluciones. El pipeline termina con un aumento de resolución (upscaling) a 1080p o 4K. A ello se suma la referencia de vídeo en la entrada multimodal, de hasta 3 segundos, para mantener la coherencia de un personaje o reproducir un movimiento.
El modelo está accesible en Google AI Studio, mediante la API Gemini Enterprise Agent Platform y en Google Flow para todos los suscriptores de Google AI Plus, Pro y Ultra. Google cita a Adobe, que lo ha integrado en Firefly, Figma Weave, GMI Cloud y Runway entre sus clientes. Una tabla de tarifas acompaña el artículo oficial, pero se publica en forma de imagen sin equivalente textual: por tanto, aquí no se reproduce ninguna tarifa.
El mismo día, Pika abre el modelo en su API Club, accesible a través de dev.pika.art, con la extensión de vídeo, la compatibilidad con la primera y la última imagen, hasta tres vídeos de referencia y una salida de hasta 4K. El estudio prolonga así un hábito bien establecido: agregar los modelos de vídeo de terceros en cuanto están disponibles, como ya había hecho con Seedance 2.5 y luego con Wan 3.0.
| Capacidad del modelo | Valor anunciado |
|---|---|
| Contexto para la extensión | Hasta 10 s, frente a 1 s en los modelos anteriores |
| Incremento de extensión | 10 s, hasta 40 s acumulados |
| Borrador 360p — velocidad | Hasta un 60 % más rápido que el 720p |
| Borrador 360p — coste | Un tercio del coste del 720p estándar |
| Aumento de resolución | 1080p o 4K |
| Referencia de vídeo multimodal | Hasta 3 s de vídeo |
| Identificador del modelo en la API | gemini-omni-1.1-flash |
🔗 Anuncio de Google · Mensaje de @pika_labs
H3 Max: fal post-entrena MiniMax H3 y genera 5 segundos de vídeo en menos de 3 segundos
26 de agosto — fal Research publica H3 Max, un modelo de vídeo post-entrenado a partir de los pesos abiertos de MiniMax H3. La particularidad del trabajo es que no se trata solo de un post-entrenamiento: el equipo de inference de fal co-diseñó la pila de ejecución en paralelo al modelo, de modo que las decisiones de entrenamiento y de servicio se informan mutuamente.
En cuanto a la calidad, fal llevó a cabo estudios de preferencia humana cara a cara contra doce modelos de vídeo de referencia, entre ellos el punto de acceso oficial de MiniMax H3, Gemini Omni Flash, Wan 3.0, Seedance 2.5, Kling 3 y Veo 3.1. Los evaluadores comparaban tres dimensiones separadas —preferencia global, respeto del prompt, estética— agregadas mediante puntuaciones Elo bayesianas con intervalos de confianza del 95 %. H3 Max llega primero en las tres y gana la mayoría de los duelos frente a cada uno de los modelos probados, incluido el H3 original. Artificial Analysis y Design Arena también lo sitúan en cabeza de sus clasificaciones independientes.
En velocidad, H3 Max genera un vídeo de 5 segundos en unos 3 segundos, es decir, aproximadamente 35 veces el rendimiento del punto de acceso oficial de MiniMax H3 y, de media, 15 veces más rápido que los modelos de calidad comparable. fal insiste en el método: una optimización solo se conservaba si el modelo resultante mantenía su posición en las evaluaciones internas de calidad. El entrenamiento y el servicio se realizaron por completo en sistemas NVIDIA GB200 NVL72.
El equipo de MiniMax H3, citado en el artículo de fal, valida el resultado: según él, H3 Max combina una calidad de vídeo a la vanguardia con un cambio de orden de magnitud en la velocidad de generación, lo que hace que la generación de vídeo de alta calidad sea práctica para un abanico mucho más amplio de aplicaciones reales. Ese es el argumento de los pesos abiertos en la práctica: un post-entrenamiento realizado por un tercero revela el potencial real de un buen modelo base.
| Medida publicada por fal | Valor |
|---|---|
| Vídeo de 5 segundos | Generado en unos 3 segundos |
| Rendimiento frente al punto de acceso oficial H3 | Aproximadamente 35x |
| Velocidad frente a modelos de calidad comparable | 15x de media |
| Modelos de vídeo comparados | 12 |
| Clasificación en preferencia humana | 1.º en las tres dimensiones |
| Descuento de lanzamiento | 50 % durante la primera semana |
🔗 Presentación de H3 Max por fal
Cohere Parse: 1,50 dólar por 1 000 páginas y 79,2 en ParseBench
27 de agosto — Cohere lanza Parse en disponibilidad general, un modelo de visión y lenguaje (vision language model) dedicado al tratamiento de documentos empresariales en gran volumen. Convierte archivos multimodales complejos en datos estructurados legibles por máquina y devuelve Markdown limpio, pensado para la indexación documental, el RAG y la recuperación agéntica. Más allá del reconocimiento óptico de caracteres, Parse identifica tablas, formularios, diagramas e imágenes integradas, y devuelve cajas delimitadoras (bounding boxes) para las tablas y las imágenes. Procesa nueve grandes lenguas mundiales.
El argumento principal es tarifario: 1,50 dólar por cada 1 000 páginas en la API de Cohere. Para las cargas sostenidas, la empresa impulsa Model Vault, su plataforma de inferencia mono-tenant, con un 23 % de ahorro al 50 % de utilización de GPU y hasta un 61 % a plena utilización por hora. El caso cuantificado dado como ejemplo —un flujo de cuentas por pagar que procesa alrededor de 13 millones de páginas al mes— representa unos 12 000 dólares de ahorro mensuales frente a la API, y unos 1,47 millones de dólares al año frente a una oferta hyperscaler facturada a 10 dólares por 1 000 páginas.
En cuanto al rendimiento, Cohere anuncia 4,5 páginas por segundo, es decir, 36 páginas por segundo en un nodo de 8 GPU H100 —aproximadamente 1,4 veces el rendimiento de dots.mocr y 2,2 veces el de Chandra OCR 2 en la misma configuración, comparándose solo modelos de código abierto servidos mediante vLLM.
Cohere asume dos límites metodológicos. Las dimensiones Layout y Chart de ParseBench se excluyen del comparativo, ya que el modelo apunta a un Markdown en orden de lectura y trata los gráficos como elementos visuales descritos por metadatos; la extracción de series numéricas se anuncia para la siguiente versión. Además, todas las puntuaciones publicadas utilizan las reglas de ParseBench de agosto de 2026, que corrigen un defecto de detección de negritas y títulos que antes inflaba las puntuaciones de formato semántico; los competidores han sido revalorados con esas mismas reglas. Parse está disponible mediante la API de Cohere, Model Vault, Microsoft Foundry y AWS SageMaker bajo el identificador parse-v5.0, y puede desplegarse en nube privada o en local.
| Modelo evaluado | Media | Tablas | Fidelidad del contenido | Formato semántico |
|---|---|---|---|---|
| GPT-5.5 | 84,4 | 89,3 | 87,5 | 76,5 |
| Opus 4.8 | 84,3 | 89,7 | 89,0 | 74,1 |
| Gemini 3.5 Flash | 81,8 | 87,6 | 84,7 | 73,2 |
| Cohere Parse | 79,2 | 87,0 | 86,6 | 64,0 |
| LlamaParse (Cost Effective) | 78,3 | 81,4 | 90,9 | 62,7 |
| Mistral OCR 4 | 74,5 | 73,9 | 89,5 | 60,1 |
| Databricks AI Parse | 72,4 | 83,7 | 88,3 | 45,3 |
| Google Document AI | 57,3 | 55,1 | 83,7 | 33,0 |
| AWS Textract | 53,3 | 82,3 | 74,8 | 2,8 |
NVIDIA entrega la primera CPU Vera a AWS y amplía NVLink Fusion a la memoria NVHBM
27 de agosto — NVIDIA ha actualizado su artículo dedicado a la CPU Vera para incorporar un hito importante: AWS recibió su primer servidor con CPU Vera y su primer GPU Vera Rubin, entregados en mano por Ian Buck, vicepresidente de Hyperscale y HPC de NVIDIA, en la sede de AWS en Seattle, a Willem Visser y Supreeth Sheshardi, vicepresidentes de Amazon EC2. La entrega acompaña un anuncio realizado el día anterior, el 26 de agosto: AWS y NVIDIA amplían una colaboración de dieciséis años, con un plan que contempla 2 millones de GPU adicionales y la migración de la infraestructura basada en CPU Vera a AWS. AWS no es el primer destinatario: Buck ya había entregado anteriormente sistemas Vera a Oracle Cloud Infrastructure, así como a Anthropic, OpenAI y SpaceXAI.
El argumento técnico se resume en una observación: un agente no funciona solo sobre GPU. Cada entorno aislado de ejecución, cada llamada a herramienta, cada capa de orquestación y cada recuperación en contexto largo es trabajo de CPU. Vera incorpora 88 núcleos Olympus diseñados por NVIDIA, 1,2 TB/s de ancho de banda de memoria, y anuncia hasta 1,8x de rendimiento por núcleo en cargas agénticas. NVIDIA cita datos de OpenRouter según los cuales estas cargas consumen 15 veces más tokens que una simple consulta de chat. Entre los proveedores cloud, Oracle Cloud Infrastructure es el primero en desplegar Vera a escala hyperscale, con cientos de miles de CPU previstos a partir de 2026. Para ser precisos: el artículo es una republicación, con una versión original fechada el 18 de mayo de 2026, y solo la parte de AWS corresponde a la jornada actual.
El 26 de agosto, NVIDIA también amplió NVLink Fusion con NVHBM, una tecnología de memoria de alto ancho de banda destinada a los chips personalizados de sus socios. El cambio arquitectónico es preciso: las arquitecturas HBM clásicas sitúan el controlador de memoria en el chip XPU, donde ocupa una superficie de silicio que podría usarse para cómputo; NVHBM desplaza ese controlador, diseñado por NVIDIA, al chip base de la pila HBM 3D. Annapurna Labs, la filial de silicio de Amazon, es el primer socio en trabajar en NVHBM, además de un compromiso ya anunciado para admitir NVLink Fusion en sus chips Trainium a partir de Trainium4.
| Característica medida | Valor anunciado |
|---|---|
| Núcleos de la CPU Vera | 88 núcleos Olympus diseñados por NVIDIA |
| Ancho de banda de memoria de Vera | 1,2 TB/s |
| Rendimiento por núcleo en cargas agénticas | Hasta 1,8x |
| GPU adicionales previstas en AWS | 2 millones |
| Ancho de banda de NVHBM frente a HBM4E estándar | Hasta +30 % |
| Consumo de HBM con NVHBM | -15 % |
| Superficie liberada en el chip de cómputo XPU | Hasta +25 % |
🔗 Entrega de la CPU Vera · NVLink Fusion y NVHBM
Google DeepMind impulsa la primera evaluación en doble ciego de un modelo de frontera
27 de agosto — Google DeepMind publica el informe de un piloto que presenta como la primera evaluación en doble ciego de un modelo de IA propietario de clase frontera. El anuncio está firmado por William Isaac, Sol Messing y Kristian Lum, y ocupa la posición de mensaje fijado de la cuenta del laboratorio.
El problema abordado es el de la contaminación de benchmarks. El artículo recurre a una analogía escolar: si un estudiante ha visto las preguntas del examen con antelación, su puntuación perfecta ya no mide nada. Para los modelos de lenguaje, la cuestión es estructural, ya que los conjuntos de evaluación públicos terminan en los corpus de entrenamiento. Google señala que los protocolos de no registro y las garantías contractuales han mantenido durante mucho tiempo la confidencialidad de los prompts de prueba externos, pero que añadir garantías técnicas y criptográficas supone un cambio de naturaleza.
Históricamente, una evaluación externa de alto riesgo imponía una disyuntiva: o bien el evaluador entregaba sus prompts al proveedor del modelo, o bien el proveedor entregaba los pesos de su modelo. El dispositivo descrito elimina ese compromiso. Se apoya en Confidential Space, una pieza del portafolio Confidential Computing de Google Cloud, que permite verificar criptográficamente que ambos activos siguen siendo privados para sus respectivos propietarios: el evaluador no accede a los pesos del modelo Gemini, y Google no accede a los prompts de prueba.
El piloto se centra en un modelo Gemini Flash Lite, probado contra benchmarks confidenciales, en colaboración con el Singapore AI Safety Institute, OpenMined, AVERI y MLCommons. Google subraya que el interés del dispositivo aumenta con la sensibilidad de la evaluación, citando explícitamente las pruebas de ciberseguridad y las realizadas por organismos gubernamentales. El anuncio incluye un informe técnico con la metodología.
🔗 El piloto de evaluaciones en doble ciego
Expert Intelligence: los ebooks de Google Play Books se convierten en fuentes en Gemini Notebook
27 de agosto — El equipo de Gemini Notebook anuncia Expert Intelligence, una iniciativa transversal de Google que permite usar libros comprados como fuentes dentro de un notebook. El lanzamiento comienza con los ebooks elegibles de Google Play Books; Google anuncia la llegada posterior de las suscripciones de terceros, los manuales escolares y la expansión a la aplicación Gemini y al Modo IA de Google Search.
El principio es fácil de describir pero nuevo en su alcance: un notebook puede combinar ahora ebooks comprados, suscripciones profesionales y archivos personales de Google Drive en una misma base de conocimientos. Las funciones habituales de Gemini Notebook se aplican entonces al libro —conversación con el contenido, generación de Audio Overviews, creación de tarjetas de repaso y de cuestionarios—, con cada respuesta anclada en las fuentes mediante citas en línea que remiten al pasaje exacto.
Lo más interesante es el modelo económico, porque responde a la pregunta que este tipo de producto plantea de inmediato: ¿qué ocurre con la remuneración del autor cuando un modelo digiere su libro? Google establece una condición de acceso explícita: para interactuar con un libro en Gemini Notebook, hay que poseerlo a través de Google Play Books. Y si se comparte un notebook que contiene un libro, se invita a los colaboradores a comprar su propio ejemplar para profundizar. Google presenta así el mecanismo a los editores como un canal de descubrimiento más que como una sustitución.
Por el lado de los editores, la mecánica es declarativa: la elegibilidad de una obra se comprueba en su ficha de Google Play Books, donde Gemini Notebook aparece bajo la insignia «Tools» si el libro está inscrito, y la inscripción se realiza a petición del equipo de Google. Los tres casos de uso detallados marcan el tono: cruzar notas de clase con The Sense of Style de Steven Pinker, aplicar The Culture Code de Daniel Coyle a un proyecto de equipo, sintetizar una rutina a partir de The New Menopause antes de convertirla en Audio Overview.
Warp añade bucles de auto-mejora a sus factories
27 de agosto — Warp completa su plataforma Warp Factories con bucles de auto-mejora (self-improvement loops). El principio se basa en tres pasos: puntuar conversaciones pasadas de los agentes según criterios definidos por el equipo, aislar los fallos y luego generar mejoras de skills. Un artículo de ingeniería publicado ese mismo día detalla todo el dispositivo.
La pieza central es una función de puntuación, que Warp denomina scorer. Toma como entrada las trazas de ejecución de un agente y devuelve una nota según una rúbrica. Warp insiste en un punto: la entrada no debe limitarse a la traza del agente, sino que debe incluir las interacciones humanas procedentes de herramientas integradas, por ejemplo los comentarios dejados en una pull request. La nota puede provenir de una persona, de código o, más comúnmente hoy, de otro agente que actúa como juez. Warp ofrece scorers predeterminados que evalúan la exactitud, la eficiencia de costes y la verbosidad, y permite configurar su frecuencia de ejecución —unas pocas horas por defecto— así como la estrategia de muestreo, ya que estas evaluaciones tienen un coste.
Las ejecuciones puntuadas alimentan después a agentes de auto-mejora, que buscan patrones recurrentes en los fallos y proponen correcciones en forma de diffs sobre la definición de la factory. Esta mecánica solo funciona porque la factory está descrita en código: un archivo factory.yaml más un árbol de definiciones de agentes, skills, servidores MCP y reglas de enrutamiento de modelos. Los humanos reciben las sugerencias como pull requests y deciden si fusionarlas o no.
Warp distingue claramente un segundo mecanismo, los benchmarks, que responde a una limitación de los bucles de auto-mejora: estos se parecen a lo que una persona competente cambiaría tras revisar resultados pasados, pero no constituyen una verdadera prueba A/B. Para resolver una cuestión como la mejor combinación de modelos, Warp propone elegir de cinco a diez tareas de referencia, ejecutar los agentes en paralelo con varias configuraciones y luego puntuar con los mismos scorers. El resultado es una matriz de resultados por configuración. Las métricas de seguimiento citadas —volumen de pull requests, coste medio por pull request, porcentaje de automatización, ahorros estimados— se presentan como un marco de medición propuesto, sin cifras de resultados de clientes como respaldo.
Replit generaliza el enrutamiento automático de modelos
27 de agosto — Replit abre Intelligent Model Routing a todos los usuarios de la plataforma. El argumento inicial es sencillo: el mejor modelo para una tarea cambia de una semana a otra, de un proyecto a otro y, a veces, de una tarea a otra, y esa elección añade un punto de decisión entre la idea y su ejecución. Replit toma entonces la iniciativa: a medida que una tarea evoluciona, se asocia al modelo mejor posicionado para completarla, equilibrando calidad, velocidad y coste.
La cifra destacada requiere una lectura precisa. En sus pruebas, Replit anuncia la misma calidad de salida con un coste un 65 % inferior al de la versión anterior del modo Max; no se trata de una reducción del 65 % en términos absolutos, ya que el mensaje en X habla, por su parte, de «hasta un 65 % más barato».
El enrutamiento no cierra la puerta al control manual. Todos los usuarios comienzan ahora en Free Mode y reciben una notificación cuando el trabajo pasa a modos más potentes que pueden generar costes; los suscriptores Core y Pro conservan la selección manual de modelo. En la empresa, los administradores definen el conjunto de modelos aprobados para cada espacio de trabajo, y Replit elige automáticamente dentro de ese conjunto.
| Elemento del lanzamiento | Valor anunciado por Replit |
|---|---|
| Reducción de coste | -65 % a calidad equivalente, frente a la versión anterior del modo Max |
| Disponibilidad | Todos los usuarios |
| Modo inicial | Free Mode, con notificación antes de escalar a un modo de pago |
| Selección manual | Conservada para los planes Core y Pro |
| Control empresarial | Conjunto de modelos aprobados definido por espacio de trabajo |
Codex CLI 0.150: menciones @ entre tareas, hooks Interrupt y endurecimiento de proyectos no fiables
26 de agosto — Codex CLI pasa a la versión 0.150.0, seguida el 27 de agosto de un parche 0.150.1. La actualización se instala con npm install -g @openai/codex@0.150.1.
La novedad estructural afecta a la orquestación entre tareas. Ahora es posible referenciar otras tareas Codex mediante menciones @ y pedir a un agente que lea, cree o envíe un mensaje a una tarea directamente desde la terminal. En la práctica, la lista de tareas pasa a ser un conjunto de objetos direccionables: un agente puede consultar lo que ha producido otra tarea o transmitirle una instrucción sin copiar y pegar manualmente contexto. En esa misma línea, las tareas de terminal que seguían sin nombre reciben automáticamente un título descriptivo, y /rename propone un título editable derivado de la conversación.
La segunda incorporación notable es el hook Interrupt. Hasta ahora, la interrupción de un turno activo era un punto ciego: la sesión se detenía sin que se pudiera desencadenar nada. La versión 0.150.0 permite ejecutar un comando o un handler MCP cuando se interrumpe un turno de nivel superior, útil para limpiar un estado, liberar un bloqueo o registrar el abandono.
En materia de seguridad, dos correcciones merecen atención para quienes ejecutan Codex sobre código de terceros. Los proyectos no fiables ya no proporcionan las instrucciones AGENTS.md de nivel de proyecto —por tanto, un archivo de instrucciones depositado en un repositorio clonado ya no puede controlar al agente sin conocimiento del usuario— y las reglas administradas de denegación de lectura siguen aplicándose tras un cambio de permisos. A ello se suma un mejor ocultamiento de identificadores en los diagnósticos del app-server, correcciones en los bearer tokens MCP remotos y en los bloqueos al detenerse en Unix debidos a procesos desvinculados. El parche 0.150.1 resuelve por último un caso concreto pero costoso: la compactación remota ahora cuenta las imágenes conservadas en su presupuesto de tokens y elimina las más antiguas cuando es necesario —en una sesión larga con capturas de pantalla, era una fuente silenciosa de desbordamiento de contexto.
| Versión publicada | Fecha del changelog | Naturaleza de la publicación |
|---|---|---|
| 0.150.0 | 26 de agosto de 2026 | Versión estable, novedades |
| 0.150.1 | 27 de agosto de 2026 | Parche sobre la compactación |
Claude Code 2.1.247 : auditoría de costes API y ventana de 1M por defecto para Sonnet 5
27 de agosto — Claude Code pasa a 2.1.247. La incorporación más visible para los equipos es un comando de auditoría de gasto: /claude-api cost-optimize perfila lo que consume un proyecto en la Claude API y luego despliega, uno por uno, los recursos para reducirlo —caching, higiene de tokens, procesamiento por lotes, nivel de esfuerzo, elección de modelo— midiendo el efecto de cada cambio antes de pasar al siguiente. La skill /claude-api cubre además ahora la Admin API: miembros de organización, invitaciones, workspaces, claves API, informes de límites de velocidad, workload identity federation y CMEK.
Un ajuste de contexto merece atención: la ventana de auto-compactación por defecto de Sonnet 5 pasa a su contexto completo de 1M de tokens, de modo que las sesiones compactan ahora en torno a 967K tokens en lugar de unos 934K. En cuanto a robustez, los subagentes ya no mueren por un 404 de modelo en la primera llamada —cambian a la cadena de modelos de respaldo de la sesión— y un hook que produzca megabytes de errores ya no puede dejar atascada la sesión en «Prompt is too long».
La versión también dedica un esfuerzo claro al endurecimiento. En el markdown renderizado en terminal, los enlaces que apuntan a una ruta de red o de automontaje, que contienen un carácter de control o que comienzan con un carácter invisible se muestran como texto plano en lugar de volverse clicables. El marketplace de plugins rechaza los nombres que contienen caracteres de control y escapa el texto que un marketplace inyecta en sus salidas.
Together AI cifra la cascada DeepSeek y luego GPT-5.6 Sol en DeepSWE
27 de agosto — Together AI amplía su serie de comparativas DeepSWE a los modelos DeepSeek, con el mismo protocolo que para los episodios GLM-5.3: las 113 tareas del benchmark, cuatro intentos por tarea y por modelo, es decir, 904 ejecuciones para el enfrentamiento DeepSeek V4 Pro 0813 contra GPT-5.6 Sol.
El resultado bruto da ventaja al modelo cerrado en el primer intento —72,7 % frente a 62,8 %—, pero la diferencia se estrecha en cada intento y se invierte en el cuarto, con 88,5 % para DeepSeek frente a 85,8 %. A 0,24 dólar por ejecución frente a 8,37, el modelo abierto es 35 veces más barato, es decir, 261 tareas resueltas por 100 dólares gastados frente a 9. No recupera ese ahorro en velocidad: 35 minutos y 146 pasos en mediana frente a 17 minutos y 53 pasos.
La conclusión operativa es un montaje en cascada. Ejecutar primero DeepSeek V4 Pro y escalar a GPT-5.6 Sol solo cuando la batería de pruebas rechaza el resultado da un 83,0 % de tareas resueltas a 3,35 dólares la unidad —diez puntos por encima de Sol solo, y por encima incluso de un router oracle perfecto a un solo intento, con 80,8 %. Otros dos comparativos de la misma serie están en línea, enfrentando DeepSeek V4 Pro con Claude Fable 5 y DeepSeek-V4 Flash con GPT-5.6 Luna.
| Estrategia evaluada | Tasa de éxito | Coste por tarea |
|---|---|---|
| GPT-5.6 Sol solo | 72,7 % | 8,37 dólares |
| Router oracle perfecto a un intento | 80,8 % | — |
| Cascada DeepSeek V4 Pro y luego Sol | 83,0 % | 3,35 dólares |
🔗 Comparativa DeepSWE de Together AI
OpenAI abre sus operaciones en Brasil y publica un experimento aleatorizado con Bocconi
27 de agosto — OpenAI pone en marcha sus operaciones comerciales en Brasil, con un equipo local instalado en São Paulo. El anuncio va acompañado de datos de uso rara vez publicados con esta granularidad por país: Brasil figura entre los tres mayores mercados de ChatGPT en usuarios activos semanales, con un número de usuarios que casi se duplicó en un año y alrededor de 215 millones de mensajes enviados cada día. En junio de 2026, el 35 % de los mensajes clasificados procedentes de cuentas individuales brasileñas estaban relacionados con el trabajo, frente al 30 % a nivel mundial. En cuanto a desarrolladores, el país ocupa el segundo puesto mundial por número de desarrolladores que usan la API de OpenAI, y los usuarios semanales de Codex allí se han multiplicado por más de once desde principios de 2026. La implantación va acompañada de alianzas con el ITA, el IMPA, el HCFMUSP, ENTER, Estímulo y la ciudad de São Paulo a través de Prodam.
El mismo día, OpenAI publica junto con investigadores de la universidad Bocconi los resultados de un experimento aleatorizado con más de 1.000 estudiantes de primer año de grado. El interés del protocolo reside en su estructura: los estudiantes se repartieron aleatoriamente, por franja de clase, en cuatro grupos —acceso a ChatGPT, formación en razonamiento causal, ambos, o ninguno de los dos—, lo que permite separar el efecto de la herramienta, el de la formación y el de su combinación. La tarea era un caso empresarial real: formular recomendaciones de marketing para la tienda de productos derivados de la universidad.
Los dos tratamientos producen efectos distintos. El acceso a ChatGPT hace ganar casi un punto sobre cinco, con más ideas y una lógica más clara. La formación en razonamiento causal, por su parte, no mejora la nota —pero el análisis textual automatizado revela un abanico de ideas más amplio y más distinto del de los demás estudiantes, algo que la rúbrica de evaluación no medía. OpenAI extrae una conclusión incómoda para las instituciones: si la IA permite producir un trabajo pulido y cercano al de un experto, examinar solo la respuesta final dice cada vez menos sobre lo que el estudiante comprende.
| Grupo experimental | Efecto medido |
|---|---|
| Acceso a ChatGPT | Casi un punto más sobre cinco, más ideas, lógica más clara |
| Formación en razonamiento causal | Sin ganancia en la rúbrica, pero ideas más variadas y más distintas |
| Ambos tratamientos combinados | Beneficios acumulados, ganancias en el mayor número de medidas |
🔗 Presencia en Brasil · Estudio Bocconi
Las tareas programadas de ChatGPT se activan con eventos de Gmail, Slack y GitHub
25 de agosto — Las tareas programadas de ChatGPT salen del modelo puramente temporal: ahora pueden activarse ante un evento ocurrido en Gmail, Slack o GitHub. El filtrado es fino —mensajes de Gmail por remitente o asunto, canales de Slack seleccionados, actividad de pull request que incluye revisiones, comentarios, actualizaciones de commits y fusiones.
El paso del cron al evento cambia la naturaleza de la herramienta: en lugar de ir a buscar periódicamente si ha pasado algo, el agente reacciona en el momento en que ocurre. La funcionalidad está disponible en ChatGPT web y móvil para los planes elegibles, con la condición de conectar la aplicación correspondiente y aprobar los accesos solicitados. Dos requisitos prácticos: la aplicación de Slack de ChatGPT debe ser miembro de cada canal supervisado, y la aplicación de GitHub conectada debe tener acceso a cada repositorio. También hay dos límites: una tarea activada por evento no puede llevar además una planificación temporal, y los eventos cercanos entre sí pueden agruparse en una sola ejecución —la vista Scheduled permite entonces revisar los eventos pendientes o activarlos manualmente.
🔗 Changelog de ChatGPT y Codex
Los agentes cloud de Cursor arrancan sin un repositorio existente
27 de agosto — Cursor elimina la última condición de entrada para sus agentes cloud: ya no es necesario haber conectado una cuenta de GitHub u otro proveedor de gestión de código fuente de terceros para iniciar una sesión. En el selector de repositorio, una opción «Start from scratch» permite empezar a promptear de inmediato, mientras Cursor crea en segundo plano un repositorio Origin para alojar el trabajo.
Cuando la construcción encaja, un botón «Create repo» guarda el resultado en un repositorio Origin, con un nombre personalizado o sugerido y una visibilidad privada o interna; el repositorio resultante queda completamente estructurado y pasa a la pestaña Codebase. Dos añadidos completan el ciclo: Cursor redirige ahora los puertos del entorno live del agente cloud hacia el navegador, lo que da acceso a una vista previa y a herramientas como el modo design, y un botón de publicación genera una URL en línea una vez conectado una cuenta de Vercel —cuenta que es un requisito de esta última funcionalidad. Todo se apoya en Origin, el alojamiento de código de Cursor que entró en beta anticipada el 17 de agosto en todos los planes de pago.
Amp abre sus proyectos a múltiples repositorios
27 de agosto — Los proyectos Amp ahora aceptan varios repositorios. Los repositorios adicionales se clonan en un directorio contiguo dentro del orb y el agente es informado explícitamente de su presencia; el panel de cambios muestra entonces un diff que cubre todos los repositorios del proyecto. Es la respuesta de Amp a las tareas que atraviesan varios servicios, un caso en el que el reparto de un proyecto por repositorio resultaba incómodo.
El añadido se realiza al crear el proyecto o más tarde en los ajustes, con un límite de 20 repositorios adicionales por proyecto. Hay una limitación que conviene conocer antes de ponerse a ello: durante la preparación del orb, solo el script .agents/setup del repositorio principal se ejecuta automáticamente, y un repositorio adicional que requiera su propia inicialización debe integrarse en ese script. El mismo día, Amp continúa su reorientación retirando la barra lateral de su interfaz de terminal —véanse las breves.
🔗 Proyectos multi-repositorio en Amp
Google Antigravity 2.11.0 renderiza artefactos HTML en el hilo de conversación
26 de agosto — Google publica la versión 2.11.0 de Antigravity, con 10 mejoras y 30 correcciones. La novedad principal es la interfaz generativa: el agente puede producir un artefacto HTML que se muestra directamente en el hilo de conversación, sin pasar por una vista previa externa. El renderizado acepta formato matemático KaTeX así como gráficos Chart.js y Plotly, lo que amplía el uso a paneles de control y visualizaciones producidas al vuelo.
La segunda tanda de cambios se centra en la configuración de los agentes y apunta hacia una modularización. La sintaxis @path/to/file permite referenciar e incluir archivos externos en AGENTS.md y en los archivos de reglas personalizadas, una clave rules: aparece en el frontmatter de los agentes markdown para vincular reglas a un agente concreto en lugar de a todo el proyecto, y Antigravity descubre ahora skills, agentes y reglas declarados en archivos skills.json, agents.json y rules.json situados en subdirectorios —útil para monorepos donde cada subproyecto lleva su propia configuración. El resto tiene que ver con la ergonomía: terminales divisibles en paralelo, renderizado del frontmatter YAML como tarjeta de metadatos, tema Darcula y lectura de rangos de páginas precisos en documentos de varias páginas.
GitHub: política global de modelos en disponibilidad general y mesa redonda de los mantenedores de OpenClaw
26 de agosto — GitHub generaliza la política global de modelos para Copilot Business y Copilot Enterprise. Anunciado en julio, este mecanismo ofrece a los administradores un interruptor único que decide el destino de los modelos que no han configurado explícitamente, en lugar de obligarlos a decidir modelo por modelo con cada nueva salida. El despliegue de la aplicación efectiva se prolonga hasta el 1 de septiembre, por lo que el cambio no se produce al mismo tiempo para todas las empresas. Las decisiones ya tomadas manualmente se conservan tal cual, y dos categorías resisten la política sea cual sea su valor: los modelos de pesos abiertos, con DeepSeek y Kimi K2 como ejemplos, y los modelos no cubiertos por el acuerdo de retención de datos de GitHub, citando el anuncio Fable 5. GitHub estudia además eliminar el estado «Delegate to default policy» para obligar a una decisión explícita sobre cada modelo.
El 27 de agosto, GitHub publica una mesa redonda en vídeo con los mantenedores de OpenClaw, acompañada de un artículo que extrae de ella diez lecciones. Lanzado por Peter Steinberger en noviembre de 2025 como proyecto de fin de semana, este repositorio muestra al 26 de agosto unas 388.000 estrellas, 81.000 forks y más de 80.000 commits —GitHub lo presenta como el proyecto de crecimiento más rápido de su historia. El interés de la conversación reside en lo que revela del trabajo de mantenedor cuando los agentes entran en el circuito: Steinberger explica que ya no habla de pull requests sino de «prompt requests», y Josh Lehman describe a colaboradores haciendo funcionar cadenas automatizadas que abrían varios centenares de pull requests. Las señales de confianza han cambiado en consecuencia —transcripciones de agente, capturas de pantalla y pruebas de test en lugar de contador de contribuciones—, sobre todo porque la reputación también se ha convertido en una superficie de ataque, con personas duplicando pull requests ajenas para inflar su número de fusiones.
| Indicador del repositorio OpenClaw al 26 de agosto de 2026 | Valor registrado |
|---|---|
| Estrellas | Unas 388.000 |
| Forks | 81.000 |
| Commits | Más de 80.000 |
| Lanzamiento del proyecto | Noviembre de 2025 |
🔗 Política global de modelos · Mesa redonda OpenClaw
Breves
- Qwen3.8-Flash enrutado en OpenRouter y ejecutable localmente en 75 GB de RAM — El modelo pasa a estar accesible vía OpenRouter un día después de la apertura de sus pesos, para asistentes de código, flujos de trabajo agénticos y la comprensión de vídeos largos. Unsloth publica a la vez sus GGUF desde el primer día: el MoE de 125 mil millones de parámetros se ejecuta localmente en 75 GB de RAM, y Unsloth afirma que supera a Claude Opus 4.6 Max — una afirmación de Unsloth, que ninguna medición independiente confirma. 🔗 OpenRouter · GGUF Unsloth
- Grok 4.6 se une a Microsoft Foundry y se activa desde Linear — El modelo llega al catálogo de Microsoft Foundry con 500 000 tokens de contexto y cuatro niveles de esfuerzo de razonamiento, complementando Amazon Bedrock y Google Enterprise Agent Platform. En grok.com, los desencadenadores de Linear permiten a Grok clasificar los tickets, seguir el progreso e iniciarse automáticamente en cuanto se le asigna un ticket. 🔗 Grok en Foundry · Desencadenadores de Linear
- Joelle Pineau y Mikey entran en la clasificación TIME100 AI 2026 — Cohere anuncia que su directora de IA figura en la lista de la revista TIME, recordando más de veinte años de investigación en Canadá, desde sillas de ruedas inteligentes hasta la ML Reproducibility Checklist. Suno anuncia el mismo día la nominación de Mikey en la misma clasificación, sin anuncio de producto asociado. 🔗 Cohere · Suno
- Un cookbook conecta un Claude Managed Agent al Chat SDK de Vercel — El Chat SDK aporta la interfaz de conversación con un gestor
onDirectMessagetipado y más de quince adaptadores (Slack, Teams, Discord, web), y Managed Agents ejecuta el agente del lado del servidor con una sesión persistente por conversación. Código publicado en el repositorio claude-quickstarts. 🔗 Mensaje de @ClaudeDevs - ChatGPT para iOS 1.2026.230: búsqueda de tareas, medidor de reasoning effort y editor a pantalla completa — Medidor compacto en el composer para ajustar el esfuerzo de razonamiento desde el móvil, editor a pantalla completa para prompts largos, búsqueda tanto en los títulos como en el contenido, y accesos directos de pantalla de inicio para ChatGPT, Work y Codex Remote. La misma entrada de changelog que las tareas eventuales anteriores.
- Amp elimina la barra lateral de su TUI — Entre los orbs, los runners y los mensajes intercambiados entre agentes, Amp considera que el seguimiento de los threads encaja en las aplicaciones web y nativas, y que superponer un multiplexado multi-entorno sobre el del terminal era una mala experiencia. 🔗 Entrada de Amp
- Hugging Face hace funcionar sus resúmenes de abstracts sobre Inkling-Small — La plataforma precisa que los resúmenes mostrados en sus páginas de artículos se basan en el modelo de pesos abiertos de Thinking Machines, bajo el lema «open weights × open science». 🔗 Mensaje de @huggingface
- Gemini CLI corrige una vulnerabilidad SSRF en la detección de metadatos OAuth MCP — La versión nocturna (nightly) del 27 de agosto contiene un único cambio, un correctivo contra el Server-Side Request Forgery en la detección de metadatos OAuth de los servidores MCP. Aún no está presente en el canal estable, que sigue en v0.57.0. 🔗 Notas de versión
- Perplexity publica nuevas evaluaciones de Brain — El sistema de memoria auto-mejorable de Perplexity Computer gana 9,3 puntos de precisión, 8,0 puntos de actualidad y 8,9 puntos de recuperación con respecto a los primeros resultados, con un 15 % menos de tokens. 🔗 Mensaje de @perplexity_ai
- Los marketplaces de plugins aceptan la actualización automática en empresa — Un campo
autoUpdatecolocado sobre una entradaextraKnownMarketplacespermite a los clientes de Copilot actualizar por sí solos los plugins de un marketplace, siempre que este siga figurando en la allowliststrictKnownMarketplaces. 🔗 Changelog de GitHub - Bloquear a un usuario cierra ahora todas sus contribuciones abiertas — Una opción «Close content authored by this user» en el cuadro de diálogo de bloqueo cierra de golpe los issues, discusiones y pull requests abiertos del usuario bloqueado, tanto en cuentas personales como en organizaciones. 🔗 Changelog de GitHub
- Cohere defiende un modelo de ingenieros desplegados que construye la capacidad del cliente — El artículo distingue la dependencia comercial o arquitectónica, inherente a la elección tecnológica, de la dependencia operativa que considera evitable, y cita el informe Deloitte 2026 según el cual solo el 25 % de las organizaciones ha puesto en producción el 40 % o más de sus pilotos de IA. 🔗 Artículo de Cohere
- Google DeepMind dedica un episodio de podcast a la incertidumbre — Zoubin Ghahramani, VP Research, explica con Hannah Fry por qué enseñar a un sistema a dudar de sí mismo y a razonar en probabilidades produce decisiones más fiables, desde la predicción meteorológica hasta la robótica. 🔗 Mensaje de @GoogleDeepMind
- Wan lanza un Skill Challenge semanal en torno a WanCLI — Cada semana se seleccionan tres skills publicadas en wan.video, cuyos autores ganan un mes de suscripción premium, y cada skill aprobada recibe 150 créditos; la skill debe llamar al menos a un modelo Wanxiang mediante WanCLI. 🔗 Mensaje de @Alibaba_Wan
- GeForce NOW en la Gamescom 2026 — Nuevos controles DLSS 4.5, compatibilidad con nuevos dispositivos Steam, con autenticación única de GOG, con Firefox y con más dispositivos Fire TV, y cinco juegos disponibles en la nube desde su lanzamiento. Más noticia de videojuegos que de IA generativa. 🔗 Entrada de NVIDIA
- Runway publica un vídeo de gancho sin producto nombrado — Un vídeo acompañado de la única frase «You’ve never seen anything like this» y de un enlace genérico a la aplicación, sin nombre de modelo ni de funcionalidad, y sin contrapartida en la página de noticias del estudio. Señalado a título informativo: no se puede extraer de ello ningún hecho verificable. 🔗 Mensaje de @runwayml
Lo que eso significa
Los agentes descienden al laboratorio, y la barrera es material antes que software. El Model Hardware Standard no resuelve un problema de modelo sino un problema de fontanería: siete programas de constructores sin interfaz común en Janelia, cuatro familias de equipos en tres ordenadores incompatibles en Carnegie Mellon. Al reducir la integración de varias semanas a unas pocas horas, Anthropic desplaza el cuello de botella de la conexión a la supervisión — y lo admite citando Genentech, donde hubo que explicarle a Claude que la formación de espuma de una muestra era un fallo físico y no un bug. El descubrimiento de Ai2 sobre el carcinoma lobulillar invasivo dice lo mismo desde el otro extremo de la cadena: el valor no está en la respuesta producida por el modelo, sino en la validación independiente y luego en el laboratorio que le siguió. Los 10 000 puestos Claude abiertos a investigadores el mismo día completan el tríptico atacando la tercera barrera, la del coste de acceso.
La seguridad pasa del producto a la infraestructura compartida. El artículo sobre ciberdefensa colectiva vale ante todo por las organizaciones que lo firman: OpenAI, Anthropic, AWS, Google, Microsoft y Oracle compiten por el mismo mercado y coinciden en el mismo texto, y una de las peticiones dirigidas a los laboratorios de frontera —hacer trazables y responsables las identidades agénticas— es directamente la lección del incidente Hugging Face publicado el día anterior. El resto de la jornada despliega este desplazamiento al nivel de la herramienta: Codex deja de cargar los AGENTS.md de los proyectos no fiables, Claude Code vuelve inertes los enlaces de terminal con caracteres invisibles, Gemini CLI corrige una SSRF en la detección OAuth de los servidores MCP. Tres correcciones sin relación aparente, pero una misma constatación: la superficie de ataque de un agente de código son los archivos y los servidores que se le pide leer.
La evaluación se convierte ella misma en un objeto que hay que asegurar. El piloto de Google DeepMind con el Singapore AI Safety Institute resuelve una disyuntiva tan vieja como la evaluación externa —entregar los prompts de prueba o entregar los pesos— sin entregar ninguno de los dos, mediante un enclave cuyas propiedades verifican criptográficamente ambas partes. Es el equivalente metodológico de las cifras que publica el resto de la jornada: Together AI no se limita a una puntuación, sino que publica 904 ejecuciones, cuatro intentos por tarea, los perfiles de fallo y el coste por tarea; Cohere asume públicamente excluir dos dimensiones de ParseBench y volver a calificar a sus competidores con las reglas corregidas de agosto. En ambos casos, lo que se pone en primer plano ya no es el resultado sino el protocolo — señal de que el resultado por sí solo ya no convence a nadie.
Y el coste de una tarea bien resuelta sigue siendo la métrica que decide. GLM-5.3 Flash obtiene todo su posicionamiento de una economía arquitectónica —tres veces menos cálculo de atención, caché KV 4,4 veces más pequeño— convertida en 0,15 dólar por millón de tokens de entrada, casi diez veces menos que GLM-5.2 en el mismo proveedor. Together AI demuestra que la cascada DeepSeek luego Sol resuelve diez puntos más de tareas por menos de la mitad del precio de Sol solo, lo que equivale a decir que el mejor modelo no es la compra adecuada. Replit saca la consecuencia de producto de esta constatación eliminando pura y simplemente la elección del modelo, Cohere vende Model Vault apoyándose en un diferencial del 61 % a plena utilización, y Google factura a un tercio del precio un borrador de vídeo en 360p. Incluso la entrega del CPU Vera en AWS responde a esta economía: si una carga agéntica consume quince veces más tokens que una consulta de chat, la orquestación fuera de GPU deja de ser un detalle contable.
Fuentes
- Anthropic — Model Hardware Standard
- Anthropic — apoyo ampliado a los científicos
- Anthropic — el navegador integrado de Cowork
- Claude Code — changelog
- Ai2 — alianza con Providence Swedish
- OpenAI — llamado a una acción colectiva sobre la ciberdefensa
- OpenAI — Codex CLI 0.150.0
- OpenAI — presencia en Brasil
- OpenAI — lo que ganan los estudiantes con ChatGPT
- Together AI — GLM-5.3 Flash
- Together AI — comparativa DeepSWE DeepSeek y GPT-5.6 Sol
- Z.ai — publicación de los pesos de GLM-5.3
- Google — Gemini Omni 1.1 Flash
- Google DeepMind — evaluaciones a doble ciego
- Gemini Notebook — Expert Intelligence
- Google — changelog de Antigravity
- fal — presentación de H3 Max
- Cohere — Parse
- NVIDIA — entrega del CPU Vera
- NVIDIA — NVLink Fusion y NVHBM
- Warp — bucles de auto-mejora
- Replit — enrutamiento inteligente de modelos
- Cursor — empezar sin un repositorio existente
- Amp — proyectos multi-repositorio
- GitHub — política global de modelos
- GitHub — mesa redonda de los mantenedores de OpenClaw