Buscar

Claude Dashboards y Claude Motion, Cyber Mission y OSS Scanner, GPT-6.1 Sol en Ultrafast

ai-powered-markdown-translator

Artículo traducido del francés al español con gpt-6.1-sol.

Ver proyecto en GitHub ↗

Anthropic añade dos funciones a Claude, Claude Dashboards para paneles que se mantienen actualizados y Claude Motion para animaciones escritas en código, y saca Docs, Slides y Design de beta en todos los planes, incluido Free. Ese mismo día, la empresa lanza su Cyber Mission, con un programa de defensa de infraestructuras críticas y OSS Scanner, que ofrece a los proyectos open source escaneos gratuitos con sus modelos más potentes. Por su parte, OpenAI despliega el nivel Ultrafast para GPT-6.1 Sol, hasta 8 veces más rápido que el modo Standard, mientras que Anthropic y NVIDIA se comprometen a aportar 150 millones y 1 000 millones de dólares, respectivamente, a la Genesis Mission.


Claude Dashboards y Claude Motion en beta, Docs, Slides y Design en todos los planes

8 de octubre — Anthropic añade dos funciones a Claude. Con Claude Dashboards, en beta en los planes de pago, se conecta una plataforma de datos de la empresa (Amazon Redshift, BigQuery, ClickHouse, Databricks o Snowflake) u otro conector, como las oportunidades de Salesforce, y luego se hace una pregunta en lenguaje cotidiano: Claude escribe la consulta, construye el panel y lo mantiene actualizado cuando cambian los datos. Un clic en una cifra muestra la consulta que la produce, y cada gráfico indica cuándo se han actualizado sus datos. Anthropic lo orienta a preguntas rápidas y exploratorias; para profundizar, el panel se puede enviar a Amplitude, Grafana, Hex, Mixpanel, Omni, Perplexity, PostHog o Sigma, a la espera de Looker, monday.com y Tableau.

Claude Motion, en beta en Team y Enterprise, está orientado a animaciones cortas: un vídeo explicativo de 30 segundos basado en un informe trimestral, un gráfico animado en una presentación o una demostración de producto. Como no interviene ningún modelo de generación de vídeo, la animación no contiene secuencias ni personas generadas por IA.

Claude Motion turns reports, charts, or product walkthroughs into short animations. Claude writes each one as code, with no video model involved, so you can change any word, number, or timing, then export an MP4. In beta on Team and Enterprise plans.

🇪🇸 Claude Motion transforma informes, gráficos o demostraciones de producto en animaciones cortas. Claude escribe cada una de ellas en código, sin ningún modelo de vídeo, de modo que puedes modificar cualquier palabra, número o duración y luego exportar un MP4. En beta en los planes Team y Enterprise. — @claudeai en X

Ese mismo día, Claude Docs, Slides y Design pierden la etiqueta beta y pasan a estar disponibles en todos los planes, incluido Free. Según Anthropic, se han creado más de 45 millones de documentos, presentaciones y diseños desde su llegada a las conversaciones, el 16 de septiembre. La salida de beta incorpora compatibilidad con CMEK para los artefactos, la elección de plantillas de artefactos por parte de los administradores, la edición colaborativa con Claude, el uso compartido fuera de la organización si el administrador lo permite, exportaciones a PowerPoint y PDF fieles al editor, el envío directo a Google Slides y la edición desde la aplicación móvil.

Función afectadaEstado al 8 de octubrePlanes afectados
Claude DashboardsBetaPlanes de pago
Claude MotionBetaTeam y Enterprise
Claude Docs, Slides y DesignSalida de betaTodos, incluido Free
claude.ai/design (sitio independiente)Abierto hasta el 14 de diciembre—

Consecuencia práctica: el sitio independiente claude.ai/design, ahora integrado en Claude, permanece abierto hasta el 14 de diciembre. Los sistemas de diseño (design systems) de una organización se migran de una sola vez desde la página Artifacts, pero las conversaciones y los comentarios del sitio independiente, así como sus enlaces públicos, desaparecerán cuando cierre. En Enterprise, Dashboards y Motion están desactivados por defecto, mientras que Docs, Slides y Design se activarán por defecto el 15 de octubre.

🔗 Publicación de Claude: Dashboards y Motion · Hilo de @claudeai

Runway y Luma, socios de lanzamiento de Claude Motion

8 de octubre — Dos empresas de vídeo generativo se presentan como socios de lanzamiento de Claude Motion. En Runway, cualquier animación se puede exportar para añadirle secuencias generadas, retocar planos describiendo el cambio deseado y hacer que Runway Agent ensamble un montaje más largo en torno a la animación; una misma animación en 16:9 también se puede adaptar a formatos vertical y cuadrado. En Luma, las animaciones se abren directamente mediante el conector Luma (MCP) añadido en Claude: los modelos de vídeo Ray y Uni cambian su estilo conservando el movimiento, las reencuadran en 9:16, 1:1, 4:3 o 21:9, y el agente Luma produce otras versiones. Ni Runway ni Luma especifican tarifas ni costes en créditos. Anthropic también cita Adobe, Descript, HeyGen, Higgsfield e invideo entre las herramientas con las que continuar una animación, y anuncia Canva y Captions para próximamente.

🔗 Publicación de Runway · Publicación de Luma


Anthropic Cyber Mission: un programa para las infraestructuras críticas y OSS Scanner para el open source

8 de octubre — Dos días después de ampliar su Cyber Verification Program, Anthropic lanza Anthropic Cyber Mission, presentada como un compromiso a largo plazo para proteger los sistemas de los que depende todo el mundo. El diagnóstico inicial procede de Project Glasswing: encontrar vulnerabilidades nunca ha sido tan fácil, pero verificarlas, priorizarlas y corregirlas sigue siendo difícil. La misión comienza en dos ámbitos, las infraestructuras críticas y el software open source; se anuncian otros ámbitos, sin fecha.

Para las infraestructuras críticas, el Critical Infrastructure Defense Program (CIDP) proporciona modelos Claude de frontera, ingenieros sobre el terreno y la investigación de Anthropic sobre amenazas a los proveedores de los operadores de tecnologías operativas: autómatas, software de control y redes industriales de electricidad, agua o transporte, que a menudo no se pueden detener para aplicar un parche. Participan once socios fundadores: Accenture, Booz Allen, CrowdStrike, Deloitte, Dragos, Hitachi, Insane Cyber, Nozomi Networks, Palo Alto Networks, PwC y Rockwell Automation. El programa comienza con un pequeño grupo y está previsto que se amplíe a otros socios y sectores en los próximos meses.

Para el open source, OSS Scanner, inspirado en OSS-Fuzz de Google, ofrece gratuitamente a los proyectos inscritos escaneos periódicos con los modelos más potentes de Anthropic, incluido Claude Mythos. Cada informe incluye un caso de reproducción, una explicación y, cuando existe, una propuesta de parche, pero se envía sin revisión humana: Anthropic espera una tasa de verdaderos positivos superior al 90 % y advierte de que algunos informes contendrán errores, como una gravedad mal evaluada. El servicio responde al cuello de botella descrito por el equipo Frontier Red Team: las vulnerabilidades encontradas superan con creces lo que los humanos pueden clasificar.

Indicador publicado por AnthropicValor publicado
Vulnerabilidades candidatas encontradas en seis mesesMás de 29 000
Vulnerabilidades revisadas y clasificadas manualmenteAproximadamente 6 000
Vulnerabilidades críticas o altas verificadas (48 proyectos)97
Aceptadas con el nivel exigido para la divulgación coordinada (CVD)85, es decir, el 88 %
Reales pero duplicadas, o inválidas11 y 1
Proporción de vulnerabilidades encontradas por los LLM en el banco de pruebas CyberGymMenos del 20 % a principios del año pasado, más del 85 % este año

wolfSSL indica que, de los 74 informes recibidos, todos salvo dos eran válidos y cinco se convirtieron en CVE. La inscripción se realiza mediante una pull request en el repositorio GitHub anthropics/oss-scanner, reservada a los mantenedores principales de proyectos considerados críticos, evaluados caso por caso, y el Defender Advantage Fund, lanzado en agosto, mantiene el servicio gratuito. La previsión de Anthropic es prudente: de aquí a dos años, la IA favorecerá la defensa, pero no necesariamente a corto plazo, ya que la explotación cuesta menos mientras que la verificación, la divulgación y la corrección siguen siendo lentas.

🔗 Publicación de Anthropic: Anthropic Cyber Mission · Publicación de Frontier Red Team sobre OSS Scanner · Repositorio anthropics/oss-scanner


Ultrafast para GPT-6.1 Sol: hasta 8 veces más rápido, a 12 y 60 dólares por millón de tokens

8 de octubre — Anunciado como «próximamente» el 29 de septiembre, el nivel Ultrafast llega a GPT-6.1 Sol. OpenAI Developers indica que se despliega ese mismo día en la API, en Codex y en ChatGPT Work, con una inteligencia presentada como cercana a GPT-6 Astra. OpenAI lo orienta a trabajos en los que cada segundo cuenta: depurar una avería, hacer que los agentes naveguen por aplicaciones u ofrecer experiencias en directo.

Ultrafast is rolling out today for GPT-6.1 Sol in the API, Codex, and ChatGPT Work. Near-Astra intelligence at up to 8x faster speeds than Sol Standard, so you can build as fast as the ideas come.

🇪🇸 Ultrafast se despliega hoy para GPT-6.1 Sol en la API, Codex y ChatGPT Work. Una inteligencia cercana a Astra, hasta 8 veces más rápida que Sol en modo Standard, para construir tan rápido como surgen las ideas. — @OpenAIDevs en X

En la API, basta con llamar a gpt-6.1-sol con service_tier: "ultrafast" en la Responses API. El modo está disponible para todos los usuarios de la API, sujeto a los límites de solicitudes, con procesamiento global y residencia de datos en Estados Unidos y en la Unión Europea, mientras que GPT-6 Astra en Ultrafast sigue limitado a la residencia estadounidense. La tarifa sigue la regla ya aplicada a Astra: seis veces el precio de Standard, es decir, 12 dólares por millón de tokens de entrada y 60 dólares de salida, cinco veces menos que GPT-6 Astra en Ultrafast (60 y 300 dólares).

Modo de procesamiento de gpt-6.1-solPrecio de entradaEntrada en cachéEscritura en cachéPrecio de salida
Standard, contexto corto2,00 dólares0,10 dólares2,50 dólares10,00 dólares
Fast, contexto corto4,00 dólares0,20 dólares5,00 dólares20,00 dólares
Ultrafast, contexto corto12,00 dólares0,60 dólares15,00 dólares60,00 dólares
Ultrafast, contexto largo24,00 dólares1,20 dólares30,00 dólares90,00 dólares

Tarifas por millón de tokens, página Pricing de la API a 8 de octubre.

En Codex y ChatGPT Work, el acceso está reservado al plan Pro 500, a los espacios Enterprise elegibles con facturación por uso y a las ofertas Edu con créditos. En Enterprise, Ultrafast está desactivado por defecto y los propietarios del espacio de trabajo deben activarlo, para determinados usuarios o para todos. La documentación de Codex detalla el coste: los límites incluidos en la suscripción se consumen 8 veces más rápido que en modo Standard, y tanto los créditos comprados como el uso de Enterprise bajo demanda se facturan a un precio seis veces mayor. Los demás planes de autoservicio no tienen acceso en el lanzamiento, ni siquiera con créditos comprados.

🔗 Changelog de la API de OpenAI · Tarifas de la API de OpenAI · Ultrafast en Codex (documentación)


Ciencia: 150 millones de dólares de Anthropic y 1 000 millones de NVIDIA para la Genesis Mission, un mapa del cielo en ultravioleta

El 8 de octubre se anunciaron dos compromisos con la Genesis Mission, el programa federal estadounidense que busca acelerar el descubrimiento científico mediante la IA, en la misma cumbre, «Science: A New Golden Age», organizada en Washington por la Office of Science and Technology Policy (OSTP) de la Casa Blanca. Ese mismo día, Anthropic muestra lo que Claude Science puede producir para un astrofísico.

Anthropic: 150 millones de dólares en tres años y Claude para más de 15 agencias federales

8 de octubre — Anthropic compromete 150 millones de dólares en tres años a la Genesis Mission. La financiación debe hacer que Claude sea accesible para más de 15 agencias miembros de la misión, entre ellas la NASA, los National Institutes of Health y la National Science Foundation. En concreto, Anthropic proporcionará Claude, Claude Code y créditos de API a varios cientos de proyectos de investigación, trabajará con las agencias y los laboratorios nacionales en las prioridades de la administración, entre ellas la energía de fusión y la computación cuántica, y ofrecerá formación y soporte técnico. El compromiso amplía la colaboración establecida en diciembre de 2025 con el Departamento de Energía; en julio, Google DeepMind (40 millones de dólares) y OpenAI (17 millones de dólares) habían anunciado sus propios compromisos con la misión.

🔗 Publicación de Anthropic: compromiso con la Genesis Mission · Tweet de @AnthropicAI

NVIDIA: 1 000 millones de dólares en cinco años para la ciencia estadounidense

8 de octubre — En el mismo evento, NVIDIA anuncia compromisos por valor de 1 000 millones de dólares en cinco años para desarrollar la capacidad de Estados Unidos en investigación y desarrollo sobre superinteligencia en ámbitos como la computación cuántica, la salud y la seguridad energética. El comunicado cita tres áreas, sin desglosar el importe: el apoyo a las instituciones de investigación universitarias, inversiones para acelerar el liderazgo estadounidense en computación cuántica y el apoyo a los proveedores cloud que atienden las misiones del gobierno. NVIDIA también afirma que colabora en varios proyectos financiados durante la fase 2 de la Genesis Mission, anunciados ese mismo día, en computación cuántica, fusión, diseño de aceleradores y microelectrónica, y recuerda su colaboración con el DOE, que incluye el mayor superordenador científico del departamento, en el Argonne National Laboratory.

🔗 Comunicado de NVIDIA

El primer mapa completo del cielo en ultravioleta, creado con Claude Science

8 de octubre — El blog Anthropic Science cuenta cómo Brice Ménard, astrofísico de la Universidad Johns Hopkins e investigador en Anthropic, creó con Claude Science lo que Anthropic presenta como el primer mapa completo del cielo en ultravioleta. El estudio espacial GALEX (NASA, 2003-2013) solo cubría aproximadamente dos tercios, con unas 38 000 observaciones. Claude coordinó agentes que reunieron los estudios cartográficos públicos y los calibraron entre sí, y después completaron el tercio restante mediante reconstrucción (inpainting), a partir de la relación entre el ultravioleta y las demás longitudes de onda. En zonas ocultadas deliberadamente, las estimaciones se aproximan a las mediciones reales con una diferencia de alrededor del 10 %.

The work would have taken humans weeks of work, but, with Claude, just took a few days while Ménard worked on other projects.

🇪🇸 Este trabajo habría requerido semanas a los humanos, pero, con Claude, solo llevó unos días mientras Ménard trabajaba en otros proyectos. — @AnthropicAI en X

🔗 Artículo de Anthropic Science


Usos prohibidos y abusos: la política de uso de Anthropic para 2026 y dos operaciones de influencia desmanteladas por OpenAI

Dos publicaciones del 8 de octubre muestran qué prohíben los laboratorios y cómo persiguen los abusos: Anthropic reescribe su política de uso y OpenAI detalla dos operaciones de influencia que ha prohibido.

Anthropic publica la versión 2026 de su política de uso, que entra en vigor el 12 de noviembre

8 de octubre — Anthropic publica la actualización anual de su política de uso (Usage Policy), que entrará en vigor el 12 de noviembre. Se trata principalmente de aclaraciones basadas en los abusos observados. Una nueva sección reúne las normas sobre campañas engañosas y actividad artificial, hasta ahora dispersas, y abarca toda actividad engañosa, política o comercial, incluida la creación de herramientas para operaciones de influencia. La sección electoral, ahora llamada «no socavar los procesos democráticos» (Do Not Undermine Democratic Processes), abandona la prohibición general de la segmentación personalizada de votantes, que impedía usos cívicos como informar a los votantes en otros idiomas. El texto también precisa que la prohibición de las armas abarca su software y sus componentes, así como el armamento de drones, prohíbe rastrear a personas sin su consentimiento y veta, solo en casos extremos, los comportamientos abusivos persistentes y gratuitos hacia los modelos.

🔗 Artículo de Anthropic: actualización de la política de uso para 2026

OpenAI desmantela Dark Clark y Bogus Bylines, incluida su primera operación de categoría 5

8 de octubre — OpenAI publica un informe sobre dos operaciones de influencia clandestinas que ha prohibido y que mantenían activas entidades ficticias (false front) con ayuda de sus modelos. «Dark Clark», de origen ruso, se dirigía a América Latina: sus operadores usaban ChatGPT sobre todo para redactar sus informes internos y dirigían un supuesto centro de investigación, el Social Research Center, animado por un personaje ficticio, «Mia Clark». «Bogus Bylines», de origen iraní, colocó cerca de 100 artículos bajo siete firmas falsas de periodistas occidentales en una docena de medios en línea, uno de los cuales tenía cerca de 2 millones de seguidores en Facebook. OpenAI afirma haber expuesto 30 operaciones de este tipo en dos años y medio.

Operación desmanteladaOrigen de las cuentasObjetivo principalCategoría en la IO Breakout Scale (1 a 6)
Dark ClarkRusiaAmérica Latina5, la primera según OpenAI
Bogus Bylines, artículosIránMedios en línea internacionales4
Bogus Bylines, comentariosIránRedes sociales2

🔗 Informe de OpenAI sobre las operaciones con entidades de fachada


Claude Haiku 5.5 en herramientas de terceros: GitHub Copilot lo ofrece desde el plan Pro y Devin registra un 58,4 %

Lanzado el 7 de octubre, Claude Haiku 5.5 llegó ese mismo día a dos herramientas de programación, que lo comparan con Claude Sonnet 5.

GitHub Copilot: Haiku 5.5 en todos los planes de pago, incluido Pro

7 de octubre — Poco más de dos horas después de su lanzamiento por Anthropic, Claude Haiku 5.5 llega a disponibilidad general en GitHub Copilot para los planes Pro, Pro+, Max, Business y Enterprise: incluido Pro, como Claude Sonnet 5.5 y a diferencia de GPT-6.1 Sol a finales de septiembre. Se puede seleccionar en diez interfaces, desde VS Code hasta Xcode. GitHub lo orienta a subagentes, modificaciones rápidas y tareas en el terminal; según sus primeras pruebas, igualó a Claude Sonnet 5 en numerosas tareas de programación con muchos menos tokens y pasos, sin publicar cifras. Se factura a la tarifa pública: 0,10 dólares por millón de tokens de entrada y 0,50 dólares de salida hasta 100 000 tokens de entrada, y después 0,50 y 2,50 dólares, es decir, diez veces menos que Claude Haiku 4.5 en el primer tramo.

🔗 Claude Haiku 5.5 en GitHub Copilot · Modelos y tarifas de GitHub Copilot

Devin: 58,4 % en FrontierCode 1.1, por delante de Claude Sonnet 5

7 de octubre — Cognition incorpora Claude Haiku 5.5 a Devin. En FrontierCode 1.1, su benchmark propio que puntúa los modelos en tareas reales de ingeniería según la calidad del código y la posibilidad de fusionarlo, Haiku 5.5 obtiene un 58,4 %, por delante de Claude Sonnet 5, por aproximadamente una octava parte de su coste por tarea según Cognition, que no proporciona un importe preciso. También se suma a los asistentes auxiliares (sidekicks) de Devin Fusion, que combina un modelo principal con uno de apoyo: con Claude Opus 5.5 como modelo principal y Haiku 5.5 como apoyo, Fusion mantiene una puntuación de 66,2 y reduce el coste y la latencia.

Modelo evaluado por CognitionPuntuación FrontierCode 1.1 Extended
Claude Sonnet 556,2
Kimi K358,2
Claude Haiku 5.558,4
GPT-6.1 Sol60,4
Claude Sonnet 5.564,4
Claude Opus 5.565,3

🔗 Claude Haiku 5.5 en Devin


Agentes de programación: Claude Code 2.1.295, Codex CLI 0.162.0, Antigravity CLI 1.3.1, VS Code 1.141 y Delta 0.19

Cinco herramientas de agentes de programación evolucionan: Claude Code refuerza sus hooks, Codex CLI gestiona worktrees, Antigravity CLI replantea la revisión de los cambios, VS Code organiza las sesiones de agentes en una cuadrícula y Delta se abre al trabajo en equipo.

Claude Code 2.1.295: hooks que bloquean cuando fallan

8 de octubre — Claude Code tuvo dos versiones durante el día. La 2.1.294 corrige los hooks prompt y agent redactados como instrucciones en lenguaje natural, que podían dejar pasar lo que debían bloquear. La 2.1.295 incluye 143 entradas, de las cuales 97 son correcciones. Con la nueva opción onFailure: "block" de los hooks command y HTTP, un hook que no se inicia, agota el tiempo de espera o devuelve un código inesperado bloquea la acción en lugar de dejarla pasar; varias correcciones siguen la misma línea, para las protecciones de los mods y las opciones --tools y --restricted. Claude Code también admite el Program Status Protocol (OSC 7501), que permite a los terminales compatibles mostrar si el agente está trabajando, esperando o ha terminado, y las descripciones de herramientas MCP cargadas mediante la búsqueda de herramientas pasan de 2 048 a 16 384 caracteres.

🔗 Claude Code 2.1.295 · Claude Code 2.1.294

Codex CLI 0.162.0: worktrees gestionados y tareas fijadas

8 de octubre — Codex CLI 0.162.0, la primera versión estable desde la 0.161.0 del día anterior, enumera 225 PR. Cuando la función worktrees está activada, Codex dispone de herramientas para crear y enumerar worktrees Git gestionados a partir de proyectos locales de confianza, y el centro de mando de los agentes permite fijar una tarea con la tecla p, en un grupo «Pinned» compartido cuando el servidor lo permite. El terminal incorpora /copy para recorrer y copiar los bloques de la transcripción, Ctrl+Insert para copiar una selección y un ajuste de la velocidad de desplazamiento, y las URL pasan a ser clicables incluso en las aprobaciones y las solicitudes MCP. Los proveedores de modelos personalizados compatibles con la Responses API pueden declarar acceso web en directo y compactación remota. En cuanto a las correcciones, apply_patch conserva los finales de línea CRLF, se refuerza el entorno aislado de Linux y las versiones de Windows reciben un instalador PowerShell firmado.

🔗 Notas de la versión de Codex CLI 0.162.0

Antigravity CLI 1.3.1: revisión replanteada en /diff, nivel de detalle medio por defecto

7 de octubre — La CLI de Antigravity publicó cinco versiones entre el 2 y el 7 de octubre. La 1.3.1 mejora la revisión de código en el terminal: en la vista de archivo de /diff, las flechas izquierda y derecha abren el archivo contiguo en su primer cambio, cada archivo conserva su posición, n y N pasan al archivo siguiente o anterior, y el encabezado indica dónde se está. Sus diez correcciones afectan, entre otros aspectos, a /rewind en conversaciones muy largas, a los plugins en Windows y a las sesiones mediante clave GEMINI_API_KEY, que reintentan la conexión cuando se interrumpe el acceso a la API Gemini. La 1.3.0 del 6 de octubre cambia el nivel de detalle predeterminado de «high» a «medium», que agrupa las llamadas a herramientas y las reflexiones en resúmenes concisos; /config permite volver al ajuste anterior. Antes, la 1.2.16 había confiado la generación de imágenes a un subagente integrado y la 1.2.15 había incorporado binarios de Android para Termux.

🔗 Changelog de Antigravity, pestaña CLI

VS Code 1.141: sesiones de agentes en cuadrícula y limpieza de worktrees

7 de octubre — VS Code 1.141 se centra en las sesiones de agentes de Copilot. La ventana Agents puede organizar varias sesiones en una cuadrícula, y el comando Chat: Open Worktree Cleanup muestra el espacio en disco ocupado por los worktrees de las sesiones inactivas para eliminarlos, a petición o automáticamente una vez fusionada la pull request. Las conversaciones iniciadas en Copilot CLI o en la aplicación GitHub Copilot aparecen desde su primera solicitud, sin recargar el editor, y una conversación de Codex abierta en la aplicación ChatGPT o en Codex CLI puede continuar allí con su historial: al elegir un modelo Copilot, se continúa con la suscripción a GitHub Copilot, por ejemplo, después de alcanzar el límite de uso de ChatGPT. Para las empresas, se puede imponer el entorno aislado del arnés de Copilot mediante los ajustes gestionados, en versión preliminar, y este arnés se convierte progresivamente en la opción predeterminada para los usuarios con las funciones experimentales activadas.

🔗 Notas de la versión de VS Code 1.141

Delta 0.19: menciones entre compañeros de equipo y bandeja de entrada

7 de octubre — Zed Industries publica Delta 0.19.0, su entorno para programar en equipo con agentes, seguido el 8 de octubre por una versión 0.19.1 con correcciones. Ahora se puede mencionar a un compañero de equipo en un mensaje o comentario escribiendo @ seguido de su nombre de usuario, y la notificación llega a una nueva bandeja de entrada (Inbox). El agente @delta lee y modifica gran parte de los ajustes desde la conversación. Un ajuste, Agent Thread Creation, impide que los agentes creen conversaciones de nivel superior sin desactivar los subagentes, el agente puede fusionar los worktrees de varios hilos y los comandos de la CLI se ejecutan sin abrir una ventana. En total, las notas enumeran 11 novedades, 22 mejoras y 45 correcciones. El 8 de octubre, un artículo difundido por Zed cuenta cómo el equipo sustituyó Google Docs por Delta para sus documentos internos.

🔗 Notas de la versión de Delta · Artículo de Delta sobre el abandono de Google Docs


Medios generativos: Nano Banana 2.1, Brand Kit y ElevenReader en Brasil de ElevenLabs, SemanTok de Stability AI

Cuatro anuncios relacionados con la imagen, el vídeo y la voz: un modelo de imágenes a mitad de precio de Google, un manual de identidad visual reutilizable y una aplicación de lectura en audio de ElevenLabs, y una investigación sobre generación de vídeo de Stability AI.

Nano Banana 2.1 en disponibilidad general en la API Gemini, a mitad de precio

6 de octubre — Google ha pasado Nano Banana 2.1 (gemini-nano-banana-2.1) a disponibilidad general en la API Gemini y Google AI Studio, sin publicar un artículo en el blog. Este modelo de generación y edición de imágenes actualiza Nano Banana 2, con una mayor calidad visual, una mejor representación del texto, personajes más coherentes entre turnos y formatos panorámicos, de 1:4 a 8:1, sin artefactos de mosaico en 2K y 4K. Admite hasta 14 imágenes de referencia y se apoya en la búsqueda de Google. El precio por imagen se reduce a la mitad en 1K y 2K, y Google declara obsoleto Nano Banana 2 (gemini-3.1-flash-image), sin fecha de retirada.

Precio de salidaNano Banana 2.1Nano Banana 2
Imagen 1K0,0336 dollar0,067 dollar
Imagen 2K0,0504 dollar0,101 dollar
Imagen 4K0,113 dollar0,151 dollar
Millón de tokens de imagen30 dollars60 dollars

🔗 Notas de la versión de la API Gemini · Ficha de Nano Banana 2.1

Brand Kit de ElevenLabs: el manual de identidad visual guardado en el espacio de trabajo

8 de octubre — ElevenLabs añade Brand Kit a ElevenCreative, su suite de creación. Los colores, las fuentes, los logos con sus normas de uso, las imágenes de referencia y las reglas de marca, incluido lo que la marca nunca hace, forman un único objeto del espacio de trabajo, que se invoca con @ en Image & Video, en Flows o mediante el agente ElevenCreative. Según el hilo de ElevenLabs, se puede crear un kit en unos minutos pegando la dirección de un sitio web o subiendo los recursos de la organización; todo el equipo genera entonces contenido a partir de las mismas instrucciones, y una agencia puede crear un kit por cliente. ElevenLabs quiere ampliar los kits a la voz y al sonido de la marca, sin indicar una fecha. Brand Kit ya está disponible, sin tarifa especificada; HeyGen (agosto) y Runway (septiembre) ya ofrecen herramientas comparables.

🔗 Artículo de ElevenLabs: Brand Kit · Hilo de @ElevenLabs

SemanTok de Stability AI: un modelo de 201M que iguala a uno 3,4 veces más grande

7 de octubre — El equipo Interactive Research de Stability AI presenta SemanTok, un tokenizer de vídeo para los modelos del mundo (world models) que generan vídeo token a token, anunciado en X el 8 de octubre. En los tokenizers «de lo general a lo detallado» (coarse-to-fine), los primeros tokens describen la escena en su conjunto y los siguientes añaden los detalles; SemanTok dota a estos primeros tokens de más contenido semántico, por lo que resulta más fácil predecirlos. Para ello, introduce en su codificador características DINO congeladas y añade cabezales ligeros que las reconstruyen a partir de cada prefijo de tokens. Según Stability AI, un modelo autorregresivo de 201M de parámetros construido sobre SemanTok iguala o supera a un modelo VideoFlexTok 3,4 veces más grande, y predecir los prefijos cortos cuesta menos. El artículo está en arXiv; no se mencionan ni código ni pesos.

🔗 Artículo de investigación de Stability AI · Artículo en arXiv

ElevenReader llega a Brasil con la voz de Fábio Porchat y 70 000 libros

8 de octubre — ElevenLabs lanza en Brasil ElevenReader, su aplicación que convierte libros, documentos y artículos en audio, gratuita en iOS y Android, con la voz del actor y humorista Fábio Porchat. El catálogo se basa en una colaboración con Bookwire Brasil: 70 000 títulos en portugués de Brasil, con licencia de las principales editoriales del país, la mayoría de los cuales no tenían una edición en audio. ElevenLabs también ha producido Dom Casmurro, de Machado de Assis, leído por Fábio Porchat con música original y diseño sonoro. Según el director general de Bookwire Brasil, es la mayor selección de libros brasileños que se ha ofrecido jamás en audio.

Oferta en BrasilCondiciones de acceso
Aplicación ElevenReader (iOS, Android)Gratuita
Dom Casmurro leído por Fábio PorchatGratis para todos
70 000 títulos con licencia de BookwireCon ElevenReader Ultra, precio no indicado

🔗 Publicación de ElevenLabs: ElevenReader en Brasil


Modelos especializados: LightOnOCR-3 para los documentos, Falcon-ASR para el árabe, Carbon-A para los genomas

Tres modelos especializados, dos de ellos con pesos abiertos, para leer documentos, transcribir el árabe y anotar genomas.

LightOnOCR-3: tres modelos OCR abiertos que también identifican el diseño de la página

8 de octubre — LightOn publica bajo la licencia Apache 2.0 LightOnOCR-3, en tres tamaños (0.8B, 1B y 4B). Además de transcribir una página, los modelos pueden identificar cada una de sus regiones: con el prompt de anclaje visual (grounding), cada bloque va precedido de un recuadro delimitador etiquetado, las imágenes reciben una breve descripción y los gráficos se convierten en tablas HTML de datos. En una H100, el 4B procesa un 21 % más de páginas por segundo que Chandra-OCR-2, construido como él sobre Qwen3.5. LightOn precisa que sus puntuaciones se calculan después de una normalización de las salidas, publicada junto con el repositorio, que modifica considerablemente las de todos los modelos líderes.

Banco de evaluaciónLightOnOCR-3-4BLightOnOCR-3-0.8BLightOnOCR-3-1BReferencia citada
olmOCR-Bench, puntuación global86,385,584,5Infinity Parser Pro (35,1B) 87,6 ; Chandra 2 85,8
ParseBench, cinco categorías75,174,671,4Infinity Parser Pro 74,3
fr-bench-pdf2md, documentos en francés74,170,569,6Chandra 2 69,0 ; MistralOCR4.1 54,1

🔗 Publicación de LightOnOCR-3

Falcon-ASR: 1,6 mil millones de parámetros para el árabe emiratí, sin pesos publicados

7 de octubre — El Technology Innovation Institute (TII) de Abu Dabi presenta Falcon-ASR, un modelo de reconocimiento de voz de 1,6 mil millones de parámetros centrado en el árabe y, en particular, en el dialecto emiratí. El mismo conjunto de pesos también transcribe el inglés, el francés, el español y el portugués, sin necesidad de especificar el idioma, con una marca de tiempo para cada palabra. Al igual que Falcon-OCR-Arabic y Falcon-Emirati, presentados el día anterior, solo se ofrece como demostración: TII anuncia acceso mediante API y aplicaciones nativas, sin publicar los pesos.

Evaluación de la tasa de error de palabras (WER)Puntuación de Falcon-ASRReferencia citada
Media de seis conjuntos en árabe (Open Universal Arabic ASR)20,92 %23,17 %, mejor resultado publicado a 30 de septiembre
Emiratí, evaluación interna de TII22,73 %Qwen3-Omni, segundo, 4,07 puntos por encima
Media de siete conjuntos en inglés (Open ASR Leaderboard)5,74 %Ninguna referencia citada

🔗 Publicación de Falcon-ASR

Carbon-A: 566 millones de genes candidatos en 22 617 especies

8 de octubre — El equipo de biología de Hugging Face (HuggingFaceBio) publica Carbon-A, un modelo de 1,2 mil millones de parámetros bajo la licencia MIT que identifica las regiones que codifican proteínas directamente en el ADN, con un único modelo para mamíferos, plantas, hongos y protistas. En 42 genomas de referencia, alcanza un F1 nucleotídico medio de 0,944 y supera, según los autores, a las siete herramientas comparadas, entre ellas AUGUSTUS, Helixer y Tiberius. El equipo lo ha ejecutado sobre los genomas eucariotas de GenBank para construir la Carbon Annotation Database: 48 167 ensamblajes de 22 617 taxones y 566 millones de loci codificantes predichos, es decir, 11 veces más taxones que el corpus de entrenamiento. Una validación en laboratorio con ActiveSite y la UCSD, mediante secuenciación de ARN completo, confirma parte de los genes; los autores precisan que esto demuestra la transcripción, pero todavía no la producción de proteínas. Está previsto un nuevo lote dentro de tres semanas.

🔗 Publicación de Carbon-A


Entrenamiento por refuerzo: los 1 004 entornos de TermGrade y TRL v1.15.0

Dos publicaciones para el aprendizaje por refuerzo: entornos de terminal evaluados y una biblioteca que permite entrenar con secuencias más largas.

TermGrade: 1 004 entornos de terminal evaluados por seis modelos

8 de octubre — La empresa ai& publica TermGrade, 1 004 entornos de terminal para entrenar y evaluar agentes mediante aprendizaje por refuerzo. Cada tarea se ejecuta en un contenedor Linux con instrucciones y tests, y solo se ha incluido si su propia solución de referencia superaba sus tests: de las 66 165 tareas candidatas escritas por DeepSeek-V4-Pro, el 1,5 % ha pasado este filtro. Seis configuraciones de modelos abiertos, desde Kimi-K3 hasta gemma-4-31B-it, han intentado resolver cada tarea, y se publican los 36 144 intentos, incluidos los fallidos. Un modelo aprende más de las tareas que resuelve aproximadamente una de cada dos veces: entrenado con 151 tareas de esta franja, gemma-4-31B-it alcanza 46,1 en Terminal-Bench 2.1, es decir, 3,1 puntos más que el modelo base, y 2,1 puntos de media en cinco entrenamientos. Todo se publica bajo Apache-2.0.

🔗 Publicación de TermGrade · Colección TermGrade en Hugging Face

TRL v1.15.0: un cabezal LM fusionado para secuencias hasta 6,9 veces más largas

8 de octubre — TRL v1.15.0, la biblioteca de entrenamiento de Hugging Face, incorpora un cabezal LM fusionado (fused LM head) que calcula directamente las log-probabilidades y la entropía de cada token con un kernel Triton, sin construir nunca el tensor completo de logits; está activado por defecto para SFT, DPO, KTO, GRPO, RLOO y la destilación. Con 8 192 tokens, el pico de memoria se reduce entre un 52 y un 82 % según el método. Estas mediciones se han realizado en una B300 limitada a 79 Gio con los pesos aleatorios de gemma-3-1b, cuyo vocabulario tiene 262 000 tokens; la mejora es mayor para los modelos pequeños con un vocabulario amplio. La versión también rompe la compatibilidad: fin del soporte para Python 3.10, use_liger_kernel obsoleto y retirada del entrenador experimental MiniLLM.

Método de entrenamientoLongitud máxima en v1.14.2 (tokens)Longitud máxima en v1.15.0 (tokens)Factor de mejora
DPO10 24059 392×5,80
KTO (lote de 2)9 21663 488×6,89
GRPO28 672114 688×4,00
RLOO23 552100 352×4,26
SFT (pérdida nll)20 480107 520×5,25

🔗 Notas de TRL v1.15.0


Inferencia: llama.cpp en Windows ML, ML Drift en open source, Together AI en B300 de IBM Cloud

Tres anuncios para ejecutar modelos, desde el PC Windows hasta el cluster de GPU.

llama.cpp llega a Windows ML, en fase experimental

7 de octubre — Durante su evento Windows, Microsoft añade a Windows ML, su framework de inferencia local, soporte experimental para llama.cpp: se descarga un modelo GGUF de Hugging Face y se ejecuta en local a través de la misma pila de Windows ML, mediante nuevas API dedicadas a tareas específicas. Una API de ejecución nativa de Windows, de más bajo nivel, también pasa a estar disponible en versión preliminar experimental. Microsoft afirma que contribuye directamente al proyecto llama.cpp junto con NVIDIA y la comunidad: kernels CUDA optimizados, mejor planificación entre el procesador y la GPU, CUDA graphs, decodificación especulativa (Eagle-3, MTP, D-Flash2), ejecución en varias GPU y formato NVFP4. La publicación sitúa estas novedades en los PC equipados con chips NVIDIA RTX Spark, como el Surface Laptop Ultra. En X, Georgi Gerganov, de llama.cpp, celebra la presencia del proyecto en el evento Windows y lo interpreta como una señal de que las pilas de software y hardware por fin convergen.

🔗 Publicación de Microsoft Foundry on Windows · Tweet de @ggerganov

ML Drift: el motor GPU de LiteRT publicado en open source

8 de octubre — El equipo de Google AI Edge publica en open source, bajo la licencia Apache 2.0, ML Drift, su motor de cálculo GPU para la inferencia en el dispositivo. Oculta las diferencias entre OpenGL ES, OpenCL, Metal y WebGPU, sirve como motor de aceleración GPU para LiteRT, está disponible como biblioteca independiente y sucede al delegado GPU de TensorFlow Lite, que dejará de recibir nuevas funcionalidades. El motor cambia de kernels según si el LLM lee el prompt o genera sus tokens, y proporciona una guía SKILL.md para que los agentes de código escriban y verifiquen shaders. Ya funciona en producción: hasta un 40 % menos de latencia por imagen para los efectos de YouTube Shorts, y hasta un 30 % de mejora para Lightroom y Photoshop en dispositivos móviles según la publicación; en Gemma, Google mide hasta un 12 % menos de memoria que con otros frameworks (frameworks).

🔗 Anuncio de ML Drift en el Google Developers Blog · Repositorio google-ai-edge/ml-drift

Together AI, primer cliente de un cluster de inferencia de GPU B300 en IBM Cloud

6 de octubre — Together AI anuncia que trabaja con IBM y NVIDIA para ampliar su capacidad de inferencia destinada a empresas, empezando por un gran cluster de GPU NVIDIA B300 alojado en IBM Cloud y conectado mediante la red Ethernet Spectrum-X de NVIDIA. Según Together AI, es el primer cluster de inferencia dedicado de esta magnitud en IBM Cloud, y la empresa es su primer cliente: opera la capa de inferencia, IBM proporciona el cloud y NVIDIA los chips y la red. Together AI justifica esta ampliación por la demanda de modelos abiertos: afirma que sirve cada mes cientos de billones de tokens a más de un millón de desarrolladores. La publicación no indica ni el tamaño del cluster ni un calendario.

🔗 Publicación de Together AI · Tweet de @togethercompute


Breves

  • Control más rápido de Codex — En la aplicación de escritorio de ChatGPT, Codex tiene en cuenta antes un mensaje de seguimiento enviado durante una tarea, para corregir un enfoque o cambiar de rumbo; el ajuste Follow-up behavior determina si estos mensajes orientan la ejecución en curso o esperan a la siguiente. 🔗 fuente
  • ChatGPT Go en Warp — Los suscriptores del plan ChatGPT Go ya pueden usarlo en Warp para cualquier pregunta sobre el terminal o tarea de código; según un miembro del equipo Sign in with ChatGPT de OpenAI, citado por Warp, el uso incluido está disponible para los clientes de Go, además de los de Plus y Pro, en todas las aplicaciones asociadas. 🔗 fuente
  • Oracle — Según un estudio de caso de OpenAI, Oracle cuenta con 130 000 usuarios activos de ChatGPT y más de 95 000 de Codex; una investigación sobre el mercado del talento que requería de 2 a 4 días se prepara en 15 a 20 minutos, y Codex traduce preguntas de negocio en consultas SQL. 🔗 fuente
  • Pollo AI — Esta plataforma de creación de vídeo, que afirma tener más de 26 millones de usuarios, enruta las solicitudes de su agente con GPT-5.6, asigna las tareas difíciles a GPT-6 Astra y todas sus imágenes a GPT-Image-2.5, y asegura reducir en más de un 50 % el tiempo dedicado a elegir un modelo. 🔗 fuente
  • Notas de la versión de Devin del 7 de octubre — Un buzón de notificaciones reúne las alertas de las sesiones, con envío al teléfono configurable, el estado de la cola de fusión se muestra en toda la aplicación, y las claves privadas guardadas como secretos se ocultan línea por línea en la salida de los comandos. 🔗 fuente
  • Copilot CLI 1.0.94 — Ya estable tras seis versiones preliminares, añade Claude Haiku 5.5 al selector de modelos, transmite el código shell mostrado al evaluador de Assisted Permissions para evitar aprobaciones innecesarias y permite activar un servidor MCP antes de su descubrimiento. 🔗 fuente
  • Gemini CLI v0.65.0-nightly.20261008 — La telemetría acepta encabezados OTLP personalizados (telemetry.otlpHeaders), una solicitud abierta desde octubre de 2025; la CLI ya no entra en un bucle entre la verificación y OAuth, y el historial siempre termina con un mensaje del usuario, lo que evita un error 400 después de /rewind. 🔗 fuente
  • El SDK Antigravity 0.1.21 aísla las API experimentales y configura las skills de los subagentes — Primera versión registrada en el changelog desde la 0.1.18 del 21 de septiembre: un decorador @beta y un módulo google.antigravity.beta separan las versiones preliminares de la API estable, y skills_config permite que un subagente herede las skills del agente principal, las sustituya o prescinda de ellas. 🔗 fuente
  • Developer Knowledge API — Google presenta el ecosistema de esta API que ofrece su documentación para desarrolladores (Google Cloud, Firebase, Android) en Markdown actualizado: un comando gcloud developer-knowledge preinstalado en Cloud Shell, una skill para agentes de código conectada a un servidor MCP, con Antigravity, Claude Code, Cursor y GitHub Copilot entre los citados, y bibliotecas en siete lenguajes. 🔗 fuente
  • AQuA — Google Cloud publica, como implementación de referencia, este agente de calidad (Ambient Quality Agent) que toma una muestra de hasta 1 000 sesiones de un agente ADK en producción, agrupa los fallos, los sigue en BigQuery e inicia un diagnóstico de las causas con Gemini 3.8 Flash. 🔗 fuente
  • Los borradores cuentan en los límites de pull requests — Ante las contribuciones de baja calidad, GitHub permite incluir las pull requests en borrador en los límites por usuario, cuando hasta ahora un colaborador podía abrirlas sin límite. 🔗 fuente
  • Archivado de pull requests — Ya no está reservado a los administradores: los roles triage, write, maintain y admin pueden archivar una pull request, lo que la cierra, la oculta al público y bloquea toda actividad nueva, incluidos los comentarios de los administradores. 🔗 fuente
  • Cronologías de GitHub y lectores de pantalla — Los lectores de pantalla recorren las cronologías de las issues y las pull requests como listas, con el número de elementos y la posición actual, y anuncian los eventos cargados, en github.com y GitHub Enterprise Server 3.23. 🔗 fuente
  • Paper Reproductions with ML Intern — Abubakar Abid anuncia en Hugging Face una función que encarga a agentes la reproducción independiente de los experimentos de un artículo publicado, desde las Paper Pages, para producir artefactos abiertos que ayuden a identificar los trabajos sólidos; sin cifras ni documentación. 🔗 fuente
  • El chat de Hugging Face por SSH — Adrien Carreira, responsable de la infraestructura de Hugging Face, presenta un chat con modelos abiertos accesible mediante el comando ssh chat.hf.co, sin configuración ni clave; no lo acompaña ninguna documentación ni lista de modelos. 🔗 fuente
  • huggingface_hub 2.2.0 — Pequeña versión correctiva: hf jobs stats ahora devuelve una instantánea y después cede el control (-f para seguir en directo), todas las descargas paralelas pasan por hf_xet, y dos cambios rompen la compatibilidad. 🔗 fuente
  • swarmlab — Hugging Face ha abierto, sin anuncio, este banco de pruebas que estudia cómo los enjambres de agentes LLM de distintos proveedores encuentran la verdad o se dividen, según la topología de los intercambios, los retrasos y los roles; una línea de YAML basta para probar una hipótesis. 🔗 fuente
  • Darwin-27B-ZTC — VIDRAFT publica bajo Apache-2.0 un evaluador que devuelve en una sola pasada una distribución de probabilidades sobre las respuestas posibles, sin generar ningún token: 0,743 de exactitud en zero-shot sobre 2 000 evaluaciones de typed-decisions y una puntuación de Brier de 0,097, según sus autores. 🔗 fuente
  • Superfluid — basecompute publica bajo Apache-2.0 este servidor LLM local, compatible con las API de OpenAI, Anthropic y Ollama, que da prioridad a las preguntas interactivas sobre el trabajo de los agentes: 0,36 segundos de respuesta con ocho agentes activos, frente a más de 10 segundos para llama-server, según sus autores. 🔗 fuente
  • funes 1.8.0 — La herramienta que indexa las sesiones de los agentes de código añade un modelo de embeddings multilingüe: en 30 preguntas sobre 2 000 conversaciones en chino, la conversación correcta aparece entre los ocho primeros resultados 30 veces de 30, frente a 23, y el rango recíproco medio pasa de 0,601 a 0,983. 🔗 fuente
  • GLiNER y las lenguas de la India — Una publicación de la comunidad muestra que, al conservar los signos combinantes en las palabras, sin reentrenamiento, el F1 medio en zero-shot de GLiNER2 pasa de 13,2 a 68,0 en nueve lenguas de la India, y el de un ajuste fino en hindi, de 59,9 a 82,6. 🔗 fuente
  • Multilingual Terminal-Bench — LILT detalla su banco de pruebas de 324 tareas de código en diez lenguas: Claude Opus 5.5 supera a Opus 5 en unos 3 puntos con un 30 % menos de tokens, lo que supone un coste por tarea aproximadamente un 45 % inferior; Gemini 3.8 Flash emplea una mediana de 41 turnos por tarea, frente a 5 para GPT-6 Sol. 🔗 fuente
  • Primitivas colectivas GPU — Milos Kotlar predice el tiempo de comunicación de cinco primitivas en cuatro RTX 4090 con un 10,9 % de error medio, frente al 22,9 % de un modelo común, pero con un peor caso del 61,6 %. 🔗 fuente
  • Best-of-N en razonamiento sobre vídeo — facebookresearch publica, sin anuncio y bajo la licencia no comercial CC BY-NC 4.0, el código del estudio Selecting or Solving? sobre la selección best-of-N y los paneles de verificadores en razonamiento sobre vídeo. 🔗 fuente
  • KDD Cup 2026 Data Agents — NVIDIA detalla el arnés de ejecución que situó a su equipo KGMON en segundo lugar con un LLM pequeño impuesto: datos convertidos en tablas SQLite, esquema proporcionado desde el principio, conjunto reducido de herramientas, lectura selectiva de documentos; la publicación no da ninguna puntuación ni nombre de modelo. 🔗 fuente
  • Microduck — Matthieu Lapeyre, de Pollen Robotics, anuncia más de tres horas de autonomía con una batería de 2 600 mAh para este pequeño robot bípedo equipado con la nueva placa electrónica propia, con un procesador que alcanza como máximo 60 °C en lugar de 114 °C. 🔗 fuente
  • Álbumes en Suno — Presentada el 5 de octubre, la función ya está disponible: permite reunir las canciones en un lanzamiento completo, elegir la portada, ordenar los temas y publicar en el momento deseado; no se especifican el plan ni el límite de canciones. 🔗 fuente
  • HeyGen y Ryan Serhant — HeyGen lanza una serie diaria de vídeos presentada por el avatar oficial del agente inmobiliario Ryan Serhant, conocido por la serie de Netflix Owning Manhattan, en Instagram, TikTok y X; sin detalles financieros. 🔗 fuente
  • Runway y la Tech Coalition — Runway se une a esta alianza contra la explotación sexual infantil en línea y a su programa Lantern de intercambio de señales entre plataformas, y recuerda sus medidas de protección: filtrado de datos, pruebas adversariales, hashing, denuncias al NCMEC y procedencia C2PA. 🔗 fuente
  • SpaceXAI y Omarchy — SpaceXAI se convierte en patrocinador fundador de la Omacom Foundation con 1,5 millones de dólares en tokens Grok; Grok 4.7 y sus sucesores impulsarán los agentes del proyecto, entre ellos Omabot, que revisa las pull requests. 🔗 fuente
  • Guía de medidas de protección de Perplexity — Perplexity publica una guía que sitúa las medidas de protección de la IA en tres momentos (entrada, acción de los agentes, salida), compara cinco tipos de protecciones e ilustra siete casos, desde la inyección de prompts hasta las alucinaciones; sin funciones nuevas. 🔗 fuente
  • pplx-decider-v1.1-27b en OpenRouter — El modelo de decisión de pesos abiertos de Perplexity llega a OpenRouter con la tarifa de la Decisions API: 0,02 dólares por millón de tokens de entrada, salida gratuita, contexto de 262 000 tokens. 🔗 fuente
  • Cohere en Ottawa — Cohere abre su primera oficina en Ottawa, cerca del parque Lansdowne, donde ya trabajan cerca de 30 empleados (comercialización, ingeniería, infraestructura, seguridad, IA soberana); no se indican la superficie ni el objetivo de plantilla. 🔗 fuente

Qué significa

El asistente ahora produce objetos de trabajo, ya no solo respuestas. Un panel de Claude Dashboards se actualiza cuando cambian los datos, una animación de Claude Motion sigue siendo editable palabra por palabra porque está escrita en código, y Docs, Slides y Design, que han salido de beta para todos los planes, ya afirman superar los 45 millones de creaciones. Estos objetos circulan después por las herramientas existentes: el panel se envía a Grafana o PostHog, la animación a Runway o Luma, que le añaden planos generados. El Brand Kit de ElevenLabs sigue la misma lógica: el manual de identidad visual se convierte en un objeto del espacio de trabajo, invocado mediante @, en lugar de una instrucción que hay que repetir en cada prompt.

La seguridad cambia de escala, tanto en la defensa como en la aplicación de las normas. Anthropic constata que encontrar vulnerabilidades nunca había sido tan fácil: más de 29 000 candidatas en seis meses, de las cuales unas 6 000 se clasificaron a mano. OSS Scanner asume el envío de informes sin revisión humana, con más de un 90 % de verdaderos positivos esperados, para aliviar este cuello de botella. Las normas de uso se precisan en paralelo: la política de 2026 de Anthropic agrupa las campañas engañosas en una sección específica, y OpenAI presenta Dark Clark como la primera operación de categoría 5 que ha desmantelado desde que comenzó a publicar sus informes. En las herramientas, Claude Code 2.1.295 ahora permite que un hook fallido bloquee la acción en lugar de dejarla pasar.

La velocidad y el precio se convierten en ajustes que se pueden elegir. Ultrafast vende GPT-6.1 Sol a un precio seis veces mayor para alcanzar hasta 8 veces más velocidad; según GitHub y Cognition, Claude Haiku 5.5 iguala o supera a Sonnet 5 en código, por aproximadamente una octava parte del coste por tarea según Cognition; Nano Banana 2.1 reduce a la mitad el precio de una imagen 1K. La inferencia se extiende desde el dispositivo, con llama.cpp en Windows ML y ML Drift en las GPU de teléfonos y ordenadores, hasta el cluster de B300 del que Together AI es el primer cliente en IBM Cloud, y TRL reduce entre un 52 y un 82 % el pico de memoria de un entrenamiento a 8 192 tokens.

Por último, muchas de las cifras del día las miden quienes las publican. FrontierCode es el benchmark propietario de Cognition, GitHub afirma que Haiku 5.5 iguala a Sonnet 5 sin publicar cifras, LightOn calcula sus puntuaciones tras una normalización que modifica las de todos los modelos líderes, TII evalúa Falcon-ASR en árabe emiratí únicamente con un conjunto de datos interno y no publica sus pesos, y los autores de Carbon-A lo comparan ellos mismos con siete herramientas. La ciencia abierta aporta un contrapunto: TermGrade publica sus 36 144 intentos, incluidos los fallos, Carbon-A su base de 566 millones de genes candidatos, y el mapa ultravioleta de Claude Science distingue píxel por píxel lo que se mide de lo que se predice. Los 150 millones de dólares de Anthropic y los mil millones de NVIDIA para la Genesis Mission impulsan la misma dirección: poner estas herramientas en manos de los investigadores.


Fuentes