Buscar

OpenAI añadirá marcas de agua al texto de ChatGPT y Codex en la Unión Europea, Devin recuerda entre sesiones, GitHub lanza ReviewBench

ai-powered-markdown-translator

Artículo traducido del francés al español con gpt-6.1-sol.

Ver proyecto en GitHub ↗

OpenAI añadirá en las próximas semanas una marca de agua invisible al texto de ChatGPT y de Codex para sus usuarios de la Unión Europea, en respuesta al AI Act, que exige que el texto generado sea identificable por una máquina, y ofrece desde hoy esta marca de agua como opción a los clientes de su API en todo el mundo. En el ámbito de los agentes, la memoria se afianza: Cognition dota a Devin de una memoria entre sesiones y publica su formato como estándar abierto, y Cohere lanza North 2 con una memoria que conserva el contexto de una sesión a otra; GitHub, por su parte, publica ReviewBench, un benchmark abierto de revisión de código mediante IA. En cuanto a los modelos abiertos, Reflection AI presenta Beam, con 501 mil millones de parámetros, cuyos pesos promete publicar más adelante en octubre.


Marca de agua invisible de OpenAI: el texto de ChatGPT y Codex se marcará en la Unión Europea, una opción mundial en la API

5 de octubre — OpenAI publica su respuesta a las normas europeas sobre la procedencia del texto. El AI Act exige a los proveedores de IA generativa que el texto que producen sea identificable de forma legible por una máquina; OpenAI responde por etapas, advirtiendo desde el principio que las tecnologías actuales de marcas de agua para texto tienen limitaciones importantes (limitaciones significativas).

Público al que afectaQué cambiaCalendario anunciado
Usuarios de ChatGPT y de Codex en la Unión Europea, todos los planesMarca de agua invisible añadida al texto que cumple los requisitosEn las próximas semanas
Clientes de la API, en todo el mundoMarca de agua opcional (opt-in) en modelos seleccionados, sin especificar, desactivada por defectoDesde el 5 de octubre
Investigadores y organizaciones expertas aprobadosAcceso al detector, caso por caso, previa solicitudSolicitudes abiertas el 5 de octubre

OpenAI no la convierte en una configuración mundial por defecto y trabaja con socios de servicios cloud para ofrecer, en las próximas semanas, la misma marca de agua en los modelos de OpenAI que ofrecen. La tecnología, textGrain, añade una señal estadística invisible a las elecciones de palabras del modelo, sin marcas visibles ni caracteres especiales; según OpenAI, iguala o supera los otros enfoques probados, incluido SynthID para texto. Se publica un informe técnico y OpenAI prevé abrir su código. El detector, por su parte, no es público en el lanzamiento, debido al riesgo de marcas de agua no detectadas y de falsos positivos: el acceso sigue el Código de Buenas Prácticas (Código de Buenas Prácticas) de la Comisión Europea.

Las cifras publicadas muestran sobre todo las limitaciones de la detección:

Condición de mediciónTasa de detección publicada
Fragmentos de 200 tokens, contenido de tipo psicología, objetivo de 1 % de falsos positivosaproximadamente 80 %
Fragmentos de 400 tokens, contenido de tipo psicología, objetivo de 1 % de falsos positivosaproximadamente 95 %
Contenido de tipo matemáticas, mismo umbral de 1 %considerablemente más baja (valor indicado solo en un gráfico)
Fragmentos de 400 tokens en inglés (conjunto ELI5), sin modificaraproximadamente 92 %
Mismos fragmentos, 10 % de las palabras sustituidas por sinónimos66 %
Mismos fragmentos, 25 % de las palabras sustituidas17 %

Watermarks have limits. They’re often undetectable, especially in short passages. Rewriting or translating text can completely remove the watermark.

🇪🇸 Las marcas de agua tienen limitaciones. A menudo son indetectables, especialmente en fragmentos cortos. Reescribir o traducir un texto puede eliminar por completo la marca de agua. — @OpenAI en X

En cuanto a la calidad, OpenAI no mide diferencias significativas en ocho benchmarks de GPT-6 Astra sin y con marca de agua (94,44 % frente a 93,94 % en GPQA Diamond, 53,90 % frente a 56,06 % en Terminal-Bench 4.0). El artículo también precisa lo que una marca de agua no indica: ni la proporción de trabajo humano, ni la propiedad o la responsabilidad del texto, ni la identidad del usuario, ni la exactitud; y su ausencia no demuestra que un humano haya escrito el texto. Para las imágenes y el audio, nada cambia: openai.com/verify y la Content Provenance API siguen siendo accesibles para las organizaciones, y SynthID se añade desde el 19 de mayo a los metadatos C2PA de las imágenes generadas.

🔗 Artículo de OpenAI sobre la procedencia del texto en la UE


5 de octubre — Cognition introduce en Devin dos funciones relacionadas: Memory, una memoria que persiste de una sesión a otra, y Dreaming, un «sueño» diario que la reorganiza. Memory conserva lo que el agente aprende al trabajar con cada usuario: preferencias, correcciones, lecciones extraídas de un proyecto o de un flujo de trabajo. No son resúmenes de sesiones, sino notas breves, cada una vinculada a la sesión en la que se aprendió la lección, y esta memoria sigue siendo personal: no se convierte en una instrucción compartida por toda la organización.

Las notas se almacenan en el Memory Drive, un repositorio Git persistente de archivos Markdown clasificados por repositorio, proyecto o tema. Un archivo MEMORY.md, deliberadamente breve, reúne las preferencias generales y el índice del resto: Devin lo recibe al inicio de cada sesión y luego busca las notas útiles con las herramientas que utiliza para explorar código, sin cargar todo el archivo histórico en su prompt. Cada sesión trabaja con su propia copia Git: Devin fusiona las actualizaciones de otras sesiones, una comprobación de revisión rechaza las escrituras desactualizadas y los conflictos se señalan en lugar de sobrescribirse en silencio.

Dreaming es una sesión diaria en segundo plano (por la noche, precisa el hilo de Cognition): Devin relee las conversaciones pasadas a la luz de su memoria, fusiona las notas que se solapan, elimina los detalles transitorios, busca las lecciones que no se habían anotado y borra los recuerdos que ninguna sesión ha utilizado. Se accede desde devin.ai, menú Customize → Memory; el artículo no dice nada sobre Devin Desktop ni Devin CLI y no anuncia ningún precio.

Cognition también publica el formato como estándar abierto, Agent Memory Repo, bajo licencia MIT. La especificación, abierta a contribuciones, describe el ciclo de cada sesión (clonar la memoria, buscar, actualizar sin intervención humana, hacer push después de cada modificación) y la combinación de varias memorias en una misma sesión, cada una en su propio repositorio con sus permisos y su historial. Entre los usos citados figuran la memoria de equipo y los enjambres de agentes (agent swarms):

In early experimentation we saw a swarm of Devins using the memory as a way to coordinate at large scale without us prompting them to (we promise they didn’t hack anyone)

🇪🇸 En las primeras pruebas, vimos a un enjambre de Devin utilizar la memoria para coordinarse a gran escala sin que se lo pidiéramos (lo prometemos, no han hackeado a nadie). — @cognition en X

Un «sueño» que reorganiza la memoria de un agente ya existía en Anthropic (Claude Managed Agents, en mayo) y en OpenAI (memoria de ChatGPT, en junio); lo que cambia aquí es una memoria en archivos versionados con Git, publicada como especificación que otros agentes pueden adoptar.

🔗 Memoria y sueños, artículo de Cognition 🔗 Especificación Agent Memory Repo

Cursor: dirigir los agentes de su SDK durante su ejecución

5 de octubre — Cursor amplía su SDK, que permite lanzar sus agentes desde código TypeScript o Python. El método run.steer() introduce un mensaje en el turno en curso de un agente; si un subagente está trabajando en ese momento, pasa a segundo plano y continúa. Los subagentes en segundo plano también comunican sus resultados: estos vuelven al agente principal como un turno adicional de la misma ejecución, en lugar de perderse cuando termina el turno principal.

Novedad del SDKAlcance indicado en el changelog
run.steer(), control durante la ejecuciónAgentes locales en TypeScript; en un agente cloud, el mensaje se envía como una reanudación normal
Devolución de resultados de los subagentes en segundo planoAgentes locales, en TypeScript y en Python
Anotaciones MCP de las herramientas personalizadas (readOnlyHint, destructiveHint…)TypeScript; simples indicaciones cuyo cumplimiento no impone el SDK
Prompt de sistema sustituible, reglas y skills siempre cargadosAgentes locales en TypeScript; acceso activado cuenta por cuenta

Estos cambios no vienen acompañados de ningún precio.

🔗 El hilo de Cursor en X 🔗 Changelog del SDK de Cursor

Qwen Code v0.25.0: agentes del espacio de trabajo, canal de correo electrónico y memoria Mem0

5 de octubre — Qwen publica la v0.25.0 de Qwen Code, su agente de programación en línea de comandos, primera versión estable desde la v0.24.7 del 29 de septiembre: 42 funcionalidades, de las cuales 23 son para el Managed Agent, 79 correcciones y ningún cambio incompatible conocido. Destacan tres incorporaciones, todas ellas de activación explícita. Los agentes del espacio de trabajo ahora colaboran en local: el daemon lanza y reanuda sus turnos, y el Web Shell permite gestionar agentes y tareas y llamar a uno con @agent desde una conversación. Estos agentes persistentes se abren al protocolo A2A 1.0 mediante accesos compartidos que caducan y pueden revocarse. Por último, la memoria Mem0 se conecta directamente al CLI: basta con indicar un punto de conexión y una clave, y Qwen Code registra por sí mismo el servidor MCP correspondiente. Un canal de correo electrónico también proporciona al agente su propio buzón, mediante IMAP y SMTP, y el Code Mode ejecuta en paralelo las llamadas Bash que agrupa el modelo. El SDK TypeScript v0.1.18 y la aplicación Desktop v0.25.0 se publicaron esa misma mañana, sin ningún tuit de Qwen.

🔗 Notas de la versión Qwen Code v0.25.0

5 de octubre — Together AI lanza en beta Together Link, que permite ejecutar los agentes de código ya instalados con los modelos abiertos alojados por la plataforma. Un comando de instalación (macOS o Linux) conecta Claude Code, Claude Desktop, Codex, OpenCode y Pi a su API, con la clave de la cuenta; la documentación añade ChatGPT Desktop y advierte que los comandos, el enrutamiento y la lista de modelos aún pueden cambiar. Además del modo Auto, se ofrecen cuatro modelos, todos con 1M de tokens de contexto:

Modelo ofrecidoEquivalente en el menú /model de Claude Code
Kimi K3Opus
GLM 5.3Fable
GLM 5.3 FlashSonnet
DeepSeek V4.1 FlashHaiku

El modo Auto, seleccionado por defecto, puede encomendar las tareas difíciles a Opus 5.5 cuando el usuario proporciona una clave de Anthropic, pero el artículo y la documentación no describen este enrutamiento de la misma manera: una elección realizada una sola vez por sesión para preservar la caché de prompt según el artículo, una selección por cada solicitud reservada a Claude Code y Claude Desktop según la documentación. Together AI anuncia una reducción del gasto de más del 50 %, sin publicar la metodología, y muestra después de cada sesión su coste junto al que habría tenido con Opus 5.5.

🔗 Artículo de Together AI 🔗 Documentación de Together Link

IBM Bob autoalojado se apoya en Nemotron 3 Ultra de NVIDIA

5 de octubre — IBM explica por qué la versión autoalojada (self-hosted) de Bob, su asistente de desarrollo agéntico, se apoya en Nemotron 3 Ultra de NVIDIA, junto con Poolside Laguna S 2.1. Esta opción, que pasó a disponibilidad general la semana anterior, ejecuta el asistente en la infraestructura del cliente, incluso en entornos desconectados (air-gapped). El equipo evaluó los modelos según cuatro criterios (consumo de recursos de hardware, precisión en código, latencia, apertura de los pesos), probándolos con el arnés de agente de Bob y utilizando como referencia modelos cerrados de Anthropic, OpenAI y Google. Demasiado verboso al principio, Nemotron se ajustó junto con NVIDIA: prompts, parámetros de muestreo, ajustes de razonamiento y correcciones del arnés. Según pruebas internas de IBM, Nemotron 3 Ultra ofrece hasta aproximadamente 4 veces menos latencia en GPU Blackwell que los modelos SaaS de última generación invocados a través de la red, y respeta estrictamente los esquemas de herramientas; Laguna S 2.1 se elige por su relación rendimiento/consumo de recursos. El artículo no publica ninguna puntuación de precisión.

🔗 Artículo de IBM sobre Bob autoalojado


ReviewBench: GitHub lanza un benchmark abierto de revisión de código mediante IA

5 de octubre — GitHub lanza en versión preliminar de investigación (research preview) ReviewBench, un benchmark abierto para agentes de revisión de código mediante IA. El sitio dedicado publica el conjunto de datos completo, la clasificación, la metodología, el prompt y la configuración del juez, así como un ejecutor de autoservicio. La publicación está firmada por Michelle Zhou y Alejandro Carderera de Diego, y sus agradecimientos vinculan a GitHub y Microsoft con el proyecto.

El corpus reúne 219 pull requests procedentes de 187 repositorios públicos de código abierto, en 19 lenguajes. Sus distribuciones de lenguajes y tamaños de repositorios reproducen las de GitHub, calculadas sobre 103,9 millones de pull requests, con una ponderación deliberada hacia los cambios medianos y grandes. La verdad de referencia (golden set) combina revisores humanos, problemas deducidos de los commits de seguimiento, herramientas de análisis deterministas y varios LLM de vanguardia; los hallazgos los valida un juez LLM, Claude Sonnet 5 según la publicación. Ingenieros sénior ajenos a la elaboración del conjunto volvieron a etiquetar cada hallazgo: su veredicto coincide con ReviewBench en el 96,6 % de los casos. La exhaustividad «fundamentada» (grounded), medida únicamente sobre la verdad de referencia, sirve como comparación principal.

Según la clasificación inicial de GitHub, Copilot code review ocupa el primer puesto:

Agente evaluado (configuración)F1 fundamentadoPrecisión fundamentadaExhaustividad fundamentadaFecha de ejecución
Copilot Code Review (Balanced)40,1 %87,8 %26,0 %1 de octubre de 2026
Devin AI37,0 %84,0 %23,8 %28 de septiembre de 2026
Qodo35,1 %85,3 %22,1 %28 de septiembre de 2026
Codex (GPT-5.6 Sol · Ultra)32,3 %87,0 %19,9 %19 de julio de 2026
Cubic27,3 %85,5 %16,3 %29 de junio de 2026
Greptile27,2 %86,1 %16,2 %16 de junio de 2026
Cursor17,3 %87,7 %9,6 %27 de septiembre de 2026

El sitio precisa que estas primeras entradas las produjo el equipo de ReviewBench ejecutando el producto público de cada proveedor en la fecha indicada, y que los proveedores no las ejecutaron ni verificaron. Ahora cualquiera puede presentar su agente: el candidato proporciona la imagen del contenedor y la clave del modelo, GitHub proporciona el juez, se realizan pruebas sobre 25 pull requests y después una ejecución completa en tres pasadas; una puntuación solo se publica tras la validación de un mantenedor, y únicamente si mejora la puntuación anterior del agente o si es su primera entrada.

GitHub también lo utiliza para mejorar Copilot code review. En una prueba A/B, una revisión con varios modelos del nivel Lite, que combina varias ejecuciones independientes, aumentó la exhaustividad un 13,6 % y redujo el coste por revisión un 8,0 %, en la dirección prevista en las evaluaciones offline. La publicación se contradice sobre el volumen de comentarios: +61 % según el texto, +25,0 % según su gráfico.

🔗 Publicación de GitHub sobre ReviewBench 🔗 Sitio y clasificación de ReviewBench


Cohere lanza North 2 y establece una alianza mundial con PwC

5 de octubre — Cohere lanza North 2, la nueva versión de North, su plataforma de agentes de IA para empresas, anunciada como «próximamente disponible» el 9 de septiembre y después prometida para octubre. El hilo de lanzamiento afirma que incorpora más de 15 nuevas funciones (15+ nuevas funciones), una cifra que la publicación no recoge. El núcleo de la versión es un nuevo arnés de agentes (agent harness), rediseñado para automatizaciones y agentes de varios pasos, en una plataforma que sigue siendo agnóstica: modelos de Cohere o modelos del cliente.

Área funcionalNovedades citadas por Cohere
AgentesAgentes y automatizaciones reutilizables, creados mediante prompts y compartidos en la organización; orquestación de múltiples agentes; memoria que conserva el contexto entre sesiones
ProductividadHabilidades (Skills), bibliotecas (Libraries) y aplicaciones que producen presentaciones, paneles y documentos; Automations, lanzadas a finales de julio, con plantillas listas para usar y editor visual
ConectoresSlack, SharePoint, OneDrive, Outlook, Exchange, Jira, Linear, Notion y GitHub; proveedores de datos financieros (PitchBook, FactSet y otros) solo previstos
Despliegue y seguridadAutoalojado, VPC, híbrido, en las instalaciones o completamente desconectado; SOC 2 Type 2, ISO 27001 e ISO 42001; políticas de autonomía con validación humana de las decisiones críticas
GobernanzaConsola North Admin, niveles de consumo de solicitudes y tokens por usuario o grupo, alertas antes de alcanzar los límites

Cohere cita a dos clientes, LG CNS en Corea del Sur y Bell Cyber en Canadá, y destaca un mayor rendimiento de sus modelos en GPU NVIDIA Blackwell y Hopper, sin cifras, con una cita de Kari Briski, responsable de IA generativa en NVIDIA. No se ofrecen precios ni un calendario de despliegue: la publicación remite a una demostración que debe reservarse con los equipos comerciales.

🔗 Publicación de lanzamiento de North 2 🔗 Hilo de lanzamiento de North 2 en X

La alianza mundial con PwC, que comienza en Canadá

5 de octubre — Ese mismo día, PwC y Cohere anuncian una alianza mundial (alianza global) que comienza en Canadá, en un comunicado de PwC Canada fechado en Toronto y difundido por una breve publicación de Cohere. El reparto de funciones es claro: Cohere aporta North, sus modelos empresariales y sus herramientas de recuperación de información; PwC aporta su experiencia sectorial, regulatoria, en gestión de riesgos y en transformación, desde la selección de casos de uso hasta la integración de la IA con los datos y sistemas de la empresa. Los usos anunciados abarcan la búsqueda empresarial, el acceso al conocimiento, la investigación en profundidad, el apoyo a la toma de decisiones y la automatización de tareas, en cloud privado, en las instalaciones o en un entorno desconectado, con los sectores regulados como objetivo principal. El comunicado cita a Domenic Marino y Annie Veillet, de PwC Canada, y a Aidan Gomez, de Cohere; no ofrece importes, clientes ni un calendario más allá de Canadá. Cohere ya había establecido una alianza con OpenText el 16 de septiembre.

🔗 Publicación de Cohere sobre la alianza con PwC 🔗 Comunicado de PwC Canada


Modelos abiertos: Beam, MetaEncoder-30B y Gemma 4 en genómica vegetal

Tres modelos abiertos protagonizan la actualidad del día, en tres etapas distintas: uno está prometido, otro se ha publicado sin anuncio y el último recibe atención un mes después de su publicación.

Beam: el modelo abierto de 501 mil millones de parámetros de Reflection AI

5 de octubre — Reflection AI presenta Beam, su primer modelo de pesos abiertos: un MoE disperso de 501 mil millones de parámetros, de los cuales 23 mil millones están activos, diseñado para código, razonamiento y tareas agénticas, y entrenado de principio a fin desde cero. El preentrenamiento utilizó 23 800 mil millones de tokens; la fase de aprendizaje por refuerzo empleó 10 500 GPU NVIDIA GB300 durante cuatro semanas y produjo más de 100 millones de trayectorias (rollouts).

Según las tablas de Reflection AI:

Benchmark evaluadoBeamNemotron 3 UltraGLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
SWE-bench Verified80,970,7————
SWE Bench Pro v165,546,4——67,7—
Terminal Bench v2.180,156,488,288,386,690,6
DeepSWE v1.144,4—61,068,051,074,2

Un guion indica una puntuación no recogida en la publicación. Reflection AI afirma que sus puntuaciones de razonamiento son comparables a las de GLM-5.2 con entre 3 y 4 veces menos cómputo de inferencia, y reconoce que Kimi K3 sigue por delante en capacidad bruta. Todavía no hay nada disponible para descargar: Beam está en las evaluaciones finales y las pruebas adversariales (red-teaming), el acceso anticipado requiere registrarse, y los pesos, el informe técnico, la ficha del modelo y las herramientas para desarrolladores se prometen para más adelante en octubre.

🔗 Publicación de Reflection AI sobre Beam

MetaEncoder-30B, el codificador de decisión que Meta publica sin anuncio

5 de octubre — Meta ha publicado en Hugging Face, bajo su organización facebook, MetaEncoder-30B, sin que se haya encontrado ningún anuncio: el repositorio, creado el 30 de septiembre y modificado el 5 de octubre, solo contaba con dos descargas en el momento de nuestra consulta. La ficha presenta un codificador multimodal «System One», el formato de los modelos de decisión de Jev: se le proporciona una tarea en lenguaje natural (pregunta, instrucción, descripción del estado, criterios) y una lista de candidatos, en texto con imágenes y vídeos de apoyo, y puntúa cada candidato. Como la tarea y los candidatos se codifican por separado, la comparación se reduce a un producto escalar, y un índice de vecinos más cercanos puede abarcar millones de candidatos sin volver a ejecutar el modelo. MetaEncoder es un ajuste contrastivo de Muse Glimmer 30B, el modelo agéntico de pesos abiertos publicado por Meta en agosto, del que hereda la licencia Apache 2.0; la descarga requiere aceptar unas condiciones, y vLLM lo sirve para texto e imagen.

Banco de evaluaciónPuntuación según la ficha del modeloMétrica utilizada
JEVBench (original / fácil / difícil)0,9444 / 1,0000 / 0,7387Exactitud
ImaJEV-Bench0,8958Exactitud
NanoBEIR0,6632NDCG_linear@10
MMEB-V3 (imagen / vídeo / documentos visuales)0,7897 / 0,6046 / 0,8138Hit@1 / Hit@1 / NDCG@5

🔗 Ficha de MetaEncoder-30B en Hugging Face

Living Models combina Gemma 4 y BOTANIC-1 para descifrar el ADN de las plantas

5 de octubre — Google destaca, en un X Article de @GoogleAI y en su escaparate Gemmaverse, el trabajo de Living Models, un laboratorio de biología con IA con sede en París. Gemma 4 E4B orquesta el análisis (flujos de procesamiento en terminal, filtrado de datos, llamadas a herramientas), en local mediante Ollama en una sola GPU NVIDIA L4, mientras que BOTANIC-1, un modelo fundacional genómico preentrenado con 320 especies vegetales, evalúa el efecto de las mutaciones; los genomas propietarios permanecen en las instalaciones. El caso de estudio retoma un descubrimiento realizado en el INRAE por Adnane Boualem: cambiar una sola letra en el gen CmEIN3 del melón hace que la flor pase de femenina a hermafrodita. Entre las 2 494 mutaciones puntuales candidatas, la mutación validada ocupa el primer puesto, sin empates, en menos de cuatro minutos según el X Article.

Configuración probada (20 ejecuciones)Recall@1
Sin orientación0,00
Orientación experta0,15
Con la puntuación de BOTANIC-10,90

Los modelos Botanic1 (de 0,3 a 2 mil millones de parámetros) y la prepublicación en bioRxiv datan de principios de septiembre: la novedad es esta difusión por parte de Google y el detalle de los resultados.

🔗 X Article de Google AI 🔗 Página Gemmaverse de Google DeepMind


Publicidad en ChatGPT: un formato visual en pruebas y una medición ampliada

5 de octubre — OpenAI prepara un formato publicitario visual para ChatGPT: las imágenes mostrarán la inspiración en torno a un producto, su uso o la experiencia que hace posible. La primera prueba tendrá lugar durante la generación de imágenes, con anuncios claramente etiquetados y separados de la imagen que se esté creando; comenzará más adelante este mes en Estados Unidos, con un primer grupo de anunciantes. OpenAI recuerda que la publicidad no influye en las respuestas de ChatGPT, que llega, según la empresa, a 1,2 mil millones de personas cada semana.

La mayor parte de los anuncios se centra en la medición: envío de conversiones mediante Hightouch, Tealium y LiveRamp, diez socios de atribución identificados (entre ellos AppsFlyer, Adjust y Triple Whale), experimentos geográficos de incrementalidad con Haus, Measured y WorkMagic, ventana de conversión postimpresión de un día en los informes e indicador de calidad de las señales (Event Quality Score). En cuanto a la seguridad de las marcas, los anunciantes que cumplan los requisitos pueden excluir expresiones (Negative Phrases), y se están preparando pruebas piloto de evaluación con DoubleVerify e Integral Ad Science. El píxel y la Conversions API, por su parte, existen desde el 5 de mayo.

Resultado publicado por OpenAIValor publicadoMedición realizada por
Coste por adquisición de WeightWatchers frente a su benchmark de búsqueda de pago−15,3 %DV Rockerbox
Compras incrementales de la marca Dose realizadas por nuevos clientes67 %WorkMagic
Visitantes de Portland Leather procedentes de ChatGPT Ads y nuevos para la marca93 %Triple Whale

🔗 Publicación de OpenAI sobre el nuevo formato publicitario 🔗 Publicación del blog Ads sobre la medición


Changelog de Perplexity del 5 de octubre: extensión de navegador para Computer, Wiley y Stripe Projects

5 de octubre — Perplexity publica un changelog de producto de 18 apartados, sin difusión en X en el momento de nuestra revisión. Ocho retoman anuncios ya cubiertos (Automations, Claude Opus 5.5, generación de vídeo, Skills American Express, Portable Computer en AMD, Fast Search, Profiles de la Agent API, Claude Fable 5.1), un noveno añade explicaciones 3D interactivas a los gráficos del 1 de octubre, y nueve novedades son inéditas:

Novedad inéditaPlataforma o versiónUsuarios destinatarios
Extensión para Chrome, Edge o Brave, que permite a Computer utilizar el navegador (Comet sigue siendo la opción predeterminada)Perplexity para Mac 26.38.0 y posterioresNo especificado
Tareas de Computer en pestañas y ventanas separadasPerplexity para Mac 26.37.1 y posterioresNo especificado
Modo de esfuerzo (Light, Standard, High, Ultra) en móvilesiOS 26.38.0 y Android 2.100.0, y posterioresPro, Max, Enterprise Pro, Enterprise Max
Revistas y libros de Wiley sin una suscripción independiente a WileyPerplexity y ComputerTodos los planes, cuotas premium variables
GPT-6.1 Sol, que también impulsa el esfuerzo Light de Computer en lugar de GPT-6 SolPerplexity y ComputerSuscriptores de pago que cumplan los requisitos
Conversación guiada para iniciar una primera tarea de ComputerWebNuevas cuentas gratuitas
Conexión de una aplicación desde el área de entrada (Conectar una aplicación)Computer en la WebNo especificado
Conector DocSend para las salas de datos de inversión (deal rooms)ComputerCuenta DocSend que cumpla los requisitos
Stripe Projects: clave de la API de Perplexity creada desde la CLI de StripeCLI de StripeDesarrolladores de la API de Perplexity

Con Stripe Projects, un comando crea o vincula el proyecto, genera la clave y la escribe en el archivo .env, una configuración que Perplexity propone encomendar a Claude Code, Cursor o Codex.

🔗 Changelog de Perplexity del 5 de octubre


Creación generativa: Suno Albums y HyperFrames Studio de HeyGen

Suno añade los álbumes

5 de octubre — Suno añade los álbumes, ausentes hasta ahora de su plataforma. Según la entrada que acompaña al anuncio, la función transforma sus mejores canciones en proyectos completos (proyectos de larga duración), y una lista de reproducción (playlist) que hacía las veces de álbum ahora puede convertirse en Album. Suno presenta a los artistas de los cinco primeros álbumes: naenia (Oakwood///diskrot), Old Soul (Isaiah Wallace), phenomenal (KakerMix///diskrot), Lost In a Dream (Dream Relic) y VOID (ECHLO). La empresa no especifica los planes incluidos, el número de canciones por álbum ni la fecha exacta de puesta en servicio. En junio, Suno ya preguntaba a su comunidad por su experiencia de escucha, entre listas de reproducción, álbumes y radios.

🔗 Anuncio de Suno en X 🔗 5 álbumes que no te puedes perder, blog de Suno

HyperFrames Studio, el editor de vídeo de HeyGen diseñado para los agentes

5 de octubre — HyperFrames, el framework open source de HeyGen que transforma código HTML en vídeo, se convierte en una aplicación de escritorio. HyperFrames Studio se presenta como un editor de vídeo construido desde cero para los agentes: se describe el vídeo deseado, el agente (Claude Code, Codex o un agente propio) entrega un primer montaje, y después la persona y el agente trabajan sobre la misma línea de tiempo (timeline). La dirección se ejerce mediante gestos en lugar de prompts: rodear un elemento de la imagen, fijar un comentario a una palabra o hacer un corte por cuenta propia. La aplicación exporta en 4K y afirma ofrecer cientos de fuentes de inspiración y plantillas; es gratuita según la cuenta de HyperFrames en X, y solo se ofrece una versión para macOS para su descarga. Da continuidad al adelanto Studio Preview de julio, que ya permitía editar visualmente un vídeo generado mediante código.

🔗 Anuncio de HyperFrames Studio 🔗 Difusión de HeyGen


Breves

  • Warp Factories hacia la disponibilidad general — En una entrada del 3 de octubre sobre su seminario de otoño, Warp indica que Warp Factories, su infraestructura de agentes, está pasando del acceso anticipado a la disponibilidad general, sin fecha ni precio; el equipo afirma haber reducido un 70 % su coste por PR durante el último mes gracias a ella. 🔗 fuente
  • Notas de la versión de Devin del 2 de octubre — Ahora se aplican los ajustes de acceso de Microsoft Teams, un clic selecciona todos los hallazgos de seguridad de la misma gravedad (incluida la API v3) y los plugins ofrecidos muestran sus skills, MCP, hooks y reglas antes de la instalación; la creación de entornos en grandes repositorios Perforce dispone de 3 horas en lugar de fallar tras 10 minutos. 🔗 fuente
  • MCP TikTok Ads en Replit — Replit añade TikTok Ads a su catálogo de más de 450 integraciones: una vez conectada la cuenta, su Agent puede crear y gestionar anuncios de TikTok, llegar a audiencias y medir el rendimiento desde el espacio de trabajo, sin consumir créditos por la conexión. 🔗 fuente
  • Cockle Finance en Replit — Replit fija un vídeo sobre Cockle Finance, cuya herramienta fue construida en Replit por Dan y su padre Steve para seguir la afluencia de clientes; según Replit, Dan hizo crecer su negocio un 15 % en tres meses, sin especificar la métrica. 🔗 fuente
  • Copilot CLI 1.0.92 en versión estable — Esta versión reúne las novedades de las versiones preliminares 1.0.92-0 a -5; la única novedad inédita es que, tras iniciar sesión con Microsoft Entra, el usuario elige la cuenta que utilizará, /logout cierra esas sesiones OAuth y los servidores MCP protegidos por Entra renuevan sus credenciales sin intervención. 🔗 fuente
  • Codex CLI 0.160.1 — Este parche de la 0.160.0 solo contiene un backport: las variables de Windows SYSTEMROOT, TEMP y TMP se conservan al iniciar servidores MCP stdio remotos cuyo entorno remoto está configurado explícitamente; es la última versión estable, ya que no ha salido ninguna 0.161.0 estable. 🔗 fuente
  • Nightly de Gemini CLI del 5 de octubre — No contiene ningún cambio: construida sobre el mismo commit que la del 3 de octubre, solo difiere en los números de versión, y los canales estable (v0.62.0) y preliminar (v0.63.0-preview.0) siguen sin cambios. 🔗 fuente
  • SDK TypeScript de SpaceXAI 0.2.1 — Publicada el 2 de octubre, esta versión añade toJson(schema), que valida la salida estructurada con un validador Standard Schema (Zod, Valibot o ArkType), y la opción retryBeforeOutput, que reintenta una solicitud en streaming (streaming) que haya fallado antes de producir ninguna salida; un 429 sin cabecera Retry-After ahora espera desde un segundo hasta 30 segundos, en lugar de 250 milisegundos. 🔗 fuente
  • Cresta Conductor sobre el Claude Agent SDK — En la serie de Anthropic dedicada a las startups que construyen con Claude, Cresta presenta Conductor, un constructor de agentes de atención al cliente en lenguaje natural basado en el Claude Agent SDK; según Cresta, ha reducido aproximadamente a la mitad el tiempo de despliegue inicial en sus primeros casos de uso, sin fecha de disponibilidad ni precio. 🔗 fuente
  • npm: caducidad de las configuraciones de publicación de confianza — Desde el 2 de octubre, una configuración de publicación de confianza (trusted publishing) que no se haya utilizado para ninguna publicación caduca 48 horas después de su creación, y npm también rechaza los tokens procedentes de eventos issue_comment de GitHub Actions, como ocurre con pull_request_target. 🔗 fuente
  • npm: la publicación pendiente crea paquetes — Desde el 2 de octubre, npm stage publish puede crear un paquete que aún no existe, con una sesión local o un token granular, incluso limitado a dejar la publicación pendiente (stage-only); la primera versión espera a que un mantenedor la promueva antes de poder instalarse. 🔗 fuente
  • Agent API de Perplexity con Fast Search — Los ajustes predefinidos low, medium y high de la Agent API ahora utilizan Fast Search para la herramienta web_search, pasando de 2,50 a 1 dólar por cada 1 000 invocaciones y con unos 800 ms menos de latencia; el ajuste predefinido xhigh mantiene la búsqueda estándar. 🔗 fuente
  • Guía RAG de Perplexity — Perplexity publica una guía con nueve ejemplos de generación aumentada por recuperación (retrieval-augmented generation, RAG) y siete arquitecturas, citándose a sí misma por su índice web y su función Instant Buy junto a ejemplos de terceros como Zendesk o GitHub Copilot; ninguna novedad de producto. 🔗 fuente
  • Plantilla de Cohere — Según Cohere, la empresa ha pasado de unos 400 empleados a principios de 2026 a más de 800 en la actualidad, una cifra incluida en un mensaje de contratación. 🔗 fuente
  • IsoVGRBench y Logbook en Meta — Sin anuncio, facebookresearch publica el código de IsoVGRBench, que evalúa los modelos de recompensa de vídeo sobre 16 000 pares que solo difieren en un aspecto (ante el mismo clip con las imágenes desordenadas, estos modelos responden prácticamente al azar), y el de Logbook, dedicado a los eventos de grabaciones de audio muy largas. 🔗 fuente
  • FiftyOne lee los conjuntos LeRobot v3 — Según una entrada comunitaria de Harpreet Sahota, la caja de herramientas open source FiftyOne ahora lee de forma nativa el formato LeRobot v3, sin conversor ni copia de los vídeos; la demostración abarca 497 episodios extraídos de los 50 tipos de robots del conjunto comunitario de LeRobot. 🔗 fuente
  • FetchMan-data de Ai2 — Publicado el 1 de octubre sin anuncio, este conjunto reúne 352 696 episodios simulados (52 millones de fotogramas, 902 instrucciones) de agarre de objetos por un humanoide Unitree G1, generados en MolmoSpaces, en formato LeRobot v3 y bajo licencia ODC-BY. 🔗 fuente
  • P(doom) en los perfiles de Hugging Face — Los usuarios del Hub pueden mostrar en su perfil su P(doom), su estimación de la probabilidad de que la IA provoque una catástrofe existencial; las respuestas alimentan una encuesta de la que solo se publicarán resultados agregados y anonimizados, dentro de dos semanas. 🔗 fuente
  • Extensión hf-image — Hugging Face ofrece, sin anuncio, una extensión de su CLI que construye, sube, descarga y ejecuta imágenes de contenedores en su registro cr.hf.co; Xet deduplica las capas sin comprimir, de modo que una capa de 2 Go modificada en 100 Mo solo transmite unos 100 Mo según el README. 🔗 fuente
  • Tres experimentos de Milos Kotlar — En tres entradas comunitarias, Milos Kotlar hace que la caché KV de un pequeño transformer sea 2,71 veces más compacta con un 97,85 % de coincidencia en el siguiente token, y reduce la proporción de tokens sin experto en un enrutamiento MoE del 13,84 % al 8,09 %, sin ninguna mejora de velocidad. 🔗 fuente
  • Auditoría de un juez LLM por Stephen Yu — Stephen Yu ha auditado, sobre 38 400 muestras, el juez GLM-5.3 que puntúa la fidelidad a los hechos en la recompensa GRPO de su modelo de reescritura de 12B: fiable para detectar que un hecho ha cambiado, con ruido al evaluar su gravedad; contar las salidas erróneas revela una reducción del 39 % que el primer recuento ocultaba. 🔗 fuente
  • Simposio de Sakana AI en Tokio — Sakana AI abre las inscripciones para un simposio gratuito el 26 de octubre en el Hitotsubashi Hall de Tokio, en inglés, con una conferencia de Jürgen Schmidhuber y una entrevista con David Ha, CEO de Sakana AI. 🔗 fuente
  • Startups de NVIDIA Inception y cáncer de mama — NVIDIA presenta cuatro startups de su programa Inception que aplican la IA al proceso asistencial, entre ellas iSono Health y su ecógrafo 3D ATUSA autorizado por la FDA (unos dos minutos por mama frente a hasta 45 minutos de forma manual), Whiterabbit.ai, Ataraxis AI y SimBioSys; algunas de estas tecnologías no están aprobadas por la FDA. 🔗 fuente

Qué significa

La procedencia del texto se convierte en una obligación normativa. Hasta ahora, la trazabilidad de los contenidos generados se centraba sobre todo en la imagen y el audio, con marcas de agua y metadatos verificables; la AI Act extiende la exigencia al texto, y OpenAI responde por etapas: marca de agua aplicada por defecto al texto de ChatGPT y de Codex en la Unión Europea, opción voluntaria en la API y detector reservado a organizaciones aprobadas. Las cifras publicadas explican esta prudencia: se detecta alrededor del 95 % de los pasajes de 400 tokens en contenido de temática psicológica, con un objetivo del 1 % de falsos positivos, pero, en pasajes de 400 tokens en inglés, sustituir el 10 % de las palabras por sinónimos reduce la detección de aproximadamente el 92 % al 66 %, y una reescritura o una traducción puede borrar la marca de agua. La marca de agua ofrece un indicio de procedencia, no una prueba, y su ausencia no dice nada sobre el autor.

La memoria de los agentes se consolida y empieza a estandarizarse. Devin guarda sus lecciones en un repositorio Git de archivos Markdown que Dreaming reorganiza cada día, y Cognition publica el formato bajo licencia MIT para que otros agentes lo adopten; North 2 conserva el contexto entre sesiones; Qwen Code conecta Mem0 directamente a su CLI. Los enfoques difieren, entre archivos versionados legibles por una persona, un servicio de memoria externo y una función integrada en una plataforma, pero responden a la misma necesidad: que un agente no empiece de cero en cada sesión. La elección de Cognition tiene una ventaja práctica: cada nota remite a la sesión en la que se aprendió, puede consultarse en la interfaz y conserva su historial Git, lo que permite leer y corregir lo que el agente ha retenido.

Los modelos abiertos entran en las herramientas de programación por varias vías. Together Link los conecta a agentes existentes, incluidos Claude Code y Codex, y anuncia una reducción del gasto de más de la mitad; IBM ejecuta la versión autoalojada de Bob sobre Nemotron 3 Ultra para las empresas que mantienen su desarrollo en su propia infraestructura, incluidos los entornos desconectados; Reflection AI presenta Beam como un modelo abierto diseñado para el código y las tareas agénticas, con 80,9 en SWE-bench Verified según sus propias tablas. El argumento común se apoya menos en la puntuación bruta, donde Reflection AI reconoce que Kimi K3 sigue por delante, que en el coste, la latencia y el control de los datos.

Muchas de las cifras del día proceden de quienes las publican. GitHub ha diseñado ReviewBench y ha elaborado la clasificación inicial en la que Copilot code review ocupa el primer puesto, sin ejecución ni verificación por parte de los demás proveedores; la latencia de Nemotron 3 Ultra procede de pruebas internas de IBM; los ahorros de Together Link y los resultados publicitarios de ChatGPT son los que anuncian Together AI y OpenAI. GitHub, sin embargo, publica su conjunto de datos, su juez y su metodología, y abre la recepción de propuestas: cada proveedor puede repetir la medición con su propio agente. Eso permitirá determinar si esta clasificación inicial se sostiene.


Fuentes