ai-powered-markdown-translatorArtículo traducido del francés al español con gpt-6.1-sol.
OpenAI añadirá en las próximas semanas una marca de agua invisible al texto de ChatGPT y de Codex para sus usuarios de la Unión Europea, en respuesta al AI Act, que exige que el texto generado sea identificable por una máquina, y ofrece desde hoy esta marca de agua como opción a los clientes de su API en todo el mundo. En el ámbito de los agentes, la memoria se afianza: Cognition dota a Devin de una memoria entre sesiones y publica su formato como estándar abierto, y Cohere lanza North 2 con una memoria que conserva el contexto de una sesión a otra; GitHub, por su parte, publica ReviewBench, un benchmark abierto de revisión de código mediante IA. En cuanto a los modelos abiertos, Reflection AI presenta Beam, con 501 mil millones de parámetros, cuyos pesos promete publicar más adelante en octubre.
Marca de agua invisible de OpenAI: el texto de ChatGPT y Codex se marcará en la Unión Europea, una opción mundial en la API
5 de octubre — OpenAI publica su respuesta a las normas europeas sobre la procedencia del texto. El AI Act exige a los proveedores de IA generativa que el texto que producen sea identificable de forma legible por una máquina; OpenAI responde por etapas, advirtiendo desde el principio que las tecnologías actuales de marcas de agua para texto tienen limitaciones importantes (limitaciones significativas).
| Público al que afecta | Qué cambia | Calendario anunciado |
|---|---|---|
| Usuarios de ChatGPT y de Codex en la Unión Europea, todos los planes | Marca de agua invisible añadida al texto que cumple los requisitos | En las próximas semanas |
| Clientes de la API, en todo el mundo | Marca de agua opcional (opt-in) en modelos seleccionados, sin especificar, desactivada por defecto | Desde el 5 de octubre |
| Investigadores y organizaciones expertas aprobados | Acceso al detector, caso por caso, previa solicitud | Solicitudes abiertas el 5 de octubre |
OpenAI no la convierte en una configuración mundial por defecto y trabaja con socios de servicios cloud para ofrecer, en las próximas semanas, la misma marca de agua en los modelos de OpenAI que ofrecen. La tecnología, textGrain, añade una señal estadística invisible a las elecciones de palabras del modelo, sin marcas visibles ni caracteres especiales; según OpenAI, iguala o supera los otros enfoques probados, incluido SynthID para texto. Se publica un informe técnico y OpenAI prevé abrir su código. El detector, por su parte, no es público en el lanzamiento, debido al riesgo de marcas de agua no detectadas y de falsos positivos: el acceso sigue el Código de Buenas Prácticas (Código de Buenas Prácticas) de la Comisión Europea.
Las cifras publicadas muestran sobre todo las limitaciones de la detección:
| Condición de medición | Tasa de detección publicada |
|---|---|
| Fragmentos de 200 tokens, contenido de tipo psicología, objetivo de 1 % de falsos positivos | aproximadamente 80 % |
| Fragmentos de 400 tokens, contenido de tipo psicología, objetivo de 1 % de falsos positivos | aproximadamente 95 % |
| Contenido de tipo matemáticas, mismo umbral de 1 % | considerablemente más baja (valor indicado solo en un gráfico) |
| Fragmentos de 400 tokens en inglés (conjunto ELI5), sin modificar | aproximadamente 92 % |
| Mismos fragmentos, 10 % de las palabras sustituidas por sinónimos | 66 % |
| Mismos fragmentos, 25 % de las palabras sustituidas | 17 % |
Watermarks have limits. They’re often undetectable, especially in short passages. Rewriting or translating text can completely remove the watermark.
🇪🇸 Las marcas de agua tienen limitaciones. A menudo son indetectables, especialmente en fragmentos cortos. Reescribir o traducir un texto puede eliminar por completo la marca de agua. — @OpenAI en X
En cuanto a la calidad, OpenAI no mide diferencias significativas en ocho benchmarks de GPT-6 Astra sin y con marca de agua (94,44 % frente a 93,94 % en GPQA Diamond, 53,90 % frente a 56,06 % en Terminal-Bench 4.0). El artículo también precisa lo que una marca de agua no indica: ni la proporción de trabajo humano, ni la propiedad o la responsabilidad del texto, ni la identidad del usuario, ni la exactitud; y su ausencia no demuestra que un humano haya escrito el texto. Para las imágenes y el audio, nada cambia: openai.com/verify y la Content Provenance API siguen siendo accesibles para las organizaciones, y SynthID se añade desde el 19 de mayo a los metadatos C2PA de las imágenes generadas.
🔗 Artículo de OpenAI sobre la procedencia del texto en la UE
Agentes de código: Devin recuerda entre sesiones, Cursor, Qwen Code, Together Link e IBM Bob
5 de octubre — Cognition introduce en Devin dos funciones relacionadas: Memory, una memoria que persiste de una sesión a otra, y Dreaming, un «sueño» diario que la reorganiza. Memory conserva lo que el agente aprende al trabajar con cada usuario: preferencias, correcciones, lecciones extraídas de un proyecto o de un flujo de trabajo. No son resúmenes de sesiones, sino notas breves, cada una vinculada a la sesión en la que se aprendió la lección, y esta memoria sigue siendo personal: no se convierte en una instrucción compartida por toda la organización.
Las notas se almacenan en el Memory Drive, un repositorio Git persistente de archivos Markdown clasificados por repositorio, proyecto o tema. Un archivo MEMORY.md, deliberadamente breve, reúne las preferencias generales y el índice del resto: Devin lo recibe al inicio de cada sesión y luego busca las notas útiles con las herramientas que utiliza para explorar código, sin cargar todo el archivo histórico en su prompt. Cada sesión trabaja con su propia copia Git: Devin fusiona las actualizaciones de otras sesiones, una comprobación de revisión rechaza las escrituras desactualizadas y los conflictos se señalan en lugar de sobrescribirse en silencio.
Dreaming es una sesión diaria en segundo plano (por la noche, precisa el hilo de Cognition): Devin relee las conversaciones pasadas a la luz de su memoria, fusiona las notas que se solapan, elimina los detalles transitorios, busca las lecciones que no se habían anotado y borra los recuerdos que ninguna sesión ha utilizado. Se accede desde devin.ai, menú Customize → Memory; el artículo no dice nada sobre Devin Desktop ni Devin CLI y no anuncia ningún precio.
Cognition también publica el formato como estándar abierto, Agent Memory Repo, bajo licencia MIT. La especificación, abierta a contribuciones, describe el ciclo de cada sesión (clonar la memoria, buscar, actualizar sin intervención humana, hacer push después de cada modificación) y la combinación de varias memorias en una misma sesión, cada una en su propio repositorio con sus permisos y su historial. Entre los usos citados figuran la memoria de equipo y los enjambres de agentes (agent swarms):
In early experimentation we saw a swarm of Devins using the memory as a way to coordinate at large scale without us prompting them to (we promise they didn’t hack anyone)
🇪🇸 En las primeras pruebas, vimos a un enjambre de Devin utilizar la memoria para coordinarse a gran escala sin que se lo pidiéramos (lo prometemos, no han hackeado a nadie). — @cognition en X
Un «sueño» que reorganiza la memoria de un agente ya existía en Anthropic (Claude Managed Agents, en mayo) y en OpenAI (memoria de ChatGPT, en junio); lo que cambia aquí es una memoria en archivos versionados con Git, publicada como especificación que otros agentes pueden adoptar.
🔗 Memoria y sueños, artículo de Cognition 🔗 Especificación Agent Memory Repo
Cursor: dirigir los agentes de su SDK durante su ejecución
5 de octubre — Cursor amplía su SDK, que permite lanzar sus agentes desde código TypeScript o Python. El método run.steer() introduce un mensaje en el turno en curso de un agente; si un subagente está trabajando en ese momento, pasa a segundo plano y continúa. Los subagentes en segundo plano también comunican sus resultados: estos vuelven al agente principal como un turno adicional de la misma ejecución, en lugar de perderse cuando termina el turno principal.
| Novedad del SDK | Alcance indicado en el changelog |
|---|---|
run.steer(), control durante la ejecución | Agentes locales en TypeScript; en un agente cloud, el mensaje se envía como una reanudación normal |
| Devolución de resultados de los subagentes en segundo plano | Agentes locales, en TypeScript y en Python |
| Anotaciones MCP de las herramientas personalizadas (readOnlyHint, destructiveHint…) | TypeScript; simples indicaciones cuyo cumplimiento no impone el SDK |
| Prompt de sistema sustituible, reglas y skills siempre cargados | Agentes locales en TypeScript; acceso activado cuenta por cuenta |
Estos cambios no vienen acompañados de ningún precio.
🔗 El hilo de Cursor en X 🔗 Changelog del SDK de Cursor
Qwen Code v0.25.0: agentes del espacio de trabajo, canal de correo electrónico y memoria Mem0
5 de octubre — Qwen publica la v0.25.0 de Qwen Code, su agente de programación en línea de comandos, primera versión estable desde la v0.24.7 del 29 de septiembre: 42 funcionalidades, de las cuales 23 son para el Managed Agent, 79 correcciones y ningún cambio incompatible conocido. Destacan tres incorporaciones, todas ellas de activación explícita. Los agentes del espacio de trabajo ahora colaboran en local: el daemon lanza y reanuda sus turnos, y el Web Shell permite gestionar agentes y tareas y llamar a uno con @agent desde una conversación. Estos agentes persistentes se abren al protocolo A2A 1.0 mediante accesos compartidos que caducan y pueden revocarse. Por último, la memoria Mem0 se conecta directamente al CLI: basta con indicar un punto de conexión y una clave, y Qwen Code registra por sí mismo el servidor MCP correspondiente. Un canal de correo electrónico también proporciona al agente su propio buzón, mediante IMAP y SMTP, y el Code Mode ejecuta en paralelo las llamadas Bash que agrupa el modelo. El SDK TypeScript v0.1.18 y la aplicación Desktop v0.25.0 se publicaron esa misma mañana, sin ningún tuit de Qwen.
🔗 Notas de la versión Qwen Code v0.25.0
Together Link: Claude Code, Codex, OpenCode y Pi con modelos abiertos
5 de octubre — Together AI lanza en beta Together Link, que permite ejecutar los agentes de código ya instalados con los modelos abiertos alojados por la plataforma. Un comando de instalación (macOS o Linux) conecta Claude Code, Claude Desktop, Codex, OpenCode y Pi a su API, con la clave de la cuenta; la documentación añade ChatGPT Desktop y advierte que los comandos, el enrutamiento y la lista de modelos aún pueden cambiar. Además del modo Auto, se ofrecen cuatro modelos, todos con 1M de tokens de contexto:
| Modelo ofrecido | Equivalente en el menú /model de Claude Code |
|---|---|
| Kimi K3 | Opus |
| GLM 5.3 | Fable |
| GLM 5.3 Flash | Sonnet |
| DeepSeek V4.1 Flash | Haiku |
El modo Auto, seleccionado por defecto, puede encomendar las tareas difíciles a Opus 5.5 cuando el usuario proporciona una clave de Anthropic, pero el artículo y la documentación no describen este enrutamiento de la misma manera: una elección realizada una sola vez por sesión para preservar la caché de prompt según el artículo, una selección por cada solicitud reservada a Claude Code y Claude Desktop según la documentación. Together AI anuncia una reducción del gasto de más del 50 %, sin publicar la metodología, y muestra después de cada sesión su coste junto al que habría tenido con Opus 5.5.
🔗 Artículo de Together AI 🔗 Documentación de Together Link
IBM Bob autoalojado se apoya en Nemotron 3 Ultra de NVIDIA
5 de octubre — IBM explica por qué la versión autoalojada (self-hosted) de Bob, su asistente de desarrollo agéntico, se apoya en Nemotron 3 Ultra de NVIDIA, junto con Poolside Laguna S 2.1. Esta opción, que pasó a disponibilidad general la semana anterior, ejecuta el asistente en la infraestructura del cliente, incluso en entornos desconectados (air-gapped). El equipo evaluó los modelos según cuatro criterios (consumo de recursos de hardware, precisión en código, latencia, apertura de los pesos), probándolos con el arnés de agente de Bob y utilizando como referencia modelos cerrados de Anthropic, OpenAI y Google. Demasiado verboso al principio, Nemotron se ajustó junto con NVIDIA: prompts, parámetros de muestreo, ajustes de razonamiento y correcciones del arnés. Según pruebas internas de IBM, Nemotron 3 Ultra ofrece hasta aproximadamente 4 veces menos latencia en GPU Blackwell que los modelos SaaS de última generación invocados a través de la red, y respeta estrictamente los esquemas de herramientas; Laguna S 2.1 se elige por su relación rendimiento/consumo de recursos. El artículo no publica ninguna puntuación de precisión.
🔗 Artículo de IBM sobre Bob autoalojado
ReviewBench: GitHub lanza un benchmark abierto de revisión de código mediante IA
5 de octubre — GitHub lanza en versión preliminar de investigación (research preview) ReviewBench, un benchmark abierto para agentes de revisión de código mediante IA. El sitio dedicado publica el conjunto de datos completo, la clasificación, la metodología, el prompt y la configuración del juez, así como un ejecutor de autoservicio. La publicación está firmada por Michelle Zhou y Alejandro Carderera de Diego, y sus agradecimientos vinculan a GitHub y Microsoft con el proyecto.
El corpus reúne 219 pull requests procedentes de 187 repositorios públicos de código abierto, en 19 lenguajes. Sus distribuciones de lenguajes y tamaños de repositorios reproducen las de GitHub, calculadas sobre 103,9 millones de pull requests, con una ponderación deliberada hacia los cambios medianos y grandes. La verdad de referencia (golden set) combina revisores humanos, problemas deducidos de los commits de seguimiento, herramientas de análisis deterministas y varios LLM de vanguardia; los hallazgos los valida un juez LLM, Claude Sonnet 5 según la publicación. Ingenieros sénior ajenos a la elaboración del conjunto volvieron a etiquetar cada hallazgo: su veredicto coincide con ReviewBench en el 96,6 % de los casos. La exhaustividad «fundamentada» (grounded), medida únicamente sobre la verdad de referencia, sirve como comparación principal.
Según la clasificación inicial de GitHub, Copilot code review ocupa el primer puesto:
| Agente evaluado (configuración) | F1 fundamentado | Precisión fundamentada | Exhaustividad fundamentada | Fecha de ejecución |
|---|---|---|---|---|
| Copilot Code Review (Balanced) | 40,1 % | 87,8 % | 26,0 % | 1 de octubre de 2026 |
| Devin AI | 37,0 % | 84,0 % | 23,8 % | 28 de septiembre de 2026 |
| Qodo | 35,1 % | 85,3 % | 22,1 % | 28 de septiembre de 2026 |
| Codex (GPT-5.6 Sol · Ultra) | 32,3 % | 87,0 % | 19,9 % | 19 de julio de 2026 |
| Cubic | 27,3 % | 85,5 % | 16,3 % | 29 de junio de 2026 |
| Greptile | 27,2 % | 86,1 % | 16,2 % | 16 de junio de 2026 |
| Cursor | 17,3 % | 87,7 % | 9,6 % | 27 de septiembre de 2026 |
El sitio precisa que estas primeras entradas las produjo el equipo de ReviewBench ejecutando el producto público de cada proveedor en la fecha indicada, y que los proveedores no las ejecutaron ni verificaron. Ahora cualquiera puede presentar su agente: el candidato proporciona la imagen del contenedor y la clave del modelo, GitHub proporciona el juez, se realizan pruebas sobre 25 pull requests y después una ejecución completa en tres pasadas; una puntuación solo se publica tras la validación de un mantenedor, y únicamente si mejora la puntuación anterior del agente o si es su primera entrada.
GitHub también lo utiliza para mejorar Copilot code review. En una prueba A/B, una revisión con varios modelos del nivel Lite, que combina varias ejecuciones independientes, aumentó la exhaustividad un 13,6 % y redujo el coste por revisión un 8,0 %, en la dirección prevista en las evaluaciones offline. La publicación se contradice sobre el volumen de comentarios: +61 % según el texto, +25,0 % según su gráfico.
🔗 Publicación de GitHub sobre ReviewBench 🔗 Sitio y clasificación de ReviewBench
Cohere lanza North 2 y establece una alianza mundial con PwC
5 de octubre — Cohere lanza North 2, la nueva versión de North, su plataforma de agentes de IA para empresas, anunciada como «próximamente disponible» el 9 de septiembre y después prometida para octubre. El hilo de lanzamiento afirma que incorpora más de 15 nuevas funciones (15+ nuevas funciones), una cifra que la publicación no recoge. El núcleo de la versión es un nuevo arnés de agentes (agent harness), rediseñado para automatizaciones y agentes de varios pasos, en una plataforma que sigue siendo agnóstica: modelos de Cohere o modelos del cliente.
| Área funcional | Novedades citadas por Cohere |
|---|---|
| Agentes | Agentes y automatizaciones reutilizables, creados mediante prompts y compartidos en la organización; orquestación de múltiples agentes; memoria que conserva el contexto entre sesiones |
| Productividad | Habilidades (Skills), bibliotecas (Libraries) y aplicaciones que producen presentaciones, paneles y documentos; Automations, lanzadas a finales de julio, con plantillas listas para usar y editor visual |
| Conectores | Slack, SharePoint, OneDrive, Outlook, Exchange, Jira, Linear, Notion y GitHub; proveedores de datos financieros (PitchBook, FactSet y otros) solo previstos |
| Despliegue y seguridad | Autoalojado, VPC, híbrido, en las instalaciones o completamente desconectado; SOC 2 Type 2, ISO 27001 e ISO 42001; políticas de autonomía con validación humana de las decisiones críticas |
| Gobernanza | Consola North Admin, niveles de consumo de solicitudes y tokens por usuario o grupo, alertas antes de alcanzar los límites |
Cohere cita a dos clientes, LG CNS en Corea del Sur y Bell Cyber en Canadá, y destaca un mayor rendimiento de sus modelos en GPU NVIDIA Blackwell y Hopper, sin cifras, con una cita de Kari Briski, responsable de IA generativa en NVIDIA. No se ofrecen precios ni un calendario de despliegue: la publicación remite a una demostración que debe reservarse con los equipos comerciales.
🔗 Publicación de lanzamiento de North 2 🔗 Hilo de lanzamiento de North 2 en X
La alianza mundial con PwC, que comienza en Canadá
5 de octubre — Ese mismo día, PwC y Cohere anuncian una alianza mundial (alianza global) que comienza en Canadá, en un comunicado de PwC Canada fechado en Toronto y difundido por una breve publicación de Cohere. El reparto de funciones es claro: Cohere aporta North, sus modelos empresariales y sus herramientas de recuperación de información; PwC aporta su experiencia sectorial, regulatoria, en gestión de riesgos y en transformación, desde la selección de casos de uso hasta la integración de la IA con los datos y sistemas de la empresa. Los usos anunciados abarcan la búsqueda empresarial, el acceso al conocimiento, la investigación en profundidad, el apoyo a la toma de decisiones y la automatización de tareas, en cloud privado, en las instalaciones o en un entorno desconectado, con los sectores regulados como objetivo principal. El comunicado cita a Domenic Marino y Annie Veillet, de PwC Canada, y a Aidan Gomez, de Cohere; no ofrece importes, clientes ni un calendario más allá de Canadá. Cohere ya había establecido una alianza con OpenText el 16 de septiembre.
🔗 Publicación de Cohere sobre la alianza con PwC 🔗 Comunicado de PwC Canada
Modelos abiertos: Beam, MetaEncoder-30B y Gemma 4 en genómica vegetal
Tres modelos abiertos protagonizan la actualidad del día, en tres etapas distintas: uno está prometido, otro se ha publicado sin anuncio y el último recibe atención un mes después de su publicación.
Beam: el modelo abierto de 501 mil millones de parámetros de Reflection AI
5 de octubre — Reflection AI presenta Beam, su primer modelo de pesos abiertos: un MoE disperso de 501 mil millones de parámetros, de los cuales 23 mil millones están activos, diseñado para código, razonamiento y tareas agénticas, y entrenado de principio a fin desde cero. El preentrenamiento utilizó 23 800 mil millones de tokens; la fase de aprendizaje por refuerzo empleó 10 500 GPU NVIDIA GB300 durante cuatro semanas y produjo más de 100 millones de trayectorias (rollouts).
Según las tablas de Reflection AI:
| Benchmark evaluado | Beam | Nemotron 3 Ultra | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|
| SWE-bench Verified | 80,9 | 70,7 | — | — | — | — |
| SWE Bench Pro v1 | 65,5 | 46,4 | — | — | 67,7 | — |
| Terminal Bench v2.1 | 80,1 | 56,4 | 88,2 | 88,3 | 86,6 | 90,6 |
| DeepSWE v1.1 | 44,4 | — | 61,0 | 68,0 | 51,0 | 74,2 |
Un guion indica una puntuación no recogida en la publicación. Reflection AI afirma que sus puntuaciones de razonamiento son comparables a las de GLM-5.2 con entre 3 y 4 veces menos cómputo de inferencia, y reconoce que Kimi K3 sigue por delante en capacidad bruta. Todavía no hay nada disponible para descargar: Beam está en las evaluaciones finales y las pruebas adversariales (red-teaming), el acceso anticipado requiere registrarse, y los pesos, el informe técnico, la ficha del modelo y las herramientas para desarrolladores se prometen para más adelante en octubre.
🔗 Publicación de Reflection AI sobre Beam
MetaEncoder-30B, el codificador de decisión que Meta publica sin anuncio
5 de octubre — Meta ha publicado en Hugging Face, bajo su organización facebook, MetaEncoder-30B, sin que se haya encontrado ningún anuncio: el repositorio, creado el 30 de septiembre y modificado el 5 de octubre, solo contaba con dos descargas en el momento de nuestra consulta. La ficha presenta un codificador multimodal «System One», el formato de los modelos de decisión de Jev: se le proporciona una tarea en lenguaje natural (pregunta, instrucción, descripción del estado, criterios) y una lista de candidatos, en texto con imágenes y vídeos de apoyo, y puntúa cada candidato. Como la tarea y los candidatos se codifican por separado, la comparación se reduce a un producto escalar, y un índice de vecinos más cercanos puede abarcar millones de candidatos sin volver a ejecutar el modelo. MetaEncoder es un ajuste contrastivo de Muse Glimmer 30B, el modelo agéntico de pesos abiertos publicado por Meta en agosto, del que hereda la licencia Apache 2.0; la descarga requiere aceptar unas condiciones, y vLLM lo sirve para texto e imagen.
| Banco de evaluación | Puntuación según la ficha del modelo | Métrica utilizada |
|---|---|---|
| JEVBench (original / fácil / difícil) | 0,9444 / 1,0000 / 0,7387 | Exactitud |
| ImaJEV-Bench | 0,8958 | Exactitud |
| NanoBEIR | 0,6632 | NDCG_linear@10 |
| MMEB-V3 (imagen / vídeo / documentos visuales) | 0,7897 / 0,6046 / 0,8138 | Hit@1 / Hit@1 / NDCG@5 |
🔗 Ficha de MetaEncoder-30B en Hugging Face
Living Models combina Gemma 4 y BOTANIC-1 para descifrar el ADN de las plantas
5 de octubre — Google destaca, en un X Article de @GoogleAI y en su escaparate Gemmaverse, el trabajo de Living Models, un laboratorio de biología con IA con sede en París. Gemma 4 E4B orquesta el análisis (flujos de procesamiento en terminal, filtrado de datos, llamadas a herramientas), en local mediante Ollama en una sola GPU NVIDIA L4, mientras que BOTANIC-1, un modelo fundacional genómico preentrenado con 320 especies vegetales, evalúa el efecto de las mutaciones; los genomas propietarios permanecen en las instalaciones. El caso de estudio retoma un descubrimiento realizado en el INRAE por Adnane Boualem: cambiar una sola letra en el gen CmEIN3 del melón hace que la flor pase de femenina a hermafrodita. Entre las 2 494 mutaciones puntuales candidatas, la mutación validada ocupa el primer puesto, sin empates, en menos de cuatro minutos según el X Article.
| Configuración probada (20 ejecuciones) | Recall@1 |
|---|---|
| Sin orientación | 0,00 |
| Orientación experta | 0,15 |
| Con la puntuación de BOTANIC-1 | 0,90 |
Los modelos Botanic1 (de 0,3 a 2 mil millones de parámetros) y la prepublicación en bioRxiv datan de principios de septiembre: la novedad es esta difusión por parte de Google y el detalle de los resultados.
🔗 X Article de Google AI 🔗 Página Gemmaverse de Google DeepMind
Publicidad en ChatGPT: un formato visual en pruebas y una medición ampliada
5 de octubre — OpenAI prepara un formato publicitario visual para ChatGPT: las imágenes mostrarán la inspiración en torno a un producto, su uso o la experiencia que hace posible. La primera prueba tendrá lugar durante la generación de imágenes, con anuncios claramente etiquetados y separados de la imagen que se esté creando; comenzará más adelante este mes en Estados Unidos, con un primer grupo de anunciantes. OpenAI recuerda que la publicidad no influye en las respuestas de ChatGPT, que llega, según la empresa, a 1,2 mil millones de personas cada semana.
La mayor parte de los anuncios se centra en la medición: envío de conversiones mediante Hightouch, Tealium y LiveRamp, diez socios de atribución identificados (entre ellos AppsFlyer, Adjust y Triple Whale), experimentos geográficos de incrementalidad con Haus, Measured y WorkMagic, ventana de conversión postimpresión de un día en los informes e indicador de calidad de las señales (Event Quality Score). En cuanto a la seguridad de las marcas, los anunciantes que cumplan los requisitos pueden excluir expresiones (Negative Phrases), y se están preparando pruebas piloto de evaluación con DoubleVerify e Integral Ad Science. El píxel y la Conversions API, por su parte, existen desde el 5 de mayo.
| Resultado publicado por OpenAI | Valor publicado | Medición realizada por |
|---|---|---|
| Coste por adquisición de WeightWatchers frente a su benchmark de búsqueda de pago | −15,3 % | DV Rockerbox |
| Compras incrementales de la marca Dose realizadas por nuevos clientes | 67 % | WorkMagic |
| Visitantes de Portland Leather procedentes de ChatGPT Ads y nuevos para la marca | 93 % | Triple Whale |
🔗 Publicación de OpenAI sobre el nuevo formato publicitario 🔗 Publicación del blog Ads sobre la medición
Changelog de Perplexity del 5 de octubre: extensión de navegador para Computer, Wiley y Stripe Projects
5 de octubre — Perplexity publica un changelog de producto de 18 apartados, sin difusión en X en el momento de nuestra revisión. Ocho retoman anuncios ya cubiertos (Automations, Claude Opus 5.5, generación de vídeo, Skills American Express, Portable Computer en AMD, Fast Search, Profiles de la Agent API, Claude Fable 5.1), un noveno añade explicaciones 3D interactivas a los gráficos del 1 de octubre, y nueve novedades son inéditas:
| Novedad inédita | Plataforma o versión | Usuarios destinatarios |
|---|---|---|
| Extensión para Chrome, Edge o Brave, que permite a Computer utilizar el navegador (Comet sigue siendo la opción predeterminada) | Perplexity para Mac 26.38.0 y posteriores | No especificado |
| Tareas de Computer en pestañas y ventanas separadas | Perplexity para Mac 26.37.1 y posteriores | No especificado |
| Modo de esfuerzo (Light, Standard, High, Ultra) en móviles | iOS 26.38.0 y Android 2.100.0, y posteriores | Pro, Max, Enterprise Pro, Enterprise Max |
| Revistas y libros de Wiley sin una suscripción independiente a Wiley | Perplexity y Computer | Todos los planes, cuotas premium variables |
| GPT-6.1 Sol, que también impulsa el esfuerzo Light de Computer en lugar de GPT-6 Sol | Perplexity y Computer | Suscriptores de pago que cumplan los requisitos |
| Conversación guiada para iniciar una primera tarea de Computer | Web | Nuevas cuentas gratuitas |
| Conexión de una aplicación desde el área de entrada (Conectar una aplicación) | Computer en la Web | No especificado |
| Conector DocSend para las salas de datos de inversión (deal rooms) | Computer | Cuenta DocSend que cumpla los requisitos |
| Stripe Projects: clave de la API de Perplexity creada desde la CLI de Stripe | CLI de Stripe | Desarrolladores de la API de Perplexity |
Con Stripe Projects, un comando crea o vincula el proyecto, genera la clave y la escribe en el archivo .env, una configuración que Perplexity propone encomendar a Claude Code, Cursor o Codex.
🔗 Changelog de Perplexity del 5 de octubre
Creación generativa: Suno Albums y HyperFrames Studio de HeyGen
Suno añade los álbumes
5 de octubre — Suno añade los álbumes, ausentes hasta ahora de su plataforma. Según la entrada que acompaña al anuncio, la función transforma sus mejores canciones en proyectos completos (proyectos de larga duración), y una lista de reproducción (playlist) que hacía las veces de álbum ahora puede convertirse en Album. Suno presenta a los artistas de los cinco primeros álbumes: naenia (Oakwood///diskrot), Old Soul (Isaiah Wallace), phenomenal (KakerMix///diskrot), Lost In a Dream (Dream Relic) y VOID (ECHLO). La empresa no especifica los planes incluidos, el número de canciones por álbum ni la fecha exacta de puesta en servicio. En junio, Suno ya preguntaba a su comunidad por su experiencia de escucha, entre listas de reproducción, álbumes y radios.
🔗 Anuncio de Suno en X 🔗 5 álbumes que no te puedes perder, blog de Suno
HyperFrames Studio, el editor de vídeo de HeyGen diseñado para los agentes
5 de octubre — HyperFrames, el framework open source de HeyGen que transforma código HTML en vídeo, se convierte en una aplicación de escritorio. HyperFrames Studio se presenta como un editor de vídeo construido desde cero para los agentes: se describe el vídeo deseado, el agente (Claude Code, Codex o un agente propio) entrega un primer montaje, y después la persona y el agente trabajan sobre la misma línea de tiempo (timeline). La dirección se ejerce mediante gestos en lugar de prompts: rodear un elemento de la imagen, fijar un comentario a una palabra o hacer un corte por cuenta propia. La aplicación exporta en 4K y afirma ofrecer cientos de fuentes de inspiración y plantillas; es gratuita según la cuenta de HyperFrames en X, y solo se ofrece una versión para macOS para su descarga. Da continuidad al adelanto Studio Preview de julio, que ya permitía editar visualmente un vídeo generado mediante código.
🔗 Anuncio de HyperFrames Studio 🔗 Difusión de HeyGen
Breves
- Warp Factories hacia la disponibilidad general — En una entrada del 3 de octubre sobre su seminario de otoño, Warp indica que Warp Factories, su infraestructura de agentes, está pasando del acceso anticipado a la disponibilidad general, sin fecha ni precio; el equipo afirma haber reducido un 70 % su coste por PR durante el último mes gracias a ella. 🔗 fuente
- Notas de la versión de Devin del 2 de octubre — Ahora se aplican los ajustes de acceso de Microsoft Teams, un clic selecciona todos los hallazgos de seguridad de la misma gravedad (incluida la API v3) y los plugins ofrecidos muestran sus skills, MCP, hooks y reglas antes de la instalación; la creación de entornos en grandes repositorios Perforce dispone de 3 horas en lugar de fallar tras 10 minutos. 🔗 fuente
- MCP TikTok Ads en Replit — Replit añade TikTok Ads a su catálogo de más de 450 integraciones: una vez conectada la cuenta, su Agent puede crear y gestionar anuncios de TikTok, llegar a audiencias y medir el rendimiento desde el espacio de trabajo, sin consumir créditos por la conexión. 🔗 fuente
- Cockle Finance en Replit — Replit fija un vídeo sobre Cockle Finance, cuya herramienta fue construida en Replit por Dan y su padre Steve para seguir la afluencia de clientes; según Replit, Dan hizo crecer su negocio un 15 % en tres meses, sin especificar la métrica. 🔗 fuente
- Copilot CLI 1.0.92 en versión estable — Esta versión reúne las novedades de las versiones preliminares 1.0.92-0 a -5; la única novedad inédita es que, tras iniciar sesión con Microsoft Entra, el usuario elige la cuenta que utilizará,
/logoutcierra esas sesiones OAuth y los servidores MCP protegidos por Entra renuevan sus credenciales sin intervención. 🔗 fuente - Codex CLI 0.160.1 — Este parche de la 0.160.0 solo contiene un backport: las variables de Windows SYSTEMROOT, TEMP y TMP se conservan al iniciar servidores MCP stdio remotos cuyo entorno remoto está configurado explícitamente; es la última versión estable, ya que no ha salido ninguna 0.161.0 estable. 🔗 fuente
- Nightly de Gemini CLI del 5 de octubre — No contiene ningún cambio: construida sobre el mismo commit que la del 3 de octubre, solo difiere en los números de versión, y los canales estable (v0.62.0) y preliminar (v0.63.0-preview.0) siguen sin cambios. 🔗 fuente
- SDK TypeScript de SpaceXAI 0.2.1 — Publicada el 2 de octubre, esta versión añade
toJson(schema), que valida la salida estructurada con un validador Standard Schema (Zod, Valibot o ArkType), y la opciónretryBeforeOutput, que reintenta una solicitud en streaming (streaming) que haya fallado antes de producir ninguna salida; un 429 sin cabecera Retry-After ahora espera desde un segundo hasta 30 segundos, en lugar de 250 milisegundos. 🔗 fuente - Cresta Conductor sobre el Claude Agent SDK — En la serie de Anthropic dedicada a las startups que construyen con Claude, Cresta presenta Conductor, un constructor de agentes de atención al cliente en lenguaje natural basado en el Claude Agent SDK; según Cresta, ha reducido aproximadamente a la mitad el tiempo de despliegue inicial en sus primeros casos de uso, sin fecha de disponibilidad ni precio. 🔗 fuente
- npm: caducidad de las configuraciones de publicación de confianza — Desde el 2 de octubre, una configuración de publicación de confianza (trusted publishing) que no se haya utilizado para ninguna publicación caduca 48 horas después de su creación, y npm también rechaza los tokens procedentes de eventos
issue_commentde GitHub Actions, como ocurre conpull_request_target. 🔗 fuente - npm: la publicación pendiente crea paquetes — Desde el 2 de octubre,
npm stage publishpuede crear un paquete que aún no existe, con una sesión local o un token granular, incluso limitado a dejar la publicación pendiente (stage-only); la primera versión espera a que un mantenedor la promueva antes de poder instalarse. 🔗 fuente - Agent API de Perplexity con Fast Search — Los ajustes predefinidos low, medium y high de la Agent API ahora utilizan Fast Search para la herramienta
web_search, pasando de 2,50 a 1 dólar por cada 1 000 invocaciones y con unos 800 ms menos de latencia; el ajuste predefinido xhigh mantiene la búsqueda estándar. 🔗 fuente - Guía RAG de Perplexity — Perplexity publica una guía con nueve ejemplos de generación aumentada por recuperación (retrieval-augmented generation, RAG) y siete arquitecturas, citándose a sí misma por su índice web y su función Instant Buy junto a ejemplos de terceros como Zendesk o GitHub Copilot; ninguna novedad de producto. 🔗 fuente
- Plantilla de Cohere — Según Cohere, la empresa ha pasado de unos 400 empleados a principios de 2026 a más de 800 en la actualidad, una cifra incluida en un mensaje de contratación. 🔗 fuente
- IsoVGRBench y Logbook en Meta — Sin anuncio, facebookresearch publica el código de IsoVGRBench, que evalúa los modelos de recompensa de vídeo sobre 16 000 pares que solo difieren en un aspecto (ante el mismo clip con las imágenes desordenadas, estos modelos responden prácticamente al azar), y el de Logbook, dedicado a los eventos de grabaciones de audio muy largas. 🔗 fuente
- FiftyOne lee los conjuntos LeRobot v3 — Según una entrada comunitaria de Harpreet Sahota, la caja de herramientas open source FiftyOne ahora lee de forma nativa el formato LeRobot v3, sin conversor ni copia de los vídeos; la demostración abarca 497 episodios extraídos de los 50 tipos de robots del conjunto comunitario de LeRobot. 🔗 fuente
- FetchMan-data de Ai2 — Publicado el 1 de octubre sin anuncio, este conjunto reúne 352 696 episodios simulados (52 millones de fotogramas, 902 instrucciones) de agarre de objetos por un humanoide Unitree G1, generados en MolmoSpaces, en formato LeRobot v3 y bajo licencia ODC-BY. 🔗 fuente
- P(doom) en los perfiles de Hugging Face — Los usuarios del Hub pueden mostrar en su perfil su P(doom), su estimación de la probabilidad de que la IA provoque una catástrofe existencial; las respuestas alimentan una encuesta de la que solo se publicarán resultados agregados y anonimizados, dentro de dos semanas. 🔗 fuente
- Extensión hf-image — Hugging Face ofrece, sin anuncio, una extensión de su CLI que construye, sube, descarga y ejecuta imágenes de contenedores en su registro cr.hf.co; Xet deduplica las capas sin comprimir, de modo que una capa de 2 Go modificada en 100 Mo solo transmite unos 100 Mo según el README. 🔗 fuente
- Tres experimentos de Milos Kotlar — En tres entradas comunitarias, Milos Kotlar hace que la caché KV de un pequeño transformer sea 2,71 veces más compacta con un 97,85 % de coincidencia en el siguiente token, y reduce la proporción de tokens sin experto en un enrutamiento MoE del 13,84 % al 8,09 %, sin ninguna mejora de velocidad. 🔗 fuente
- Auditoría de un juez LLM por Stephen Yu — Stephen Yu ha auditado, sobre 38 400 muestras, el juez GLM-5.3 que puntúa la fidelidad a los hechos en la recompensa GRPO de su modelo de reescritura de 12B: fiable para detectar que un hecho ha cambiado, con ruido al evaluar su gravedad; contar las salidas erróneas revela una reducción del 39 % que el primer recuento ocultaba. 🔗 fuente
- Simposio de Sakana AI en Tokio — Sakana AI abre las inscripciones para un simposio gratuito el 26 de octubre en el Hitotsubashi Hall de Tokio, en inglés, con una conferencia de Jürgen Schmidhuber y una entrevista con David Ha, CEO de Sakana AI. 🔗 fuente
- Startups de NVIDIA Inception y cáncer de mama — NVIDIA presenta cuatro startups de su programa Inception que aplican la IA al proceso asistencial, entre ellas iSono Health y su ecógrafo 3D ATUSA autorizado por la FDA (unos dos minutos por mama frente a hasta 45 minutos de forma manual), Whiterabbit.ai, Ataraxis AI y SimBioSys; algunas de estas tecnologías no están aprobadas por la FDA. 🔗 fuente
Qué significa
La procedencia del texto se convierte en una obligación normativa. Hasta ahora, la trazabilidad de los contenidos generados se centraba sobre todo en la imagen y el audio, con marcas de agua y metadatos verificables; la AI Act extiende la exigencia al texto, y OpenAI responde por etapas: marca de agua aplicada por defecto al texto de ChatGPT y de Codex en la Unión Europea, opción voluntaria en la API y detector reservado a organizaciones aprobadas. Las cifras publicadas explican esta prudencia: se detecta alrededor del 95 % de los pasajes de 400 tokens en contenido de temática psicológica, con un objetivo del 1 % de falsos positivos, pero, en pasajes de 400 tokens en inglés, sustituir el 10 % de las palabras por sinónimos reduce la detección de aproximadamente el 92 % al 66 %, y una reescritura o una traducción puede borrar la marca de agua. La marca de agua ofrece un indicio de procedencia, no una prueba, y su ausencia no dice nada sobre el autor.
La memoria de los agentes se consolida y empieza a estandarizarse. Devin guarda sus lecciones en un repositorio Git de archivos Markdown que Dreaming reorganiza cada día, y Cognition publica el formato bajo licencia MIT para que otros agentes lo adopten; North 2 conserva el contexto entre sesiones; Qwen Code conecta Mem0 directamente a su CLI. Los enfoques difieren, entre archivos versionados legibles por una persona, un servicio de memoria externo y una función integrada en una plataforma, pero responden a la misma necesidad: que un agente no empiece de cero en cada sesión. La elección de Cognition tiene una ventaja práctica: cada nota remite a la sesión en la que se aprendió, puede consultarse en la interfaz y conserva su historial Git, lo que permite leer y corregir lo que el agente ha retenido.
Los modelos abiertos entran en las herramientas de programación por varias vías. Together Link los conecta a agentes existentes, incluidos Claude Code y Codex, y anuncia una reducción del gasto de más de la mitad; IBM ejecuta la versión autoalojada de Bob sobre Nemotron 3 Ultra para las empresas que mantienen su desarrollo en su propia infraestructura, incluidos los entornos desconectados; Reflection AI presenta Beam como un modelo abierto diseñado para el código y las tareas agénticas, con 80,9 en SWE-bench Verified según sus propias tablas. El argumento común se apoya menos en la puntuación bruta, donde Reflection AI reconoce que Kimi K3 sigue por delante, que en el coste, la latencia y el control de los datos.
Muchas de las cifras del día proceden de quienes las publican. GitHub ha diseñado ReviewBench y ha elaborado la clasificación inicial en la que Copilot code review ocupa el primer puesto, sin ejecución ni verificación por parte de los demás proveedores; la latencia de Nemotron 3 Ultra procede de pruebas internas de IBM; los ahorros de Together Link y los resultados publicitarios de ChatGPT son los que anuncian Together AI y OpenAI. GitHub, sin embargo, publica su conjunto de datos, su juez y su metodología, y abre la recepción de propuestas: cada proveedor puede repetir la medición con su propio agente. Eso permitirá determinar si esta clasificación inicial se sostiene.
Fuentes
- Nuestro enfoque sobre las normas de procedencia del texto de la EU (OpenAI)
- Hilo de OpenAI sobre las limitaciones de las marcas de agua
- Memoria y sueños: cómo Devin aprende al trabajar contigo (Cognition)
- Hilo de Cognition en X
- Repositorio Agent Memory
- Hilo de Cursor sobre el SDK
- Changelog del SDK de Cursor
- Qwen Code v0.25.0 en GitHub
- Together Link (Together AI)
- Documentación de Together Link
- Por qué IBM eligió NVIDIA Nemotron para IBM Bob self-hosted
- ReviewBench: un benchmark abierto para la revisión de código con AI (blog de GitHub)
- Sitio de ReviewBench
- North 2: AI empresarial sin concesiones (Cohere)
- Hilo de lanzamiento de North 2 (Cohere en X)
- Alianza de Cohere y PwC (blog de Cohere)
- Comunicado de PwC Canada
- Presentamos Beam (Reflection AI)
- MetaEncoder-30B en Hugging Face
- Artículo de Google AI en X sobre Living Models
- Living Models en Gemmaverse (Google DeepMind)
- Crear publicidad adaptada a cómo las personas usan la AI (OpenAI)
- Más formas de medir ChatGPT Ads
- Changelog de Perplexity del 5 de octubre
- Anuncio de los álbumes por Suno
- 5 álbumes que no te puedes perder (Suno)
- Anuncio de HyperFrames Studio
- Publicación compartida por HeyGen
- Construye la fábrica. Deja que funcione. Vete a hacer kayak. (Warp)
- Notas de la versión de Devin del 2 de octubre
- MCP TikTok Ads en Replit
- Cockle Finance en Replit
- Copilot CLI v1.0.92
- Codex CLI 0.160.1
- Nightly de Gemini CLI del 5 de octubre
- SDK de TypeScript de SpaceXAI v0.2.1
- Cresta y el Claude Agent SDK (blog de claude.com)
- Las configuraciones no validadas de trusted publishing de npm ahora caducan
- staged publishing de npm ahora permite crear nuevos paquetes
- Changelog de la API de Perplexity
- 9 ejemplos de RAG (blog de Perplexity)
- Plantilla de Cohere
- Repositorio IsoVGRBench
- FiftyOne y LeRobot v3 (Harpreet Sahota)
- FetchMan-data en Hugging Face
- P(doom) en el Hub (changelog de Hugging Face)
- Repositorio hf-image
- Cache KV con presupuesto KL (Milos Kotlar)
- Auditoría del juez LLM (Stephen Yu)
- Simposio de Sakana AI
- Del escaneo al plan de tratamiento (NVIDIA)