ai-powered-markdown-translatorArtículo traducido del fr al es con gpt-6.1-sol.
GPT-6 e Intelligent UI llegan a todos los usuarios de ChatGPT: GPT-6 Sol para los planes de pago desde el 7 de octubre, GPT-6 Luna para Free y Go a partir del 8 de octubre. Anthropic completa su familia 5.5 con Claude Haiku 5.5, desde 0,10 dólar por millón de tokens de entrada, mientras que el evento Windows de Microsoft abre la preventa de los PC RTX Spark y anuncia que GitHub Copilot pronto podrá encargar sus tareas a un modelo local. OpenAI también publica 722 manuscritos de resultados matemáticos producidos por un modelo interno.
ChatGPT pasa a GPT-6 e Intelligent UI para todos, lee archivos de audio y prepara College Planner
7 de octubre — OpenAI extiende GPT-6 a todos los usuarios de ChatGPT. No se trata de un nuevo modelo base: GPT-6 Sol y GPT-6 Luna ya se ofrecían a los clientes de pago desde septiembre (cubiertos aquí el 22 de septiembre). Esta vez, las versiones de octubre de estos dos modelos, ajustadas para las conversaciones cotidianas, llegan a la pestaña Chat: GPT-6 Sol para Plus, Pro, Business y Enterprise desde el 7 de octubre, GPT-6 Luna para Free y Go a partir del 8 de octubre. Sustituyen a GPT-5.6 Sol y GPT-5.6 Luna en ChatGPT, mientras que Codex y ChatGPT Work siguen usando las versiones de septiembre. OpenAI afirma que así se dirige a los más de 1,2 mil millones de personas que utilizan ChatGPT cada semana.
La novedad más visible se llama Intelligent UI. GPT-6 compone sus respuestas con texto, elementos visuales y elementos interactivos (gráficos, botones, formularios, diagramas interactivos, mapas) y puede crear a petición una pequeña herramienta, como una calculadora de ahorro, una herramienta para dividir la cuenta o un juego; cuando basta con un texto sencillo, ChatGPT se limita a ello. Para hacerlo, OpenAI se apoya en una biblioteca de componentes nativos y en un compilador que muestra la interfaz a medida que se genera. Intelligent UI funciona desde el nivel de esfuerzo Instant hasta Extra High, sin una cuota independiente, pero no con el nivel de esfuerzo Pro, asignado a GPT-6 Pro (impulsado por GPT-6 Astra), ni en las antiguas aplicaciones de escritorio para macOS y Windows.
Segundo cambio: ChatGPT puede empezar a responder mientras razona o utiliza herramientas y después completar su respuesta sin un nuevo prompt. Según las evaluaciones internas de OpenAI, GPT-6 Instant empieza a responder un 44 % antes de media que GPT-5.6 Instant en las preguntas que requieren una búsqueda web, y GPT-6 Extra High comienza en el mismo plazo que GPT-5.6 Medium, con una puntuación global superior a la de GPT-5.6 Extra High.
| Plan o ajuste del nivel de esfuerzo | Modelo utilizado en ChatGPT | Calendario y detalles |
|---|---|---|
| Plus, Pro, Business y Enterprise | GPT-6 Sol (Instant, Medium, High, Extra High) | Despliegue mundial desde el 7 de octubre |
| Free y Go | GPT-6 Luna | A partir del 8 de octubre |
| Nivel de esfuerzo Pro (Pro de 100 y 200 dólares, Business, Enterprise) | GPT-6 Pro, impulsado por GPT-6 Astra | Sin Intelligent UI |
| ChatGPT Work y Codex | Versiones de septiembre de GPT-6 Sol y GPT-6 Luna | Sin cambios |
En cuanto a la seguridad, la ficha del sistema publicada ese mismo día clasifica estas versiones en el nivel de capacidad «High» en ciberseguridad, así como en biología y química, según el Preparedness Framework, sin alcanzar ese umbral en automejora; mantienen las salvaguardas de GPT-5.6, con una mayor resistencia a los intentos de eludirlas (jailbreaks), incluso a lo largo de varios turnos. En la API, la instantánea chat-latest apunta ahora a este nuevo modelo de ChatGPT, y OpenAI recomienda la familia GPT-6 para producción.
GPT-6 and Intelligent UI, now rolling out in ChatGPT for everyone. Intelligent UI in ChatGPT delivers fast, interactive answers that make everyday questions more visual, complex topics easier to grasp, and interactive tools for your task available on the spot.
🇪🇸 GPT-6 e Intelligent UI se están desplegando ahora en ChatGPT para todo el mundo. En ChatGPT, Intelligent UI ofrece respuestas rápidas e interactivas que hacen que las preguntas cotidianas sean más visuales y los temas complejos más fáciles de comprender, y pone a tu disposición al instante herramientas interactivas adaptadas a tu tarea. — @OpenAI en X
🔗 GPT-6 e Intelligent UI para todos · Ficha del sistema, actualización de octubre · GPT-6 y otros modelos en ChatGPT
Los archivos de audio en ChatGPT
6 de octubre — ChatGPT ya acepta archivos de audio adjuntos. Se puede adjuntar una grabación a una conversación para obtener una transcripción, un resumen o respuestas sobre su contenido, o para transformar una reunión, una entrevista o una clase en notas estructuradas, e incluso en un borrador de correo de seguimiento. La función está reservada a las suscripciones y los espacios de trabajo de pago, incluido Enterprise: el plan Free no tiene acceso «por ahora». Los formatos aceptados son WAV, MP3, OGG, FLAC, AAC, M4A y PCM, así como WebM y MP4 si solo contienen audio, hasta 512 Mo por archivo. OpenAI advierte de que las transcripciones pueden contener errores, que la identificación de los hablantes sigue siendo poco fiable y que el rendimiento varía según el idioma.
🔗 Notas de la versión de ChatGPT · Subir archivos y audio a ChatGPT
ChatGPT for Teens: primeras cifras de uso y próxima llegada de College Planner
7 de octubre — OpenAI presenta un primer balance de ChatGPT for Teens, la experiencia que se aplica por defecto a las cuentas identificadas como pertenecientes a menores de 18 años. Según la empresa, cerca de 1,2 millones de adolescentes han utilizado Learning Visualizations en una semana y más de 180 000 han usado Study Mode; pasan allí una media de menos de 15 minutos al día, y menos del 2 % supera las tres horas consecutivas. La novedad anunciada, College Planner, llegará «pronto», primero a Estados Unidos para estudiantes de secundaria de los grados 10 a 12 que aspiran a cursar estudios universitarios de cuatro años: un mismo plan reunirá los requisitos de solicitud, los plazos, las tareas y los trámites de ayuda económica, incluidas las becas. OpenAI también apoya a College Advising Corps y, durante tres años, al Digital Wellness Lab del Boston Children’s Hospital, sin comunicar el importe.
🔗 Ayudar a los adolescentes a aprender, planificar y dar forma al futuro de la IA
Claude Haiku 5.5, aproximadamente un 75 % más barato que Haiku 4.5 según Anthropic
7 de octubre — Quince días después de Opus 5.5 y nueve días después de Sonnet 5.5, Anthropic completa la familia Claude 5.5 con Claude Haiku 5.5 (claude-haiku-5-5). El modelo está dirigido a tareas de gran volumen y sensibles al coste (resúmenes, compactaciones del contexto, consultas de bases de datos, clasificación), al papel de subagente de Opus 5.5 y Sonnet 5.5 en tareas de código, y a usos en los que la velocidad importa, como la atención al cliente en tiempo real o el control de un navegador: es el modelo más rápido de Anthropic a velocidad estándar, aunque los Opus en Fast Mode siguen siendo más rápidos. También es el primer Haiku con un ajuste del nivel de esfuerzo (medium por defecto), con un contexto de 1 millón de tokens y hasta 128 000 tokens de salida.
La tarifa tiene dos tramos. Hasta 100 000 tokens de prompt, Haiku 5.5 cuesta 0,10 dólar por millón de tokens de entrada y 0,50 dólar de salida, un 90 % menos que Haiku 4.5; por encima de ese umbral, pasa a 0,50 y 2,50 dólares, un 50 % menos. El ahorro de «aproximadamente un 75 %» que se destaca es una media calculada por Anthropic: el 90 % de las solicitudes enviadas a Haiku 4.5 quedaba por debajo del umbral, y la nueva división en tokens (tokenizer) cuenta aproximadamente un 30 % más de tokens para un mismo texto.
| Tipo de tarifa (por millón de tokens) | Haiku 5.5 hasta 100 000 tokens de prompt | Haiku 5.5 por encima de 100 000 tokens | Haiku 4.5 |
|---|---|---|---|
| Tokens de entrada | 0,10 dólar | 0,50 dólar | 1 dólar |
| Tokens de salida | 0,50 dólar | 2,50 dólares | 5 dólares |
| Lecturas de cache | 0,01 dólar | 0,05 dólar | 0,10 dólar |
| Escrituras de cache | 0,125 dólar | 0,625 dólar | 1,25 dólar |
En los benchmarks publicados por Anthropic, la diferencia con Haiku 4.5 es amplia, y Haiku 5.5 supera a GPT-6 Luna de OpenAI en todos aquellos en los que aparecen ambos. Sin embargo, sigue por detrás de Sonnet 5.5, que Anthropic continúa recomendando, junto con Opus 5.5, para tareas complejas de código con agentes.
| Benchmark evaluado (cifras de Anthropic) | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| Terminal-Bench 4.0 (código con agentes) | 39,2 % | 0,0 % | 16,4 % | 70,6 % |
| OSWorld 2.1, subconjunto sin conexión | 72,4 % | 15,7 % | 48,9 % | 83,9 % |
| Humanity’s Last Exam, sin herramientas | 45,9 % | 10,2 % | — | 56,9 % |
| FrontierCode 1.1, Main | 46,4 % | — | 42,4 % | 52,1 % (nivel de esfuerzo Xhigh) |
| Chartography, sin herramientas | 46,4 % | 6,4 % | 29,1 % | 61,6 % |
Seis clientes han compartido sus experiencias con las pruebas anticipadas: HubSpot cita un 92,8 % en su suite CRM, su mejor puntuación hasta la fecha; AlphaSense, 0,84 frente a 0,76 para Haiku 4.5 en 400 consultas; y Box, 11 puntos más con aproximadamente la mitad de latencia. La migración desde Haiku 4.5 requiere trabajo: la guía enumera once cambios, entre ellos la eliminación de budget_tokens, de los parámetros temperature, top_p y top_k y del prellenado, y el comando /claude-api migrate de Claude Code automatiza una parte. En cuanto a la seguridad, Anthropic describe salvaguardas de ciberseguridad más restrictivas que las de Haiku 4.5, pero algo menos que las de sus otros modelos recientes: se permiten más tareas defensivas que con Sonnet 5.5, mientras que las pruebas de intrusión siguen bloqueadas.
El lanzamiento viene acompañado de una bajada de precios: las lecturas de cache de Sonnet 5.5 pasan de 0,20 a 0,10 dólar por millón de tokens desde el 7 de octubre, lo que hace que el modelo sea aproximadamente un 20 % más barato en la mayoría de las tareas con agentes, según Anthropic. Haiku 5.5 ya está disponible en la API de Claude, Amazon Web Services, Google Cloud y Microsoft Azure, así como en Claude Code.
Introducing Claude Haiku 5.5: the cheapest, fastest, and most capable small model we’ve ever released. On average, it costs around 75% less to run than Claude Haiku 4.5.
🇪🇸 Presentamos Claude Haiku 5.5: el modelo pequeño más barato, más rápido y de mayor rendimiento que hemos publicado hasta ahora. De media, ejecutarlo cuesta aproximadamente un 75 % menos que Claude Haiku 4.5. — @claudeai en X
🔗 Anuncio de Claude Haiku 5.5 · Guía de migración a Haiku 5.5
Haiku 5.5 en Cursor: 48,4 % en CursorBench
7 de octubre — Cursor ofrece Claude Haiku 5.5 desde el día de su lanzamiento, y se puede activar en sus ajustes de modelos. Según Cursor, cuesta 10 veces menos que Claude Haiku 4.5 en las solicitudes cortas. En CursorBench, la clasificación que Cursor publica en su sitio, Haiku 5.5 con nivel de esfuerzo Max ocupa el puesto 10 con un 48,4 % de éxito por 1,12 dólar por tarea, justo por delante de Sonnet 5.5 con nivel de esfuerzo High, cuyos costes Cursor ha recalculado el 7 de octubre para tener en cuenta su nueva tarifa, y por delante de Opus 5 con nivel de esfuerzo Max. Sin embargo, trabaja más: una media de 325 934 tokens y 163 pasos por tarea, frente a 37 391 tokens y 41 pasos para Sonnet 5.5 con nivel de esfuerzo High.
| Configuración probada por Cursor | Puesto en la clasificación | Puntuación CursorBench | Coste por tarea |
|---|---|---|---|
| Opus 5.5, nivel de esfuerzo Max | 1 | 57,8 % | 13,43 dólares |
| Haiku 5.5, nivel de esfuerzo Max | 10 | 48,4 % | 1,12 dólar |
| Sonnet 5.5, nivel de esfuerzo High | 11 | 47,8 % | 1,20 dólar |
| Opus 5, nivel de esfuerzo Max | 13 | 46,6 % | 11,95 dólares |
| Haiku 5.5, nivel de esfuerzo Low | 54 | 30,9 % | 0,08 dólar |
🔗 Anuncio de Cursor en X · Clasificación de CursorBench
Un crédito mensual de API de 100 a 500 dólares para los planes Max y Team
7 de octubre — Anunciado en la misma publicación que Haiku 5.5, llega un crédito mensual que se puede utilizar en Claude Platform para los suscriptores de Max y Team, con un despliegue escalonado a lo largo de varios días. Permite crear herramientas, aplicaciones y agentes propios con la API; según @ClaudeDevs, funciona con todos los modelos, incluido Haiku 5.5, tanto en código propio como en herramientas de terceros.
| Plan incluido | Crédito mensual de API |
|---|---|
| Max 5x | 100 dólares |
| Max 20x | 200 dólares |
| Team, puesto Standard | 20 dólares por puesto |
| Team, puesto Premium | 100 dólares por puesto |
| Tope de un equipo Team | 500 dólares, compartidos |
| Free, Pro y Enterprise | No elegibles |
En Team, los créditos de los puestos se suman en un fondo común: tres puestos Standard y dos Premium dan, por ejemplo, 260 dólares al mes. El crédito cubre todos los modelos de la API de Claude, incluida la API Message Batches, así como el Playground de la Console, Claude Managed Agents y Claude Agent SDK. No cubre Claude Code en uso interactivo (terminal, IDE, aplicación de escritorio o web), ni el uso adicional más allá de los límites del plan, ni los modelos Claude servidos por Amazon Bedrock, Google Cloud Vertex AI o Microsoft Foundry, y no modifica los límites de uso de Claude, Claude Code o Cowork.
Para solicitarlo, hay que tener una suscripción activa desde hace al menos siete días en un plan elegible y después vincular una organización de Claude Console desde los ajustes de facturación de claude.ai, sin añadir ningún método de pago. Solo se puede vincular una organización, y únicamente el soporte puede cambiarla. El crédito se renueva en cada ciclo de facturación, no se acumula para el siguiente ciclo y se utiliza antes que los créditos comprados; una vez agotado, las llamadas se detienen hasta el siguiente crédito, salvo que la organización haya comprado créditos o activado la recarga automática, y no se carga ningún importe a la suscripción de Claude. En mayo, Anthropic había anunciado un crédito mensual para el uso programático a partir del 15 de junio; la página de ayuda precisa que el nuevo crédito no corresponde a esos «créditos Agent SDK», que, según indica, no están disponibles.
🔗 Página de ayuda: créditos mensuales de API de los planes Max y Team · Anuncio de @ClaudeDevs
IA local en Windows: NVIDIA abre las reservas de los PC RTX Spark y presenta un adelanto de DGX Station for Windows
7 de octubre — NVIDIA y Microsoft aprovechan el evento Windows AI and Surface, celebrado en San Francisco con una conversación entre Jensen Huang y Satya Nadella, para lanzar comercialmente RTX Spark, el chip para PC Windows anunciado en Build el 2 de junio. Las reservas de los portátiles están abiertas desde el 7 de octubre, y estarán disponibles el 16 de octubre; los mini-PC llegarán en noviembre. Acer, ASUS, Dell, HP, Lenovo, Microsoft, MSI y Gigabyte preparan equipos, y Microsoft presenta un Surface Laptop Ultra construido en torno al chip. La publicación de NVIDIA no indica ningún precio.
RTX Spark combina una GPU Blackwell RTX y una CPU Grace conectadas a 600 Go/s, para ofrecer un petaflop de cálculo de IA en FP4 y hasta 128 Go de memoria unificada. NVIDIA destaca la ejecución local de grandes modelos, sin envío de datos al cloud ni contador de uso, con la misma pila CUDA que utiliza en sus servidores. El chip también está dirigido a los creadores (NVFP4, codificación AV1 y 4:2:2 por hardware) y a los jugadores, con juegos a 1440p que superan las 100 imágenes por segundo gracias a DLSS 5.
Para las empresas, NVIDIA presenta un adelanto de DGX Station for Windows, también anunciada en Build en junio, que describe como el primer superordenador de IA de escritorio del ecosistema Windows: permite ejecutar en local modelos del orden de un billón de parámetros sin salir de Windows, mientras que las herramientas Linux siguen siendo accesibles mediante WSL. No hay fecha ni precio, solo un registro para recibir una notificación. Por su parte, Microsoft pone en disponibilidad general Microsoft Execution Containers (MXC), la infraestructura que ejecuta los agentes en segundo plano bajo el control de Windows.
| Elemento comparado | RTX Spark | DGX Station for Windows |
|---|---|---|
| Chip | GPU Blackwell RTX (hasta 6 144 núcleos) y CPU Grace (hasta 20 núcleos) | Superchip GB300 Grace Blackwell Ultra Desktop |
| Memoria | Hasta 128 Go, unificada | 748 Go, coherente |
| Cálculo de IA en FP4 | 1 petaflop | Hasta 20 petaflops |
| Disponibilidad anunciada | Portátiles en reserva, disponibles el 16 de octubre; mini-PC en noviembre | Adelanto, sin fecha ni precio |
🔗 Publicación de NVIDIA sobre el evento Windows
Desarrollar en local en Windows: Copilot dirigirá las solicitudes a MAI Code 1.1 Flash, su entorno aislado pasa a disponibilidad general y Replit prepara una aplicación de escritorio
7 de octubre — GitHub Copilot pronto podrá elegir por sí solo entre un modelo que se ejecuta en el equipo del desarrollador y un modelo en el cloud. Según la publicación de Microsoft y GitHub en el blog Microsoft Command Line, este enrutamiento llegará «de aquí a final de mes»: aún no está disponible. GitHub lo presenta como el siguiente paso de Project HydraFusion, su orquestador que ya reparte las tareas entre varios modelos, y destaca un ahorro de créditos de IA, sin cuantificarlo.
Se prevén dos usos en Copilot CLI, la app GitHub Copilot y VS Code. El modo Auto elegirá, turno a turno, entre inferencia local y en el cloud según el contexto de la tarea y el estado del cache; el desarrollador también podrá seleccionar por sí mismo un modelo local, MAI Code 1.1 Flash mediante el proveedor Windows ML o cualquier modelo expuesto a través de un punto de acceso local (endpoint) compatible con la API de OpenAI. La publicación lo recuerda: una inferencia local no hace que la sesión funcione sin conexión.
La demostración se ejecuta en un Surface Laptop Ultra equipado con RTX Spark. Microsoft AI ejecuta en él una versión local de MAI Code 1.1 Flash, una mezcla de expertos (mixture-of-experts) especializada en código, con 137 mil millones de parámetros, de los cuales 6,8 mil millones están activos. Cuantificado a unos 3,3 bits por peso, ocupa 53 Go, un 80 % menos que la variante en el cloud, con un pico de memoria de 75,5 Go con un contexto de 256 000 tokens.
| Benchmark evaluado (pruebas de Microsoft del 5 de octubre) | MAI Code 1.1 Flash | Versión cuantificada en el dispositivo | GPT OSS 120B (versión GGUF de Unsloth) |
|---|---|---|---|
| SWE-Bench Verified (500 tareas) | 72,6 % | 70,80 % | 32,0 % |
| Terminal-Bench 2.1 (89 tareas) | 62,9 % | 66,29 % | 23,6 % |
Microsoft precisa que estas pruebas se ejecutaron en un entorno de ejecución llama.cpp para Windows ARM64 y que los resultados varían según el dispositivo y la configuración. Una primera pieza ya está disponible en el terminal: desde la versión preliminar 1.0.94-0 de Copilot CLI, el comando /model descubre los modelos de una instancia local de Ollama. No se añade nada sin confirmación, Ollama y el modelo deben estar ya instalados, y solo se proponen los modelos que admiten llamadas a herramientas y el flujo continuo (streaming).
🔗 Incorporación de modelos locales y herramientas aisladas a Windows y GitHub Copilot · Descubre modelos locales en GitHub Copilot CLI
El entorno aislado local de Copilot pasa a disponibilidad general
7 de octubre — El entorno aislado local de GitHub Copilot sale de la versión preliminar pública abierta el 2 de junio: pasa a disponibilidad general en Copilot CLI, la app GitHub Copilot y las sesiones de VS Code que pasan por Agent Host, sin coste adicional. Las herramientas y los comandos que lanza Copilot se ejecutan entonces con acceso restringido a los archivos, a la red, a las credenciales de Git y GitHub CLI y a otras capacidades del sistema, según las políticas establecidas por el desarrollador o su organización; una empresa puede imponer ajustes que los desarrolladores no pueden flexibilizar, sea cual sea el modelo utilizado. El motor, Microsoft eXecution Container (MXC), es una biblioteca open source del equipo de Windows que se basa en ProcessContainer en Windows, Seatbelt en macOS y bubblewrap en Linux, sin máquina virtual. Sus límites están documentados: las herramientas de archivos integradas están controladas por el propio Copilot y no por el sistema, y los servidores MCP remotos quedan fuera del entorno aislado local.
🔗 El entorno aislado local de GitHub Copilot ya está disponible de forma general
Replit crea las aplicaciones en local en Windows
7 de octubre — Replit anuncia, junto con Microsoft, la versión preliminar de una aplicación de escritorio que crea y ejecuta las aplicaciones directamente en el ordenador del usuario, en Windows. Replit ya ofrecía una aplicación de escritorio: la novedad reside en esta creación local, donde cada build se ejecuta en su propio entorno aislado, basado en Microsoft Execution Containers y en OpenShell, el entorno de ejecución open source de NVIDIA. El acceso anticipado se realiza mediante una lista de espera, sin fecha ni precio, y no se menciona ninguna versión para macOS. Replit presentó esta versión preliminar en el escenario durante el evento Windows del 7 de octubre.
🔗 Anuncio de Replit en X · Lista de espera de la versión preliminar
OpenAI publica 722 manuscritos de resultados matemáticos producidos por un modelo interno
6 de octubre — OpenAI publica de una sola vez un amplio conjunto de resultados matemáticos producidos por un modelo interno de vanguardia, que no está disponible públicamente. Anunciado la noche del 6 de octubre, el repositorio de GitHub openai/math reúne 722 manuscritos agrupados en 372 familias clasificadas por disciplina: un resultado principal puede ir acompañado de argumentos complementarios, consecuencias o demostraciones alternativas.
La gran mayoría de los resultados procede de un mismo procedimiento: unos 4 000 problemas planteados al modelo, con una media del equivalente a tres horas de reflexión de ChatGPT Pro por resultado. OpenAI explica que amplió sus evaluaciones a problemas de investigación abiertos tras saturar sus evaluaciones matemáticas existentes. Dos trabajos son excepciones a este procedimiento: una región libre de ceros de la función zeta de Riemann, cuya redacción fue retocada por un humano para facilitar la lectura, y la demostración de un caso particular de la conjetura de Hodge, el de las variedades abelianas CM.
| Indicador publicado por OpenAI | Valor anunciado |
|---|---|
| Manuscritos publicados | 722 |
| Familias de resultados | 372 |
| Problemas planteados al modelo | Unos 4 000 |
| Cómputo medio por resultado | Unas tres horas de reflexión de ChatGPT Pro |
| Resúmenes de razonamiento publicados | 10 |
No todos los resultados se verifican de la misma manera. Muchas demostraciones están formalizadas en Lean, un lenguaje que permite verificar una demostración por ordenador, aunque no todas: OpenAI advierte que «algunos resultados no formalizados podrían contener errores», promete corregirlos rápidamente y añadirá nuevas formalizaciones de manera progresiva. Los diez resúmenes del razonamiento del modelo abordan temas como el exponente de irracionalidad de π, las conjeturas de Mahler, la conjetura de finitud directa de Kaplansky en característica dos o el isomorfismo de los factores de grupos libres.
La propia publicación se preparó con el grupo asesor independiente sobre matemáticas e IA del Institute for Advanced Study: protocolos de revisión y citación, correcciones publicadas como nuevas versiones e historial conservado. OpenAI también anuncia la financiación de talleres, conferencias y programas dedicados a estos resultados, y afirma que trabaja para ofrecer a los científicos un acceso «responsable» al modelo que los produjo, sin un calendario.
We’re releasing a broad range of new mathematical results produced by an internal frontier model. We’ve been consulting with the independent Advisory Group on Mathematics and Artificial Intelligence at the Institute for Advanced Study, and we have drawn on their advice and public recommendations to inform how we release these results.
🇪🇸 Publicamos una amplia gama de nuevos resultados matemáticos producidos por un modelo interno de vanguardia. Hemos consultado al grupo asesor independiente sobre matemáticas e inteligencia artificial del Institute for Advanced Study, y nos hemos basado en sus consejos y recomendaciones públicas para decidir cómo publicar estos resultados. — @OpenAI en X
🔗 Compartir los avances de la IA en matemáticas · Repositorio openai/math en GitHub
Perplexity publica pplx-embed-v2-late, embeddings multivector para texto e imágenes
7 de octubre — Perplexity Research publica pplx-embed-v2-late, dos modelos de embeddings de interacción tardía (late interaction) de 0.6B y 9B parámetros, disponibles en Hugging Face bajo licencia MIT. Mientras que un embedding denso comprime cada documento en un único vector, estos modelos de tipo ColBERT conservan un vector de 128 dimensiones por token y puntúan cada par consulta-documento mediante MaxSim: cada token de la consulta se empareja con el token más cercano del documento. Buscan en texto, imágenes y páginas renderizadas (PDF, diapositivas, escaneos) sin recurrir al OCR, lo que preserva tablas, figuras y diseño de página.
Los dos tamaños comparten un mismo espacio de embeddings porque se destilan token por token a partir de un modelo maestro interno de 18B, derivado de una base de 27B. Por tanto, un corpus indexado con el 9B puede consultarse mediante consultas codificadas con el 0.6B: en ViDoRe v3 con imágenes, esta configuración alcanza el 63,5 %, frente al 62,3 % con el 0.6B en ambos lados, sin coste adicional por consulta. El 0.6B, podado a partir de Qwen3.5-0.8B, sirve así como codificador ligero de consultas, incluso en el propio dispositivo.
| Benchmark evaluado (mediciones de Perplexity) | Puntuación del 9B | Puntuación del 0.6B | Punto de comparación |
|---|---|---|---|
| 72 tareas especializadas (nDCG@10) | 81,3 % | 78,0 % | El 9B supera en 1,6 puntos al siguiente modelo |
| Q2D-Web, búsqueda web (Recall@1000) | 74,8 % | 73,6 % | nemotron-embed-8b: 69,3 % |
| ViDoRe v3 con imágenes (nDCG@10) | 65,2 % | 62,3 % | Solo EVIE supera al 9B |
| BrowseComp+ (agente GPT-OSS-120B) | 64,0 % | — | Siguiente mejor ColBERT: 4,9 puntos menos |
| MADQA (agente Gemini 3.5 Flash) | 92,4 % | 90,1 % | Mixedbread Agentic Search: 93,4 % |
El 9B no gana en todos los casos, y Perplexity lo señala: EVIE, de Tencent, lo supera en ViDoRe v3 con imágenes; gemini-embedding-2, en MIRACL-Vision y en el benchmark interno PPLX-Q2I; y Mixedbread Agentic Search obtiene una mejor puntuación en MADQA, una diferencia que Perplexity considera dentro de su intervalo de confianza. La empresa también reconoce que el almacenamiento y el coste de puntuación aumentan con la longitud de los documentos. Se anuncia un informe técnico para «más adelante este año», y Perplexity prevé ofrecer progresivamente sus embeddings de interacción tardía, densos y contextuales en su plataforma API, sin fecha.
🔗 Publicación de Perplexity Research · pplx-embed-v2-late-9b en Hugging Face
Agentes de código: Claude Code 2.1.293, Codex CLI 0.161.0, Cursor en iOS, Antigravity 2.21.0 y Warp Factories
Cinco herramientas de agentes de código evolucionan: Claude Code adopta Haiku 5.5, Codex CLI se conecta a servidores MCP desde el terminal, Cursor se controla desde un iPhone, Antigravity agrupa las acciones de su agente y Warp se abre a las herramientas de Microsoft.
Claude Code 2.1.293 pasa a utilizar Haiku 5.5 por defecto
7 de octubre — Publicada pocos minutos después del anuncio de Haiku 5.5, la versión 2.1.293 de Claude Code lo convierte en el modelo Haiku por defecto en la API de Anthropic. Añade un campo agentType a la carga útil de subagentStatusLine para distinguir los subagentes personalizados, y una opción isDeferred que expone desde el principio el esquema de las herramientas declaradas por mods. Lo principal son 38 correcciones entre 56 entradas: tras una compactación, Claude podía situar sus últimas acciones previas a esta como si fueran posteriores, y luego eliminar o repetir un trabajo terminado; las reglas limitadas a una ruta y los CLAUDE.md anidados también se cargan cuando Claude lee un archivo con cat o grep en Bash; desaparece una fuga de memoria de las conexiones MCP HTTP. Se revierten dos cambios recientes (el mensaje de rechazo del modo automático de la 2.1.281 y una corrección de las sesiones cloud de la 2.1.290), y el límite de reglas de canal de Claude Tag pasa de 20 a 50.
🔗 Claude Code 2.1.293 en GitHub
Codex CLI 0.161.0 pone Daybreak detrás de una opción
7 de octubre — Codex CLI 0.161.0 es la primera versión estable desde la 0.160.1 del 5 de octubre. El comando /mcp login <name> permite conectarse a un servidor MCP sin salir de la sesión de terminal en curso, y las conversaciones de voz incorporan la selección del micrófono, el altavoz y los canales de entrada. Daybreak, la gama de ciberseguridad de OpenAI, pasa a depender de una opción: el conmutador /daybreak y el estado de Daybreak en la línea de estado permanecen ocultos hasta que el usuario lo activa con --enable cli_daybreak (o features.cli_daybreak=true), y sin esa opción se omite el enrutamiento Cyber automático. Para un único turno, codex exec --cyber-access-program selecciona un programa de acceso Cyber. En Amazon Bedrock, el multi-agent V2 y el esfuerzo de razonamiento Ultra llegan a los modelos compatibles, y Bedrock Mantle admite las regiones AWS GovCloud. Las correcciones afectan a los permisos, la reanudación de hilos y la detección de una base SQLite corrupta.
Cursor controla desde iOS los agentes del ordenador
6 de octubre — La aplicación de Cursor para iOS muestra ahora los agentes que se ejecutan localmente en el ordenador: se puede ver qué hace cada uno y responderle, y el tweet del anuncio también menciona el inicio de nuevas tareas. Los agentes permanecen en la máquina y la aplicación se conecta a ella: por tanto, el ordenador debe seguir encendido y conectado, y un ajuste Keep this computer awake impide que entre en suspensión cuando está enchufado y con la pantalla abierta. La función está activada por defecto, salvo en las organizaciones Enterprise, donde debe activarla un administrador; el emparejamiento se valida en la aplicación de escritorio y no se necesitan agentes cloud. La aplicación para iOS lanzada a finales de junio destacaba los agentes cloud: ahora son los agentes locales los que se vuelven accesibles desde el teléfono.
Antigravity 2.21.0 agrupa las acciones de su agente
6 de octubre — La aplicación Antigravity de Google pasa a la versión 2.21.0, con 9 mejoras y 14 correcciones. La búsqueda avanzada permite encontrar una conversación por su contenido, con ⌘+K (Ctrl+K en Windows). La pestaña de tareas programadas (Scheduled Tasks) pasa a llamarse Automations: desde ella se ejecuta una automatización de inmediato con Run Now, o se pide al agente que guíe la creación de una nueva con Create with Prompt. Las modificaciones de archivos, los comandos de terminal y las lecturas que el agente realiza entre dos respuestas se agrupan ahora en una única línea plegable, acompañada de un breve resumen. Entre los problemas corregidos, un vídeo MP4 o MOV truncado que leyera el agente podía hacer fallar el resto de la conversación, y un archivo de configuración guardado con el Bloc de notas de Windows o PowerShell dejaba de funcionar. El changelog advierte que una versión puede tardar unos días en llegar a todos los usuarios.
Warp Factories se abre a Microsoft Teams y Azure DevOps
7 de octubre — Warp abre Warp Factories, su plataforma de fábricas de software (software factories), a Microsoft Teams y Azure DevOps Services. En Teams, mencionar la aplicación Warp en un canal o hilo configurado encomienda la tarea a la fábrica con el contexto de la conversación; esta informa de su progreso en el mismo hilo y envía allí sus pull requests para su revisión. En Azure DevOps, se menciona la fábrica desde un elemento de trabajo (work item) o una pull request, o se activan ejecuciones a partir de sus eventos; cada fábrica recibe su propia identidad para las operaciones Git, con acceso limitado a los repositorios seleccionados. Las dos integraciones están disponibles para todos los clientes de Warp Factories. Warp presenta esta doble compatibilidad nativa como una primicia en el sector; Devin ya se integraba con Teams y Azure DevOps Server.
API y plataformas: los toolsets computer use y browser use de los SDK de Claude, Grok 4.7 en Microsoft Foundry
Dos anuncios para los desarrolladores que construyen sobre modelos alojados: Anthropic simplifica el control de un ordenador o un navegador, y Grok 4.7 llega a la disponibilidad general en Microsoft.
Los toolsets computer use y browser use de los SDK de Claude
7 de octubre — Los SDK de Python y TypeScript de Claude incorporan, en beta, los conjuntos de herramientas (toolsets) computer use y browser use. Hasta ahora, la API indicaba dónde quería hacer clic Claude o qué quería escribir, y había que crear un bucle propio para traducir cada acción en un comando. El SDK se encarga ahora de ese bucle: el desarrollador crea una subclase de BetaAbstractBrowserToolset20260801 o BetaAbstractComputerToolset20260801, escribe un método por acción, y el SDK dirige las llamadas, aplica las políticas de URL y archivos proporcionadas, solicita las aprobaciones y construye los resultados devueltos al modelo. Anthropic no proporciona un navegador ni un controlador listo para usar: se conecta una automatización propia o un controlador de Browser Use, Browserbase, E2B o Daytona, y se publica un ejemplo mínimo con Chrome DevTools Protocol en el repositorio claude-quickstarts. La ejecución de JavaScript y el envío de archivos están desactivados por defecto y, sin una política de URL, no se verifica ninguna dirección.
🔗 Hilo de @ClaudeDevs en X · Documentación de los toolsets del SDK
Grok 4.7 en disponibilidad general en Microsoft Foundry
7 de octubre — Grok 4.7, el modelo de SpaceXAI lanzado el 21 de septiembre, está disponible en Microsoft Foundry, según anunció @SpaceXAI durante la noche. La documentación de Microsoft lo clasifica en disponibilidad general, entre los modelos vendidos directamente por Azure: texto e imagen como entrada, contexto de 500 000 tokens (entrada y salida combinadas), llamadas a herramientas, acceso mediante Chat Completions o la Responses API, y esfuerzo de razonamiento de low a xhigh, con high por defecto. Microsoft se compromete a ofrecer los modelos Grok en disponibilidad general, a partir de Grok 4.7, durante al menos seis meses; Grok 4.6 sigue figurando en versión preliminar. La página de precios de Azure aún no incluía Grok 4.7 la noche del 7 de octubre. Después de Amazon Bedrock (28 de septiembre) y Google Cloud en versión preliminar (1 de octubre), Grok 4.7 se ofrece así en los tres grandes proveedores de cloud.
🔗 Implementar y utilizar modelos Grok en Microsoft Foundry
Modelos abiertos: Open d1 de Liquid AI, Bolmo de Ai2 en Nature con Bwen 8B y Blama 8B
Dos publicaciones con pesos abiertos, una para decidir con rapidez en el borde de la red y otra para leer texto byte a byte.
Open d1, los modelos de decisión abiertos de Liquid AI
7 de octubre — Liquid AI abre su familia de modelos de decisión con Open d1: dos modelos con pesos abiertos, d1-3B (texto e imagen) y d1-omni-600M (texto con imagen o audio), este último en una versión temprana de investigación. No generan texto: asignan en una sola pasada una probabilidad a cada respuesta permitida. Según Liquid AI, d1-3B obtiene 48,57 en el Decision Index 0.2.1, la mejor puntuación por debajo de 10 mil millones de parámetros, por delante de Decider 35B-A3B (47,11), y una media de 82,9 en siete conjuntos de datos públicos. Medida con NVIDIA, su latencia para una pregunta va de 8 ms en una RTX 4090 a 50 ms en un Jetson Orin Nano, lo que permite orientarlo al borde de la red (edge). No se publica ningún benchmark de visión ni de audio. Los pesos están en Hugging Face bajo la licencia propia de Liquid AI (lfm1.0), con versiones GGUF; el d1 del 29 de septiembre solo era accesible mediante API.
🔗 Publicación de Liquid AI en Hugging Face
Bolmo de Ai2 en Nature, con Bwen 8B y Blama 8B
7 de octubre — Ai2 publica en Nature, en línea el 7 de octubre, el método que hay detrás de Bolmo, su familia de modelos completamente abiertos que leen directamente los bytes en lugar de subpalabras. Leer los bytes evita los puntos ciegos de un vocabulario fijo (ortografía, cadenas inusuales, ciertos sistemas de escritura), pero hasta ahora exigía un entrenamiento completo desde cero. La conversión a bytes (byteifying) parte, en cambio, de un modelo de subpalabras que ya ofrece un buen rendimiento y lo transforma mediante un breve entrenamiento adicional. Bolmo 1B y 7B, derivados de Olmo, datan de diciembre; Ai2 presenta también Bwen 8B (derivado de Qwen 3 8B, licencia Apache-2.0) y Blama 8B (derivado de Llama 3 8B, licencia llama3), cuyos repositorios existen desde el 26 de agosto, así como puntos de control «Stage 1» en los que solo se entrena la nueva capa de bytes. Según Ai2, los dos modelos se acercan al rendimiento de sus modelos originales y Bwen 8B supera a Bolmo 7B, sin cifras publicadas.
SynthID Detector abierto a todos para verificar imágenes, vídeos y sonidos
7 de octubre — Google abre a todo el mundo SynthID Detector, la herramienta que detecta las marcas de agua invisibles SynthID en contenidos generados por IA. Presentado el año pasado en una versión preliminar destinada a los profesionales de los medios, está disponible en synthid.com, en todo el mundo y en inglés. Se puede subir una imagen, un vídeo o un archivo de audio. La verificación abarca los contenidos de Google y los de sus socios OpenAI, NVIDIA y Kakao, y próximamente Apple. El portal advierte que no es un detector de IA de propósito general: un contenido procedente de un modelo sin SynthID, o muy modificado, puede aparecer como «no detectado». Google afirma haber incorporado marcas de agua a más de 180 mil millones de imágenes y vídeos y a 240 000 años de audio desde 2023, frente a los 100 mil millones y 60 000 años anunciados en julio, y realizar más de un millón de verificaciones al día en Search, la aplicación Gemini y Chrome.
🔗 Google amplía SynthID Detector para contenidos de IA
Seguridad: el clasificador de GitHub para los secretos filtrados
7 de octubre — GitHub pone en servicio un clasificador ModernBERT ajustado, dedicado a los secretos filtrados y desarrollado con Microsoft Applied Sciences: lee el código que rodea un valor para detectar posibles credenciales, incluidas contraseñas sin un formato reconocible. Evalúa un lote de candidatos en menos de 2 ms y podría, según GitHub, «más que duplicar» los secretos bloqueados en el push. Desde ahora, las alertas de contraseñas detectadas por IA pasan a utilizar este modelo, sin coste adicional. La protección de los pushes mediante IA, en versión preliminar privada, debe llegar «más adelante este mes» para las organizaciones que cumplan los requisitos, y las comprobaciones del comando /security-review de Copilot entrarán «pronto» en versión preliminar privada, ambas a cambio de créditos de IA. El ensayo de Erin Havens, responsable de producto de seguridad en GitHub, recuerda que una de cada tres pull requests implica a un agente de IA y que la protección de los pushes solo detiene alrededor del 30 % de los nuevos secretos detectados.
🔗 La protección de secretos debe escalar con el software
Infraestructura: GitHub reconstruye Git para la actividad de los agentes
6 de octubre — GitHub reconstruye su infraestructura Git para seguir el ritmo del desarrollo agéntico. Según el artículo de ingeniería de Brian Celenza, la actividad total de Git pasó de 218,2 a 473,3 mil millones de eventos al mes entre septiembre de 2025 y agosto de 2026; desarrolladores y agentes produjeron 7,38 mil millones de commits en septiembre de 2026, más de cinco veces más que un año antes, y los pushes se multiplicaron por 4,9. La arquitectura actual, Spokes, replica cada repositorio en varios servidores y valida cada actualización mediante una votación por mayoría: añadir copias para las lecturas ralentiza, por tanto, las escrituras. La nueva arquitectura separa almacenamiento y cómputo, con los datos de referencia en Azure Blob Storage y procesos ligeros (workers) que atienden las lecturas desde una cache. En sus benchmarks internos, GitHub mide hasta 35 veces más rendimiento de escritura, sin fecha para la transición.
🔗 Construcción de una infraestructura Git para el desarrollo a escala de agentes
IA de voz: ElevenLabs firma un memorando de entendimiento con un estado indio
7 de octubre — Con motivo de su Summit de Bengaluru, ElevenLabs firmó su primer memorando de entendimiento (MOU) con el gobierno de un estado indio para un piloto de IA de voz. La empresa no identifica el estado ni proporciona calendario, alcance o importe: el anuncio se limita a un tweet, sin artículo de blog. La cifra que lo acompaña ilustra la importancia del proyecto: durante el último año, ElevenAgents mantuvo más de 100 millones de conversaciones en India, de las cuales más del 70 % fueron en hindi, canarés, tamil y telugu. El Summit reunió a más de 500 directivos de empresas, desarrolladores y socios.
Investigación: PivotOPD, el método de NVIDIA para corregir el error decisivo de un agente
7 de octubre — Los investigadores de NVIDIA presentan PivotOPD, un método de entrenamiento para agentes que encadenan varios turnos de acción. Su conclusión: en ALFWorld, el 59 % de los fallos de tres modelos Qwen3 contienen un «error pivote», cometido al principio, tras el cual el agente sigue en la dirección equivocada. PivotOPD amplía la destilación según la política actual (on-policy distillation): ante cada error pivote, un modelo profesor indica la acción correcta y luego una acción de recuperación para los turnos siguientes, de modo que el alumno aprende a evitar el error y a recuperarse de él. Frente a 13 métodos de referencia, obtiene la mejor media en ALFWorld, WebShop y Search-based QA con alumnos Qwen3 de 1.7B y 8B, y corrige el 72,7 % de los 72 errores pivote reproducidos, frente al 20,3 % de la destilación estándar. La mejora se traslada al código: un alumno Nemotron-3.5 pasa del 62,8 % al 66,0 % en SWE-Bench Verified. El artículo está en arXiv; se anuncia que el código estará disponible próximamente.
🔗 Página del proyecto PivotOPD
Optimización: mPDLP distribuye programas lineales gigantes entre varias GPU en cuOpt
7 de octubre — NVIDIA añade a cuOpt, su biblioteca open source de optimización, mPDLP, un solucionador de programación lineal distribuido entre varias GPU conectadas mediante NVLink, para grandes problemas de planificación (cadenas de suministro, redes eléctricas). Al agrupar en una misma GPU las variables y restricciones interdependientes, limita los intercambios y reduce hasta 6 veces la memoria máxima por GPU. En un nodo DGX B200, la aceleración alcanza 11,4 veces en el cálculo PDLP y 4,2 veces de principio a fin; frente a D-PDLP, mPDLP es entre 1,2 y 2,5 veces más rápido en la mayoría de los problemas grandes, pero más lento en las tres instancias más grandes y en los problemas pequeños. Kinaxis resuelve 3,3 veces más rápido una cadena de suministro de más de 135 millones de variables en ocho H100, y PSR resuelve más de 5 veces más rápido un modelo energético de 185 millones de variables en ocho B200.
🔗 Artículo de NVIDIA sobre mPDLP
Robótica: unos robots ensamblan las bandejas de prueba GB300
7 de octubre — El Seattle Robotics Lab de NVIDIA cuenta cómo enseña a robots a ensamblar las bandejas de prueba de los GB300, que verifican los módulos antes de su envío. Se seleccionaron dos movimientos junto con Foxconn, que fabrica estos sistemas: colocar y atornillar una barra colectora en 16 puntos, y enchufar cuatro conectores montados en cables flexibles. El requisito fijado con Foxconn es una tasa de éxito del 99,5 %, en un tiempo que como máximo duplique el de un operario cualificado, sin colisiones. Los robots se acercan al objetivo sin alcanzarlo: más del 95 % de éxito en 160 segundos para la barra, frente a un objetivo de 124, y entre el 90 y el 95 % para los conectores, a 40 segundos por cable. El equipo combina una cadena clásica de percepción y control, la estimación de pose DOPER y aprendizaje por refuerzo en Isaac Lab, corregido en el robot real. NVIDIA promete publicar DOPER y su orquestador TALOS, sin fecha.
🔗 Artículo del blog técnico de NVIDIA sobre las bandejas GB300
Breves
- La app de ChatGPT para iOS 1.2026.272 — Muestra vistas previas de páginas directamente en las respuestas, abre los enlaces de tareas de Codex en la aplicación y, en Codex Mobile, rediseña el selector de aprobación y agiliza el flujo de las conversaciones largas. 🔗 fuente
- Radisson Hotel Group — Según un estudio de caso de OpenAI, su plugin de ChatGPT, construido en seis semanas con Accenture Song, logra una conversión aproximadamente 1,5 veces mayor que su búsqueda orgánica en julio-agosto de 2026, y el 54 % de los eventos de pago y reserva de su campaña publicitaria en ChatGPT se atribuyen a simples visualizaciones de anuncios. 🔗 fuente
- Jump Trading — La empresa de trading cuantitativo encarga a agentes GPT-6 Astra análisis que pueden ejecutarse durante varios días cruzando numerosas fuentes de datos, con una revisión humana al final del proceso; el estudio de caso de OpenAI no publica ninguna cifra de mejora. 🔗 fuente
- Extensiones de plugins de ChatGPT — En el hilo de su tutorial en vídeo, OpenAI Developers menciona a Adobe, Canva, Figma, Shopify, Instacart y Atlassian entre las empresas que las utilizan, además de tldraw y MagicPath; presentadas el 29 de septiembre, permiten iniciar un plugin desde la barra lateral, gestionan las menciones @ y añaden visores de archivos. 🔗 fuente
- Every y Claude Managed Agents — El equipo de Every construyó sobre Claude Managed Agents un agente empresarial que todos utilizan en Slack para compartir sus skills con cada nuevo modelo, y después lo abrió a sus suscriptores; Anthropic difunde una entrevista en vídeo, sin cifras. 🔗 fuente
- Zed 1.23 y versión preliminar 1.24.1 — La 1.23 pasa a ser estable con su vista previa de archivos JSONL y NDJSON, y la versión preliminar 1.24.1 permite arrastrar una pestaña de terminal al Agent Panel, admite modelos Amazon Bedrock personalizados con herramientas, imágenes y razonamiento, crea tags Git y reduce aproximadamente un 23 % el tamaño del binario Linux. 🔗 fuente
- Puck, el metaagente de Amp — Ahora admite varias conversaciones separadas: el botón + abre una, un clic en su nombre permite pasar de una a otra, y las que llevan tres días inactivas se guardan aparte. 🔗 fuente
- Copilot CLI 1.0.93 — Ya en versión estable, aplica los cambios de configuración de los servidores MCP entre dos turnos, sin reiniciar la sesión, y pone a disposición de todos el sandbox de comandos mediante /sandbox y —sandbox; el SDK Copilot 1.0.17 también pasa a ser estable. 🔗 fuente
- Las métricas de uso de Copilot — Contabilizaban menos actividad de los agentes de la real desde que varios IDE canalizan sus sesiones a través del Copilot SDK; la corrección exige una actualización (VS Code 1.139.0 desde ahora, Visual Studio 18.12 en octubre, JetBrains a finales de octubre, Eclipse y Xcode de aquí a noviembre), y los datos perdidos no se recuperarán. 🔗 fuente
- Gemini CLI v0.65.0-nightly.20261007 — Esta versión nocturna inaugura la serie 0.65.0 con cinco correcciones, dos de ellas contra pérdidas de datos: la configuración del proyecto pasa a ser de solo lectura en una carpeta no confiable, donde
gemini mcp addpodía vaciar.gemini/settings.json, y salir inmediatamente de una sesión reanudada ya no elimina su historial. 🔗 fuente - Transformers.js 4.3.1 — Un día después del lanzamiento de EmbeddingGemma 2, la biblioteca calcula sus embeddings multimodales (740 millones de parámetros, 768 dimensiones) directamente en el navegador, con WebGPU o WASM, o en Node.js. 🔗 fuente
- RL Environment Explorer — Adithya S K, de Hugging Face, presenta este Space de FineEnvs para explorar, visualizar y ejecutar los entornos de aprendizaje por refuerzo del Hub (OpenEnv, Harbor, MiMo, Verifiers, NeMo Gym): más de 12 millones de entradas de tareas, procedentes sobre todo de unos pocos grandes entornos OpenEnv. 🔗 fuente
- Seb-9B — Stas Veretennikov publica este modelo de decisión local bajo licencia Apache-2.0 (texto, JSON o imagen, hasta 20 opciones), que obtiene una media de 0,792 en 17 suites públicas frente a 0,786 de Jev 1.13; el autor realizó todas las mediciones y aclara que sus datos de entrenamiento incluían la parte de entrenamiento de uno de los bancos de pruebas, sin sus casos de prueba. 🔗 fuente
- Nemotron en las olimpiadas de 2026 — NVIDIA detalla la receta común (ajuste fino supervisado, aprendizaje por refuerzo, un bucle que genera, verifica y corrige) detrás de los 535,4 sobre 600 en la IOI 2026, en participación no oficial, y los 30 sobre 42 en la IMO 2026, con un umbral para el oro de 29, y publica el banco de pruebas Nemotron-IMO-Bench de 200 problemas. 🔗 fuente
- Instadocs: AI Gone Wild — Netflix anuncia para el 12 de octubre este documental que reconstruye el ciberataque sufrido por Hugging Face en julio, llevado a cabo, según Netflix, por agentes autónomos creados por investigadores de OpenAI. 🔗 fuente
- Runway en el directorio de aplicaciones de ChatGPT — Una vez instalado el plugin y conectada la cuenta de Runway, una mención @Runway en una conversación le encarga una generación de imágenes o vídeos; Runway no especifica tarifas ni coste en créditos. 🔗 fuente
- Face Swap de Luma — La función sustituye el rostro de un personaje en un plano existente para iterar sin empezar todo de nuevo; el anuncio se limita a dos tweets, sin página de producto, precio ni detalles sobre el modelo. 🔗 fuente
- DSX Air — NVIDIA muestra cómo probar los cambios de una fábrica de IA en este gemelo digital: los agentes aplican la modificación, verifican la configuración, la seguridad y el aislamiento, y después entregan un informe; el paso a producción sigue sujeto a una validación humana. Es un artículo metodológico, sin cifras. 🔗 fuente
- cuPhoton — Un tutorial de NVIDIA aplica este conjunto de herramientas open source al análisis de imágenes astronómicas en GPU, desde la lectura de archivos FITS hasta la revisión de candidatos; las mejoras anunciadas, de hasta 14 900 veces, corresponden a determinadas operaciones y no al procesamiento de principio a fin. 🔗 fuente
- Cosmos y SynthID — Los contenidos generados por los modelos NVIDIA Cosmos en build.nvidia.com llevan la marca de agua SynthID y ahora cualquiera puede verificarlos con el detector que Google ha puesto a disposición del público. 🔗 fuente
- El SDK TypeScript de SpaceXAI 0.2.3 — Añade un nivel de servicio
fast, intercambiable conpriority, y el identificadorgrok-imagine-video-1.5-lite, un modelo de vídeo ligero ausente de las notas de la versión: según los datos de la página de modelos, no admite audio como entrada y cuesta cuatro veces menos por segundo quegrok-imagine-video-1.5en 480p. 🔗 fuente - Guía RAG vs. LLM — Perplexity publica una guía didáctica que presenta RAG y LLM como complementarios, distingue tres tipos de RAG (ingenuo, modular, avanzado) y explica cuándo basta con un LLM solo; no aporta ninguna funcionalidad ni cifra nueva. 🔗 fuente
Qué significa
Los modelos pequeños se convierten en el producto de masas. A partir del 8 de octubre, GPT-6 Luna responde a los usuarios gratuitos de ChatGPT, y Anthropic fija el precio de Haiku 5.5 en 0,10 dólares por millón de tokens de entrada para prompts de menos de 100 000 tokens, a la vez que reduce a la mitad el precio de las lecturas de cache de Sonnet 5.5. Estos modelos absorben la mayor parte del volumen: conversaciones cotidianas, subagentes, resúmenes, compactaciones. Sin embargo, la clasificación de Cursor recuerda que el precio por token no lo dice todo: con esfuerzo Max, Haiku 5.5 consume casi nueve veces más tokens por tarea que Sonnet 5.5 con esfuerzo High, con un coste por tarea apenas inferior (1,12 dólares frente a 1,20). Por su parte, el crédito API mensual de los planes Max y Team invita a los suscriptores a probar estos modelos en su propio código.
La IA también llega al equipo de trabajo. Los portátiles RTX Spark llegan el 16 de octubre, DGX Station for Windows promete hasta 20 petaflops en un escritorio, y Copilot deberá encargar por sí mismo algunas tareas a MAI Code 1.1 Flash en local antes de que termine el mes. Replit ahora construye las aplicaciones en la máquina del usuario. Los agentes que ejecutan código en un ordenador personal plantean una cuestión de seguridad, y el mismo componente aparece en todas partes: Microsoft Execution Containers (MXC), en disponibilidad general en Windows, aísla tanto los comandos de Copilot como los builds de Replit. GitHub, por su parte, despliega un clasificador dedicado a los secretos divulgados y reconstruye su infraestructura Git, porque una de cada tres pull requests ya implica a un agente y los commits se han multiplicado por más de cinco en un año.
La respuesta también se convierte en una interfaz. Con Intelligent UI, ChatGPT responde con gráficos, formularios o una pequeña herramienta construida bajo demanda, y empieza a responder antes de terminar de razonar. Para los desarrolladores, los SDK de Claude se encargan del bucle de computer use y browser use, y Cursor permite seguir desde un iPhone a los agentes que trabajan en el ordenador y responderles. En estos tres casos, el texto es solo una parte del intercambio: la IA muestra, hace clic e informa, y el usuario supervisa.
Por último, muchas de las cifras del día las miden quienes las publican: los benchmarks de Haiku 5.5, Anthropic; los de MAI Code 1.1 Flash, Microsoft; Q2D-Web, Perplexity, que lo diseñó; las puntuaciones de Open d1, Liquid AI; y el rendimiento de escritura multiplicado por 35, las pruebas internas de GitHub. La propia OpenAI advierte de que los resultados no formalizados de sus 722 manuscritos pueden contener errores, y sus mejoras de velocidad para GPT-6 proceden de evaluaciones internas. Estas mediciones siguen siendo útiles para situar los productos unos respecto a otros; las evaluaciones externas, como la clasificación CursorBench, donde un proveedor de herramientas mide el modelo de otro, permitirán contrastarlas.
Fuentes
- GPT-6 e Intelligent UI para todos (OpenAI)
- Anuncio de GPT-6 para todos (@OpenAI)
- Ficha de sistema de GPT-6 Sol y GPT-6 Luna, actualización de octubre
- GPT-6 y otros modelos en ChatGPT
- Notas de versión de ChatGPT
- Subir archivos y audio a ChatGPT
- Ayudar a los adolescentes a aprender, planificar y dar forma al futuro de la IA (OpenAI)
- Anuncio de Claude Haiku 5.5 (Anthropic)
- Lanzamiento de Claude Haiku 5.5 (@claudeai)
- Guía de migración a Haiku 5.5
- Haiku 5.5 en Cursor (@cursor_ai)
- Clasificación de CursorBench
- Créditos API mensuales de los planes Max y Team (soporte de Claude)
- Anuncio del crédito API (@ClaudeDevs)
- RTX Spark y DGX Station for Windows (blog de NVIDIA)
- Llevar modelos locales y herramientas con sandbox a Windows y GitHub Copilot (Microsoft Command Line)
- Descubrir modelos locales en GitHub Copilot CLI
- El sandboxing local de GitHub Copilot ya está disponible de forma general
- Versión preliminar de la aplicación de escritorio de Replit (@Replit)
- Lista de espera de la aplicación de escritorio de Replit
- Compartir los avances de la IA en matemáticas (OpenAI)
- Repositorio openai/math
- Anuncio de los resultados matemáticos (@OpenAI)
- Embeddings multimodales más allá de un único vector (Perplexity Research)
- pplx-embed-v2-late-9b en Hugging Face
- Claude Code 2.1.293
- Codex CLI 0.161.0
- Control remoto para agentes locales (changelog de Cursor)
- Changelog de Antigravity
- Warp Factories, Microsoft Teams y Azure DevOps (blog de Warp)
- Toolsets de computer use y browser use en los SDK (@ClaudeDevs)
- Documentación de los toolsets del SDK de Claude
- Desplegar y usar modelos Grok en Microsoft Foundry
- Open d1 (Liquid AI en Hugging Face)
- Bolmo en Nature (Ai2)
- Google amplía SynthID Detector para contenido de IA
- La protección de secretos debe crecer al ritmo del software (GitHub)
- Crear infraestructura de Git para el desarrollo a escala de agentes (GitHub)
- Protocolo de acuerdo con un estado de la India (@ElevenLabs)
- PivotOPD (NVIDIA Research)
- mPDLP en cuOpt (blog técnico de NVIDIA)
- Las máquinas que fabrican las máquinas (blog técnico de NVIDIA)
- Changelog de ChatGPT y Codex, ChatGPT para iOS 1.2026.272
- Radisson Hotel Group lleva la búsqueda de hoteles a ChatGPT (OpenAI)
- Cómo Jump Trading está ampliando la investigación cuantitativa con ChatGPT (OpenAI)
- Extensiones de plugins de ChatGPT (@OpenAIDevs)
- Every y Claude Managed Agents (@claudeai)
- Zed v1.24.1-pre
- Muchos, muchos Pucks (Amp)
- Copilot CLI 1.0.93
- Actualiza tu IDE para restablecer la actividad de los agentes en las métricas de uso de Copilot
- Gemini CLI v0.65.0-nightly.20261007
- Transformers.js 4.3.1
- RL Environment Explorer (@adithya_s_k)
- Comparativa de Seb-9B (blog de Hugging Face)
- Nemotron en la IOI y la IMO 2026 (blog de Hugging Face)
- Instadocs: IA descontrolada (@netflix)
- Runway en ChatGPT (@runwayml)
- Face Swap (@LumaLabsAI)
- Validar los cambios en las fábricas de IA con gemelos digitales y agentes de IA (blog técnico de NVIDIA)
- Análisis de imágenes científicas más rápido con NVIDIA cuPhoton
- Cosmos y SynthID (@NVIDIAAI)
- SDK de TypeScript de SpaceXAI 0.2.3
- RAG vs. LLM (Perplexity)