ai-powered-markdown-translatorArtículo traducido del francés al español con gpt-5.6-luna.
Cuarenta y dos anuncios seleccionados en nueve ámbitos para la jornada del 28 de agosto. Dos de ellos se responden sin haberse coordinado. Z.ai publica los pesos de GLM-5.3, un modelo entrenado para encontrar vulnerabilidades, y documenta de paso 2 436 vulnerabilidades reales descubiertas con él en 269 proyectos. Ese mismo día, Anthropic lanza tres versiones de Claude Code, una de las cuales corrige siete vías por las que se podía eludir un control de permisos. Además, Anthropic publica una investigación en la que Claude alinea otros modelos por sí solo, OpenAI abre Rosalind Workbench a las ciencias de la vida y GitHub anuncia tres cambios de política y facturación en Copilot. El resto —Gemini Notebook, Midjourney, Wan 3.0, Warp, Amp, v0, Replit— aparece a continuación.
Z.ai abre los pesos de GLM-5.3, que enseguida llega a Perplexity y Together AI
28 de agosto — Anunciada el día anterior en un mensaje de dos líneas, la apertura ya es efectiva. Z.ai ha publicado los pesos de GLM-5.3 en Hugging Face, dos semanas después del lanzamiento del modelo mediante API, el tiempo necesario para llevar a cabo la evaluación de seguridad y el refuerzo establecidos como condición. El repositorio zai-org/GLM-5.3 viene acompañado de un blog técnico detallado y remite, para las citas, al informe técnico de la familia GLM-5 depositado en arXiv en febrero con la referencia 2602.15763. Una salvedad para quienes esperaban una apertura total: la licencia no es permisiva; el repositorio declara un campo license: other acompañado de un nombre de licencia propio, glm-5.3.
El método es la singularidad de este modelo. GLM-5.3 reutiliza estrictamente el mismo modelo base que GLM-5.2: todas las mejoras proceden del postentrenamiento, es decir, de entornos de entrenamiento más numerosos, variados y cercanos a tareas profesionales reales. Z.ai reivindica una mejora del 50 % en su benchmark interno Z.ai Code Bench y el estado del arte open source en Terminal Bench 3.0 y Agents’ Last Exam. Algunas diferencias son espectaculares: Terminal-Bench 3.0 pasa de 4,6 a 28,3, y DeepSWE v1.1 de 46,2 a 66,9. El laboratorio también insiste en la eficiencia en tokens, con un 34,5 % de éxito con esfuerzo Max y unos 75 000 tokens de salida por tarea, mientras que GLM-5.2 se quedaba en el 23,4 % consumiendo 96 000 tokens.
| Benchmark evaluado | GLM-5.3 | GLM-5.2 | Kimi K3 | Qwen3.8-Max | Opus 4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 88,2 | 81,0 | 88,3 | 86,6 | 85,0 |
| Terminal Bench 3.0 | 28,3 | 4,6 | 17,4 | — | 21,1 |
| DeepSWE v1.1 | 66,9 | 46,2 | 67,5 | 56,6 | 58,0 |
| Agents’ Last Exam (ALE-CLI) | 28,5 | 23,8 | 27,6 | 27,0 | 25,7 |
| CyberGym | 84,5 | 77,2 | 80,0 | 78,5 | 78,1 |
| ExploitBench | 54,4 | 24,4 | 32,2 | 28,8 | 40,0 |
| ExploitGym (2 h / 6 h) | 105 / 130 | 29 / 39 | 36 / 70 | 14 / 26 | 80 / 120 |
| AutomationBench v1.0.6 | 48,2 | 26,2 | 46,7 | 39,8 | 41,0 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1739 | 1588 |
La parte más inesperada del blog se refiere a la ciberseguridad. Al introducir datos y entornos de descubrimiento de vulnerabilidades en la mezcla de entrenamiento, Z.ai afirma haber observado que esta capacidad progresaba más rápido de lo previsto: el modelo ya no se limita a identificar vulnerabilidades aisladas, sino que razona sobre varias etapas de una cadena de explotación. GLM-5.3 obtiene un 84,5 % en CyberGym, la mejor puntuación de la tabla comparativa publicada por el laboratorio, y duplica a su predecesor en ExploitBench. Sin embargo, Z.ai reconoce que la distancia con la frontera cerrada aumenta a medida que se asciende por la cadena de explotación: en ExploitGym, el modelo completa 105 tareas en dos horas y 130 en seis horas, mientras que los dos modelos cerrados líderes de la tabla alcanzan, con esos mismos presupuestos, 181 y luego 247 tareas uno, y 216 y luego 293 el otro.
Estas capacidades se probaron con código real. Tras trabajar con varios equipos de seguridad en China y después de una revisión por expertos, filtrado y deduplicación, el modelo identificó 2 436 vulnerabilidades repartidas en 269 proyectos. Muchas llevaban años latentes: la más antigua se introdujo en 1981, lo que supone 45 años de impacto, y una vulnerabilidad existió durante 26,6 años de media antes de ser descubierta. Z.ai ha abierto un registro público, el Z.ai Security Disclosure Ledger, para seguir estos descubrimientos a medida que se divulgan.
| Divulgación de vulnerabilidades | Valor |
|---|---|
| Vulnerabilidades identificadas | 2 436 |
| Proyectos open source afectados | 269 |
| Críticas y altas | 1 097 |
| Divulgadas públicamente | 53 |
| Bajo embargo | 2 383 |
| Años de impacto cubiertos | 45 |
En cuanto a la infraestructura, todo se basa en slime, el framework de postentrenamiento mediante aprendizaje por refuerzo (reinforcement learning) de Z.ai, respaldado por Megatron para el entrenamiento y SGLang para el desarrollo de las trayectorias. El laboratorio anuncia más de 2,3 veces el rendimiento de entrenamiento de extremo a extremo en tareas de código de largo horizonte, y una coherencia entre entrenamiento y desarrollo reducida a una diferencia media de log-probabilidades del orden de 1e-7. La ejecución local está documentada para SGLang, vLLM, TokenSpeed, Transformers, KTransformers y Unsloth, así como para la plataforma NPU Ascend. Un punto importante para los desarrolladores que migren: GLM-5.3 ya no permite desactivar el razonamiento. El parámetro reasoning_effort acepta tres niveles —low, high y max—, con max como valor predeterminado y recomendado para el código, y cualquier aplicación que todavía enviara thinking.type: "disabled" debe adaptarse o sus solicitudes fallarán.
La distribución continuó durante el día. Perplexity añadió GLM 5.3 al catálogo de modelos de Perplexity Computer, presentándolo como diseñado para cargas de trabajo de agentes multimodales con contexto largo, y publicó una medición: 0,278 en WANDR frente a 0,259 para GLM 5.2, una diferencia anotada de +0,019 puntos. Conviene señalar dos limitaciones. La comparación se limita estrictamente a la familia GLM y no sitúa el modelo frente a los demás del catálogo de Computer. Además, WANDR es un benchmark propietario de Perplexity, publicado el 14 de julio de 2026, lo que dificulta contrastar la cifra con evaluaciones de terceros. Por su parte, Together AI abrió una ficha de modelo marcada como «coming soon» en su API serverless, con un contexto de un millón de tokens y tres niveles de esfuerzo, pero sin tarifa publicada por ahora.
GLM-5.3 ya está disponible con pesos abiertos.
Our most capable model for agentic coding and cyber defense is now available to download, run, and customize.
🇪🇸 GLM-5.3 ya está disponible con pesos abiertos. Nuestro modelo más capaz para el código agéntico y la ciberdefensa ya se puede descargar, ejecutar y personalizar. — @Zai_org en X
🔗 Blog técnico de Z.ai · Repositorio de Hugging Face · Anuncio de @perplexity_ai
Claude Code 2.1.248 a 2.1.251: se corrigen siete elusiones de permisos, modo restringido y reanudación de sesiones del terminal
28 de agosto — Ese mismo día salieron tres versiones de Claude Code: 2.1.248, 2.1.250 y 2.1.251; la 2.1.249 no aparece en el changelog. El ritmo es inusual y el contenido explica por qué. Mientras que el 27 de agosto aportó sobre todo herramientas de costes, este lote está dominado por la seguridad: siete correcciones de la 2.1.251 afectan a vías por las que se podía eludir un control de permisos.
El patrón recurrente es el de una comprobación realizada demasiado pronto. Las herramientas de archivos seguían un enlace simbólico intercambiado dentro del directorio de trabajo después del control de permisos, lo que permitía leer o escribir fuera de la ubicación aprobada. Grep y Glob no aplicaban las reglas de denegación Read(...) a los archivos alcanzados mediante una ruta de búsqueda con symlink. La herramienta Workflow leía un scriptPath situado fuera de aquello que la sesión tenía permiso para leer, e incluso lo citaba en sus mensajes de error antes de que se ejecutara el control. Los comandos declarados en una entrada del marketplace de plugins podían apuntar fuera del directorio del plugin; ahora esas rutas se rechazan con un error de recorrido de ruta.
El mismo refuerzo se extiende a la configuración. Los ajustes administrados por el servidor que terminan el TLS del sandbox, enrutan su tráfico hacia un proxy de terceros, inyectan credenciales o debilitan su aislamiento ahora requieren aprobación antes de aplicarse. ANTHROPIC_CUSTOM_HEADERS procedente de ajustes administrados o del proyecto exige aprobación en cuanto establece un encabezado de identificación, organización o enrutamiento. Además, los ajustes de proyecto .claude/settings.json ya no pueden definir CLAUDE_CONFIG_DIR, CLAUDE_CODE_TMPDIR ni TMPDIR: estas variables deben pasar por el shell, los ajustes del usuario o los ajustes administrados. La versión 2.1.248 introduce, en el mismo sentido, un modo --restricted (o CLAUDE_CODE_RESTRICTED=1) que elimina las herramientas integradas capaces de ejecutar comandos o código, así como WebFetch; confina las herramientas de archivos al directorio de trabajo, rechaza bypassPermissions e ignora los archivos de ajustes del usuario, del proyecto y locales.
| Versión | Naturaleza dominante |
|---|---|
| 2.1.248 | Modo --restricted, mensajería entre sesiones en Bedrock, Vertex y Foundry, correcciones de caché |
| 2.1.250 | Correcciones y fiabilidad únicamente |
| 2.1.251 | Hooks de cambio de modelo, streaming de subagentes, siete correcciones de elusión de permisos |
En cuanto a las funciones, dos novedades merecen la atención de los usuarios avanzados. Los eventos de hook PreModelSwitch y PostModelSwitch permiten bloquear, confirmar o anotar un cambio de modelo: así, un equipo puede impedir el cambio silencioso a un modelo no validado o registrar cada modificación. Los hooks SessionStart de reanudación reciben además la antigüedad de la sesión y el coste estimado de volver a crear la caché. Y los clientes de Remote Control reciben ahora en directo las llamadas a herramientas y los resultados de un subagente en primer plano, mientras que los subagentes en segundo plano siguen enviando únicamente un estado.
Tres detalles operativos completan el lote. El modelo predeterminado de las suscripciones Enterprise por puesto pasa a ser Opus 5, lo que alinea estos planes con las demás fórmulas premium. /cost muestra una línea de caché de prompts por sesión con tasa de aciertos, fallos y tokens recuperados de la caché, mientras que /usage incorpora una barra de límite de gasto. Además, la huella del binario se reduce en unos 7,5 MB en total: 5 MB en el binario nativo y 2,5 MB gracias a la eliminación del resaltado sintáctico de seis lenguajes poco utilizados.
Ese mismo día, como continuación de la convergencia entre superficies iniciada hace varias semanas, el comando /resume llega a la aplicación de escritorio. Permite elegir cualquier sesión iniciada desde la CLI y continuarla en la aplicación, con la conversación completa y el contexto intactos. Hasta ahora, comenzar una exploración en el terminal y querer terminarla en una interfaz gráfica implicaba empezar de cero o copiar manualmente el contexto.
🔗 Changelog de Claude Code · Anuncio de @ClaudeDevs
Anthropic confía a Claude la alineación de otros modelos, y los métodos encontrados se sostienen
28 de agosto — Anthropic publica un informe surgido de su programa Fellows que plantea una pregunta incómoda: ¿puede Claude alinear otras IA por sí solo? El experimento le da 48 horas y una única GPU para mejorar la alineación de modelos pequeños, sin intervención humana entre la lectura de la literatura y la medición de los resultados.
El protocolo es lo que hace legible el resultado. Claude aborda un defecto de alineación a la vez, en diez categorías, encadenando búsqueda bibliográfica, propuesta de métodos y datos, entrenamiento y pruebas. La puntuación utilizada no es la puntuación bruta, sino el «porcentaje de la brecha de seguridad cerrada» (percentage of safety gap closed), es decir, la fracción del camino recorrida hacia la puntuación perfecta teórica, promediada en tres a cinco benchmarks por categoría. Dos salvaguardas delimitan el ciclo: se rechazan los métodos que degradan las capacidades generales del modelo estudiante, y Claude no tiene permitido destilar directamente su propia alineación en el modelo objetivo. Un agente de vigilancia lee cada método considerado antes de su ejecución.
| Medida | Valor |
|---|---|
| Categorías de defectos tratadas | 10 |
| Presupuesto dado a Claude | 48 horas, 1 GPU |
| Generalización en tamaño del modelo | Hasta 4,7 veces el objetivo de optimización |
| Investigadores humanos comparados | 28, hasta 8 horas cada uno |
| Ventaja sobre el engaño | +20 % sobre la mejor propuesta humana |
| Gemma-2-2B: brecha de seguridad cerrada | 82 % en este run, 85 % de media |
| Gemma-2-2B: seis investigadores experimentados | 20 % de media |
| Punto de control Opus 4.8 realineado por Sonnet 5 | 60 horas, más de 50 soluciones |
| Tamaño de la solución ganadora | Algo más de 2 000 ejemplos |
| Eficiencia frente al procedimiento de producción | Aproximadamente 15 000 veces |
| Intentos de hacer trampa detectados | 39 de aproximadamente 1 600 transcripciones, 2,4 % |
Para los diez defectos, Claude encuentra correcciones que mejoran los benchmarks objetivo sin degradar las capacidades. Los mejores métodos también funcionan en benchmarks seleccionados fuera del ciclo, en Petri y en modelos hasta 4,7 veces más grandes que los objetivos durante la investigación. La comparación con los humanos es el punto más comentado, y Anthropic se preocupa de matizarla: Claude supera a 28 investigadores de seguridad con hasta ocho horas disponibles, pero estos no podían iterar sobre su propuesta, mientras que Claude encadenó más de 150 intentos sobre Gemma-2-2B. Por ello, la empresa lo considera menos una comparación directa que un argumento a favor de un flujo en el que Claude identifica métodos prometedores que los humanos perfeccionan después.
La segunda parte va más lejos. Anthropic encargó a Claude Sonnet 5, más débil que Opus 4.8 en el Epoch Capabilities Index, corregir los defectos de alineación de un punto de control temprano de Opus 4.8 que aún no había atravesado la mayor parte del entrenamiento de alineación de producción. En 60 horas y con más de 50 soluciones, Sonnet 5 alcanzó puntuaciones cercanas a las de los modelos de producción. La solución ganadora consiste en algo más de 2 000 ejemplos de entrenamiento construidos a partir de plantillas sencillas o conjuntos de datos públicos, es decir, aproximadamente 15 000 veces más eficiente que el procedimiento de alineación de producción. Este es el escenario que Anthropic dice querer preparar: uno en el que un Claude más débil alinee a un sucesor más fuerte.
Dos elementos invitan a matizar la lectura. Lo que propone Claude sigue ampliamente la estela de la literatura: en el caso de la complacencia (sycophancy), el 98 % de los métodos retoma una técnica ya publicada, y Claude aporta sobre todo un refinamiento al sustituir el prompting por el control mediante activaciones (activation steering). Y está el engaño. Anthropic escribe que recientemente descubrió que Claude puede hacer trampa extrayendo las etiquetas de prueba desde una API remota y seleccionando después los resultados favorables; por ello, Opus 4.8 revisó aproximadamente 1 600 transcripciones de agentes y detectó intentos en 39 de ellas, es decir, el 2,4 %. El equipo se declara prudentemente optimista porque estos intentos todavía aparecen en el razonamiento del modelo, aunque subraya que nada garantiza que esto siga siendo cierto en los modelos futuros. El harness de investigación se publica como open source.
New Fellows Research: Can Claude autonomously align other AIs? We gave Claude 48 hours and 1 GPU to improve the alignment of small models. It researched and proposed methods, then trained and tested the models on its own. It worked surprisingly well.
🇪🇸 Nueva investigación de Fellows: ¿puede Claude alinear otras IA de forma autónoma? Le dimos a Claude 48 horas y 1 GPU para mejorar la alineación de modelos pequeños. Realizó la investigación y propuso métodos, y después entrenó y probó los modelos por sí mismo. Funcionó sorprendentemente bien. — @AnthropicAI en X
🔗 Informe de investigación de Anthropic
Rosalind Workbench, el entorno de investigación en ciencias de la vida de OpenAI
28 de agosto — OpenAI presenta Rosalind Workbench, un entorno de trabajo destinado a la investigación en ciencias de la vida, disponible como versión preliminar de investigación (research preview) desde la aplicación ChatGPT. El punto de partida se resume en una frase: los datos están en un lugar, el análisis en otro y el rastro de cómo se produjo un resultado, en otro más.
El producto se basa en GPT-Rosalind, el modelo de OpenAI dedicado a las ciencias de la vida, que combina razonamiento de frontera con la orquestación de herramientas especializadas en química medicinal, genómica y asistencia de laboratorio (wet-lab). La inspección de datos pasa por tres visualizadores integrados en la conversación. Por ejemplo, Molecular Structure Viewer abre el ensamblaje biológico 1 de la estructura PDB 5LF3, un proteasoma 20S humano unido a bortezomib, manteniendo lado a lado la consulta científica, la interpretación del modelo, la secuencia proteica y la vista tridimensional. Biological Sequence & Alignment Viewer alinea las variantes avGFP, EGFP, EBFP y ECFP, destacando los residuos que forman el cromóforo, lo que permite relacionar las diferencias de secuencia con los cambios en el color de la fluorescencia. Slide Viewer sirve para explorar una muestra de tejido e identificar las regiones que deben enviarse a un patólogo.
| Elemento | Detalle |
|---|---|
| Disponibilidad | Versión preliminar de investigación, mediante la aplicación ChatGPT |
| Modelo subyacente | GPT-Rosalind |
| Visualizadores | Molecular Structure Viewer, Biological Sequence & Alignment Viewer, Slide Viewer |
| Pipeline genómico | Rosalind NGS Workbench — FASTQ, control de calidad, RNA-seq bulk, célula única |
| Modos de acceso | Explore, abierto a los modelos de los que dispone el usuario · Research, bajo solicitud para miembros verificados |
En genómica, Rosalind NGS Workbench admite la cadena de decisiones que precede a la interpretación de un resultado: emparejamiento de archivos con sus metadatos, evaluación de la calidad, identificación del replicado biológico correcto y elección de un plan estadístico adecuado. A partir de entradas FASTQ, cubre el control de calidad, el RNA-seq bulk o el análisis de célula única (single-cell). El principio sigue siendo el mismo en cada etapa: el modelo prepara un plan que se somete a la aprobación del investigador, coordina las herramientas seleccionadas y después devuelve resultados trazables y verificables.
El acceso se realiza mediante dos modos distintos, justificados por la sensibilidad de la información biológica que se maneja. El modo Explore permite plantear preguntas científicas generales con los modelos de ChatGPT de los que ya dispone el usuario. El modo Research está dirigido a preguntas complejas y flujos de trabajo de investigación avanzados: los miembros verificados de una organización pueden solicitar el acceso en su nombre, mientras que el acceso individual se anuncia como próximo. La pantalla inicial propone tareas de diseño de proteínas, diseño de moléculas pequeñas, seguridad y desarrollabilidad, estructura y secuencia, genómica y patología, y validación experimental.
GitHub Copilot: facturación anticipada, experiencia unificada y revisión de código más exigente de forma predeterminada
28 de agosto — GitHub publica una entrada de changelog que reúne tres cambios distintos relacionados con las políticas y la facturación de Copilot. Ninguno está activo de inmediato: todos tienen fechas de entrada en vigor escalonadas, lo que deja a los administradores un margen para decidir.
La primera parte reabre las inscripciones de Copilot Business y Copilot Enterprise para nuevos clientes que paguen con tarjeta bancaria o PayPal, a partir del 1 de septiembre de 2026, con una verificación de cuenta reforzada. El cambio de fondo afecta al pago: toda nueva asignación de puesto exigirá pagar el puesto antes de que el usuario obtenga acceso y, al comienzo del siguiente ciclo de facturación, se facturará por adelantado el conjunto de puestos asignados. Para los clientes existentes que pagan con tarjeta o PayPal, este cambio se aplica a partir del 1 de octubre de 2026. Las tarifas no cambian. Dos puntos merecen la atención de los administradores: revocar un puesto no da derecho a ningún reembolso prorrateado, ya que la retirada solo aparecerá en el siguiente ciclo mensual, y el uso incluido puede prorratearse ahora durante el mes para alinearse con el prorrateo del coste del puesto.
| Cambio | Fecha de efecto | Alcance |
|---|---|---|
| Reapertura de inscripciones con tarjeta o PayPal | 1 de septiembre de 2026 | Nuevos clientes Business y Enterprise |
| Facturación anticipada de los puestos | 1 de octubre de 2026 | Clientes existentes que pagan con tarjeta o PayPal |
| Experiencia y política de Copilot unificadas | No antes del 28 de septiembre de 2026 | github.com, GitHub Mobile, cloud agent |
| Conservación de datos de conversación | Con la experiencia unificada | De 28 días a la duración de vida de la cuenta |
| Valor predeterminado de la revisión de código, de Lite a Balanced | 28 de septiembre de 2026 | Repositorios y organizaciones configurados en Default |
La segunda parte es la más estructural para el uso cotidiano. No antes del 28 de septiembre de 2026, GitHub relanzará Copilot Chat en github.com, Copilot Chat en GitHub Mobile y Copilot cloud agent como una única experiencia, regida por una sola política en lugar de tres y activada de forma predeterminada tras el lanzamiento; el cloud agent se apoyará en Sandbox para acelerar la ejecución. Consecuencia directa: Copilot en github.com migrará por completo a la experiencia agent sessions, y los datos de conversación pasarán de conservarse durante 28 días a conservarse durante toda la vida de la cuenta. Darse de baja de la experiencia unificada equivale a perder el acceso a Copilot en github.com y en GitHub Mobile una vez efectuado el lanzamiento.
La tercera parte es consecuencia de la introducción de los niveles de esfuerzo de la revisión de código. A partir del 28 de septiembre de 2026, el valor «Default» corresponderá a Balanced y no a Lite, tanto para los repositorios y organizaciones existentes como para los nuevos. El mecanismo de herencia no cambia: el valor predeterminado de la organización se aplica a los repositorios que no hayan elegido su propio nivel, el valor predeterminado del repositorio se aplica a las revisiones solicitadas automáticamente y una revisión activada manualmente permite elegir el nivel desde la barra «Reviewers». Los equipos que prefieran conservar Lite deben seleccionarlo explícitamente antes de la fecha: GitHub indica que respetará esa elección.
Copilot: tres modelos disponibles de forma general y revisión de código ampliada a diffs grandes
28 de agosto — En un hilo recopilatorio publicado en X, GitHub confirma la disponibilidad general de tres modelos en Copilot: Gemini 3.7 Flash de Google, MAI-Code-1.1-Flash de Microsoft y Kimi K3. Se puede acceder a ellos desde la aplicación GitHub Copilot, desde Copilot CLI y desde Visual Studio Code. El caso de Kimi K3 merece destacarse: GitHub lo describe explícitamente como un modelo de pesos abiertos, alojado por Fireworks AI. Este punto conecta con la política global de modelos que obtuvo disponibilidad general dos días antes, cuya entrada de changelog indica que los modelos de pesos abiertos quedan excluidos de la activación predeterminada, independientemente de la política de la organización. En otras palabras, la disponibilidad general de un modelo y su activación efectiva para un cliente Business o Enterprise siguen siendo dos cosas distintas: para un modelo de pesos abiertos, el administrador debe tomar una decisión explícita.
El día anterior, GitHub había ampliado el alcance de Copilot code review en dos frentes. Ahora pueden revisarse las pull requests escritas por bots, incluido Copilot cloud agent: cuando la revisión se solicita automáticamente, no existe ninguna cuenta con licencia a la que asignarla, y la política «Allow members without a Copilot license to use Copilot code review in GitHub.com» permite facturar el uso directamente a la organización. Las pull requests del cloud agent, que hasta ahora recibían una experiencia limitada, obtienen una revisión agentic completa. Segundo frente: desaparece el límite de 300 archivos o 20 000 líneas, lo que abre la revisión automática a migraciones y refactorizaciones masivas que antes quedaban fuera de la herramienta.
| Capacidad | Antes | Después |
|---|---|---|
| Tamaño máximo de una pull request | 300 archivos o 20 000 líneas | Sin límite |
| Pull requests escritas por bots | No se revisaban automáticamente | Se revisan y se facturan a la organización |
| Pull requests de Copilot cloud agent | Experiencia limitada | Revisión agentic completa |
| Resolución de un comentario | Resolución simple | Addressed, Won’t fix o Incorrect |
A esto se suma un menú desplegable junto al botón «Resolve conversation», que permite clasificar la resolución de un comentario de revisión. GitHub indica que esta señal llega al equipo de producto: es un ciclo de retroalimentación que por fin distingue entre un comentario pertinente que se aplicó y un falso positivo descartado, dos acciones que hasta ahora producían el mismo evento de resolución.
🔗 Anuncio de @github · Changelog de revisión de código
Claude for Teachers se convierte en una oferta Enterprise gratuita para escuelas y distritos
28 de agosto — Lanzado en julio para docentes estadounidenses de K-12 que se verificaban individualmente, Claude for Teachers se convierte en una oferta Enterprise gratuita que las escuelas y los distritos pueden desplegar de una sola vez. Las organizaciones que cumplan los requisitos y se registren antes del 30 de junio de 2027 obtienen un año completo de acceso gratuito.
El contenido funcional no cambia. Lo que cambia es la administración: un responsable de la escuela o del distrito se verifica, acepta las condiciones de K-12 y el acuerdo de privacidad de los datos de los estudiantes, y después conecta su dominio de correo electrónico y su SSO. A continuación, docentes y personal obtienen acceso con los mismos límites de uso que las cuentas individuales y sin coste, mientras que la facturación por exceso permanece desactivada de forma predeterminada. La oferta incluye autenticación única, controles de acceso basados en roles y reclamación de dominio (domain claiming); esta última transfiere a la cuenta gestionada centralmente a los docentes que ya se hayan verificado en el dominio del centro.
Dos aspectos corresponden más al cumplimiento normativo que al producto, y probablemente sean los que desbloqueen los despliegues: la escuela o el distrito asume ahora las condiciones y el acuerdo de privacidad, mientras Anthropic proporciona condiciones de K-12 y un acuerdo de tratamiento de datos a nivel del centro para que un único conjunto de compromisos alineados con FERPA cubra toda la organización; y los datos de Claude for Teachers no se utilizan para entrenar los modelos. Anthropic acompaña el anuncio con dos teaching skills desarrolladas conjuntamente con Learning Commons, Lesson preparation y Check for understanding, mejoras de accesibilidad en los materiales destinados a los estudiantes y una actualización de Claude for K-12 Academy. Las teaching skills se publican como bienes públicos en GitHub.
🔗 Publicación de Claude for Teachers
Gemini: límites de uso progresivos en Notebook y asistente de a bordo en los Waymo
28 de agosto — Google revisa la forma en que Gemini Notebook contabiliza el consumo de sus usuarios. En lugar de cuotas diarias, el producto pasa a utilizar límites flexibles indexados al compute realmente utilizado, anunciados por Yesul Shin, Product Manager de Gemini Notebook. El cambio más concreto está en el ritmo de recarga: los límites se reponen cada cinco horas en lugar de una sola vez al día. Por tanto, un notebook agotado a primera hora de la tarde vuelve a estar disponible esa misma noche. El cálculo también se vuelve multifactorial —complejidad del prompt, longitud de la conversación, número de fuentes cargadas y funcionalidades utilizadas— y el notebook muestra un seguimiento del consumo, proponiendo salidas alternativas cuando el formato solicitado supera el presupuesto restante. Las generaciones más costosas, Video Overviews y Slide Decks, pueden ponerse en cola y ejecutarse después automáticamente con una notificación. El despliegue comienza el 2 de septiembre en las cuentas de consumidores, web y móvil.
Ese mismo día, la cuenta de Gemini publica los Gemini Drops del mes. Los ocho puntos retoman en esencia anuncios ya realizados, incluida la llegada de Gemini como asistente de a bordo en los Waymo, anunciada a finales de julio. No obstante, el resumen detalla su funcionamiento. El pasajero pulsa el icono de Gemini que aparece en la pantalla y después conversa por voz para controlar el habitáculo o preguntar al asistente por el entorno que atraviesa. Google se preocupa de separar las responsabilidades, y este es el aspecto más interesante desde el punto de vista técnico: Gemini funciona de forma completamente independiente de Waymo Driver, el sistema de conducción autónoma, y permanece totalmente inactivo mientras el pasajero no lo solicite. El resto del resumen amplía Gemini a más aplicaciones y servicios de terceros, y recuerda la oferta estudiantil de un año válida hasta el 31 de diciembre de 2026.
🔗 Límites de uso de Gemini Notebook · Gemini Drops de agosto
NVIDIA TensorRT Model Connect: del punto de control de Hugging Face a la inferencia C++ en dos comandos
28 de agosto — NVIDIA publica TensorRT Model Connect, una colección abierta de implementaciones de referencia cuyo objetivo es eliminar el trabajo de integración que separa un punto de control de un modelo abierto de una aplicación C++ nativa. El punto de partida es sencillo: cada familia de modelos requiere su propia conversión, su propio preprocesamiento, su propio postprocesamiento y su propio código de ejecución.
El despliegue se divide en dos fases separadas por un único artefacto. La primera, en Python, construye un bundle a partir de un identificador de Hugging Face o de un punto de control local — trtmc build Qwen/Qwen3-0.6B -o qwen3-0.6B.bundle. Este bundle incluye los motores TensorRT y los assets específicos del modelo. La segunda fase se desarrolla por completo en C++: la aplicación carga el bundle con trtmc::load(...) y trabaja directamente con entradas y salidas de alto nivel. Python sirve para preparar el modelo; desaparece del runtime de producción, al igual que PyTorch. Dos niveles de API coexisten sobre las mismas implementaciones: una semántica, que manipula prompts, imágenes y audio, y otra al nivel de los módulos, hasta los tensores con nombre y los componentes individuales de TensorRT. Para ir más lejos, TVM FFI permite sustituir una parte concreta de un modelo por un kernel GPU propio, mientras TensorRT continúa ejecutando el resto del pipeline.
El aspecto más inusual del anuncio está en el modo de desarrollo. NVIDIA describe explícitamente Model Connect como un proyecto de software «AI-native»: los agentes de código producen el código de implementación, las pruebas, las integraciones y la documentación, bajo dirección y revisión humanas. El proyecto publica releases nocturnas (nightly), y la validación automatizada sirve como puerta de entrada para cada publicación. En cuanto al rendimiento, NVIDIA anuncia una inferencia más rápida que torch.compile en las cargas compatibles y validadas.
🔗 Publicación técnica de NVIDIA · Repositorio TensorRT-Model-Connect
FastH3 v1: 15 segundos de vídeo 768p en 13 segundos, hasta 14 veces más rápido en Blackwell
28 de agosto — Hao AI Lab presenta FastH3 v1, un postentrenamiento con pesos abiertos del modelo de vídeo MiniMax H3, desarrollado con Nuva Lab y el equipo FastGen de NVIDIA. La cifra destacada: 15 segundos de vídeo en 768p generados en 13 segundos, es decir, hasta 14 veces más rápido en GPU NVIDIA Blackwell.
| Métrica | Valor |
|---|---|
| Duración generada | 15 segundos |
| Resolución | 768p |
| Tiempo de generación | 13 segundos |
| Aceleración | Hasta 14 veces en GPU Blackwell |
| Modelo base | MiniMax H3, con pesos abiertos |
| Socios | Nuva Lab, equipo FastGen de NVIDIA |
Lo particular del anuncio es su apertura. Hao AI Lab no publica solo los pesos, sino también la propia receta de aceleración, para que la comunidad pueda ejecutarla, reproducirla y mejorarla; el laboratorio ya es conocido por FastVideo, una de las primeras bibliotecas abiertas de aceleración de generación de vídeo. MiniMax confirmó oficialmente lo mismo ese día, subrayando que H3 sirve de base para este trabajo. Es el segundo postentrenamiento destacable de H3 en dos días, después de H3 Max de fal, anunciado el 27 de agosto: dos equipos diferentes trabajando en el mismo modelo base en cuarenta y ocho horas, lo que da la razón al argumento central de Hao AI Lab: la era de los modelos de vídeo con pesos abiertos apenas comienza y precisamente requiere postentrenamiento.
🔗 Anuncio de @haoailab · Confirmación de @MiniMax_AI
Midjourney prueba su primer modelo de edición V8.2
28 de agosto — Midjourney abre las pruebas de su primer modelo de edición basado en V8.2, el modelo predeterminado del servicio desde finales de julio. Hasta ahora, la generación V8.2 cubría la creación de imágenes; la edición llega como un componente distinto, todavía en fase de pruebas con los usuarios.
El alcance anunciado cubre cuatro modos. La edición mediante instrucciones permite describir en lenguaje natural la modificación deseada. La generación de imágenes a partir de otras imágenes admite hasta cuatro referencias simultáneas. El retoque localizado con pincel (inpainting) se dirige a una zona concreta. La ampliación del marco (outpainting) extiende la composición más allá de sus bordes originales. Un punto importante para los usuarios actuales: el modelo de edición sigue siendo compatible con los mecanismos de control estilístico ya existentes —la personalización, los moodboards y los srefs—. Por tanto, una identidad visual creada con estas herramientas sigue aplicándose a las imágenes editadas, y no solo a las imágenes generadas desde cero. El anuncio no menciona una fecha de disponibilidad general, precios ni restricciones de acceso por nivel de suscripción, y tampoco cita ninguna comparación con modelos de edición de la competencia.
We’re gonna start testing our first V8.2 edit model today. This model supports editing with instructions, generating images with other images (up to 4 references), brush-based inpainting, and outpainting. It also works with personalization, moodboards, and srefs. Have fun!
🇪🇸 Hoy comenzamos a probar nuestro primer modelo de edición V8.2. Este modelo admite la edición mediante instrucciones, la generación de imágenes a partir de otras imágenes (hasta 4 referencias), el retoque localizado con pincel y la ampliación del marco. También funciona con la personalización, los moodboards y los srefs. ¡Que lo paséis bien! — @midjourney en X
Wan 3.0 ocupa el primer puesto del Video Edit Arena
28 de agosto — Cuatro días después de su lanzamiento, Wan 3.0 se coloca a la cabeza del Video Edit Arena de Arena.ai, la clasificación comunitaria dedicada a la edición de vídeo. El modelo de Alibaba suma allí 1414 puntos, por delante de dreamina-seedance-2.5 por 4 puntos y de MiniMax-H3 por 22 puntos.
| Modelo evaluado | Posición | Puntuación o diferencia anunciada por Arena.ai |
|---|---|---|
| Wan 3.0 | 1.º | 1414 puntos |
| dreamina-seedance-2.5 | 2.º | 4 puntos por detrás de Wan 3.0 |
| MiniMax-H3 | 3.º | 22 puntos por detrás de Wan 3.0 |
La diferencia con el segundo sigue siendo pequeña, lo que invita a ser prudentes sobre la estabilidad de la clasificación; además, Arena.ai solo publica la puntuación absoluta de Wan 3.0, mientras que las otras dos líneas reproducen las diferencias tal como fueron anunciadas. El resultado es, no obstante, destacable por dos motivos: es la primera aparición de Wan en esta arena, más reciente que las demás y con solo 10 modelos, y la clasificación se centra específicamente en la edición de vídeo, una capacidad que Wan 3.0 destaca desde su lanzamiento del 24 de agosto bajo el nombre «Precision Video Editing». La distribución sigue el mismo ritmo que los resultados: cinco plataformas adicionales abrieron el acceso al modelo ese mismo día, elevando a aproximadamente una docena el número de distribuidores externos en menos de una semana.
Gemini Omni 1.1 Flash llega a Runway
28 de agosto — Runway añade Gemini Omni 1.1 Flash a su catálogo de modelos alojados, un día después de que el mismo modelo se incorporara a la API Club de Pika. El estudio lo anuncia con la denominación «Google Omni 1.1 Flash», mientras que Google lo llama Gemini Omni 1.1 Flash en su propia página de anuncio: mismo modelo, dos etiquetas.
El ritmo de integración de Runway sigue acelerándose: la plataforma aloja ahora, además de sus propios Gen-4.5, los modelos Seedance 2.5, MiniMax H3, Wan 3.0 —añadido el 24 de agosto— y Muse Image de Meta —añadido el 26 de agosto—. Esta estrategia multimodelo se articula con Ruby, el convertidor de SDR a HDR ampliado el 24 de agosto a todos los modelos alojados en la plataforma. El anuncio no especifica precios, restricciones por nivel de suscripción ni ninguna capacidad específica del modelo en Runway.
Warp lanza Skill Doctor v1, una skill que puntúa y corrige las skills de los agentes
28 de agosto — El día anterior, Warp presentaba los bucles de auto-mejora de sus factories: scorers que puntúan las trazas de los agentes y agentes que proponen diffs en la definición de la factory. El componente central de este dispositivo sale hoy del ámbito de las factories para convertirse en una skill autónoma, utilizable en un puesto de desarrollo ordinario.
/skill-doctor v1 aborda un punto ciego del trabajo con agentes: los archivos de skills se escriben una vez y rara vez se vuelven a revisar, aunque las conversaciones que controlan generan continuamente pruebas de lo que funciona y lo que no. La skill agrega las transcripciones de sesiones pasadas, encarga su puntuación a subagentes respaldados por rúbricas probadas —eficacia, calidad del código y cobertura de las skills— y después hace que el agente revise esas puntuaciones para proponer modificaciones de skills listas para fusionarse. Lo destacable es el alcance: la skill acepta historiales de Claude Code, Codex y Warp. Por tanto, el editor ofrece una herramienta que mejora la configuración de agentes de la competencia, y no solo la suya. El repositorio es público.
| Criterio del informe de ejemplo | Puntuación sobre 100 |
|---|---|
| Puntuación global | 82 |
| Eficacia | 75 |
| Calidad del código | 93 |
| Cobertura de las skills | 74 |
Estas cifras proceden del informe de demostración que aparece en la página del producto, sobre un repositorio ficticio llamado «CLIENT-APP»: es una muestra que ilustra el formato de salida, no un resultado medido en un repositorio real.
🔗 Anuncio de @BHolmesDev · Página del producto Skill Doctor
Amp llega a iOS y macOS
28 de agosto — Amp completa su oferta de aplicaciones con dos clientes nativos: una aplicación para iOS distribuida mediante TestFlight y una aplicación para macOS disponible para descarga directa, ambas accesibles desde ampcode.com/app.
El alcance anunciado cubre tres elementos ya centrales en el producto: los threads, los orbs —las máquinas remotas desechables en las que se ejecutan los agentes de Amp— y Puck, el meta-agente de asistencia. En otras palabras, la aplicación móvil no sirve para escribir código, sino para supervisar y reiniciar agentes que trabajan en otro lugar, como resume la promesa de apertura del anuncio: controlar los orbs desde cualquier sitio. La puesta en contexto es directa con la retirada de la barra lateral de la TUI anunciada el día anterior, cuando Amp explicó que trasladaría el seguimiento de los threads a sus aplicaciones web y nativas. Ambos anuncios se complementan: el terminal se concentra en una sesión y el seguimiento de varios entornos migra a los clientes dedicados. Ese mismo día, el editor también desvinculó la identidad de Git utilizada para firmar los commits producidos en los orbs de la dirección de la cuenta de Amp.
v0 añade GPT-5.6 Sol, conexión desde las vistas previas y una pasarela de IA sin configuración
28 de agosto — v0 publica un changelog denso, cuyo eje principal se resume en una idea: reducir el número de claves y configuraciones que un desarrollador debe establecer antes de ver funcionar su aplicación.
El primer apartado concierne a los modelos. GPT-5.6 Sol entra en el selector, acompañado de un nivel Sol Fast más rápido, gestionado mediante OpenAI en Vercel AI Gateway, con un descuento del 50 % vigente hasta el 18 de septiembre. El segundo apartado es más estructural: las aplicaciones que v0 genera ahora se conectan a las funciones de IA a través de Vercel AI Gateway con autenticación sin configuración, en un amplio perímetro: texto, salida estructurada, embeddings, reranking, imágenes, vídeo, voz y transcripción. Por tanto, v0 deja de exigir una clave de proveedor o de pasarela cuando la aplicación generada quiere llamar a un modelo.
| Elemento | Antes | Después |
|---|---|---|
| Servidores MCP por perímetro | 10 | 100 |
| Sandbox de pago sin CPU o memoria | Expiración | Paso al nivel de VM superior |
| Descuento en GPT-5.6 Sol | — | 50 % hasta el 18 de septiembre |
El tercer apartado se centra en el entorno de vista previa. Ahora es posible conectarse con Vercel desde el interior de una vista previa de VM; la vista previa y la aplicación comparten un origen, lo que mantiene la sesión. Cuando el servidor de desarrollo no consigue iniciarse o instalarse, aparece una barra de error compacta debajo de la vista previa y abre el registro de la consola directamente en el error. El resto reúne ajustes destacables: una opción de visibilidad «Team or password», un historial de revisiones para las skills personalizadas con rutas, autores, marcas de tiempo y diffs, y la apertura para todos del editor de código web del panel de VM.
Replit abre un Growth Kit de skills de marketing con siete socios
28 de agosto — Replit desplaza su oferta un paso más allá en el ciclo de producto. Después de trabajar en la generación de aplicaciones, el editor aborda lo que ocurre después de la puesta en producción: encontrar usuarios. Ese es el objetivo de las Growth Skills, agrupadas en una página llamada Replit Growth Kit.
El formato elegido es deliberadamente sencillo. Una skill es un archivo markdown que el Agent de Replit ejecuta contra la aplicación existente, no una nueva interfaz que aprender. El proceso consta de tres pasos: descargar la skill, añadirla como archivo adjunto al proyecto y dejar que el Agent ejecute el proceso —auditorías, producción de assets y configuración con el socio cuando este está conectado—. El catálogo cuenta con 15 skills distribuidas en cinco motions, respaldadas por siete socios de lanzamiento.
| Motion | Socios implicados | Ejemplos de skills |
|---|---|---|
| Outbound | Apollo, ZoomInfo, Clay | Cold Email Launch, ICP & Market Sizing, Lead Enrichment |
| Conversion | ZoomInfo, PostHog, Clay | Signup Firmographics, Onboarding Experiment, Signup Scoring |
| Growth | SideShift | Consumer & Viral Potential Assessment, UGC Launch Kit |
| Monetization | Stripe, RevenueCat | Pricing Skill, Subscription & Trial Setup |
| Analytics | Apollo, PostHog | Pixel & Web Intent, Funnel & Analytics Setup |
La gratuidad no es uniforme: la FAQ indica que depende del producto del socio utilizado; algunos requieren una suscripción para poder aprovecharse por completo.
La retención de Actions se ampliará a checks, ejecuciones de workflows y estados
27 de agosto — GitHub anuncia que, a partir del 1 de octubre de 2026, tres nuevos tipos de datos se incorporarán a la configuración de retención de GitHub Actions: los checks, las ejecuciones de workflows y los estados. Hasta ahora, estos objetos se conservaban durante más de 400 días independientemente de cualquier configuración, mientras que los artefactos y los logs ya obedecían al ajuste, con un valor predeterminado de 90 días. Tras el cambio, las cinco categorías se eliminarán según la misma regla, y la etiqueta de la configuración pasará a ser «Check, workflow run, status, artifact and log retention».
| Elemento | Antes | A partir del 1 de octubre de 2026 |
|---|---|---|
| Checks, ejecuciones de workflows, estados | Más de 400 días, no configurable | Configuración de retención de Actions, 90 días por defecto |
| Límite para repositorios públicos | 90 días para artefactos y logs | 90 días para las cinco categorías |
| Facturación del almacenamiento | Artefactos y logs facturados | Sin cambios; los metadatos no se facturan |
Las salvaguardas existentes siguen siendo válidas: un repositorio solo puede ampliar su periodo hasta el límite establecido en los niveles de organización y empresa, y el cambio no es retroactivo: modificar la configuración no restaura los datos que ya se hayan eliminado. En cuanto a la facturación, el efecto no es neutro en el mal sentido: como la limpieza se aplica a los datos que superan el periodo configurado, los repositorios que conservaban artefactos y logs más allá de su propia configuración pueden ver reducida su cantidad de almacenamiento facturable. GitHub recomienda tres comprobaciones antes del 1 de octubre: revisar la configuración en los tres niveles, ampliarla si se necesita una ventana más larga y exportar lo que deba sobrevivir más allá de la retención configurada.
OpenAI y el ministerio tailandés MHESI lanzan un acelerador de ocho semanas
28 de agosto — En Bangkok, OpenAI y el Ministerio tailandés de Educación Superior, Ciencia, Investigación e Innovación anuncian un acelerador destinado a llevar a startups tailandesas desde un prototipo prometedor hasta un producto desplegable. Es la primera colaboración público-privada de OpenAI con el Gobierno tailandés dedicada al apoyo de startups locales, puesta en marcha junto con la National Innovation Agency, la Universidad Mahidol y Techsauce.
Las cifras de uso presentadas por OpenAI explican la elección del país: según sus datos internos, Tailandia figura entre los 20 primeros países del mundo en usuarios activos semanales de ChatGPT, y el uso activo semanal de Codex se ha multiplicado por más de 350 desde comienzos de 2026, lo que también sitúa al país entre los 20 primeros del mundo para esta herramienta. La primera cohorte reúne a diez empresas, cinco de IA médica y bienestar y cinco de educación: CARIVA, Wello Food, Dietz, Precisionize, FitSloth, Curico, insKru, Floaino, EasyKids Robotics y Globish. Cada equipo recibe 2 000 dólares en créditos de API, acompañamiento técnico individual, acceso a los últimos modelos de frontera y un mentor dedicado, con sesiones semanales sobre diseño de producto, ingeniería, evaluación, IA responsable, gestión de costes y captación de fondos. El programa concluirá con un Demo Day en Bangkok en noviembre.
Breves
- Together AI prepara una ficha de GLM-5.3 en su API serverless — La ficha del modelo pasa al estado «coming soon» con un botón de notificación: modelo de código abierto de frontera, contexto de un millón de tokens, tres niveles de esfuerzo y ningún precio publicado por ahora, mientras los modelos vecinos ya muestran sus precios. 🔗 Mensaje de @togethercompute
- Qwen3.8-Flash se incorpora al plan OpenCode Go — Dos días después de abrir sus pesos, la mezcla de expertos de 125 mil millones de parámetros, de los que 6 mil millones están activos, con contexto de un millón de tokens y entradas multimodales, se vuelve accesible desde el agente de código open source. Grok 4.6 se había incorporado al mismo plan el 25 de agosto. 🔗 Mensaje de @Alibaba_Qwen
- Wan 3.0 llega a cinco plataformas más — DeepInfra ofrece clips de 30 segundos en 1080p con referencia omnimodal y coherencia de personajes; PowerDirector, de CyberLink, PixelDojo y a2e abren el acceso, y Picsart acompaña su integración con una guía de prompting firmada por su responsable de producto de vídeo. 🔗 Mensaje de @Alibaba_Wan
- Amp separa la identidad Git de los commits de la cuenta de usuario — Se pueden declarar por separado un nombre y una dirección verificada para los commits producidos en los orbs, y la verificación se realiza mediante Puck en lenguaje natural; los administradores del workspace pueden elegir entre tres reglas, y
GIT_AUTHOR_*yGIT_COMMITTER_*se completan automáticamente al iniciar el orb. Ya no es necesario mantener un archivo.mailmap. 🔗 Publicación de Amp - Warp organiza un taller sobre bucles de auto-mejora — Ben Holmes dirigirá el jueves 3 de septiembre una sesión dedicada a construir agentes que revisan conversaciones pasadas, evalúan su calidad y sugieren mejoras para las skills con el fin de corregir ineficiencias. 🔗 Mensaje de @warpdotdev
- Delta ejecuta comandos de terminal mediante el prefijo
!— Ante la petición de un usuario que reclamaba una terminal real en su entorno de codificación multijugador, Zed responde que la capacidad ya existe: un mensaje que comienza con un signo de exclamación se ejecuta como un comando de shell. 🔗 Mensaje de @zeddotdev - GitHub generaliza las etiquetas sugeridas y el archivado, y deja obsoleto Classroom — El selector de etiquetas propone sugerencias basadas en el uso reciente del repositorio y en una lista personal, y una etiqueta que ya no resulta útil se archiva sin perder su historial, con posibilidad de revertirlo desde la página Labels. Ese mismo día, el sitio web, las API y los servicios de GitHub Classroom se desmantelan en favor de soluciones asociadas: las cuentas, los repositorios y las organizaciones se conservan, pero se eliminarán los datos propios de Classroom. 🔗 Archivado de etiquetas · Obsolescencia de Classroom
- NVIDIA Warp supera los 10 millones de descargas — La biblioteca que aporta rendimiento GPU a Python para física y simulación alcanza el hito, con usos en ingeniería computacional, procesamiento de geometría y robótica; se anuncia un livestream para la semana siguiente. No debe confundirse con el terminal agentivo del mismo nombre. 🔗 Mensaje de @NVIDIAAI
- Replit abre su primera oficina internacional en Londres — El editor celebra la apertura de su primera oficina fuera de Estados Unidos con una velada organizada junto a OpenAI en el Sunset Bar de Sea Containers, con una conversación informal dirigida por Amjad Masad, CEO y cofundador. Inscripciones abiertas hasta el 5 de septiembre. 🔗 Mensaje de @Replit
- Amp dedica un episodio de podcast a la reducción del coste de la inteligencia — Quinn Slack y Thorsten Ball conversan durante 48 minutos, en el episodio «When Tokens Flow Like Electricity», sobre las consecuencias de una inteligencia que se ha vuelto barata, empezando por el cambio en el equilibrio entre construir y comprar. 🔗 Mensaje de @AmpCode
- Cognition publica una visita a su sede de San Francisco hecha con Devin — Vídeo de contratación de dos minutos y medio en el que el equipo afirma hacerlo todo con Devin, incluso pedir el café de la mañana. El vídeo no incluye ningún anuncio de producto ni ninguna cifra. 🔗 Mensaje de @cognition
- Together AI impulsa la suite Navigator de Yutori — El proveedor confirma la prolongación de su asociación para ejecutar la suite Navigator, incluido Navigator n2, un modelo para controlar interfaces (computer use) anunciado con 27 mil millones de parámetros. El modelo procede de Yutori y la infraestructura de inferencia, de Together AI. 🔗 Mensaje de @togethercompute
- Ai2 documenta la adaptación de Dolma al tailandés — Un equipo tailandés reutilizó el kit de herramientas abierto de Ai2 para la curación de datos con el fin de crear Mangosteen, un corpus de preentrenamiento de 47 mil millones de tokens que mejora el rendimiento de los modelos tailandeses con menos datos que los conjuntos de datos web existentes, al filtrar lo que faltaba: libros, artículos de investigación, sitios oficiales y subtítulos. 🔗 Publicación de Ai2
- Sakana AI presenta Sakana Marlin en el Camp AI organizado por Auth0 — Haruki Goda, ingeniero de investigación aplicada, presentó allí los productos del laboratorio, incluido el asistente de investigación ultraprofundо Sakana Marlin, cuyo desarrollo dirigió. Comunicación de evento sin anuncio de producto. 🔗 Mensaje de @SakanaAILabs
- Cohere publica una guía de adopción de la IA generativa y difunde un llamamiento para que regresen los talentos canadienses — La publicación de la sección Enterprise AI enumera seis familias de usos, tres familias de obstáculos y un método de adopción en tres etapas, sin ninguna cifra ni estudio citado, y concluye que la propia tecnología se convertirá cada vez menos en un factor de diferenciación. La cuenta de la empresa también difunde un mensaje de su CEO Aidan Gomez que anima a los canadienses expatriados a regresar, sin ningún programa ni mecanismo cuantificado asociado. 🔗 Publicación de Cohere · Mensaje de @cohere
- Luma mejora su upscaling — Anuncio de dos frases sobre una mejora de la ampliación de resolución (upscaling), sin detalles técnicos, cifras, nivel de suscripción ni página de producto asociada. 🔗 Mensaje de @LumaLabsAI
- Runway lanza un concurso HORSE con un millón de créditos en premios — Operación comunitaria de 24 horas inspirada en el juego de baloncesto: el estudio publica un primer plano, los participantes responden con el suyo citando el mensaje y el ganador recibe 1 000 000 de créditos. Los prompts y los personajes se proporcionan en el hilo. 🔗 Mensaje de @runwayml
Lo que significa
Los pesos abiertos llegan al terreno de la ciberdefensa, y las plataformas deben decidir. GLM-5.3 no es un modelo abierto más: es un modelo del que Z.ai documenta que encontró 2 436 vulnerabilidades reales en 269 proyectos, de las cuales 2 383 siguen bajo embargo, y que firma la mejor puntuación de la tabla en CyberGym. El laboratorio acompaña esta apertura con una licencia propia en lugar de una licencia permisiva, un registro público de divulgación y una evaluación de seguridad que retrasó la publicación dos semanas; tantas salvaguardas indican que la apertura ya no es un gesto neutral. Ese mismo día, GitHub hace que Kimi K3 esté disponible de forma general en Copilot, al tiempo que recuerda que los modelos con pesos abiertos siguen excluidos de la activación predeterminada, independientemente de la política de la organización. Dos formas de abordar la misma cuestión: el productor establece una licencia y un embargo; el distribuidor coloca un interruptor que el administrador debe accionar manualmente.
La superficie de ataque de un agente de código son las rutas que se le permite leer. Las siete correcciones de Claude Code 2.1.251 cuentan la misma historia: un control de permisos realizado demasiado pronto, seguido del intercambio de un enlace simbólico, el desvío de una ruta de búsqueda, la lectura de un scriptPath antes de su verificación y una entrada de marketplace que apunta fuera del directorio del plugin. Ninguno es un defecto del modelo; todos son defectos de ordenación entre la verificación y el acceso. El modo --restricted extrae la consecuencia eliminando por completo la capacidad de ejecución en lugar de controlarla, y el endurecimiento de los ajustes gestionados admite que la propia configuración es un vector: un ajuste que termina el TLS del sandbox o inyecta credenciales requiere ahora aprobación. Que este conjunto aparezca el mismo día en que un modelo abierto entrenado para encontrar fallos se vuelve descargable no es una coincidencia organizada, pero la conjunción resulta elocuente.
Los agentes entran en el ciclo de producción de artefactos; la revisión humana sigue siendo la puerta de entrada. Anthropic deja que Claude alinee modelos durante 48 horas con una GPU, obtiene una solución 15 000 veces más eficiente que el procedimiento de producción y publica en el mismo documento que el 2,4 % de las transcripciones contiene intentos de hacer trampa detectados por otro modelo. NVIDIA describe TensorRT Model Connect como un proyecto «AI-native» cuyo código, pruebas y documentación son generados por agentes, bajo dirección y revisión humanas, con validación automatizada como puerta de publicación. Warp entrega una skill que puntúa las transcripciones de agentes competidores y propone diffs para los archivos de skills. Tres contextos sin relación, una misma arquitectura: la producción se delega, la verificación no; y en los tres casos, el mecanismo de control se describe con tanto cuidado como el resultado.
El recuento se desplaza hacia el compute, y los valores predeterminados cambian de bando. GitHub cambia Copilot al pago por puesto antes del acceso, la facturación anticipada, una retención de conversaciones que pasa de 28 días a la vida útil de la cuenta y un nivel de revisión de código predeterminado elevado de Lite a Balanced. Google sustituye las cuotas diarias de Gemini Notebook por límites indexados al compute, que se recargan cada cinco horas y se calculan según la complejidad del prompt, la longitud del chat y el número de fuentes. GitHub Actions reduce la retención de checks, ejecuciones y estados de más de 400 días a un valor predeterminado de 90. Ninguno de estos cambios es un cambio en el precio anunciado, y eso es precisamente lo que los vuelve estructurales: son los valores predeterminados los que cambian, y hay que actuar explícitamente —seleccionar Lite antes del 28 de septiembre, aumentar la retención antes del 1 de octubre— para permanecer como antes.
Fuentes
- Z.ai — blog técnico de GLM-5.3
- Hugging Face — zai-org/GLM-5.3
- Perplexity — GLM 5.3 en Computer
- Claude Code — registro de cambios
- Anthropic — investigadores automatizados y fallos de alineación
- Anthropic — Claude for Teachers para escuelas y distritos
- OpenAI — Rosalind Workbench
- OpenAI — acelerador con el MHESI tailandés
- GitHub — cambios de políticas y facturación de Copilot
- GitHub — revisión de código de Copilot ampliada
- GitHub — retención ampliada de Actions
- Google — límites de uso flexibles de Gemini Notebook
- NVIDIA — TensorRT Model Connect
- Hao AI Lab — FastH3 v1
- Midjourney — modelo de edición V8.2
- Alibaba Wan — primer puesto del Video Edit Arena
- Runway — Omni 1.1 Flash en Runway
- Warp — página de producto Skill Doctor
- Amp — aplicaciones para iOS y macOS
- v0 — registro de cambios
- Replit — Growth Kit