Pesquisar

GPT-5.6 Sol unifica ChatGPT, Kimi K3 em disponibilidade geral no Copilot, WeatherNext prevê ciclones com cinco dias de antecedência

Artigo gerado por inteligência artificial
GPT-5.6 Sol unifica ChatGPT, Kimi K3 em disponibilidade geral no Copilot, WeatherNext prevê ciclones com cinco dias de antecedência

ai-powered-markdown-translator

Artigo traduzido do fr para o pt com gpt-5.4-mini.

Ver projeto no GitHub ↗

Em 6 de agosto de 2026, a OpenAI unifica a experiência do ChatGPT em torno de uma GPT-5.6 Sol comum aos modos rápido e de raciocínio para os assinantes pagos, com 68% menos erros factuais, enquanto o GPT-5.6 Luna passa a ter chats ilimitados gratuitos. No mesmo dia, o Kimi K3 chega à disponibilidade geral no GitHub Copilot, o Google DeepMind publica na Nature o WeatherNext, seu modelo aberto que prevê ciclones com cinco dias de antecedência, e a Alibaba abre o beta público do Wan3.0 para geração de vídeo de 30 segundos. A Meta completa a semana com benchmarks da Artificial Analysis colocando o Muse Spark 1.2 quase na fronteira e um balanço de cinco resultados de nível ouro em Olimpíadas científicas internacionais, enquanto uma dezena e meia de anúncios cobre as ferramentas de código agentic (Amp, Devin, Replit, Warp, Cursor), o ecossistema open-weight (Hugging Face, Sakana, Together AI) e a geração de mídia (ElevenLabs, Suno).


ChatGPT passa para GPT-5.6 Sol unificado, GPT-5.6 Luna fica ilimitado e gratuito

6 de agosto — A OpenAI unifica a experiência de conversa no ChatGPT em torno de uma versão atualizada do GPT-5.6 Sol para assinantes pagos. Até aqui, os usuários Plus e Pro alternavam manualmente entre um modelo rápido (Instant) e um modelo de raciocínio aprofundado. Agora, o GPT-5.6 Sol gerencia os dois modos em uma única experiência, com um controle deslizante de esforço de raciocínio (slider) ajustável em tempo real — uma simplificação direta da interface, em resposta ao feedback dos usuários sobre a confusão entre os dois modos antigos.

Em confiabilidade, a OpenAI apresenta um número concreto: em sua avaliação de factualidade de alto risco (finanças, medicina, direito), a nova versão do GPT-5.6 Sol produz 68% menos respostas contendo erros factuais, em comparação com o GPT-5.5 Instant. Esse é o argumento central desta atualização, apresentada como um ganho de confiabilidade e não como um salto de capacidades brutas.

No lado da oferta gratuita, os usuários Free e Go também passam a ter acesso ampliado ao GPT-5.6 Luna: conversas de texto ilimitadas a partir de 7 de agosto e a ظهور de um botão «Think» para acionar mais raciocínio em perguntas difíceis — um recurso até então reservado às ofertas pagas.

Item acompanhadoDetalhe numérico
Erros factuais finanças/medicina/direito-68% vs GPT-5.5 Instant
GPT-5.6 Sol + controle deslizante (Plus/Pro)disponível desde 6 de agosto
Chats ilimitados GPT-5.6 Luna (Free/Go)disponível desde 7 de agosto

Um ponto de escopo a notar: esta atualização diz respeito apenas à experiência Chat do ChatGPT — a versão do GPT-5.6 Sol que alimenta o ChatGPT Work e o Codex não é alterada por este anúncio.

🔗 Anúncio oficial da OpenAI


Kimi K3 disponível em versão geral no GitHub Copilot

6 de agosto — O GitHub anuncia a disponibilidade geral do Kimi K3, o modelo open-weight da Moonshot AI, no Copilot. A implantação é gradual nas ofertas Pro, Pro+, Max, Business e Enterprise, e o modelo é acessível em todas as superfícies do Copilot: Visual Studio Code, Visual Studio, Copilot CLI, o agente cloud, o app GitHub Copilot, github.com, GitHub Mobile, além dos plugins JetBrains, XCode e Eclipse.

📣 @Kimi_Moonshot’s Kimi K3, an open-weight model, is now generally available and rolling out in GitHub Copilot. The model shows frontier-level abilities on agentic coding with highly cost-effective pricing. It is hosted by @FireworksAI_HQ.

🇵🇹 📣 O Kimi K3 da @Kimi_Moonshot, um modelo de pesos abertos, já está em disponibilidade geral e sendo implantado no GitHub Copilot. O modelo apresenta capacidades de nível de fronteira em código agentic, com uma precificação muito competitiva. Ele é hospedado pela @FireworksAI_HQ.@github no X

O modelo é hospedado via Fireworks AI, com cobrança por uso alinhada às tarifas do fornecedor — o changelog não detalha nem preços exatos nem a janela de contexto. Para organizações em Business e Enterprise, o Kimi K3 vem desativado por padrão: os administradores precisam ativar explicitamente a política de modelo antes que as equipes possam acessá-lo. Essa chegada se insere na estratégia multi-modelo do Copilot, que já havia integrado o Kimi K2.7 Code mais cedo em agosto.

🔗 Changelog do GitHub


WeatherNext: Google DeepMind prevê ciclones com cinco dias de antecedência, pesos abertos

6 de agosto — O Google DeepMind publica na revista Nature os resultados do WeatherNext, seu modelo de IA dedicado à previsão de ciclones tropicais. O modelo alcança precisão de estado da arte para prever a trajetória e a intensidade de uma tempestade, oferecendo em média 24 horas extras para se preparar em comparação com os métodos anteriores.

Predicting cyclones accurately can help save lives - and every hour of lead time counts. Published in @Nature, our AI model WeatherNext achieves state-of-the-art accuracy in forecasting a storm’s track and intensity, giving us a critical extra 24 hours to prepare on average.

🇵🇹 Prever com precisão os ciclones pode salvar vidas — e cada hora de antecedência conta. Publicado na @Nature, o nosso modelo de IA WeatherNext alcança precisão de estado da arte na previsão da trajetória e da intensidade de uma tempestade, nos dando em média 24 horas extras para nos prepararmos.@GoogleDeepMind no X

Durante o furacão Melissa, o WeatherNext forneceu previsões antecipadas de seu landfall em categoria 5, com cinco dias de antecedência e um nível de confiança de 80%. O modelo, treinado com vários anos de dados atmosféricos globais e quase 5 000 ciclones históricos, gera cada cenário de previsão probabilística em 15 dias em menos de um minuto em um chip TPU. O Google DeepMind agora fornece 1 000 previsões probabilísticas por tempestade, acessíveis via a ferramenta WeatherLab.

Indicador medidoValor medido
Tempo extra de preparação+24h em média
Alerta do furacão Melissa (categoria 5)5 dias de antecedência, confiança 80%
Ciclones históricos no treinamento~5 000

Ponto notável para o ecossistema: o código e os pesos do modelo são abertos no GitHub, livremente disponíveis tanto para a pesquisa acadêmica quanto para a previsão operacional.


Wan3.0 (Alibaba) entra em beta público com vídeos nativos de 30 segundos

6 de agosto — A Alibaba lança o beta público do Wan3.0, a nova geração de seu modelo de geração de vídeo, com três eixos destacados: geração de vídeo nativa podendo chegar a 30 segundos em uma única passada, um render visual qualificado como «reality-grade» (personagens mais expressivos, melhor coerência das referências de uma cena para outra) e uma função de Omni-Reference que amplia a compreensão do modelo para além de texto, imagem, áudio e vídeo: o Wan3.0 agora pode ler documentos estruturados (doc, xls, ppt, pdf, etc.) e gerar um vídeo diretamente a partir do conteúdo deles.

O beta já está disponível no Alibaba Cloud Model Studio e no Qwen Cloud, com chegada prevista em breve ao aplicativo Wan reservado aos membros.

Resolução de vídeoPreço da API (por segundo gerado)
480p0,05 $
720p0,10 $
1080p0,20 $

O acesso completo à API deve ser aberto gradualmente nas próximas semanas. Este lançamento posiciona o Wan3.0 diante dos anúncios recentes da concorrência sobre geração de vídeo de longa duração com controle multimodal fino — FLUX 3 Video da Black Forest Labs, Seedance 2.5 da ByteDance, MiniMax H3 — um segmento em que a capacidade de gerar clipes de 20 a 30 segundos com controle de referência rico se torna um argumento central de diferenciação.

🔗 Anúncio @Alibaba_Wan


Muse Spark 1.2 da Meta se aproxima da fronteira, segundo a Artificial Analysis

5-6 de agosto — A consultoria independente Artificial Analysis publica sua avaliação completa do Muse Spark 1.2, o modelo da Meta lançado em paralelo ao agente Muse Code. No AA Intelligence Index, ele obtém pontuação 54 (variante xhigh), alta de 3 pontos em relação ao Muse Spark 1.1 (51) e de 11 pontos em relação ao Muse Spark 1.0 (43, lançado em abril) — sua terceira versão em quatro meses. Essa pontuação o coloca em empate efetivo com GPT-5.5 (xhigh, 55) e Grok 4.5 (high, 54), logo atrás dos modelos de ponta atuais: Claude Opus 5 (max, 61), Claude Fable 5 (max, 60), GPT-5.6 Sol (max, 59) e Kimi K3 (max, 57).

O principal progresso está no trabalho de conhecimento agentic, ponto fraco identificado no lançamento do Muse Spark 1.1: a pontuação GDPval-AA v2 Elo sobe de 1371 para 1631, colocando o modelo em 5º lugar entre todos os modelos avaliados, à frente do Claude Opus 4.8 (1588).

Indicador medidoMuse Spark 1.1Muse Spark 1.2
AA Intelligence Index (xhigh)5154
GDPval-AA v2 Elo13711631
Terminal-Bench 2.178%80%
Custo por tarefa (Intelligence Index)0,29 $0,40 $

No custo, o Muse Spark 1.2 continua entre os modelos mais eficientes do seu nível de inteligência, a 0,40 $ por tarefa para uma precificação de API inalterada (1,25 $ / 4,25 $ por milhão de tokens de entrada/saída). Apenas Grok 4.5 e GPT-5.6 Sol (medium) são mais baratos no seu grupo. No Vals Index, o Muse Spark 1.2 também entra no top 5 com apenas 0,69 $ por teste — três vezes mais barato que o Kimi K3, dez vezes mais barato que Claude Fable 5, Opus 5 e GPT-5.6 Sol.

🔗 Thread da Artificial Analysis


Meta reivindica resultados de nível ouro em cinco Olimpíadas científicas internacionais

6 de agosto — A Meta Superintelligence Labs (MSL) anuncia ter inscrito versões internas da família Muse Spark em cinco competições científicas internacionais de alto nível em 2026, para medir o progresso real em raciocínio em vez de benchmarks sintéticos — um balanço acumulado após uma primeira medalha em física já relatada em julho.

To understand whether we’re making genuine progress on reasoning, we entered our AI models in five international STEM Olympiad competitions this year. The results: Asian Physics Olympiad (APhO): Perfect score on the theory exam — gold medal. International Physics Olympiad (IPhO): Perfect score — gold medal. International Mathematical Olympiad (IMO): Gold medal, top 4% of human participants. International Chemistry Olympiad (IChO): Gold-medal level. Romanian Masters of Mathematics (RMM): Gold-medal level.

🇵🇹 Para saber se estamos realmente progredindo em raciocínio, inscrevemos nossos modelos de IA em cinco competições internacionais de ciências neste ano. Resultados: Olimpíada Asiática de Física (APhO) — pontuação perfeita na prova teórica, medalha de ouro. Olimpíada Internacional de Física (IPhO) — pontuação perfeita, medalha de ouro. Olimpíada Internacional de Matemática (IMO) — medalha de ouro, top 4% dos participantes humanos. Olimpíada Internacional de Química (IChO) — nível de medalha de ouro. Romanian Masters of Mathematics (RMM) — nível de medalha de ouro.@shuchaobi no X

Competição científicaResultado obtido
APhO (física, Ásia)Pontuação perfeita na prova teórica — ouro
IPhO (física, internacional)Pontuação perfeita na prova teórica — ouro
IMO (matemática)Ouro, top 4% dos participantes humanos
IChO (química)Nível de medalha de ouro
RMM (matemática, Romênia)Nível de medalha de ouro

Três dessas competições (APhO, IPhO, IMO) foram provas ao vivo, corrigidas pelos juízes oficiais segundo os mesmos critérios usados para candidatos humanos. A Meta especifica que os modelos utilizados não tinham acesso a nenhuma ferramenta externa — sem pesquisa na web, sem interpretador de código, sem calculadora — com uma orquestração multiagente em raciocínio paralelo.

🔗 Relay @AIatMeta


Ferramentas de desenvolvimento em IA: Portals, sandbox remota, roteamento de modelos

Cinco anúncios aproximam o desenvolvimento local de ambientes remotos ou multi-modelo nesta semana.

Amp lança os Portals — pré-visualização ao vivo dos apps nos Orbs

6 de agosto — A Amp adiciona os Portals, disponíveis agora em todos os orbs (o ambiente de desenvolvimento remoto da Amp), um recurso que expõe diretamente no navegador os serviços HTTP rodando dentro de um orb. Até aqui, testar ao vivo as mudanças feitas pelo agente exigia configurar uma VPN ou lidar com portas. Tecnicamente, o agente cria ou detecta um arquivo .amp/services.yaml e executa amp orb services ensure para iniciar a aplicação, exposta depois por uma conexão HTTPS segura. Os Portals ficam acessíveis a qualquer pessoa com acesso ao thread, o que permite que vários membros de uma equipe vejam as mesmas mudanças ao vivo, inclusive quando o orb desperta após um período de suspensão.

🔗 Amp — Portals

Devin Outposts agora roda no Vercel Sandbox

5 de agosto — A Cognition amplia o Devin Outposts (lançado no fim de julho para executar o Devin nativamente em qualquer computador) com uma integração ao Vercel Sandbox, disponível agora. O agente agora pode construir e testar uma aplicação em uma microVM isolada na infraestrutura da Vercel, com acesso ao Docker, conexão a redes privadas via VPN e retomada a partir de um snapshot do sistema de arquivos que preserva intactos o repositório, as dependências e o estado de build. Essa integração aproxima o Devin Outposts de ofertas de ambientes cloud efêmeros semelhantes às da Amp (Orbs) ou da Warp, com a vantagem de se apoiar na infraestrutura da Vercel já usada por muitas equipes de front-end.

🔗 @cognition no X

Replit faz suas varreduras de segurança durante o build, com Semgrep

5 de agosto — A Replit anuncia, em parceria com a Semgrep, que suas varreduras de segurança agora são executadas durante a construção da aplicação em vez de apenas no final — uma evolução que responde diretamente a uma demanda dos usuários. Essas varreduras vêm ativas por padrão e se integram ao conjunto de funcionalidades do Replit Auto-Protect, que protege automaticamente as aplicações geradas pelo agente. A Replit informa que seu Agent já executa mais de 100 000 varreduras por dia, um número que ilustra a escala em que a ferramenta é usada para vibe coding em produção, com detecção e correção de vulnerabilidades antes da publicação.

🔗 @Replit no X

Warp introduz roteadores de modelos personalizados

5 de agosto — Pouco mais de uma semana após o lançamento do Warp Agent CLI, a Warp adiciona roteadores de modelos personalizados, disponíveis agora para todos os usuários. Passa a ser possível definir suas próprias regras de roteamento em linguagem natural («envie as tarefas simples para Minimax», «envie as correções de bugs para Kimi K3»), e cada requisição é então automaticamente direcionada ao modelo considerado mais adequado. Esses roteadores se somam ao roteamento automático já integrado ao CLI e funcionam com modelos open weight, em BYOK (bring your own key), ou por meio de uma assinatura SuperGrok — uma resposta direta à tendência observada em várias ferramentas concorrentes de orquestrar vários modelos conforme a tarefa em vez de apostar em um único modelo de fronteira.

🔗 @warpdotdev no X

Cursor detalha Cursor Router — até 68% de economia sem perda de qualidade

6 de agosto — Cursor publica um artigo técnico detalhando o funcionamento do Cursor Router, seu sistema de seleção automática de modelo lançado em 22 de julho — portanto, não um lançamento, mas um artigo de fundo com dados inéditos. O roteador funciona em duas etapas: «Compass» avalia primeiro a complexidade da tarefa prevendo a probabilidade de satisfação do usuário, depois um classificador por taxonomia (domínio, tipo de tarefa, modificadores como mudanças visuais) seleciona o modelo de fronteira mais eficaz nessa categoria específica. O roteador distribui as requisições entre Grok (tarefas rotineiras), Sol/GPT-5.6 (planejamento), Opus (execução) e Fable (depuração) — Opus 5 foi adicionado após o lançamento inicial. Cursor apresenta números concretos: o modo «Auto Intelligence» ofereceria satisfação do usuário superior à do Fable sozinho por um custo 68% menor, e o modo «Auto Balance» superaria o Opus 4.8 por 41% menos custo.

🔗 Cursor — como o Cursor Router funciona


Ecossistema open-weight: inferência, armazenamento e pesquisa autônoma

Três anúncios consolidam a infraestrutura em torno dos modelos com pesos abertos, tanto no lado de hospedagem quanto no de pesquisa.

Baseten torna-se fornecedor oficial de inferência no Hugging Face

6 de agosto — Baseten, plataforma de infraestrutura de IA especializada em inferência serverless, entra para os Inference Providers do Hugging Face. A integração permite iniciar inferência hospedada pela Baseten diretamente a partir das páginas de modelos do Hub, pela interface web ou pelos SDKs Python e JavaScript. O suporte inicial cobre três grandes modelos open-weight: DeepSeek V4 Flash, Kimi K3 e GLM-5.2, com outros tipos de tarefas previstos posteriormente. Os assinantes PRO recebem 2 $ em créditos mensais de inferência válidos em todos os provedores, enquanto as contas gratuitas dispõem de cotas mais limitadas. A integração expõe um formato de API compatível com OpenAI via o roteador do Hugging Face, o que simplifica a troca de provedor sem reescrever o código de chamada.

🔗 Hugging Face — Baseten

Ai2 amplia sua parceria com o Hugging Face — armazenamento elevado para ~2 petabytes

5 de agosto — A Ai2 (Allen Institute for AI) amplia sua parceria com o Hugging Face para acelerar a disseminação de seus trabalhos em ciência aberta. O armazenamento alocado no Hub quase triplica, passando para cerca de 2 petabytes, e o tráfego deixa de estar sujeito aos limites padrão de taxa — um ganho relevante para o download dos maiores conjuntos de dados e dos modelos multi-checkpoints. A Ai2 informa que seus recursos foram baixados mais de 50 milhões de vezes desde a primavera de 2024, e que os artefatos relacionados ao seu modelo MolmoAct 2 ultrapassaram 400.000 downloads em três semanas. A parceria cobre todo o portfólio da Ai2: os modelos Olmo e Molmo, o modelo de observação terrestre OlmoEarth, bem como vários conjuntos de avaliação. Segundo a Ai2, a organização publica anualmente mais novos artefatos no Hub do que qualquer outra estrutura acompanhada pelo Hugging Face, com mais de 900 modelos e 1.200 conjuntos de dados contabilizados.

🔗 Ai2 — parceria com o Hugging Face

Sakana Marlin — agente de pesquisa autônomo e lançamento do Marlin Insights

6 de agosto — Sakana AI destaca o Sakana Marlin, descrito como um «Virtual CSO» (diretor científico virtual) capaz de raciocinar e conduzir pesquisas de forma autônoma por várias horas. A empresa afirma que essa capacidade se apoia em duas peças de pesquisa publicadas por suas equipes: AB-MCTS, aceito em spotlight na NeurIPS 2025, e AI Scientist, publicado na Nature. A Sakana AI também lançou o Marlin Insights, uma série de projetos de pesquisa produzidos pelo Marlin; o primeiro número analisa o desfecho da crise no Estreito de Ormuz e as razões pelas quais os Estados Unidos, apesar de sua superioridade militar, têm dificuldade em encontrar uma saída. Esse lançamento ilustra a estratégia da Sakana AI de transformar sua pesquisa fundamental em produtos de análise autônoma voltados para empresas, na continuidade de seus recentes deploys comerciais (Daiwa Securities, Namazu).

🔗 @SakanaAILabs no X


GitHub Copilot e o ecossistema: dados abertos, design reutilizável, comandos slash

Atualização Q1 2026 do GitHub Innovation Graph

5 de agosto — O GitHub publica a atualização trimestral (Q1 2026) de seu Innovation Graph, projeto de dados abertos que acompanha a atividade global de desenvolvimento. O thread de tweets destaca uma aceleração da atividade de Git push em vários países fora dos mercados tradicionais, bem como um aumento de 16% em relação ao trimestre anterior na colaboração open source transfronteiriça no Q1 2026, com avanços notáveis para a União Europeia, a Índia e Singapura desde 2020.

País monitoradoGit pushes (Q1 2020 → Q1 2026)
Índia4,4M → 45M
Vietnã630K → 5,1M
Paquistão240K → 3,5M

O conjunto dos dados permanece aberto e pode ser baixado, permitindo explorar com mais detalhe essas dinâmicas por país e por período.

🔗 Thread @github — Innovation Graph

Genspark Design — sistema de design reutilizável entre projetos

6 de agosto — Genspark lança o Genspark Design, um recurso disponível imediatamente que transforma automaticamente um projeto já construído (cores, tipografia, componentes) em um sistema de design reutilizável para os projetos seguintes. O objetivo é evitar recomeçar a identidade visual a cada novo projeto: uma landing page gerada depois herda o mesmo estilo de um app existente, sem retrabalho manual. Esse anúncio se soma aos esforços recentes da Genspark em torno da geração de interfaces e de suítes de escritório (GenOffice), e visa usuários que encadeiam vários projetos gerados por IA em busca de consistência visual sem configuração repetida.

🔗 @genspark_ai no X

Guia dos comandos slash no app GitHub Copilot

6 de agosto — O GitHub publica um guia detalhando os seis comandos slash disponíveis no app desktop do GitHub Copilot, acessíveis digitando «/» na área de chat. Eles cobrem todo o ciclo de trabalho: planejamento, teste de uma abordagem, implementação automatizada, revisão cruzada por outro modelo, criação de interfaces interativas e orquestração multi-repositório — distinguindo-se dos comandos slash do CLI, que visam o terminal em vez do app desktop.

Comando slashFunção fornecida
/planDivide a tarefa antes de codificar
/sparAdvogado do diabo para desafiar uma abordagem
/autopilotTransforma um plano em código
/rubber-duckRevisão independente por outro modelo
/orchestrateCoordena o trabalho entre vários repositórios

🔗 GitHub — guia dos comandos slash


Geração de mídia: dublagem e transparência de áudio

ElevenLabs lança Dubbing v2 no ElevenAPI

6 de agosto — A ElevenLabs disponibiliza em geral no ElevenAPI a versão 2 de seu motor de dublagem (Dubbing v2), que já existia no lado do produto, para permitir que desenvolvedores integrem dublagem por IA diretamente em seus próprios aplicativos. Tecnicamente, o Dubbing v2 se condiciona diretamente ao desempenho áudio original em vez de uma transcrição plana, o que preserva o tom, a emoção e a cadência da voz de origem. O modelo adapta a cadência para uma dicção natural em mais de 90 idiomas, com uma tradução «sync-aware» que alinha automaticamente inícios e fins de fala sem ajuste manual. Para casos de uso corporativos, um modo de edição granular permite importar a própria transcrição e regenerar apenas os segmentos modificados em vez da dublagem inteira — com todo o pipeline (tradução, clonagem de voz, dublagem, sincronização) exposto por uma única API.

🔗 @ElevenLabs no X

Suno implanta ferramentas de transparência e atualiza suas regras comunitárias

6 de agosto — A Suno publica um artigo assinado por seu CEO Mikey Shulman, expondo os princípios que a empresa diz querer seguir para construir «responsavelmente» o futuro da música gerada por IA. Na prática, o anúncio introduz a implantação de tecnologias de watermarking e fingerprinting de áudio para identificar as faixas geradas na plataforma, apresentadas como resistentes à adulteração sem degradar a experiência de escuta, além de restrições futuras ao download com o objetivo de limitar a distribuição em massa para plataformas de streaming, preservando ao mesmo tempo os usos profissionais e criativos. O anúncio é acompanhado por uma atualização das Community Guidelines que agora proíbe explicitamente a recriação de músicas existentes, o uso da voz ou da imagem de uma pessoa sem consentimento e práticas de spam ou de contorno automatizado da moderação, com sanções que vão de advertência a banimento definitivo.

🔗 @suno no X


Agentes e plugins: padrões abertos e modelos subagentes

Agent Plugins — padrão aberto para plugins de agentes

6 de agosto — A OpenAI anuncia Agent Plugins, um novo padrão aberto criado com AWS, Cursor, GitHub, VS Code e Vercel para empacotar Agent Skills e configurações de servidores MCP em um formato comum. O objetivo é permitir que desenvolvedores construam um plugin uma única vez e o reutilizem em vários clientes de agentes compatíveis, em vez de duplicar a integração para cada ferramenta. No lançamento, os clientes compatíveis listados são Codex, ChatGPT, Cursor, GitHub Copilot, Kiro e VS Code — um escopo amplo que cobre tanto o ecossistema da OpenAI quanto vários concorrentes diretos no campo dos agentes de código. Os tweets não detalham a mecânica técnica precisa (formato de manifesto, processo de publicação) nem uma data de disponibilidade geral além do lançamento anunciado.

🔗 @OpenAIDevs no X

Perplexity Computer implanta GPT-5.6 Terra e Luna como modelos subagentes

6 de agosto — A Perplexity implanta dois novos modelos GPT-5.6 dentro do Computer, sua plataforma de subagentes e automações: Terra e Luna. Terra torna-se o modelo padrão para todos os subagentes do Computer e também serve como modelo orquestrador; Luna é posicionado como o modelo principal das automações agendadas. Segundo a Perplexity, Terra foi projetado para trabalho complexo orientado a objetivos, um perfil adequado ao papel de subagente que precisa decompor uma tarefa e executá-la de forma autônoma. No benchmark WANDR, Terra obteria uma pontuação 11 pontos superior à do Claude Sonnet, ao mesmo tempo em que oferece uma redução de custo de uma ordem de grandeza. Essa introdução de modelos especializados por função ilustra uma arquitetura de agentes cada vez mais diferenciada na Perplexity.

🔗 @perplexity_ai no X


Breves

  • Together AI afirma que Kimi K3 é quase duas vezes melhor que Claude Fable 5 no benchmark jurídico Harvey LAB-AA — Sem detalhe metodológico publicado, deve ser encarado como uma reivindicação de marketing do fornecedor de inferência. 🔗 fonte
  • Hugging Face destaca Cadena, um decompilador de malhas 3D em CAD editável — Demo Spaces que converte um arquivo 3D congelado em programa CAD modificável passo a passo, por exemplo para alargar um furo sem reconstruir o modelo. 🔗 fonte
  • O CEO do Hugging Face defende uma regulação de IA por camadas — Clément Delangue apoia o novo quadro regulatório americano que distingue pesos de modelos, APIs e aplicativos, que ele considera protetor para o open source. 🔗 fonte
  • Together AI detalha sua arquitetura multi data centers com 99,9% de disponibilidade — Tráfego distribuído em tempo real em dois sites simultaneamente, com capacidade de absorver a perda total de um datacenter sem interrupção do serviço. 🔗 fonte
  • Gemini Omni: geração gratuita de 10 vídeos prolongada até 11 de agosto — A oferta, que deveria terminar em 4 de agosto, continua acessível até 11 de agosto de 2026, 23h59 (horário do Pacífico). 🔗 fonte
  • GenOffice disponível no Linux — A suíte de escritório de IA open source da Genspark, já disponível no macOS e no Windows, agora pode ser compilada e usada no Linux. 🔗 fonte
  • Flux 3 disponível no agente de vídeo de IA da Genspark — Integração do Flux 3 (Black Forest Labs) com áudio nativo e diálogo multilíngue, para clipes de até 20 segundos em 1080p. 🔗 fonte
  • Qwen3.8-Max sobe nos rankings públicos — A Alibaba reivindica o 5º lugar no Artificial Analysis Intelligence Index e o 1º lugar no Agentic Index, após um 2º lugar na Image-to-WebDev Arena na véspera. 🔗 fonte
  • Qwen-Image-3.0-Pro implantado no Qwen Cloud e fal.ai — O modelo de geração de imagem da Alibaba, já classificado em 5º lugar mundial, torna-se acessível diretamente no Qwen Cloud e na plataforma de terceiros fal.ai. 🔗 fonte
  • OpenAI e a American Psychological Association se unem em IA e saúde mental dos jovens — Parceria para desenvolver recomendações e salvaguardas baseadas em evidências em torno do bem-estar dos jovens usuários. 🔗 fonte
  • OpenAI publica dados Signals sobre o uso global do ChatGPT — Novos indicadores por país sobre adoção e tendências de uso, sem detalhe numérico acessível nesta data. 🔗 fonte
  • Cohere faz parceria com a Universidade de Waterloo para um certificado em transformação de IA — O novo certificado «AI Transformation & Change Management» deve preparar os estudantes para a adoção responsável da IA nas empresas. 🔗 fonte

O que isso significa

A semana ilustra uma mudança clara: a inteligência de ponta está se tornando a opção padrão, em vez de uma escolha paga adicional. A OpenAI unifica o ChatGPT em torno de um GPT-5.6 Sol que lida tanto com a rapidez quanto com o raciocínio profundo, ao mesmo tempo em que torna Luna ilimitado e gratuito para as contas Free e Go. A GitHub segue uma lógica semelhante do lado dos desenvolvedores ao generalizar o Kimi K3, um modelo open-weight, no Copilot para todo o seu portfólio de ofertas pagas. Nos dois casos, a novidade não é um salto em capacidades brutas, mas uma mudança de distribuição: modelos antes reservados aos níveis premium ou às integrações sob medida tornam-se a configuração padrão, deslocando a concorrência para a confiabilidade percebida e o custo de acesso, em vez da pontuação bruta em um benchmark.

A medição da capacidade de IA torna-se, por si só, um terreno de competição estruturado. O Muse Spark 1.2 da Meta se aproxima da fronteira segundo a Artificial Analysis, com um custo por tarefa que permanece entre os mais baixos da sua categoria, enquanto a Meta Superintelligence Labs reivindica resultados de nível ouro em cinco Olimpíadas científicas internacionais sem uso de ferramentas — uma demonstração pública pensada para convencer para além dos leaderboards habituais. Em paralelo, a infraestrutura que sustenta esses modelos abertos se profissionaliza: a Baseten torna-se provedora oficial de inferência no Hugging Face para DeepSeek V4 Flash, Kimi K3 e GLM-5.2, a Ai2 praticamente triplica seu armazenamento no Hub, e a Sakana AI transforma sua pesquisa fundamental em um produto de pesquisa autônoma com o Marlin. O fio condutor: o valor desloca-se do modelo isolado para o ecossistema que o distribui, o hospeda e o verifica.

As ferramentas de código agêntico convergem para uma mesma ideia: nenhum modelo único domina mais todas as tarefas, portanto é preciso rotear de forma inteligente. A Cursor detalha como seu roteador combina estimativa de complexidade e classificação por taxonomia para reduzir os custos em até 68% sem perda de satisfação percebida, a Warp introduz regras de roteamento em linguagem natural, e a Amp, assim como a Devin, amplia seus ambientes remotos (Portals, integração com Vercel Sandbox) para aproximar o desenvolvimento na nuvem do conforto do local. A Replit, por sua vez, desloca suas verificações de segurança Semgrep para antes do build, em vez de depois, com mais de 100 000 scans por dia nessa escala. Em conjunto, esses anúncios desenham uma geração de ferramentas em que a inteligência já não é a única alavanca: a orquestração, a segurança por padrão e a integração de infraestrutura contam tanto quanto.

Para além dos modelos de linguagem, a semana mostra a IA se instalando ao mesmo tempo em usos de impacto direto e na produção criativa em grande escala. O WeatherNext do Google DeepMind, publicado em Nature e disponível em pesos abertos, oferece em média 24 horas adicionais de antecedência para prever um ciclone — uma aplicação em que o interesse geral claramente se sobrepõe à competição comercial. Em contraste, o Wan3.0 da Alibaba, a ElevenLabs e a Suno ilustram a rápida maturação da geração de mídia: vídeo nativo de 30 segundos com controle multimodal, dublagem condicionada à performance vocal original agora em disponibilidade geral via API, e ferramentas de watermarking implantadas em resposta às preocupações com a autenticidade dos conteúdos gerados. Essas duas direções, ciência aberta e criação comercial, avançam no mesmo ritmo, mas com desafios de responsabilidade muito diferentes.


Fontes