ai-powered-markdown-translatorArtigo traduzido do fr para o pt com gpt-5.4-mini.
Grande dia para os blocos de infraestrutura agentic: a Anthropic lança em beta geral o computer use, a browser tool, a Skills API e a Files API na Claude Platform, enquanto o GitHub Copilot se instala no Slack e no Microsoft Teams. Do lado dos modelos, a DeepSeek publica seu primeiro modelo multimodal e a Pika Labs lança um sintetizador de voz que afirma oferecer uma relação custo/benefício inédita. Entre os dois, um grande conjunto de dados egocêntrico, um estudo sobre os vieses de benchmark em reconhecimento de voz e uma dezena de atualizações notáveis na Google DeepMind, GitHub, Z.ai, Qwen, Harvey e nas ferramentas de geração de vídeo/áudio.
Claude Platform: computer use, browser tool, Skills API e Files API em disponibilidade geral
20 de agosto — A Anthropic anuncia a passagem para disponibilidade geral de quatro blocos para construir agentes na Claude Platform: computer use, a browser tool, a Skills API e a Files API. O objetivo declarado é reduzir o número de idas e vindas necessárias para automatizar uma tarefa em um aplicativo que não tem API, e permitir a construção de Claude Managed Agents com skills versionadas e arquivos reutilizáveis.
O novo computer_toolset_20260801 permite que Claude encadeie várias ações por turno (clique, digitação, tecla do teclado, captura de tela) em vez de uma ida e volta por ação isolada. A Anthropic indica que os clientes em acesso antecipado observaram 20 a 40% menos idas e vindas por tarefa. A browser tool evolui em paralelo com browser_toolset_20260801: em vez de mirar pixels — frágil ao menor mudança de layout — Claude recebe agora a estrutura da página e pode agir sobre referências de elementos.
Do lado da API, a Skills API permite enviar o procedimento de uma equipe uma única vez, versioná-lo e fixá-lo a um version_id específico ou a latest. A Files API ganha um parâmetro expires_in_seconds, um limite de taxa 5 vezes maior (500 requisições por minuto) e uma cota de 1 TB por organização. A Anthropic também publicou um adaptador AG-UI para os Managed Agents, que mapeia cada thread de conversa para uma sessão gerenciada e transmite texto, chamadas de ferramentas e raciocínio para a interface.
| Bloco | Novidade do dia |
|---|---|
| Computer use | computer_toolset_20260801, até -40% de idas e vindas por tarefa |
| Browser tool | browser_toolset_20260801, direcionamento por referência de elemento de página |
| Skills API | Versionamento, fixação em version_id ou latest |
| Files API | 500 requisições/minuto (x5), cota de 1 TB por organização |
GitHub Copilot chega ao Slack e ao Microsoft Teams
21 de agosto — O GitHub Copilot desembarca em prévia pública no Slack e no Microsoft Teams. O princípio é o mesmo nos dois casos: mencionar @GitHub em uma mensagem direta, um canal ou um thread abre uma sessão de agente na nuvem capaz de responder a perguntas sobre o código e a atividade do GitHub, triagem de relatórios de bugs, investigar falhas, implementar mudanças em um sandbox seguro na nuvem e, em seguida, abrir pull requests com um link para a conversa de origem.
No Slack, a integração se apoia no Slack Code, a nova oferta agentic do Slack lançada no mesmo fim de semana: o GitHub Copilot pode abrir canais de código dedicados onde a equipe consulta diffs e inspeciona prévias de renderização sem poluir a conversa original. No Teams, uma discussão se transforma em uma sessão de agente coletiva que todos podem acompanhar e orientar; o trabalho continua de forma assíncrona no sandbox na nuvem enquanto a equipe faz outra coisa.
Disponibilidade reservada a organizações nos planos Copilot Business ou Enterprise. O administrador ativa a política de agente na nuvem do Copilot e instala o app para Slack ou Teams; os administradores de repositório podem exigir uma aprovação antes da fusão dos pull requests gerados pelo agente. O uso consome créditos de IA, e o sandbox na nuvem é cobrado separadamente com orçamentos configuráveis.
🔗 GitHub Copilot no Slack · 🔗 GitHub Copilot no Teams
DeepSeek-V4-Flash-Vision-Exp: primeiro modelo multimodal da DeepSeek na API
21 de agosto — A DeepSeek coloca no ar DeepSeek-V4-Flash-Vision-Exp, um modelo multimodal experimental disponível sob o identificador deepseek-v4-flash-vision-exp. Nas capacidades puramente textuais — agentes, raciocínio, conhecimento de mundo — o modelo iguala o DeepSeek-V4-Flash. A novidade está em outro lugar: nos benchmarks de agentes multimodais, a DeepSeek anuncia um salto nítido em relação ao V4-Flash, com desempenhos que se aproximam de Opus-4.8.
O suporte multimodal do lado da API é completo: entrada mista texto + imagem (base64, URL externa ou via uma nova Files API gratuita lançada no mesmo dia), compatível com os três formatos existentes (Chat Completions, Messages, Responses). A tarifa segue a tabela do V4-Flash, com tokenização de imagens limitada a 384 tokens por imagem. A Files API permite fazer upload de uma imagem uma única vez e referenciá-la por file_id, uma economia de largura de banda para usos agenticos repetitivos. DeepSeek Harness 0.1.1, o harness de agente open source lançado em 13 de agosto, foi atualizado no mesmo dia para suportar o novo modelo nativamente.
| Elemento | Detalhe |
|---|---|
| Modelo | deepseek-v4-flash-vision-exp |
| Capacidades de texto | Paridade com o DeepSeek-V4-Flash |
| Capacidades multimodais | Próximas de Opus-4.8 nos benchmarks de agentes multimodais |
| Preço da imagem | Até 384 tokens/imagem, preço do V4-Flash |
| APIs suportadas | Chat Completions, Messages, Responses |
| Harness | DeepSeek Harness 0.1.1 (suporte nativo) |
DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8.
🇵🇹 O DeepSeek-V4-Flash-Vision-Exp já está disponível na plataforma API da DeepSeek! Este modelo multimodal experimental iguala o DeepSeek-V4-Flash nas capacidades textuais — incluindo agentes, raciocínio e conhecimento de mundo. Nos benchmarks de agentes multimodais, o V4-Flash-Vision-Exp dá um salto importante em relação ao V4-Flash, aproximando o desempenho de agentes multimodais ao do Opus-4.8. — @deepseek_ai no X
Pika Speech: síntese vocal 3B a 1,2 segundo por minuto, até 9x mais barato que o ElevenLabs v3
21 de agosto — A Pika Labs amplia sua linha Pika Audio com Pika Speech, um modelo de síntese vocal de 3 bilhões de parâmetros. O principal argumento é a velocidade: um fator de tempo real (RTF) de 0,02, ou seja, um minuto de fala 48 kHz com qualidade de estúdio gerado em cerca de 1,2 segundo em testes locais em formato longo, com requisições possíveis de até cinco minutos de fala contínua.
No controle do ritmo, o Pika Speech inova: em vez de esticar ou comprimir o áudio depois — o método padrão na maioria dos sistemas TTS — o modelo controla ritmo e duração diretamente graças a um « latent de fim de fala » (EOS latent), uma âncora colocada na imagem final alvo. Mover essa âncora para mais cedo comprime o fluxo; movê-la para mais tarde deixa o texto respirar. Na arquitetura, a equipe combina flow matching e distillation por matching de distribuição, FlashAttention-3 e um « token packing » que faz com que cinco segmentos de frase custem cerca de duas vezes o preço de um só, em vez de cinco vezes.
Nos custos, a Pika reivindica uma vantagem de até 9x em relação ao ElevenLabs v3, 4,5x em relação ao Cartesia e ao ElevenLabs Turbo, e 2x em relação ao Fish Audio — sem detalhar a metodologia exata além desses ratios. O modelo está acessível via o Pika API Club.
Let’s talk about Pika Speech, a 3B text-to-speech model at RTF 0.02. […] Pika Speech generates one minute of studio-quality 48 kHz speech in about 1.2 seconds—and supports requests up to five minutes. That efficiency makes it up to 9× more cost-efficient than ElevenLabs v3, 4.5× than Cartesia and ElevenLabs Turbo, and 2× than Fish Audio.
🇵🇹 Vamos falar do Pika Speech, um modelo de síntese vocal de 3 bilhões de parâmetros com um fator de tempo real de 0,02. […] O Pika Speech gera um minuto de fala 48 kHz com qualidade de estúdio em cerca de 1,2 segundo — e suporta requisições de até cinco minutos. Essa eficiência o torna até 9 vezes mais econômico que o ElevenLabs v3, 4,5 vezes mais que o Cartesia e o ElevenLabs Turbo, e 2 vezes mais que o Fish Audio. — @pika_labs no X
EgoSuite-Open100K: o maior conjunto de dados egocêntrico humano aberto
21 de agosto — A Lightwheel AI, em parceria com a Hugging Face, open-source EgoSuite-Open100K, apresentado como o maior conjunto de dados egocêntrico humano totalmente anotado já publicado em acesso livre. O objetivo visado é 100.000 horas de dados humanos em primeira pessoa; as primeiras 10.000 horas já estão disponíveis, e o restante será publicado em etapas.
O conjunto de dados cobre mais de 15.000 tarefas distribuídas em mais de 15.000 cenas reais — cozinhas, quartos, armazéns, linhas de montagem — agrupadas em 7 categorias de ambientes e 128 tipos de cenas. Cada sequência é anotada com pose da mão, pose do corpo e semântica no nível das subtarefas, e parte do corpus ainda conta com cobertura de câmera no punho. Ponto notável do lado da licença: ao contrário de muitos conjuntos de dados de pesquisa, o EgoSuite-Open100K é licenciado para treinamento comercial, e não apenas acadêmico.
O dataset é apresentado por seus criadores como o primeiro bloco público de uma infraestrutura de dados mais ampla para a « Physical AI » (robótica e IA incorporada) — a ideia de que a escala dos modelos físicos agora depende de acesso a dados humanos massivos e compartilhados.
🔗 Anúncio da Lightwheel AI · 🔗 Repost da Hugging Face
Claude Security passa para Claude Mythos 5
21 de agosto — A Anthropic faz rodar o Claude Security, sua ferramenta de varredura de vulnerabilidades, no Claude Mythos 5, em beta pública para todos os clientes Claude Enterprise. O argumento: aproveitar o modelo de segurança mais capaz da Anthropic em sua codebase sem acesso separado ao modelo — as varreduras são cobradas em uso de tokens padrão no plano existente.
Na prática, a ferramenta entra em um repositório GitHub e o Mythos 5 analisa o código rastreando a circulação de dados entre arquivos e raciocinando sobre as interações entre componentes. Cada resultado retorna com uma categoria CWE, um nível de confiança, uma avaliação de severidade e um patch sugerido, que se abre diretamente no Claude Code na web. A Anthropic aproveita para lançar um Defender Advantage Fund dotado de 35 milhões de dólares em créditos para segurança open source, e pretende expandir seu Cyber Verification Program nas próximas semanas.
Precificação GPT-5.6 Sol: OpenAI reduz seus preços de API, GitHub Copilot segue
21 de agosto — A OpenAI reduz em mais de 20% os preços de API e créditos do GPT-5.6 Sol durante os próximos três meses. A medida já está ativa no lado da API e será implantada no Codex e no ChatGPT Work ao longo do dia. Para os usuários do Codex em planos por tarefa (token-based), os créditos comprados agora rendem mais; o uso incluído nas assinaturas Pro, Plus e Business, por sua vez, permanece inalterado — a redução beneficia, portanto, sobretudo os desenvolvedores de API e os usuários cobrados por token.
GPT-5.6 Sol a -50% no GitHub Copilot
Em paralelo, o GitHub divulga uma promoção distinta: -50% no GPT-5.6 Sol no GitHub Copilot até 3 de setembro, utilizável no app, na CLI e no IDE. Trata-se de um desconto pontual do lado do Copilot, e não deve ser confundido com a redução tarifária permanente da OpenAI descrita acima — duas empresas diferentes, dois mecanismos distintos sobre o mesmo modelo.
🔗 Redução tarifária da OpenAI · 🔗 Promoção do GitHub Copilot
GLM-5.3 (Max) sobe no Code Arena: WebDev
20 de agosto — A LMArena indica que o GLM-5.3 (Max) da Z.ai mexeu na fronteira de Pareto (relação qualidade/custo) do ranking Code Arena: WebDev, dedicado à avaliação de modelos em tarefas de desenvolvimento web. Com 1597 pontos, o modelo ficaria em 2º lugar entre os modelos de pesos abertos (uma vez publicados) e em 8º no geral.
| Modelo | Preço ($/M tokens) | Pontos Code Arena: WebDev |
|---|---|---|
| GLM-5.3 (Max) | $3,65 | 1597 |
| Qwen3.8 (Max) | $5,00 | — |
| Gemini-3.7-flash-high | $2,86 | pontuação inferior |
| DeepSeek-v4-flash-high | $1,10 | pontuação inferior |
A $3,65 por milhão de tokens, o GLM-5.3 (Max) continua em uma faixa de preço comparável à do Qwen3.8 (Max), ao mesmo tempo em que supera o Gemini-3.7-flash-high e o DeepSeek-v4-flash-high nesse ranking — um novo sinal da competitividade da Z.ai no desenvolvimento web agentic, em complemento aos resultados já conhecidos no Terminal-Bench e no Agent Arena geral.
Harvey lança Tenet, um modelo jurídico construído sobre Kimi K3
20 de agosto — A Harvey apresenta Tenet, seu primeiro modelo pós-treinado para o direito, a partir de uma base Kimi K3 (Moonshot AI) pós-treinada com a Fireworks AI sobre um corpus de dados jurídicos públicos, dados sintéticos e dados de especialistas humanos simulando trabalho jurídico de longa duração.
A Harvey anuncia que esse pós-treinamento aumenta a taxa de sucesso completa do Tenet em 82% no benchmark LAB e em 22% no LAB Contracts, em comparação com o Kimi K3 de base — com estado da arte no LAB Contracts e a 2ª colocação no LAB como um todo. O custo operacional do Tenet seria inferior a um quarto do dos modelos de fundação mais performáticos do mercado. Como complemento, a Harvey treinou três subagentes especialistas: due diligence de M&A, revisão de tabelas e conhecimento do escritório.
Georgia Tech traça as origens do raciocínio social do Olmo 3
21 de agosto — Uma equipe da Georgia Tech aproveitou o fato de que a pilha Olmo 3 da Ai2 é totalmente aberta — pesos, corpus de pré-treinamento Dolma 3 (1,26 bilhão de documentos), infraestrutura — para relacionar estatisticamente capacidades do modelo aos textos que as produziram, uma experiência impossível em um modelo fechado.
O método se baseia em funções de influência, aplicadas a cerca de 5,68 milhões de documentos amostrados no Dolma 3. Principal resultado: os textos ricos em diálogos e escrita interpessoal pesam mais no desempenho em raciocínio social do que no conhecimento factual — e, ao retirar os documentos literários mais influentes, o desempenho no benchmark SocialIQA caiu significativamente, confirmando a causalidade.
Viés de « benchmark optimization » detectado em modelos ASR open source
21 de agosto — Uma equipe da Hume AI publica no blog da Hugging Face um estudo sobre um viés metodológico em reconhecimento de voz: alguns modelos pareceriam ser otimizados para reproduzir as transcrições de referência dos benchmarks públicos em vez de transcrever fielmente o áudio.
Em 11 modelos ASR open source testados, cerca de 40 % dos trechos VoxPopuli analisados conteriam erros em suas referências, e 6 modelos em 11 reproduziam esses erros em vez de transcrever corretamente o áudio. No LibriSpeech, as taxas de recuperação de números mascarados chegavam a 30 a 40 %, sinal de que alguns modelos “preenchem” o texto em vez de ouvi-lo. A conclusão recomenda o uso de conjuntos de avaliação mantidos em segredo e uma separação mais rigorosa entre dados de treinamento e de teste.
SenseNova-U1.5-8B-MoT : modelo de imagem aberto sem VAE nem DiT
21 de agosto — A SenseNova publica em pesos abertos um modelo de geração de imagem cujos desempenhos anunciados seriam comparáveis aos do Nano Banana 2. O interesse técnico está na arquitetura: sem VAE, sem codificador de texto separado, sem DiT — o modelo se baseia em uma “mixture of transformers”, em que os tokens de texto e de imagem usam pesos distintos e se esperam mutuamente, com o denoising ocorrendo diretamente no espaço dos pixels em vez de em um espaço latente comprimido.
Essa abordagem contrasta com a pilha padrão dos modelos de difusão texto-imagem, e sua abertura em pesos permitirá à comunidade verificar de forma independente as comparações de desempenho anunciadas.
Diffusers 0.40.0 : Modular Diffusers sai do status experimental
21 de agosto — A Hugging Face publica Diffusers 0.40.0. A mudança mais estruturante é a saída do status experimental para Modular Diffusers, o sistema de pipelines modulares da biblioteca. A versão adiciona a integração de vários modelos abertos recentes (LTX2.5, MiniMax H3, MiniMax Music 3, Wan Animate 2), suporte ao paralelismo tensorial para uma seleção de modelos, e dois novos backends de quantização (SDNQ, Nunchaku-Lite).
Google DeepMind explora IA em jogos com a Fenris Creations
21 de agosto — A Google DeepMind anuncia uma parceria de pesquisa com o estúdio Fenris Creations, na continuidade de 15 anos de trabalhos usando videogames como campo de experimentação para IA, da maestria em Atari até o nível Grandmaster em StarCraft II. Após SIMA, que ensinou agentes a compreender mundos 3D, a DeepMind quer explorar a navegação em dinâmicas humanas reais dentro de um universo persistente.
A parceria mira quatro desafios abertos: aprendizado contínuo (adquirir novas habilidades sem esquecer as anteriores), sistemas de memória profunda indo muito além das janelas de contexto atuais, planejamento de longo horizonte (semanas, meses, anos) e dinâmicas multiagentes (cooperação, negociação, economia, comportamentos emergentes). O objetivo de longo prazo é duplo: criar novas experiências de jogo com desenvolvedores e reutilizar esses avanços para problemas do mundo real e a descoberta científica.
Runway Ruby : conversão de vídeo SDR para HDR 16 bits
21 de agosto — A Runway lança Ruby, um modelo que converte vídeo SDR (standard dynamic range) em HDR 16 bits, com saída em sequências EXR ou ProRes/HEVC 10-12 bits, no espaço de cores BT.2020 com suporte a PQ ou HLG — os padrões usados em pós-produção profissional e broadcast HDR.
Ruby funciona tanto sobre um vídeo enviado pelo usuário quanto sobre uma saída gerada pela Runway, com limite de 30 segundos. A funcionalidade já está disponível para os planos Max e Enterprise.
NVIDIA AVO reivindica 100 % no benchmark ARC-AGI-3
21 de agosto — A NVIDIA apresenta AVO, um agente de código generalista, com uma pontuação de 100 % no ARC-AGI-3, um benchmark de raciocínio interativo. Segundo a NVIDIA, AVO completou os 183 níveis distribuídos pelos 25 ambientes públicos do benchmark, sem instruções explícitas, regras enunciadas nem objetivos formulados previamente.
AVO funciona por meio de um ciclo contínuo de inspeção, planejamento, implementação e avaliação, apoiando-se em memória, ferramentas e feedback de execução para construir sobre o que aprende ao longo do tempo — uma abordagem concebida para manter a progressão em tarefas longas em vez de recomeçar do zero a cada nova janela de contexto.
HeyGen Look Packs : trocar roupa e cenário mantendo o rosto
21 de agosto — A HeyGen lança Look Packs, uma funcionalidade que troca a roupa e o cenário de um vídeo de avatar ao mesmo tempo em que preserva fielmente o rosto da pessoa — o argumento sendo que a maioria dos modelos generativos também modifica os traços faciais quando muda a aparência.
O uso visado é a coerência da marca pessoal em diferentes contextos profissionais: imobiliário, jurídico, fitness, educação, bem-estar. Um criador de conteúdo B2B pode, assim, produzir vídeos com roupas e cenários adequados a cada setor, mantendo-se reconhecível de um vídeo para outro. Este anúncio se insere na cadência intensa da HeyGen nos últimos dias (Retouch em 20 de agosto, Brand Kits e upscale 4K em 18-19 de agosto).
Amp lança Explain Usage para explicar seu consumo de tokens
21 de agosto — A Amp adiciona Explain Usage, uma funcionalidade que permite pedir diretamente ao Puck, o assistente integrado, para analisar seu próprio consumo de tokens, créditos e tamanho de orb. O usuário faz uma pergunta em linguagem natural — “Quais threads consumiram mais tokens hoje?” — e o Puck lê os dados de uso pessoais e as métricas por thread para responder.
Existem dois pontos de entrada: fazer a pergunta diretamente ao Puck, ou clicar no botão dedicado nas páginas de uso. Para os usuários que preferem os dados brutos, a Amp também expõe essas informações via CLI (amp usage --details, amp threads usage <thread-id> --details).
v0 (Vercel) adiciona Vercel Connect para se conectar a 100+ serviços
21 de agosto — Os apps e agentes construídos em v0 agora podem se conectar diretamente ao Slack, GitHub, Salesforce e a mais de 100 outros serviços de terceiros por meio do Vercel Connect, sem que o desenvolvedor precise gerenciar sozinho o fluxo de autenticação.
O mecanismo se baseia em conectores de equipe reutilizáveis associados a tokens de curta duração: uma vez que um conector é configurado no nível da equipe, cada novo app ou agente gerado pode reutilizá-lo em vez de pedir autenticação completa a cada vez. Isso posiciona o v0 como uma plataforma capaz de produzir agentes integrados à stack de software de uma empresa, e não apenas interfaces isoladas.
Threads compartilhados no Codex e no ChatGPT Work
20 de agosto — Codex e ChatGPT Work introduzem os “threads compartilhados”: um link somente leitura que expõe o raciocínio completo de uma sessão — abordagem, decisões, contexto — em vez de um simples resultado final. O objetivo é evitar reconstruir o contexto de uma pull request a partir de capturas de tela dispersas durante uma revisão de código, uma exploração técnica aprofundada ou uma passagem de projeto entre colegas de equipe.
É uma funcionalidade que se insere na continuidade dos anúncios recentes em torno do ChatGPT Sites (edição por várias pessoas, personalização de URL) e reforça o posicionamento de Codex/ChatGPT Work como ferramenta de trabalho em equipe.
Fundos transparentes em prévia para GPT-Image-2
20 de agosto — A API GPT-Image-2 agora permite, em prévia, gerar imagens com fundo transparente. O interesse prático é produzir assets reutilizáveis — visuais de produtos, elementos de design gráfico, maquetes de sites, campanhas de marketing — que depois podem ser colocados em qualquer fundo sem retoque manual de recorte.
Breves
- Zed — Antigravity é instalado com um clique a partir do ACP Registry do Zed. 🔗 Tweet
- trackio 0.36 — A Hugging Face publica uma atualização adicionando suporte a um novo tipo de dado registrável, sem mais detalhes. 🔗 Tweet
- A IA « full-stack » segundo a Google DeepMind — Paige Bailey decompõe a abordagem ponta a ponta da Google em cinco camadas: infraestrutura, segurança, pesquisa, modelos/ferramentas, produtos. 🔗 Artigo da Google
- GitHub — melhor gestão de usuários bloqueados: busca por nome, ordenação e paginação de listas longas. 🔗 Changelog
- GitHub — o fixamento de views, projetos e marcos na barra lateral do repositório passa para disponibilidade geral, com várias melhorias relacionadas (avatares de reações, densidade do dashboard). 🔗 Changelog
- Manus estende o acesso gratuito ao Manus 1.6 Lite e ao Manus 1.6 até 28 de agosto (SGT), dentro do limite da cota diária. 🔗 Tweet
- Manus lembra os usuários notificados de salvar seus dados antes de 23 de agosto às 7h59 (SGT), antes de sua transição para empresa independente. 🔗 Tweet
- Genspark lança uma promoção até 30 de setembro: Design + GenTeam com -90%, GenMail grátis, Slides Ultra Mode com -50%. 🔗 Tweet
- NVIDIA detalha a divisão entre o arnês de um agente (o que ele tenta fazer) e a infraestrutura (o que ele realmente pode fazer) em um deep dive de segurança da pilha agêntica. 🔗 Tweet
- NVIDIA publica o balanço do Spark Hack Series de Seattle no DGX Spark: projetos vencedores em resposta a desastres, saúde e sobrevivência offline com Nemotron e NemoClaw. 🔗 Tweet
- NVIDIA Cosmos 3 — um vídeo do Cosmos Labs mostra o pós-treinamento do Cosmos 3 com os parceiros Aigen e Linker Vision. 🔗 Tweet
- Luma Labs participará sobre agentes criativos no Summer Signal, organizado com a GMI Cloud em 14 de setembro. 🔗 Tweet
- Synthesia — seu CEO é citado em um artigo da Forbes Tech sobre medir a adoção da IA por resultados, e não pelo uso. 🔗 Tweet
- Qwen3.8-27B continua sua trajetória comunitária: novas receitas de inferência NVFP4 + DFlash2 no cookbook do SGLang, versões enxutas publicadas pela Unsloth, 1º lugar no ranking do agente de código Cline em quatro dias, e uma DGX Station NVIDIA relatando mais de 2713 tokens/segundo no pico agregado em serviço BF16. 🔗 SGLang · 🔗 Unsloth · 🔗 Cline · 🔗 DGX Station
- Qwen3.8-Max agora pode ser usado na ferramenta de código Kilo Code para geração de interfaces. 🔗 Tweet
- Kimi Work publica um segundo tutorial para analistas financeiros: dashboard de investidor, atualização de modelos financeiros, geração de relatórios em lote. 🔗 Tweet
- GLM-5.3 continua sua progressão: pontuação de 69 no ranking oficial DeepSWE, disponibilidade na plataforma WorkBuddy e extensão da Build Week pela Z.ai até 23 de agosto às 18h (PT) com 100 milhões de tokens gratuitos para os 50 000 primeiros novos inscritos no ZCode. 🔗 DeepSWE · 🔗 WorkBuddy · 🔗 Build Week
- GPT-5.6 Sol — três plataformas de terceiros (Router, Cloudflare AI Gateway, OpenCode Zen) oferecem cada uma -50% até meados de setembro, além dos descontos já cobertos no Devin, OpenRouter e v0. 🔗 Cloudflare AI Gateway
O que isso significa
O anúncio Anthropic-GitHub de hoje desenha uma tendência de fundo: a infraestrutura agêntica está saindo do estágio experimental. A GA de computer use e do browser tool na Claude Platform, combinada com a chegada do Copilot ao Slack e ao Teams, sinaliza que os grandes fornecedores não se contentam mais em vender modelos — eles vendem agentes capazes de agir nas ferramentas que as equipes já usam no dia a dia, sem passar por uma integração via API dedicada em cada caso. É uma mudança tanto de distribuição quanto de capacidade: o agente agora vai até onde o trabalho acontece, em vez de exigir que o trabalho venha até ele.
No terreno dos modelos, DeepSeek-V4-Flash-Vision-Exp confirma que o multimodal se torna um padrão esperado em vez de um diferencial — mesmo os atores posicionados na eficiência econômica (V4-Flash) agora o integram nativamente, com desempenhos que se aproximam dos melhores modelos fechados. A competição nos benchmarks agênticos de código (GLM-5.3 no Code Arena: WebDev, Qwen3.8-27B no Cline) ilustra a mesma dinâmica do lado das ferramentas de desenvolvimento: as diferenças de preço entre modelos abertos e fechados estão se reduzindo, o que leva a OpenAI a baixar seus preços de API em mais de 20% no GPT-5.6 Sol logo em seguida.
O movimento em direção à abertura total — não apenas dos pesos, mas dos dados e da infraestrutura de treinamento — continua a dar frutos científicos: o estudo da Georgia Tech sobre o Olmo 3 simplesmente não teria sido possível em um modelo fechado, assim como o estudo da Hume AI sobre os vieses de benchmark ASR lembra que uma pontuação de leaderboard não garante qualidade real de transcrição. São dois lembretes úteis no momento em que o setor multiplica anúncios de pontuações recordes.
Por fim, a multiplicação de conjuntos de dados massivos com licença comercial — EgoSuite-Open100K hoje, após vários anúncios semelhantes nas últimas semanas — confirma que o acesso a dados humanos reais, e não apenas sintéticos, está se tornando uma questão estratégica para robótica e IA incorporada, no mesmo nível em que o cálculo se tornou para os grandes modelos de linguagem.
Fontes
- Claude Platform — GA computer use, browser tool, Skills API, Files API
- GitHub Copilot no Slack
- GitHub Copilot no Teams
- DeepSeek-V4-Flash-Vision-Exp
- Pika Speech
- Detalhes da arquitetura do Pika Speech
- EgoSuite-Open100K
- Espelho do Hugging Face EgoSuite
- Claude Security no Mythos 5
- Redução de preço do GPT-5.6 Sol (API)
- GPT-5.6 Sol -50% no GitHub Copilot
- GLM-5.3 (Max) no Code Arena: WebDev
- Harvey Tenet
- Georgia Tech traça as origens do raciocínio social de Olmo 3
- Viés de benchmark optimization em ASR
- SenseNova-U1.5-8B-MoT
- Diffusers 0.40.0
- Google DeepMind × Fenris Creations
- Runway Ruby
- NVIDIA AVO no ARC-AGI-3
- HeyGen Look Packs
- Explicação do uso do Amp
- v0 Vercel Connect
- Threads compartilhados Codex / ChatGPT Work
- Fundos transparentes GPT-Image-2
- Zed × Antigravity
- trackio 0.36
- IA full-stack segundo Google DeepMind
- GitHub — gestão de usuários bloqueados
- GitHub — fixação na sidebar
- Manus — acesso gratuito estendido
- Manus — lembrete de backup
- Genspark — promoção
- NVIDIA — segurança da pilha agêntica
- NVIDIA — hackathon DGX Spark Seattle
- NVIDIA Cosmos 3 — pós-treinamento
- DGX Station — Qwen3.8-27B
- Luma Labs — Summer Signal
- Synthesia na Forbes
- Qwen3.8-27B — cookbook SGLang
- Qwen3.8-27B — Unsloth
- Qwen3.8-27B — 1ª posição na Cline
- Qwen3.8-Max — Kilo Code
- Kimi Work — tutorial para analistas financeiros
- GLM-5.3 — pontuação DeepSWE
- GLM-5.3 — WorkBuddy
- GLM-5.3 — Build Week Z.ai
- GPT-5.6 Sol — descontos de terceiros