ai-powered-markdown-translatorArtigo traduzido do fr para o pt com gpt-5.4-mini.
O fio condutor de 15 de julho é a robustez dos agentes diante de ataques: a OpenAI revela o GPT-Red, um red teamer automatizado que fortalece o GPT-5.6 contra injeções de prompt, enquanto o Claude Code endurece seu CLI e o agente de revisão de código do Warp faz a escolha deliberada de um acesso somente leitura. O restante do dia cobre uma onda de anúncios sobre agentes de codificação (Codex no Chrome, Grok Build em open source, Devin no Slack, GitHub Copilot), modelos abertos (Meta AI, Hugging Face, Ai2, Together AI) e várias novidades do lado do Google, geração de mídia, Perplexity e Cohere.
GPT-Red : OpenAI fortalece a robustez do GPT-5.6 frente a injeções de prompt
15 de julho — A OpenAI apresenta o GPT-Red, um modelo de red teaming automatizado treinado internamente para fortalecer a resistência de seus modelos a injeções de prompt (prompt injection) — esses ataques que escondem uma instrução maliciosa em um documento, uma página web ou na saída de uma ferramenta para desviar um agente de sua tarefa original. Em vez de depender apenas de equipes humanas para imaginar ataques, a OpenAI delega essa exploração a um modelo especializado, capaz de realizá-la continuamente e em grande escala.
O modelo é treinado por autojogo (self-play) com aprendizado por reforço: um atacante é recompensado quando consegue provocar um comportamento indesejado, enquanto uma população de modelos defensores aprende a resistir sem prejudicar sua tarefa original. Esse jogo de soma zero produziu um atacante capaz de derrotar praticamente todos os modelos testados, internos e públicos, até o GPT-5.6.
Integrado ao treinamento do GPT-5.6, o GPT-Red permitiu reduzir por 6 a taxa de falha do modelo diante das injeções diretas mais difíceis, em comparação com o melhor modelo de produção de quatro meses atrás. Em um cenário de referência acadêmico (Dziemian et al., 2025), ele atinge 84% de sucesso contra 13% para red teamers humanos nos mesmos casos.
A OpenAI ilustra o interesse prático com dois estudos de caso reais. Em um agente gerenciando uma máquina de vendas nas suas instalações (desenvolvido pela Andon Labs, na linha do projeto « Project Vend »), o GPT-Red conseguiu baixar o preço de um item caro para 0,50 dólar, fazer pedir um item de mais de 100 dólares para revendê-lo pelo mesmo preço promocional e cancelar o pedido de outro cliente. Em um agente Codex CLI confrontado com dez cenários de exfiltração de dados, ele se mostrou mais eficaz e mais econômico em tokens do que uma base de referência usando um simples prompt. O modelo permanece estritamente interno — jamais implantado publicamente — para evitar que suas capacidades ofensivas caiam em mãos erradas. Um pré-print detalhando o método deve ser publicado ao longo da semana.
| Indicador medido | Valor medido |
|---|---|
| Taxa de sucesso GPT-Red vs red teamers humanos (cenário acadêmico) | 84 % contra 13 % |
| Redução das falhas frente às injeções diretas (GPT-5.6 vs modelo anterior) | 6x menos falhas |
| Taxa residual de falha do GPT-5.6 frente às injeções diretas do GPT-Red | 0,05 % |
“Introducing GPT-Red. An internal automated red teamer on a mission to find our models’ prompt injection vulnerabilities at scale, helping us build stronger defenses before wider deployment.”
🇵🇹 Apresentação do GPT-Red. Um red teamer automatizado interno cuja missão é encontrar, em grande escala, as vulnerabilidades dos nossos modelos a injeções de prompt, a fim de nos ajudar a construir defesas mais sólidas antes de uma implantação mais ampla. — @OpenAI no X
Claude Code : artefatos conectados ao MCP e CLI v2.1.207 a v2.1.210
Os artefatos agora chamam os conectores MCP
15 de julho — Os artefatos (Artifacts) do Claude Code podem agora chamar conectores MCP (Model Context Protocol), para construir painéis e aplicações que recuperam informações e executam ações sob demanda, para cada visitante. Um artefato é construído uma única vez e depois busca dados em tempo real a cada consulta, usando os conectores MCP próprios do visitante do momento — não os de seu criador. Esse modelo de permissão por visitante em vez de por criador resolve uma preocupação óbvia de segurança para uso corporativo: cada pessoa vê apenas os dados aos quais ela mesma tem acesso.
A funcionalidade está disponível nos planos Pro, Max, Team e Enterprise, mas não nos artefatos compartilhados publicamente — o que faz sentido, já que o acesso aos dados depende dos conectores de cada visitante.
CLI v2.1.207 a v2.1.210 : leitor de tela, transcripts mais leves, segurança reforçada
15 de julho — A Anthropic publicou quatro versões do CLI Claude Code desde a última cobertura. A mais densa, a v2.1.208, adiciona um modo leitor de tela (--ax-screen-reader), corrige vazamentos de memória que podiam atingir 64 MB em sessões longas e reduz o tamanho dos transcripts de sessão em até 79 vezes nas sessões com muita atividade de edição. Ela também reforça a segurança: comandos de exclusão catastróficos contendo guillemets oblíquos invertidos (backticks) agora disparam uma confirmação, mesmo no modo automático e com --dangerously-skip-permissions.
A v2.1.207 amplia o modo automático para Bedrock, Vertex AI e Foundry sem opt-in, e muda essas plataformas para Claude Opus 4.8 por padrão. A v2.1.210 adiciona um contador de tempo ao vivo em chamadas longas de ferramentas e reforça a ferramenta Agent contra injeção indireta de prompt por meio de conteúdo lido por um subagente.
Agentes de codificação : Codex, Grok Build, Warp, Devin e GitHub Copilot
Codex no Chrome demonstra um plano automatizado de entrada em produção
15 de julho — A OpenAI Developers compartilhou uma demonstração do Codex usado no Chrome para transformar uma simples solicitação em plano de entrada em produção: a partir de um formulário, o agente constrói uma checklist, busca o contexto no Google Drive, Slack e em arquivos locais, sinaliza os pontos que exigem acompanhamento humano, atualiza o portal correspondente e depois redige uma resposta — com a decisão final permanecendo nas mãos do usuário em cada etapa. Essa demonstração destaca a navegação web orientada pelo Codex, uma funcionalidade já documentada no changelog do produto sob o nome « Browser use ».
xAI disponibiliza o código-fonte do Grok Build
15 de julho — A xAI disponibilizou o código-fonte do Grok Build, seu agente de codificação em linha de comando lançado em beta inicial no fim de maio. A publicação cobre quatro componentes: o loop do agente, as ferramentas (leitura, modificação, busca de código, execução de comandos), a interface de terminal e o sistema de extensão (skills, plugins, hooks, servidores MCP, subagents). Ponto notável para os desenvolvedores: o Grok Build agora pode funcionar inteiramente localmente (local-first), conectado à sua própria inferência e controlado via um arquivo config.toml.
A xAI também desativou a retenção padrão de dados para todos os usuários desde 12 de julho e está apagando os dados de código anteriormente mantidos:
“In response to user questions about privacy: Since launch, Grok Build has fully respected zero data retention (ZDR). All users have always had the ability to disable data upload in the CLI. […] We disabled default retention for all Grok Build users starting on July 12th. Additionally, we are deleting all coding data that was previously retained, ensuring every user’s preferences are respected.”
🇵🇹 Em resposta às perguntas dos usuários sobre privacidade: desde o seu lançamento, o Grok Build sempre respeitou a retenção zero de dados (ZDR). Todos os usuários sempre tiveram a possibilidade de desativar o envio de dados no CLI. […] Desativamos a retenção por padrão para todos os usuários do Grok Build a partir de 12 de julho. Além disso, estamos apagando todos os dados de código anteriormente mantidos, para garantir o respeito às preferências de cada usuário. — @SpaceXAI no X
Warp constrói um agente de revisão de código autoaperfeiçoável
15 de julho — Zach Lloyd, CEO da Warp, publica o terceiro capítulo de sua série sobre a « cloud software factory »: um agente de revisão de código capaz de se aprimorar automaticamente, após os textos sobre o agente de triagem de tickets e o agente de redação de especificações. A arquitetura se baseia em uma competência de revisão que analisa o pull request, o diff e as especificações, uma ação GitHub que transforma sua saída em comentários, e um segundo agente « de loop externo » que observa uma vez por dia os retornos humanos para propor ele mesmo uma atualização da competência de revisão. Escolha de design notável: o agente dispõe apenas de acesso somente leitura aos pull requests, com a publicação dos comentários sendo gerenciada pelo código da ação GitHub — para limitar o risco de injeção de prompt.
Devin chega ao Slack
15 de julho — A Cognition integra o Devin diretamente ao Slack, em parceria com o Slack, para permitir que as equipes investiguem problemas, façam perguntas sobre uma base de código e iniciem tarefas de desenvolvimento sem sair do canal de conversa. Essa integração se soma às superfícies já oferecidas para Devin (CLI, IDE via Windsurf, GitHub) e responde ao fato de que muitas solicitações de engenharia começam em mensagens do Slack muito antes de se tornarem tickets formais.
GitHub Copilot : atualização do Visual Studio e extensão BYOK para JetBrains
14 de julho — O GitHub publica seu resumo de junho para o Copilot no Visual Studio: janela de uso com alertas proativos antes do excedente, validação de confiança para servidores MCP (comparação na inicialização com uma referência conhecida, ativada por padrão) e passagem para disponibilidade geral do agente de modernização C++. Outras adições: sugestões de edição a longa distância, inclusão de um pull request como contexto no Copilot Chat e revisão de pull requests integrada ao IDE — tudo disponível de Free a Enterprise.
No lado do JetBrains, o Copilot amplia seu suporte BYOK (Bring Your Own Key) para endpoints personalizados compatíveis com OpenAI, adiciona um provedor de agente Claude para configurar agentes e habilidades (prévia pública, Pro e superior), e introduz um sandbox local bem como uma habilidade de depuração integrada para o Copilot CLI.
🔗 Atualização do Visual Studio · 🔗 Extensão BYOK JetBrains
Modelos abertos : Meta AI, Hugging Face, Ai2 e Together AI
Meta AI conquista nota perfeita na Olimpíada Asiática de Física
14 de julho — A Meta AI submeteu um modelo à prova teórica da Olimpíada Asiática de Física (APhO 2026), com autorização do comitê da competição. Resultado: nota perfeita de 30 em 30, igualando os três melhores candidatos humanos. A Meta AI não especifica se se trata do Muse Spark 1.1 (sua última grande versão, de 9 de julho) ou de outro modelo interno não público.
Hugging Face dá um teaser de um novo modelo em pesos abertos
15 de julho — A Hugging Face transmitiu no fim do dia uma livestream sobriamente intitulada (em inglês) « novo modelo em pesos abertos », sem revelar o nome por escrito — nem no tweet, nem no título do broadcast, nem no blog oficial. Várias respostas ao tweet pedem explicitamente qual é o modelo e como ele se compara aos benchmarks padrão, sem que nenhuma resposta escrita tenha sido dada no momento da redação. A acompanhar assim que a informação for publicada por escrito.
Ai2 encerra SciArena após 1.700 usuários
15 de julho — A Ai2 encerrou o SciArena, sua plataforma de avaliação aberta que testava a capacidade dos modelos de responder a perguntas de literatura científica, julgadas por pesquisadores em vez de modelos automáticos. Balanço de encerramento: cerca de 1.700 usuários e perto de 3.900 votos coletados. A metodologia completa e os resultados estão detalhados em um artigo depositado no arXiv.
Together AI disponibiliza Inkling no dia 0 e lança TogetherLink
15 de julho — A Together AI disponibilizou desde o lançamento o Inkling, o novo modelo da Thinking Machines Lab: um mixture of experts (MoE) multimodal de 975 bilhões de parâmetros no total (40 bilhões ativos por token), dotado de uma janela de contexto de um milhão de tokens e capaz de processar texto, imagem e áudio. A Together AI otimizou seu núcleo FlashAttention-4 para essa arquitetura, que combina atenção relativa condicionada pela consulta e convoluções causais curtas.
No mesmo dia, a Together AI também lançou o TogetherLink, um CLI open source para executar qualquer modelo aberto nos ambientes de desenvolvimento mais usados — a demonstração destaca o GLM 5.2 rodando diretamente no Codex e no Claude Code.
| Indicador medido | Valor medido |
|---|---|
| Parâmetros totais (Inkling) | 975 Bi |
| Parâmetros ativos por token | 40 Bi |
| Janela de contexto | 1M tokens |
🔗 Suporte day-0 para Inkling · 🔗 TogetherLink no X
Google DeepMind e Gemini Spark
DeepMind investiga o gargalo de validação científica dos agentes de IA
15 de julho — O Google DeepMind publica « Conjecture Machines », um ensaio de política pública sobre a forma como os agentes de IA transformam a pesquisa científica. O exemplo de abertura é marcante: o microbiologista José Penadés (Imperial College London) submeteu ao Co-Scientist um problema no qual sua equipe trabalhava havia quase uma década; o agente devolveu em dois dias cinco hipóteses classificadas por prioridade, sendo a primeira aquela que sua equipe levou anos para demonstrar.
O ensaio distingue dois regimes: a ideação, na qual os agentes avançam rapidamente (via Co-Scientist ou AlphaEvolve), e a validação, que continua lenta e cara — exceto em matemática e em informática, onde ela pode ser formal (a ferramenta Aletheia resolveu 6 dos 10 problemas do « First Proof challenge » de fevereiro). Quatro prioridades são propostas aos responsáveis por políticas públicas: acesso amplo aos agentes, exploração dos dados nacionais, investimento na infraestrutura de validação e evolução da revisão por pares.
🔗 Thread no X · 🔗 Ensaio completo no DeepMind
Gemini Spark amplia sua cobertura geográfica e ganha quatro melhorias
15 de julho — A Google está expandindo o lançamento do Gemini Spark, seu agente pessoal que მუშაობa em segundo plano para o usuário, para mais países e idiomas para assinantes do Google AI Ultra. Quatro melhorias começam a ser distribuídas no mesmo dia:
| Melhoria trazida | Descrição |
|---|---|
| Edição no Google Docs | O Spark pode abrir e modificar diretamente um documento |
| Integração mais profunda com o Workspace | Leitura dos comentários no Google Sheets e Slides |
| Velocidade | As tarefas longas são executadas mais rapidamente |
| Sourcing multi-source aprimorado | Recuperação e análise de várias fontes em paralelo em tarefas complexas |
Geração de mídia: Suno e Synthesia
Suno chega ao teclado do iMessage
15 de julho — A Suno lança uma extensão de teclado para iMessage, permitindo gerar e enviar faixas musicais diretamente do app Mensagens no iOS, sem trocar de aplicativo. É necessário atualizar o app Suno para a versão mais recente para acessar o recurso.
Synthesia lança Dubbing 2.0
15 de julho — A Synthesia anuncia o Dubbing 2.0, uma reformulação do seu sistema de dublagem de vídeo por IA baseada em uma infraestrutura totalmente nova: sincronização labial muito melhor, mesmo em cenas complexas, vozes mais expressivas, traduções que respeitam melhor o ritmo do vídeo de origem e edição instantânea das transcrições sem novo render completo. Cada usuário recebe até 450 minutos gratuitos para testar a funcionalidade.
Perplexity e Cohere: infraestrutura e pesquisa comunitária
Perplexity revela SPACE, a plataforma sandbox do Perplexity Computer
15 de julho — A Perplexity apresenta o SPACE, a camada de execução segura que alimenta o Perplexity Computer: ambientes isolados para código, arquivos e sessões de agentes de longa duração, cada um implementado como uma máquina virtual com seu próprio kernel convidado. As credenciais nunca entram no sandbox; um gateway de rede central impõe as políticas de saída. Graças ao sistema de arquivos btrfs (copy-on-write), o SPACE lida com 100% do tráfego de produção do Perplexity Computer desde junho, e a Perplexity planeja expandi-lo para microVMs Linux, convidados Windows e as máquinas locais dos usuários.
| Indicador medido | Antes do SPACE | Com o SPACE |
|---|---|---|
| Latência mediana de criação de um sandbox | 185 ms | 60 ms (3,1x) |
| Latência P90 de criação | 447 ms | 89 ms (5,0x) |
Cohere publica os resultados da Expedition Tiny Aya
15 de julho — A Cohere Labs divulga os resultados da Expedition Tiny Aya, um programa de pesquisa com mentoria construído em torno do Tiny Aya, seu modelo aberto e leve, com bom desempenho em mais de 70 idiomas e capaz de rodar localmente, inclusive em telefone. Os projetos comunitários abrangem educação (companheiro de voz offline para crianças, com um novo benchmark de segurança), segurança multilíngue (o desalinhamento aprendido em um idioma pode se transferir para outro) e implantação local (compressão consciente do idioma, assistentes quantizados em 4 bits). As pesquisas foram aceitas na conferência COLM 2026.
“Tiny Aya is Cohere Labs’ answer to a familiar problem: most AI is built for a handful of languages and needs serious hardware to run. Tiny Aya is open-weight, strong across 70+ languages, and light enough to run locally, even on a phone.”
🇵🇹 O Tiny Aya é a resposta da Cohere Labs a um problema familiar: a maioria das IAs é projetada para um punhado de idiomas e exige hardware potente. O Tiny Aya é aberto, tem bom desempenho em mais de 70 idiomas e é leve o suficiente para rodar localmente, até mesmo em um telefone. — Blog da Cohere
Breves
- Together AI melhora a confiabilidade de seus GPU Clusters — verificações de saúde passivas, reparo guiado de nós, stack Slurm reconstruído e suporte OIDC externo para clusters GPU em produção. 🔗 fonte
- HeyGen detalha o método das «seis decisões» para promptar o HyperFrames — décimo episódio da série diária dedicada ao seu agente CLI de geração de vídeo. 🔗 fonte
- Kling AI publica um novo episódio de sua série interativa «Choose a door» — a comunidade vota nos comentários para orientar a continuação do curta de terror «You Can Never Leave». 🔗 fonte
- O Pika MCP deixa o status experimental — conexão do Pika a agentes de terceiros (Claude, Codex, OpenClaw, HermesAgent) agora disponível publicamente. 🔗 fonte
- OpenAI Developers lança kbd-1.0-codex-micro — um macropad com joystick projetado com @work_louder para controlar seus atalhos do Codex, em edição limitada. 🔗 fonte
- Cohere publica uma análise sobre o custo total de propriedade da IA nas empresas — 92 a 96% das organizações que implantam IA generativa ou agentica enfrentam despesas mais altas do que o previsto, segundo Gartner, IDC e McKinsey. 🔗 fonte
O que isso significa
A segurança de agentes está se tornando um trabalho de engenharia em si, e não uma reflexão posterior. O GPT-Red automatiza o red teaming por autojogo e o desdobra em casos reais em um caixa eletrônico e em um agente Codex CLI; a CLI Claude Code v2.1.208 reforça seus próprios comandos destrutivos e sua ferramenta Agent contra a injeção indireta; e o agente de revisão de código do Warp faz a escolha explícita de acesso somente leitura para limitar essa mesma família de ataques. Três iniciativas independentes que convergem para a mesma ideia: quanto mais os agentes agem sozinhos em sistemas reais, mais a defesa contra prompt injection precisa se tornar uma disciplina contínua e automatizada, e não uma checklist pontual.
O ecossistema de agentes de codificação continua se adensando em todas as frentes ao mesmo tempo. A xAI abre o código-fonte do Grok Build e permite uso totalmente local, o Devin se instala no Slack para captar solicitações antes mesmo de virarem tickets, o Codex é implantado no Chrome para conduzir tarefas de ponta a ponta, e o GitHub Copilot amplia em paralelo sua oferta BYOK e seu agente de modernização. Essa diversidade de estratégias — abertura do código, integração nas ferramentas de comunicação, navegação web autônoma, flexibilidade de provedores de modelos — reflete uma competição em que cada ator busca um ângulo de acesso diferente ao fluxo de trabalho diário dos desenvolvedores, em vez de uma convergência para um único modelo dominante.
Os modelos abertos e a infraestrutura que os serve avançam em conjunto. A Together AI ilustra as duas faces do movimento ao servir o Inkling desde o primeiro dia e publicar simultaneamente o TogetherLink para rodar qualquer modelo aberto nos IDEs, enquanto a Ai2 encerra o SciArena após reunir quase 3.900 votos de pesquisadores sobre a confiabilidade das respostas científicas geradas por IA. Em segundo plano, o ensaio da Google DeepMind sobre o gargalo da validação científica e a plataforma sandbox SPACE da Perplexity colocam a mesma questão sob dois ângulos diferentes: como verificar, em grande escala e com segurança, o que produzem agentes cada vez mais autônomos.
Do lado dos usos mais voltados ao público geral, a IA generativa continua a se infiltrar em pontos de entrada cada vez mais cotidianos — o teclado do iMessage para a Suno, a edição de documentos do Workspace para o Gemini Spark, a dublagem de vídeo para a Synthesia. Essa diversificação vem acompanhada de um lembrete mais austero no lado corporativo: a análise da Cohere sobre o custo total de propriedade da IA destaca que 92 a 96% das organizações gastam mais do que o previsto, um lembrete de que a generalização dos agentes não dispensa uma gestão econômica rigorosa da infraestrutura subjacente.
Fontes
- OpenAI — GPT-Red
- @OpenAI no X — GPT-Red
- @ClaudeDevs no X — artefatos MCP
- CHANGELOG Claude Code
- @OpenAIDevs no X — Codex no Chrome
- xAI — Grok Build em open source
- @SpaceXAI no X — confidencialidade do Grok Build
- Warp — agente de revisão de código autoaperfeiçoador
- @cognition no X — Devin no Slack
- GitHub Copilot no Visual Studio — atualização de junho
- GitHub Copilot para JetBrains — extensão BYOK
- @AIatMeta no X — Olimpíada de Física
- @huggingface no X — livestream de novo modelo
- @allen_ai no X — balanço do SciArena
- Together AI — suporte day-0 ao Inkling
- @nutlope no X — TogetherLink
- @GoogleDeepMind no X — Conjecture Machines
- Google DeepMind — Conjecture Machines (ensaio completo)
- @GeminiApp no X — Gemini Spark
- @suno no X — teclado iMessage
- Synthesia — Dubbing 2.0
- @perplexity_ai no X — SPACE
- @cohere no X — Expedition Tiny Aya
- Blog da Cohere — Tiny Aya in the wild
- Together AI — confiabilidade dos GPU Clusters
- @HeyGen no X — HyperFrames Day 10
- @Kling_ai no X — Choose a door
- @pika_labs no X — Pika MCP
- @OpenAIDevs no X — kbd-1.0-codex-micro
- Blog da Cohere — custo total de propriedade da IA