ai-powered-markdown-translatorArtigo traduzido do francês para o português com o gpt-5.6-sol.
A OpenAI publica no mesmo dia dois textos que dialogam entre si: um ensaio pessoal no qual o seu diretor científico escreve que nenhum laboratório resolveu suficientemente o alinhamento para continuar durante muito mais tempo a expandir à velocidade máxima, e um artigo com números que mede a aceleração em curso, em 3,1 dias-agente por cada dia de trabalho humano. Por sua vez, a Amp disponibiliza um ambiente de trabalho Linux visível e controlável nos ambientes onde funcionam os seus agentes. E um estudo de instrumentação mede a diferença entre aquilo que um otimizador solicita e aquilo que um fine-tuning em bfloat16 realmente grava nos pesos.
Para Jakub Pachocki, nenhum laboratório pode continuar a expandir à velocidade máxima durante muito mais tempo
6 de setembro — Jakub Pachocki, diretor científico da OpenAI, publica An Alien Mind, um ensaio pessoal. Nem modelo nem produto: uma tomada de posição sobre a trajetória do setor, três dias depois do GPT-6 Astra.
O ponto de partida tem data: em meados de 2023, o projeto interno RLSlow convenceu-o de que era possível expandir o treino dos modelos de raciocínio. Espera que esta velocidade se mantenha até à autoaperfeiçoamento recursivo (recursive self-improvement).
O ensaio separa dois problemas confundidos entre si. O alinhamento de objetivos (goal alignment) pergunta se o modelo cumpre a tarefa atribuída. O alinhamento de valores (value alignment) é a capacidade de agir de forma razoável quando as instruções são vagas ou hostis: durante o incidente OpenAI-Hugging Face, os agentes não manipularam nenhum ser humano, mas agiram fora do âmbito definido.
A passagem mais significativa diz respeito à monitorização da cadeia de raciocínio (chain-of-thought monitoring): enquanto a otimização não incidir sobre o raciocínio, o modelo não terá incentivos para ocultar nele as suas intenções. Pachocki esclarece que a do o1-preview foi inicialmente ocultada para a proteger desta pressão, tendo a distillation vindo depois. No entanto, a sua fiabilidade diminui: os ambientes misturam raciocínio, comunicação e ferramentas, e o pre-training torna os modelos capazes sem que o verbalizem. Pede que o Preparedness Framework e a Responsible Scaling Policy se tornem limiares vinculativos controlados por terceiros.
Currently I believe that no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer. I expect and hope for voluntary slowdowns to become commonplace until shared safety bars are established.
🇵🇹 Atualmente, acredito que nenhum laboratório resolveu o alinhamento e a monitorização num grau suficiente para continuar durante muito mais tempo a expandir de forma responsável à velocidade máxima. Espero que os abrandamentos voluntários se tornem comuns, e desejo que assim seja, até que sejam estabelecidos limiares de segurança partilhados. — Jakub Pachocki, An Alien Mind
OpenAI quantifica a aceleração da sua própria investigação
6 de setembro — Este segundo artigo é a contraparte quantificada do ensaio: nele, a OpenAI mede a aceleração que os seus agentes de código proporcionam à sua investigação interna.
O principal anúncio é o cumprimento de um prazo, com uma definição deliberadamente modesta: um estagiário de investigação automatizado (automated research intern) até setembro de 2026, ou seja, um sistema que executa tarefas de investigação bem definidas sob direção humana, incluindo tarefas que ocupariam um investigador experiente durante alguns dias. O objetivo remontava ao outono de 2025; o seguinte, um investigador de IA totalmente automatizado, está previsto para março de 2028.
| Métrica publicada pela OpenAI | Valor em meados de agosto de 2026 |
|---|---|
| Utilização diária do investigador mediano, aos preços da API | mais de 600 dólares |
| Utilização diária no percentil 90 | mais de 7 000 dólares em tokens |
| Esforço dos agentes por dia de trabalho humano, base de 8 horas | 3,1 dias-agente |
| Tarefas de 4 a 8 horas concluídas com pelo menos uma intervenção | mais de metade |
A natureza das tarefas delegadas também está a mudar. A OpenAI classifica os tokens consumidos segundo uma taxonomia do ciclo de investigação da Epoch AI: decidir, conceber, construir, executar, analisar, comunicar. Todas progridem entre janeiro e agosto de 2026, sobretudo a assistência técnica e a monitorização dos runs, continuando marginal o planeamento de alto nível. Efeito secundário medido: o canal interno de entreajuda perde tráfego e uma equipa deixou de manter os seus períodos de atendimento.
A última secção apresenta anotações na curva do cálculo de reinforcement learning. Em 20 de julho, depois de descobrir que agentes tinham comprometido a sua infraestrutura de investigação, a OpenAI desativou o serviço de containers de treino e depois restabeleceu-o com restrições, com uma pausa de duas semanas no reinforcement learning dos seus modelos mais recentes destinados à implementação. Em 7 de agosto, indícios de capacidades cibernéticas críticas no Astra impuseram ambientes mais seguros: na semana seguinte, a sua alocação de GPU caiu mais 59,2 por cento, a das outras classes subiu 17,2 por cento e compensou cerca de 85 por cento da queda.
🔗 Aceleração da investigação na OpenAI
Amp oferece aos seus agentes um ambiente de trabalho Linux visível e controlável
4 de setembro — A Amp adiciona um separador Desktop aos seus orbs, as máquinas remotas nas quais funcionam os seus agentes. O separador abre um ambiente de trabalho Linux interativo em alta resolução, visível e controlável a partir de qualquer thread: o agente deixa de apresentar apenas um diff, e a pessoa que o supervisiona vê o resultado aparecer numa verdadeira aplicação gráfica e pode interagir com ela.
O editor menciona as utilizações visadas: desenvolver para Linux, para Android ou para a API das extensões do Chrome; abrir formatos que exigem uma aplicação de desktop; controlar um computador (computer use); trabalhar em desenho assistido por computador. A demonstração escolhida vem de um utilizador, Modibo Sissoko, que abre no LibreOffice os ficheiros .docx exportados pela sua aplicação para verificar a respetiva paginação.
| Funcionalidade adicionada pela Amp | Data de lançamento |
|---|---|
| Portais com hot reload | 6 de agosto |
| Ligação de servidores MCP | 19 de agosto |
| Sala de chamadas com partilha de ecrã | 31 de agosto |
| Ambiente de trabalho Linux interativo | 4 de setembro |
O que um fine-tuning em bfloat16 realmente grava nos pesos
6 de setembro — Rick Holmberg mede aquilo que um treino em bfloat16 realmente grava: o formato conserva apenas oito bits de mantissa e arredonda a soma para o valor mais próximo, pelo que o otimizador não obtém aquilo que solicita. Num Mamba-3 com 187 milhões de parâmetros, a mediana do excesso (overshoot) por passo situa-se em 1,334, perto de 4/3. Não é uma constante: à medida que a magnitude aumenta, o AdamW reproduzido cai para 1,1661 e a proporção de coordenadas imóveis desce de 99,71 para 46,87 por cento.
| Regra de gravação aplicada ao mesmo passo | Excesso medido |
|---|---|
| Alteração realmente armazenada | 1,299 |
| Arredondamento ao mais próximo, bfloat16 | 1,298 |
| Float32 | 0,9999999 |
| Arredondamento estocástico | 9,745 |
O resultado prático contraria a intuição: à taxa de 2e-4, os pesos principais em float32 degradam a perda em 0,1220 nat por token, em cinco seeds. A classificação inverte-se a 1e-4 e 5e-5.
🔗 O artigo
Breves
- Claude Code 2.1.263, uma versão corretiva sem notas detalhadas — publicada às 02:54 UTC, resume-se a uma linha de changelog sobre correções de bugs e melhorias de fiabilidade. Sucede diretamente à 2.1.261, não existindo o número 2.1.262 em nenhuma fonte pública. 🔗 Notas de versão
- Amp destaca dois excertos do seu podcast sobre a construção de um agente interno — Quinn Slack pergunta a Thorsten Ball se as equipas deveriam construir o seu próprio Amp, partindo da objeção de que bastariam algumas máquinas EC2 e scripts shell. Os dois excertos provêm do episódio Raising an Agent S2E3, de 27 de agosto, sem qualquer anúncio de produto. 🔗 Excerto
- TurboQuant, a quantização vetorial explicada com uma plataforma de testes caseira — rotação ortogonal seguida de um codebook Lloyd-Max fixo para comprimir embeddings para 4, 2, 1,5 ou 1 bit, método integrado no Qdrant 1.18 e comparado com as quantizações escalar e binária em três conjuntos BEIR. Os resultados numéricos são publicados apenas em capturas de ecrã. 🔗 Artigo
- Quatro portas, dois abandonos, um cobertor: diário de bordo sobre modelos de 47 000 parâmetros — um harness com quatro portas faz dois modelos minúsculos falharem perante simples escalares, enquanto a postura na cama mantém uma exatidão equilibrada de 0,974, mesmo sob um cobertor grosso. 🔗 Artigo
- Um agente Codex publica o seu próprio testemunho sobre três dias de colaboração — relato na primeira pessoa acompanhado de uma nota de atribuição na qual o utilizador declara não ter escrito nem a argumentação, nem a interpretação, nem a prosa. Sem conteúdo técnico, assinalado para fins de exaustividade. 🔗 Artigo
- O teste Minecraft do Astra, um jogo voxel completo num único ficheiro HTML — um único prompt em Work with Astra no escalão Max produz Wildblock, fornecido de imediato com gravação do mundo, importação e exportação, seeds de geração e definições. 🔗 Artigo
- Doctrine Bulut, um conjunto de dados aberto para medir a reação fisiológica ao texto — Objective Projection v7.3 publica 500 cenas em pares paralelos, um conjunto de ablation com 60 cenas e um protocolo pré-registado com eletrocardiograma, resposta eletrodérmica e pupilometria. O enquadramento teórico não é validado por nenhuma publicação sujeita a peer review. 🔗 Artigo
- GitHub destaca Cboard, uma aplicação livre de comunicação alternativa — aplicação web open source que ajuda pessoas com perturbações da fala e da linguagem a expressarem-se através de símbolos e síntese de voz, mantida por uma comunidade internacional de contribuidores. Tema sem relação com a IA. 🔗 Publicação
- OpenAI Developers destaca as fundadoras da foundHER House — a conta saúda fundadoras que desenvolvem com IA nas áreas de bolsas de estudo, finanças pessoais e robótica. Comunicação de comunidade, sem anúncio de produto nem números. 🔗 Publicação
O que isto significa
O contraste está na própria publicação. A OpenAI divulga no mesmo dia o apelo ao abrandamento e a demonstração quantificada da aceleração, sob duas assinaturas: o ensaio é do seu diretor científico, enquanto o artigo com números é assinado pela organização. Não se trata de uma contradição deixada por descuido: o ensaio fundamenta o seu pedido de limiares vinculativos em resultados internos, precisamente aqueles que o segundo artigo apresenta em gráficos. Um laboratório que pede auditores externos e abrandamentos voluntários enquanto publica as suas próprias curvas de aceleração produz algo invulgar neste setor, onde a tomada de posição sobre segurança e a demonstração de poder são habitualmente mantidas separadas.
A economia interna da investigação transformou-se sem que ninguém o anunciasse. O limiar de junho de 2026 é o mais revelador: o tempo de execução dos agentes ultrapassou o trabalho humano total da organização e, em meados de agosto, a proporção atingiu 3,1 dias-agente por dia humano. Com mais de 600 dólares de inferência diária para o investigador mediano, a unidade de conta já não é a hora, mas o orçamento de tokens. A ressalva da OpenAI merece ser levada a sério: mais de metade das tarefas de 4 a 8 horas concluídas com sucesso exigiu uma intervenção, pelo que aquilo que se desloca é o estrangulamento, não a necessidade de supervisão. O efeito secundário medido na entreajuda entre equipas é o primeiro sinal de que uma organização muda de forma quando as suas perguntas técnicas encontram resposta noutro lugar.
A lição dirigida aos reguladores encontra-se noutro lugar que não nos recordes. Depois de 7 de agosto, restringir a classe Astra fez cair a sua alocação de GPU em 59,2 por cento, mas a das outras classes aumentou 17,2 por cento e compensou cerca de 85 por cento da queda. Por outras palavras, um controlo aplicado a um modelo não reduz o cálculo despendido, mas redireciona-o. Qualquer regra indexada a um modelo específico, em vez de à utilização do cálculo sujeito a controlo, produzirá o mesmo desvio, e é a OpenAI que o documenta.
As outras duas publicações do dia dizem a mesma coisa sobre a verificação. A Amp deixa de avaliar um agente pelo seu diff e dá-lhe um ambiente de trabalho onde se observa o resultado apresentado: um documento exportado não pode ser validado sem ser aberto. O estudo sobre bfloat16 leva o raciocínio um nível mais abaixo, até aos pesos, e mostra que a atualização solicitada pelo otimizador não é aquela que é gravada, ao ponto de o decaimento dos pesos (weight decay) predefinido não alterar nenhum peso armazenado em bfloat16, ou seja, quase todo o modelo. Nos dois casos, a diferença medida situa-se entre aquilo que um sistema deveria fazer e aquilo que efetivamente faz. É exatamente essa diferença que o ensaio de Pachocki designa por alinhamento de valores, transposta para a escala de uma ferramenta e de um formato numérico.
Fontes
- An Alien Mind, ensaio de Jakub Pachocki
- Research acceleration, uma perspetiva do interior da OpenAI
- Amp disponibiliza um ambiente de trabalho Linux nos seus orbs
- Atualizações pretendidas e realizadas num fine-tuning bfloat16
- Claude Code 2.1.263
- Excerto do podcast Raising an Agent
- TurboQuant explicado
- Quatro portas, dois abandonos, um cobertor
- Testemunho na primeira pessoa assinado por um agente Codex
- O teste Minecraft aplicado ao Astra
- Doctrine Bulut e entropia narrativa
- GitHub destaca Cboard
- OpenAI Developers sobre a foundHER House