ai-powered-markdown-translatorArtikel mit gpt-6.1-sol aus dem Französischen ins Deutsche übersetzt.
GPT-6 und Intelligent UI kommen für alle Nutzer von ChatGPT: GPT-6 Sol für kostenpflichtige Tarife ab dem 7. Oktober, GPT-6 Luna für Free und Go ab dem 8. Oktober. Anthropic vervollständigt seine 5.5-Familie mit Claude Haiku 5.5, ab 0,10 Dollar pro Million Input-Tokens, während Microsofts Windows-Veranstaltung die Vorbestellungen für RTX Spark-PCs eröffnet und ankündigt, dass GitHub Copilot seine Aufgaben bald einem lokalen Modell übertragen kann. OpenAI veröffentlicht außerdem 722 Manuskripte mit mathematischen Ergebnissen, die ein internes Modell erzeugt hat.
ChatGPT wechselt für alle zu GPT-6 und Intelligent UI, liest Audiodateien und bereitet College Planner vor
7. Oktober — OpenAI macht GPT-6 allen Nutzern von ChatGPT zugänglich. Es handelt sich nicht um ein neues Basismodell: GPT-6 Sol und GPT-6 Luna wurden zahlenden Kunden bereits seit September angeboten (hier am 22. September behandelt). Diesmal kommen Oktober-Versionen dieser beiden Modelle, die auf alltägliche Gespräche abgestimmt sind, in den Chat-Tab: GPT-6 Sol für Plus, Pro, Business und Enterprise ab dem 7. Oktober, GPT-6 Luna für Free und Go ab dem 8. Oktober. Sie ersetzen GPT-5.6 Sol und GPT-5.6 Luna in ChatGPT, während Codex und ChatGPT Work bei den September-Versionen bleiben. OpenAI richtet sich damit nach eigenen Angaben an die mehr als 1,2 Milliarden Menschen, die ChatGPT jede Woche nutzen.
Die sichtbarste Neuerung heißt Intelligent UI. GPT-6 gestaltet seine Antworten mit Text, visuellen Darstellungen und interaktiven Elementen (Diagrammen, Schaltflächen, Formularen, interaktiven Schaubildern, Karten) und kann auf Wunsch ein kleines Tool erstellen, etwa einen Sparrechner, einen Rechner zum Aufteilen einer Rechnung oder ein Spiel; wenn einfacher Text genügt, bleibt ChatGPT dabei. OpenAI nutzt dafür eine Bibliothek nativer Komponenten und einen Compiler, der die Oberfläche während der Generierung anzeigt. Intelligent UI funktioniert mit den Denkaufwandsstufen von Instant bis Extra High, ohne separates Kontingent, jedoch weder mit der Denkaufwandsstufe Pro, die GPT-6 Pro (angetrieben von GPT-6 Astra) übernimmt, noch in den älteren Desktop-Anwendungen für macOS und Windows.
Die zweite Änderung: ChatGPT kann bereits mit der Antwort beginnen, während es nachdenkt oder Tools nutzt, und seine Antwort anschließend ohne neuen Prompt ergänzen. Laut internen Bewertungen von OpenAI beginnt GPT-6 Instant bei Fragen, die eine Websuche erfordern, im Durchschnitt 44 % früher zu antworten als GPT-5.6 Instant. GPT-6 Extra High beginnt nach derselben Zeit wie GPT-5.6 Medium und erzielt dabei eine bessere Gesamtbewertung als GPT-5.6 Extra High.
| Tarif oder Einstellung des Denkaufwands | In ChatGPT verwendetes Modell | Zeitplan und Einzelheiten |
|---|---|---|
| Plus, Pro, Business und Enterprise | GPT-6 Sol (Instant, Medium, High, Extra High) | Weltweite Einführung ab dem 7. Oktober |
| Free und Go | GPT-6 Luna | Ab dem 8. Oktober |
| Denkaufwand Pro (Pro 100 und 200 Dollar, Business, Enterprise) | GPT-6 Pro, angetrieben von GPT-6 Astra | Ohne Intelligent UI |
| ChatGPT Work und Codex | September-Versionen von GPT-6 Sol und GPT-6 Luna | Keine Änderung |
Was die Sicherheit betrifft, stuft die am selben Tag veröffentlichte Systemkarte diese Versionen im Rahmen des Preparedness Framework sowohl in der Cybersicherheit als auch in Biologie und Chemie auf der Fähigkeitsstufe „High“ ein, ohne diese Schwelle bei der Selbstverbesserung zu erreichen; sie übernehmen die Schutzmechanismen von GPT-5.6 und sind widerstandsfähiger gegen Umgehungsversuche (jailbreaks), auch über mehrere Gesprächsrunden hinweg. In der API verweist der Snapshot chat-latest nun auf dieses neue ChatGPT-Modell; OpenAI empfiehlt die GPT-6-Familie für den produktiven Einsatz.
GPT-6 and Intelligent UI, now rolling out in ChatGPT for everyone. Intelligent UI in ChatGPT delivers fast, interactive answers that make everyday questions more visual, complex topics easier to grasp, and interactive tools for your task available on the spot.
🇩🇪 GPT-6 und Intelligent UI werden jetzt in ChatGPT für alle ausgerollt. In ChatGPT liefert Intelligent UI schnelle, interaktive Antworten, die Fragen des Alltags anschaulicher und komplexe Themen leichter verständlich machen, und stellt sofort interaktive Tools bereit, die auf Ihre Aufgabe zugeschnitten sind. — @OpenAI auf X
🔗 GPT-6 und Intelligent UI für alle · Systemkarte, Oktober-Update · GPT-6 und andere Modelle in ChatGPT
Audiodateien in ChatGPT
6. Oktober — ChatGPT akzeptiert nun Audiodateien als Anhang. Man kann eine Aufnahme an eine Unterhaltung anhängen, um eine Transkription, eine Zusammenfassung oder Antworten zu ihrem Inhalt zu erhalten oder um eine Besprechung, ein Interview oder eine Lehrveranstaltung in strukturierte Notizen oder sogar in den Entwurf einer anschließenden E-Mail umzuwandeln. Die Funktion ist kostenpflichtigen Abonnements und Workspaces vorbehalten, einschließlich Enterprise: Der Free-Tarif hat „vorerst“ keinen Zugriff darauf. Unterstützt werden WAV, MP3, OGG, FLAC, AAC, M4A und PCM sowie WebM und MP4, sofern sie ausschließlich Audio enthalten, bis zu 512 MB pro Datei. OpenAI weist darauf hin, dass Transkriptionen Fehler enthalten können, die Sprechererkennung weiterhin wenig zuverlässig ist und die Leistung je nach Sprache variiert.
🔗 ChatGPT-Versionshinweise · Dateien und Audio in ChatGPT hochladen
ChatGPT for Teens: erste Nutzungszahlen und College Planner in Vorbereitung
7. Oktober — OpenAI zieht eine erste Zwischenbilanz zu ChatGPT for Teens, der standardmäßig für Konten aktivierten Nutzungserfahrung, deren Nutzer als unter 18 Jahre alt erkannt wurden. Nach Angaben des Unternehmens haben innerhalb einer Woche fast 1,2 Millionen Jugendliche die Learning Visualizations und mehr als 180 000 den Study Mode genutzt; sie verbringen damit im Durchschnitt weniger als 15 Minuten pro Tag, und weniger als 2 % überschreiten drei Stunden am Stück. Die angekündigte Neuerung College Planner kommt „bald“, zunächst in den USA für Schüler der 10. bis 12. Klasse, die ein vierjähriges Hochschulstudium anstreben: Ein gemeinsamer Plan bündelt dort Bewerbungsvoraussetzungen, Fristen, Aufgaben und Schritte zur Beantragung finanzieller Unterstützung, einschließlich Stipendien. OpenAI unterstützt außerdem College Advising Corps und für drei Jahre das Digital Wellness Lab des Boston Children’s Hospital, ohne einen Betrag zu nennen.
🔗 Jugendlichen beim Lernen, Planen und Mitgestalten der Zukunft von AI helfen
Claude Haiku 5.5 laut Anthropic rund 75 % günstiger als Haiku 4.5
7. Oktober — Fünfzehn Tage nach Opus 5.5 und neun Tage nach Sonnet 5.5 vervollständigt Anthropic die Claude-5.5-Familie mit Claude Haiku 5.5 (claude-haiku-5-5). Das Modell richtet sich an Aufgaben mit hohem Volumen und hoher Kostensensibilität (Zusammenfassungen, Kontextkomprimierungen, Datenbankabfragen, Klassifizierung), an den Einsatz als Sub-Agent von Opus 5.5 und Sonnet 5.5 beim Coding sowie an Anwendungen, bei denen Geschwindigkeit zählt, etwa Live-Kundensupport oder die Steuerung eines Browsers: Es ist Anthropics schnellstes Modell bei Standardgeschwindigkeit, wobei die Opus-Modelle im Fast Mode weiterhin schneller sind. Es ist außerdem das erste Haiku mit einer Einstellung des Denkaufwands (standardmäßig medium), mit einem Kontext von 1 Million Tokens und bis zu 128 000 Output-Tokens.
Die Preise sind in zwei Stufen aufgeteilt. Bis zu 100 000 Prompt-Tokens kostet Haiku 5.5 0,10 Dollar pro Million Input-Tokens und 0,50 Dollar pro Million Output-Tokens, also 90 % weniger als Haiku 4.5; darüber steigen die Preise auf 0,50 und 2,50 Dollar, also 50 % weniger. Die hervorgehobene Ersparnis von „rund 75 %“ ist ein von Anthropic berechneter Durchschnitt: 90 % der an Haiku 4.5 gesendeten Anfragen blieben unter der Schwelle, und die neue Aufteilung in Tokens (tokenizer) zählt für denselben Text ungefähr 30 % mehr Tokens.
| Tarifart (pro Million Tokens) | Haiku 5.5 bis zu 100 000 Prompt-Tokens | Haiku 5.5 über 100 000 Tokens | Haiku 4.5 |
|---|---|---|---|
| Input-Tokens | 0,10 Dollar | 0,50 Dollar | 1 Dollar |
| Output-Tokens | 0,50 Dollar | 2,50 Dollar | 5 Dollar |
| Cache-Lesezugriffe | 0,01 Dollar | 0,05 Dollar | 0,10 Dollar |
| Cache-Schreibzugriffe | 0,125 Dollar | 0,625 Dollar | 1,25 Dollar |
Bei den von Anthropic veröffentlichten Benchmarks ist der Abstand zu Haiku 4.5 groß, und Haiku 5.5 liegt überall dort vor OpenAIs GPT-6 Luna, wo beide aufgeführt sind. Es bleibt hingegen hinter Sonnet 5.5 zurück, das Anthropic zusammen mit Opus 5.5 weiterhin für komplexes agentisches Coding empfiehlt.
| Bewerteter Benchmark (Angaben von Anthropic) | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| Terminal-Bench 4.0 (agentisches Coding) | 39,2 % | 0,0 % | 16,4 % | 70,6 % |
| OSWorld 2.1, Offline-Teilmenge | 72,4 % | 15,7 % | 48,9 % | 83,9 % |
| Humanity’s Last Exam, ohne Tools | 45,9 % | 10,2 % | — | 56,9 % |
| FrontierCode 1.1, Main | 46,4 % | — | 42,4 % | 52,1 % (Denkaufwand Xhigh) |
| Chartography, ohne Tools | 46,4 % | 6,4 % | 29,1 % | 61,6 % |
Sechs Kunden berichteten über ihre Vorabtests: HubSpot nennt 92,8 % bei seiner CRM-Testsuite, sein bislang bestes Ergebnis, AlphaSense 0,84 gegenüber 0,76 für Haiku 4.5 bei 400 Anfragen und Box 11 Punkte mehr bei ungefähr halb so hoher Latenz. Die Migration von Haiku 4.5 erfordert Arbeit: Der Leitfaden listet elf Änderungen auf, darunter das Ende von budget_tokens, der Parameter temperature, top_p und top_k sowie des Prefillings, und der Claude-Code-Befehl /claude-api migrate automatisiert einen Teil davon. Was die Sicherheit betrifft, beschreibt Anthropic Cyber-Schutzmechanismen, die strenger sind als die von Haiku 4.5, aber etwas weniger streng als die seiner anderen aktuellen Modelle: mehr erlaubte defensive Aufgaben als bei Sonnet 5.5, weiterhin blockierte Penetrationstests.
Die Einführung geht mit einer Preissenkung einher: Cache-Lesezugriffe bei Sonnet 5.5 sinken ab dem 7. Oktober von 0,20 auf 0,10 Dollar pro Million Tokens, wodurch das Modell laut Anthropic bei den meisten agentischen Aufgaben rund 20 % günstiger wird. Haiku 5.5 ist ab sofort über die Claude API, Amazon Web Services, Google Cloud und Microsoft Azure sowie in Claude Code verfügbar.
Introducing Claude Haiku 5.5: the cheapest, fastest, and most capable small model we’ve ever released. On average, it costs around 75% less to run than Claude Haiku 4.5.
🇩🇪 Hier ist Claude Haiku 5.5: das günstigste, schnellste und leistungsfähigste kleine Modell, das wir je veröffentlicht haben. Im Durchschnitt kostet sein Betrieb rund 75 % weniger als der von Claude Haiku 4.5. — @claudeai auf X
🔗 Ankündigung von Claude Haiku 5.5 · Migrationsleitfaden für Haiku 5.5
Haiku 5.5 in Cursor: 48,4 % auf CursorBench
7. Oktober — Cursor stellt Claude Haiku 5.5 bereits am Tag der Einführung bereit; es lässt sich in den Modelleinstellungen aktivieren. Laut Cursor ist es bei kurzen Anfragen 10-mal günstiger als Claude Haiku 4.5. Auf CursorBench, der von Cursor auf seiner Website veröffentlichten Rangliste, belegt Haiku 5.5 mit Denkaufwand Max Platz 10 mit einer Erfolgsquote von 48,4 % bei 1,12 Dollar pro Aufgabe, knapp vor Sonnet 5.5 mit Denkaufwand High, dessen Kosten Cursor am 7. Oktober neu berechnet hat, um den neuen Tarif zu berücksichtigen, und vor Opus 5 mit Denkaufwand Max. Es arbeitet allerdings mehr: im Durchschnitt 325 934 Tokens und 163 Schritte pro Aufgabe gegenüber 37 391 Tokens und 41 Schritten für Sonnet 5.5 mit Denkaufwand High.
| Von Cursor getestete Konfiguration | Ranglistenplatz | CursorBench-Ergebnis | Kosten pro Aufgabe |
|---|---|---|---|
| Opus 5.5, Denkaufwand Max | 1 | 57,8 % | 13,43 Dollar |
| Haiku 5.5, Denkaufwand Max | 10 | 48,4 % | 1,12 Dollar |
| Sonnet 5.5, Denkaufwand High | 11 | 47,8 % | 1,20 Dollar |
| Opus 5, Denkaufwand Max | 13 | 46,6 % | 11,95 Dollar |
| Haiku 5.5, Denkaufwand Low | 54 | 30,9 % | 0,08 Dollar |
🔗 Ankündigung von Cursor auf X · CursorBench-Rangliste
Monatliches API-Guthaben von 100 bis 500 Dollar für die Tarife Max und Team
7. Oktober — Im selben Beitrag wie Haiku 5.5 angekündigt, erhalten Abonnenten von Max und Team ein monatliches Guthaben für die Claude Platform, das über einige Tage hinweg ausgerollt wird. Es dient dazu, eigene Tools, Anwendungen und Agenten mit der API zu entwickeln; laut @ClaudeDevs lässt es sich mit allen Modellen einschließlich Haiku 5.5 nutzen, sowohl im eigenen Code als auch in Tools von Drittanbietern.
| Betroffener Tarif | Monatliches API-Guthaben |
|---|---|
| Max 5x | 100 Dollar |
| Max 20x | 200 Dollar |
| Team, Standard-Sitz | 20 Dollar pro Sitz |
| Team, Premium-Sitz | 100 Dollar pro Sitz |
| Obergrenze eines Teams im Tarif Team | 500 Dollar, gemeinsam genutzt |
| Free, Pro und Enterprise | Nicht berechtigt |
Bei Team werden die Guthaben der Sitze in einem gemeinsamen Pool zusammengeführt: Drei Standard-Sitze und zwei Premium-Sitze ergeben beispielsweise 260 Dollar pro Monat. Das Guthaben deckt alle Modelle der Claude API ab, einschließlich der Message Batches API, sowie den Playground der Console, Claude Managed Agents und das Claude Agent SDK. Es deckt weder die interaktive Nutzung von Claude Code (Terminal, IDE, Desktop-App oder Web) noch zusätzliche Nutzung über die Tarifgrenzen hinaus oder Claude-Modelle ab, die über Amazon Bedrock, Google Cloud Vertex AI oder Microsoft Foundry bereitgestellt werden. Außerdem verändert es die Nutzungslimits von Claude, Claude Code oder Cowork nicht.
Um es zu beanspruchen, muss ein Abonnement in einem berechtigten Tarif seit mindestens sieben Tagen aktiv sein. Anschließend wird über die Abrechnungseinstellungen von claude.ai eine Organisation der Claude Console verknüpft, ohne eine Zahlungsmethode hinzuzufügen. Es kann nur eine Organisation verknüpft werden, und nur der Support kann sie ändern. Das Guthaben wird in jedem Abrechnungszyklus erneuert, kann nicht übertragen werden und wird vor gekauftem Guthaben verbraucht; sobald es aufgebraucht ist, stoppen die Aufrufe bis zum nächsten Guthaben, sofern die Organisation kein Guthaben gekauft oder die automatische Aufladung aktiviert hat. Dem Claude-Abonnement wird dabei nichts in Rechnung gestellt. Im Mai hatte Anthropic ein monatliches Guthaben für die programmatische Nutzung ab dem 15. Juni angekündigt; die Hilfeseite stellt klar, dass das neue Guthaben nicht diesen „Agent SDK-Guthaben“ entspricht, die ihr zufolge nicht verfügbar sind.
🔗 Hilfeseite: monatliches API-Guthaben der Tarife Max und Team · Ankündigung von @ClaudeDevs
Lokale KI unter Windows: NVIDIA eröffnet Vorbestellungen für RTX Spark-PCs und stellt DGX Station for Windows vorab vor
7. Oktober — NVIDIA und Microsoft nutzen die Veranstaltung Windows AI and Surface in San Francisco, bei der Jensen Huang und Satya Nadella miteinander sprechen, um RTX Spark auf den Markt zu bringen, den am 2. Juni auf der Build angekündigten Chip für Windows-PCs. Laptops können seit dem 7. Oktober vorbestellt werden und sind ab dem 16. Oktober verfügbar; Mini-PCs folgen im November. Acer, ASUS, Dell, HP, Lenovo, Microsoft, MSI und Gigabyte bereiten Geräte vor, und Microsoft stellt einen Surface Laptop Ultra auf Basis des Chips vor. Der Beitrag von NVIDIA nennt keine Preise.
RTX Spark kombiniert einen Blackwell RTX-GPU und einen Grace-CPU, die mit 600 Go/s verbunden sind, für einen Petaflop KI-Rechenleistung in FP4 und bis zu 128 Go gemeinsam genutzten Speicher. NVIDIA hebt die lokale Ausführung großer Modelle hervor, ohne Daten in die Cloud zu senden oder die Nutzung zu zählen, mit demselben CUDA-Stack wie auf seinen Servern. Der Chip richtet sich auch an Kreative (NVFP4, AV1-Encoding und hardwaregestütztes 4:2:2-Encoding) und Gamer, mit Spielen in 1440p bei mehr als 100 Bildern pro Sekunde dank DLSS 5.
Für Unternehmen stellt NVIDIA DGX Station for Windows vorab vor, die ebenfalls im Juni auf der Build angekündigt wurde und die das Unternehmen als ersten KI-Desktop-Supercomputer im Windows-Ökosystem bezeichnet: Damit sollen sich Modelle mit etwa einer Billion Parametern lokal ausführen lassen, ohne Windows zu verlassen, während Linux-Tools über WSL zugänglich bleiben. Es gibt weder einen Termin noch einen Preis, lediglich eine Anmeldung für Benachrichtigungen. Microsoft macht seinerseits Microsoft Execution Containers (MXC) allgemein verfügbar, die Infrastruktur, die Agenten unter der Kontrolle von Windows im Hintergrund ausführt.
| Vergleichspunkt | RTX Spark | DGX Station for Windows |
|---|---|---|
| Chip | Blackwell RTX-GPU (bis zu 6 144 Kerne) und Grace-CPU (bis zu 20 Kerne) | GB300 Grace Blackwell Ultra Desktop-Superchip |
| Speicher | Bis zu 128 Go, gemeinsam genutzt | 748 Go, kohärent |
| KI-Rechenleistung in FP4 | 1 Petaflop | Bis zu 20 Petaflops |
| Angekündigte Verfügbarkeit | Laptops vorbestellbar, verfügbar am 16. Oktober; Mini-PCs im November | Vorabvorstellung, ohne Termin oder Preis |
🔗 NVIDIA-Beitrag zur Windows-Veranstaltung
Lokal unter Windows entwickeln: Copilot wird Anfragen an MAI Code 1.1 Flash weiterleiten, seine Sandbox wird allgemein verfügbar, Replit bereitet eine Desktop-App vor
7. Oktober — GitHub Copilot wird bald selbst zwischen einem Modell auf dem Rechner des Entwicklers und einem Modell in der Cloud wählen können. Laut dem Beitrag von Microsoft und GitHub im Blog Microsoft Command Line kommt dieses Routing „bis Ende des Monats“: Es ist noch nicht verfügbar. GitHub bezeichnet es als nächsten Schritt von Project HydraFusion, seinem Orchestrator, der Aufgaben bereits auf mehrere Modelle verteilt, und hebt Einsparungen bei KI-Credits hervor, ohne sie zu beziffern.
In Copilot CLI, der GitHub Copilot-App und VS Code sind zwei Nutzungsarten vorgesehen. Der Auto-Modus wird von Runde zu Runde anhand des Aufgabenkontexts und des Cache-Zustands zwischen lokaler Inferenz und Cloud wählen; Entwickler können auch selbst ein lokales Modell auswählen, MAI Code 1.1 Flash über den Anbieter Windows ML oder ein beliebiges Modell, das über einen lokalen Zugriffspunkt (endpoint) bereitgestellt wird, der mit der API von OpenAI kompatibel ist. Der Beitrag erinnert daran: Lokale Inferenz macht die Sitzung nicht offline.
Die Demonstration läuft auf einem Surface Laptop Ultra mit RTX Spark. Microsoft AI betreibt darauf eine lokale Version von MAI Code 1.1 Flash, ein auf Code spezialisiertes Modell mit mehreren Experten (mixture-of-experts) und 137 Milliarden Parametern, von denen 6,8 Milliarden aktiv sind. Auf etwa 3,3 Bits pro Gewicht quantisiert, belegt es 53 Go, 80 % weniger als die Cloud-Variante, mit einem maximalen Speicherbedarf von 75,5 Go bei 256 000 Tokens Kontext.
| Bewerteter Benchmark (Microsoft-Tests vom 5. Oktober) | MAI Code 1.1 Flash | Quantisierte Version auf dem Gerät | GPT OSS 120B (GGUF-Version von Unsloth) |
|---|---|---|---|
| SWE-Bench Verified (500 Aufgaben) | 72,6 % | 70,80 % | 32,0 % |
| Terminal-Bench 2.1 (89 Aufgaben) | 62,9 % | 66,29 % | 23,6 % |
Microsoft erklärt, dass diese Tests in einer llama.cpp-Laufzeitumgebung für Windows ARM64 liefen und die Ergebnisse je nach Gerät und Konfiguration variieren. Ein erster Baustein ist bereits im Terminal verfügbar: Seit der Vorabversion 1.0.94-0 von Copilot CLI erkennt der Befehl /model die Modelle einer lokalen Ollama-Instanz. Ohne Bestätigung wird nichts hinzugefügt, Ollama und das Modell müssen bereits installiert sein, und es werden nur Modelle angeboten, die Tool-Aufrufe und Streaming (streaming) unterstützen.
🔗 Lokale Modelle und Tools in Sandboxen für Windows und GitHub Copilot bereitstellen · Lokale Modelle in GitHub Copilot CLI entdecken
Die lokale Sandbox von Copilot wird allgemein verfügbar
7. Oktober — Die lokale Sandbox von GitHub Copilot verlässt die am 2. Juni gestartete öffentliche Vorabversion: Sie wird in Copilot CLI, der GitHub Copilot-App und VS Code-Sitzungen über Agent Host ohne zusätzliche Kosten allgemein verfügbar. Von Copilot gestartete Tools und Befehle werden dann mit eingeschränktem Zugriff auf Dateien, das Netzwerk, Git- und GitHub CLI-Zugangsdaten sowie andere Systemfunktionen ausgeführt, gemäß Richtlinien, die der Entwickler oder seine Organisation festlegt; ein Unternehmen kann Einstellungen erzwingen, die Entwickler unabhängig vom verwendeten Modell nicht lockern können. Die Engine, Microsoft eXecution Container (MXC), ist eine Open-Source-Bibliothek des Windows-Teams, die sich unter Windows auf ProcessContainer, unter macOS auf Seatbelt und unter Linux auf bubblewrap stützt, ohne virtuelle Maschine. Ihre Grenzen sind dokumentiert: Die integrierten Datei-Tools werden von Copilot selbst und nicht vom System kontrolliert, und entfernte MCP-Server bleiben außerhalb der lokalen Sandbox.
🔗 Lokales Sandboxing für GitHub Copilot jetzt allgemein verfügbar
Replit erstellt Anwendungen lokal unter Windows
7. Oktober — Replit kündigt gemeinsam mit Microsoft die Vorabversion einer Desktop-App an, die Anwendungen unter Windows direkt auf dem Computer des Nutzers erstellt und ausführt. Replit bot bereits eine Desktop-App an: Neu ist die lokale Erstellung, bei der jeder Build in einer eigenen Sandbox läuft, die auf Microsoft Execution Containers und OpenShell, der Open-Source-Laufzeitumgebung von NVIDIA, basiert. Der frühzeitige Zugang erfolgt über eine Warteliste, ohne Termin oder Preisangabe, und eine Version für macOS wird nicht erwähnt. Replit stellte diese Vorabversion während der Windows-Veranstaltung am 7. Oktober auf der Bühne vor.
🔗 Ankündigung von Replit auf X · Warteliste für die Vorabversion
OpenAI veröffentlicht 722 Manuskripte mathematischer Ergebnisse eines internen Modells
6. Oktober — OpenAI veröffentlicht auf einmal eine große Sammlung mathematischer Ergebnisse, die von einem internen Spitzenmodell erzeugt wurden, das nicht öffentlich verfügbar ist. Das am Abend des 6. Oktober angekündigte GitHub-Repository openai/math enthält 722 Manuskripte, die in 372 nach Fachgebiet geordnete Ergebnisfamilien gegliedert sind: Ein Hauptergebnis kann dort von ergänzenden Argumenten, Folgerungen oder alternativen Beweisen begleitet werden.
Die große Mehrheit der Ergebnisse stammt aus demselben Verfahren: Dem Modell wurden etwa 4 000 Probleme gestellt, mit durchschnittlich dem Äquivalent von drei Stunden Denkzeit von ChatGPT Pro pro Ergebnis. OpenAI erklärt, seine Evaluierungen auf offene Forschungsprobleme ausgeweitet zu haben, nachdem bei seinen bestehenden mathematischen Evaluierungen eine Sättigung erreicht war. Zwei Arbeiten weichen von diesem Verfahren ab: ein nullstellenfreier Bereich der Riemannschen Zetafunktion, dessen Text von einem Menschen für bessere Lesbarkeit überarbeitet wurde, und der Beweis eines Spezialfalls der Hodge-Vermutung, nämlich für abelsche CM-Varietäten.
| Von OpenAI veröffentlichte Kennzahl | Angegebener Wert |
|---|---|
| Veröffentlichte Manuskripte | 722 |
| Ergebnisfamilien | 372 |
| Dem Modell gestellte Probleme | Etwa 4 000 |
| Durchschnittlicher Rechenaufwand pro Ergebnis | Etwa drei Stunden Denkzeit von ChatGPT Pro |
| Veröffentlichte Zusammenfassungen der Überlegungen | 10 |
Nicht alle Ergebnisse werden auf dieselbe Weise überprüft. Viele Beweise sind in Lean formalisiert, einer Sprache, mit der sich ein Beweis per Computer überprüfen lässt, aber nicht alle: OpenAI warnt, dass „einige nicht formalisierte Ergebnisse Fehler enthalten könnten“, verspricht, sie schnell zu korrigieren, und wird laufend neue Formalisierungen hinzufügen. Die zehn Zusammenfassungen der Überlegungen des Modells behandeln Themen wie den Irrationalitätsexponenten von π, die Mahler-Vermutungen, Kaplanskys Vermutung zur direkten Endlichkeit in Charakteristik zwei oder die Isomorphie von Faktoren freier Gruppen.
Die Veröffentlichung selbst wurde gemeinsam mit der unabhängigen Beratungsgruppe für Mathematik und KI des Institute for Advanced Study vorbereitet: Verfahren für Begutachtung und Zitierung, als neue Versionen veröffentlichte Korrekturen und eine erhaltene Versionshistorie. OpenAI kündigt außerdem die Finanzierung von Workshops, Konferenzen und Programmen zu diesen Ergebnissen an und erklärt, an einem „verantwortungsvollen“ Zugang für Wissenschaftler zu dem Modell zu arbeiten, das sie erzeugt hat, ohne einen Zeitplan zu nennen.
We’re releasing a broad range of new mathematical results produced by an internal frontier model. We’ve been consulting with the independent Advisory Group on Mathematics and Artificial Intelligence at the Institute for Advanced Study, and we have drawn on their advice and public recommendations to inform how we release these results.
🇩🇪 Wir veröffentlichen ein breites Spektrum neuer mathematischer Ergebnisse, die von einem internen Spitzenmodell erzeugt wurden. Wir haben die unabhängige Beratungsgruppe für Mathematik und künstliche Intelligenz des Institute for Advanced Study konsultiert und uns bei der Entscheidung, wie diese Ergebnisse veröffentlicht werden sollen, auf ihre Ratschläge und öffentlichen Empfehlungen gestützt. — @OpenAI auf X
🔗 Fortschritte der KI in der Mathematik teilen · Repository openai/math auf GitHub
Perplexity veröffentlicht pplx-embed-v2-late, Multivektor-Embeddings für Text und Bilder
7. Oktober — Perplexity Research veröffentlicht pplx-embed-v2-late, zwei Embedding-Modelle mit später Interaktion (late interaction) und 0.6B beziehungsweise 9B Parametern, die auf Hugging Face unter MIT-Lizenz verfügbar sind. Während ein dichtes Embedding jedes Dokument auf einen einzigen Vektor komprimiert, behalten diese Modelle vom Typ ColBERT einen Vektor mit 128 Dimensionen pro Token bei und bewerten jedes Paar aus Suchanfrage und Dokument mit MaxSim: Jedes Token der Suchanfrage wird dem ähnlichsten Token im Dokument zugeordnet. Sie durchsuchen Text, Bilder und gerenderte Seiten (PDF, Folien, Scans) ohne OCR, wodurch Tabellen, Abbildungen und Layout erhalten bleiben.
Beide Größen teilen denselben Embedding-Raum, weil sie Token für Token aus einem internen Teacher-Modell mit 18B Parametern destilliert werden, das von einem Basismodell mit 27B Parametern abgeleitet wurde. Ein mit dem 9B indexierter Korpus kann daher mit Suchanfragen durchsucht werden, die mit dem 0.6B kodiert wurden: Auf ViDoRe v3 mit Bildern erreicht diese Konfiguration 63,5 %, gegenüber 62,3 % mit dem 0.6B auf beiden Seiten, ohne zusätzliche Kosten pro Suchanfrage. Der aus Qwen3.5-0.8B durch Pruning abgeleitete 0.6B dient damit als leichter Encoder für Suchanfragen, auch direkt auf dem Gerät.
| Bewerteter Benchmark (Messungen von Perplexity) | Score des 9B | Score des 0.6B | Vergleichspunkt |
|---|---|---|---|
| 72 spezialisierte Aufgaben (nDCG@10) | 81,3 % | 78,0 % | Der 9B liegt 1,6 Punkte vor dem nächstbesten Modell |
| Q2D-Web, Websuche (Recall@1000) | 74,8 % | 73,6 % | nemotron-embed-8b: 69,3 % |
| ViDoRe v3 mit Bildern (nDCG@10) | 65,2 % | 62,3 % | Nur EVIE liegt vor dem 9B |
| BrowseComp+ (Agent GPT-OSS-120B) | 64,0 % | — | Nächstbester ColBERT: 4,9 Punkte weniger |
| MADQA (Agent Gemini 3.5 Flash) | 92,4 % | 90,1 % | Mixedbread Agentic Search: 93,4 % |
Der 9B gewinnt nicht überall, und Perplexity schreibt das ausdrücklich: EVIE von Tencent liegt auf ViDoRe v3 mit Bildern vor ihm, gemini-embedding-2 auf MIRACL-Vision und dem internen Benchmark PPLX-Q2I, und Mixedbread Agentic Search erzielt auf MADQA einen höheren Score. Diesen Abstand sieht Perplexity innerhalb seines Konfidenzintervalls. Der Anbieter räumt außerdem ein, dass Speicherbedarf und Bewertungskosten mit der Länge der Dokumente steigen. Ein technischer Bericht ist für „später in diesem Jahr“ angekündigt, und Perplexity plant, seine Embeddings mit später Interaktion sowie seine dichten und kontextuellen Embeddings schrittweise auf seiner API-Plattform bereitzustellen, ohne Terminangabe.
🔗 Beitrag von Perplexity Research · pplx-embed-v2-late-9b auf Hugging Face
Coding-Agenten: Claude Code 2.1.293, Codex CLI 0.161.0, Cursor auf iOS, Antigravity 2.21.0 und Warp Factories
Fünf Tools für Coding-Agenten entwickeln sich weiter: Claude Code setzt auf Haiku 5.5, Codex CLI verbindet sich aus dem Terminal mit MCP-Servern, Cursor lässt sich von einem iPhone aus steuern, Antigravity fasst die Aktionen seines Agenten zusammen und Warp öffnet sich für Microsofts Tools.
Claude Code 2.1.293 verwendet standardmäßig Haiku 5.5
7. Oktober — Die wenige Minuten nach der Ankündigung von Haiku 5.5 veröffentlichte Version 2.1.293 von Claude Code macht es zum standardmäßigen Haiku-Modell auf der Anthropic API. Sie ergänzt die Payload von subagentStatusLine um ein Feld agentType, um benutzerdefinierte Subagenten zu unterscheiden, und fügt eine Option isDeferred hinzu, die das Schema der von Mods deklarierten Tools von Anfang an verfügbar macht. Den Schwerpunkt bilden 38 Fehlerbehebungen unter insgesamt 56 Einträgen: Claude konnte nach einer Kompaktierung seine letzten Aktionen vor dieser Kompaktierung zeitlich nach ihr einordnen und daraufhin abgeschlossene Arbeit rückgängig machen oder erneut ausführen; auf einen Pfad beschränkte Regeln und verschachtelte CLAUDE.md werden auch geladen, wenn Claude eine Datei mit cat oder grep in Bash liest; ein Speicherleck bei MCP-HTTP-Verbindungen wird behoben. Zwei jüngste Änderungen werden zurückgenommen (die Ablehnungsmeldung des Auto-Modus aus 2.1.281 und eine Fehlerbehebung für Cloud-Sitzungen aus 2.1.290), und das Limit für Kanalregeln von Claude Tag steigt von 20 auf 50.
🔗 Claude Code 2.1.293 auf GitHub
Codex CLI 0.161.0 macht Daybreak optional
7. Oktober — Codex CLI 0.161.0 ist die erste stabile Version seit 0.160.1 vom 5. Oktober. Mit dem Befehl /mcp login <name> lässt sich eine Verbindung zu einem MCP-Server herstellen, ohne die laufende Terminalsitzung zu verlassen, und bei Sprachgesprächen können nun Mikrofon, Lautsprecher und Eingangskanäle ausgewählt werden. Daybreak, OpenAIs Cyber-Produktreihe, wird an eine Option gebunden: Der Schalter /daybreak und der Daybreak-Status in der Statuszeile bleiben verborgen, bis der Nutzer die Option mit --enable cli_daybreak (oder features.cli_daybreak=true) aktiviert; ohne diese Option entfällt das automatische Cyber-Routing. Für einen einzelnen Turn wählt codex exec --cyber-access-program ein Cyber-Zugangsprogramm aus. Bei Amazon Bedrock kommen Multi-Agent V2 und der Reasoning-Aufwand Ultra für kompatible Modelle hinzu, und Bedrock Mantle akzeptiert AWS-GovCloud-Regionen. Die Fehlerbehebungen betreffen Berechtigungen, das Fortsetzen von Gesprächen und die Erkennung einer beschädigten SQLite-Datenbank.
🔗 Codex CLI 0.161.0 auf GitHub
Cursor steuert die Agenten auf dem Computer über iOS
6. Oktober — Die iOS-App von Cursor zeigt nun die Agenten an, die lokal auf dem Computer laufen: Man sieht, was jeder Agent tut, und kann ihm antworten; der Ankündigungs-Tweet erwähnt außerdem das Starten neuer Aufgaben. Die Agenten bleiben auf dem Rechner, die App verbindet sich mit ihm: Der Computer muss daher eingeschaltet und online bleiben, und die Einstellung Keep this computer awake verhindert den Ruhezustand, wenn der Rechner am Strom hängt und der Bildschirm aufgeklappt ist. Die Funktion ist standardmäßig aktiviert, außer in Enterprise-Organisationen, in denen ein Administrator sie aktivieren muss; die Kopplung wird in der Desktop-App bestätigt, und Cloud-Agenten sind nicht erforderlich. Die Ende Juni veröffentlichte iOS-App stellte Cloud-Agenten in den Vordergrund: Jetzt werden die lokalen Agenten vom Telefon aus zugänglich.
Antigravity 2.21.0 fasst die Aktionen seines Agenten zusammen
6. Oktober — Googles Antigravity-App wird auf Version 2.21.0 aktualisiert, mit 9 Verbesserungen und 14 Fehlerbehebungen. Die erweiterte Suche findet Gespräche anhand ihres Inhalts, mit ⌘+K (Ctrl+K unter Windows). Der Tab für geplante Aufgaben (Scheduled Tasks) wird zu Automations: Dort lässt sich eine Automatisierung mit Run Now sofort starten, oder man bittet den Agenten mit Create with Prompt, durch die Erstellung einer neuen Automatisierung zu führen. Dateiänderungen, Terminalbefehle und Lesezugriffe, die der Agent zwischen zwei Antworten ausführt, werden nun in einer einzigen einklappbaren Zeile mit einer kurzen Zusammenfassung gebündelt. Zu den behobenen Fehlern gehören eine unvollständige MP4- oder MOV-Datei, deren Verarbeitung durch den Agenten den gesamten weiteren Gesprächsverlauf scheitern lassen konnte, und eine Einstellungsdatei, die nach dem Speichern mit Windows-Notepad oder PowerShell nicht mehr funktionierte. Der Changelog weist darauf hin, dass es einige Tage dauern kann, bis eine Version alle Nutzer erreicht.
Warp Factories öffnet sich für Microsoft Teams und Azure DevOps
7. Oktober — Warp öffnet Warp Factories, seine Plattform für Softwarefabriken (software factories), für Microsoft Teams und Azure DevOps Services. In Teams überträgt eine Erwähnung der Warp-App in einem konfigurierten Kanal oder Thread die Aufgabe samt Gesprächskontext an die Fabrik; diese berichtet im selben Thread über ihren Fortschritt und stellt dort ihre Pull Requests zur Prüfung bereit. In Azure DevOps erwähnt man die Fabrik aus einem Arbeitselement (work item) oder einem Pull Request heraus oder löst Ausführungen durch deren Ereignisse aus; jede Fabrik erhält eine eigene Identität für Git-Operationen, mit auf ausgewählte Repositorys beschränktem Zugriff. Beide Integrationen sind für alle Kunden von Warp Factories verfügbar. Warp bezeichnet diese native Unterstützung beider Dienste als Branchenpremiere; Devin war bereits in Teams und Azure DevOps Server integriert.
API und Plattformen: die Toolsets computer use und browser use der Claude SDKs, Grok 4.7 auf Microsoft Foundry
Zwei Ankündigungen für Entwickler, die auf gehosteten Modellen aufbauen: Anthropic vereinfacht die Steuerung eines Computers oder Browsers, und Grok 4.7 wird bei Microsoft allgemein verfügbar.
Die Toolsets computer use und browser use der Claude SDKs
7. Oktober — Die Python- und TypeScript-SDKs von Claude integrieren als Beta die Werkzeugsammlungen (toolsets) computer use und browser use. Bisher gab die API an, was Claude anklicken oder eingeben wollte, und man musste eine eigene Schleife schreiben, um jede Aktion in einen Befehl zu übersetzen. Der SDK übernimmt diese Schleife nun: Der Entwickler leitet eine Unterklasse von BetaAbstractBrowserToolset20260801 oder BetaAbstractComputerToolset20260801 ab, schreibt eine Methode pro Aktion, und der SDK leitet die Aufrufe weiter, wendet die vorgegebenen URL- und Dateirichtlinien an, fordert Freigaben an und erstellt die Ergebnisse, die an das Modell zurückgegeben werden. Anthropic liefert weder einen Browser noch einen einsatzbereiten Treiber: Man bindet seine eigene Automatisierung oder einen Treiber von Browser Use, Browserbase, E2B oder Daytona an, und im Repository claude-quickstarts wird ein Minimalbeispiel mit Chrome DevTools Protocol veröffentlicht. Die Ausführung von JavaScript und die Übertragung von Dateien sind standardmäßig deaktiviert, und ohne URL-Richtlinie wird keine Adresse überprüft.
🔗 Thread von @ClaudeDevs auf X · Dokumentation der SDK-Toolsets
Grok 4.7 allgemein verfügbar auf Microsoft Foundry
7. Oktober — Grok 4.7, das am 21. September veröffentlichte Modell von SpaceXAI, ist auf Microsoft Foundry verfügbar, wie @SpaceXAI in der Nacht bekannt gab. Microsofts Dokumentation führt es als allgemein verfügbar unter den direkt von Azure verkauften Modellen: Text und Bild als Eingabe, ein Kontext von 500 000 Tokens (Eingabe und Ausgabe zusammen), Tool-Aufrufe, Zugriff über Chat Completions oder die Responses API und Reasoning-Aufwand von low bis xhigh, standardmäßig high. Microsoft verpflichtet sich, Grok-Modelle ab Grok 4.7 mindestens sechs Monate lang allgemein verfügbar anzubieten; Grok 4.6 wird dort weiterhin als Vorschau geführt. Die Azure-Preisseite führte Grok 4.7 am Abend des 7. Oktober noch nicht auf. Nach Amazon Bedrock (28. September) und Google Cloud als Vorschau (1. Oktober) wird Grok 4.7 damit bei den drei großen Cloud-Anbietern angeboten.
🔗 Grok-Modelle in Microsoft Foundry bereitstellen und verwenden
Offene Modelle: Open d1 von Liquid AI, Bolmo von Ai2 in Nature mit Bwen 8B und Blama 8B
Zwei Veröffentlichungen mit offenen Gewichten: eine für schnelle Entscheidungen am Netzwerkrand, die andere zum Lesen von Text Byte für Byte.
Open d1, die offenen Entscheidungsmodelle von Liquid AI
7. Oktober — Liquid AI öffnet seine Familie von Entscheidungsmodellen mit Open d1: zwei Modelle mit offenen Gewichten, d1-3B (Text und Bild) und d1-omni-600M (Text mit Bild oder Audio), letzteres als frühe Forschungsversion. Sie erzeugen keinen Text: Sie weisen jeder zulässigen Antwort in einem einzigen Durchlauf eine Wahrscheinlichkeit zu. Laut Liquid AI erreicht d1-3B 48,57 im Decision Index 0.2.1, den besten Score unter 10 Milliarden Parametern, vor Decider 35B-A3B (47,11), sowie durchschnittlich 82,9 auf sieben öffentlichen Datensätzen. Die gemeinsam mit NVIDIA gemessene Latenz für eine Frage reicht von 8 ms auf einer RTX 4090 bis 50 ms auf einem Jetson Orin Nano und macht damit den Einsatz am Netzwerkrand (edge) möglich. Es werden keine Vision- oder Audio-Benchmarks veröffentlicht. Die Gewichte stehen auf Hugging Face unter Liquid AIs eigener Lizenz (lfm1.0) bereit, mit GGUF-Versionen; d1 vom 29. September war nur per API zugänglich.
🔗 Beitrag von Liquid AI auf Hugging Face
Bolmo von Ai2 in Nature, mit Bwen 8B und Blama 8B
7. Oktober — Ai2 veröffentlicht in Nature, seit dem 7. Oktober online, die Methode hinter Bolmo, seiner Familie vollständig offener Modelle, die direkt Bytes statt Subwörter lesen. Das Lesen von Bytes vermeidet die blinden Flecken eines festen Vokabulars (Rechtschreibung, ungewöhnliche Zeichenketten, bestimmte Schriftsysteme), erforderte bisher aber ein vollständiges Training von Grund auf. Die Umstellung auf Bytes (byteifying) geht dagegen von einem bereits leistungsfähigen Subwort-Modell aus und wandelt es durch ein kurzes zusätzliches Training um. Bolmo 1B und 7B, die von Olmo abgeleitet wurden, stammen aus dem Dezember; Ai2 stellt außerdem Bwen 8B (abgeleitet von Qwen 3 8B, Lizenz Apache-2.0) und Blama 8B (abgeleitet von Llama 3 8B, Lizenz llama3) vor, deren Repositorys seit dem 26. August existieren, sowie „Stage 1“-Checkpoints, bei denen nur die neue Byte-Schicht trainiert wird. Laut Ai2 kommen beide Modelle ihren Ausgangsmodellen nahe, und Bwen 8B übertrifft Bolmo 7B, ohne dass Zahlen veröffentlicht werden.
SynthID Detector für alle zugänglich, um Bilder, Videos und Audio zu überprüfen
7. Oktober — Google öffnet SynthID Detector für alle, das Tool, das unsichtbare SynthID-Wasserzeichen in durch IA erzeugten Inhalten erkennt. Nachdem es letztes Jahr als vorläufige Version für Medienschaffende vorgestellt wurde, ist es auf synthid.com weltweit und auf Englisch zugänglich. Dort lädt man ein Bild, ein Video oder eine Audiodatei hoch. Die Überprüfung umfasst Inhalte von Google und seinen Partnern OpenAI, NVIDIA und Kakao sowie bald auch Apple. Das Portal weist darauf hin, dass es kein allgemeiner IA-Detektor ist: Inhalte aus einem Modell ohne SynthID oder stark veränderte Inhalte können als „nicht erkannt“ eingestuft werden. Google gibt an, seit 2023 mehr als 180 Milliarden Bilder und Videos sowie 240 000 Jahre Audio mit Wasserzeichen versehen zu haben, gegenüber den im Juli angekündigten 100 Milliarden und 60 000 Jahren, und täglich mehr als eine Million Überprüfungen in Search, der Gemini-App und Chrome durchzuführen.
🔗 Google erweitert SynthID Detector für AI-Inhalte
Sicherheit: GitHubs Klassifikator für offengelegte Secrets
7. Oktober — GitHub nimmt einen feinabgestimmten ModernBERT-Klassifikator in Betrieb, der speziell für offengelegte Secrets entwickelt und gemeinsam mit Microsoft Applied Sciences gebaut wurde: Er liest den Code rund um einen Wert, um wahrscheinliche Zugangsdaten zu erkennen, einschließlich Passwörtern ohne erkennbares Format. Er bewertet eine Gruppe von Kandidaten in weniger als 2 ms und könnte laut GitHub die beim Push blockierten Secrets „mehr als verdoppeln“. Ab sofort werden Warnungen zu durch IA erkannten Passwörtern auf dieses Modell umgestellt, ohne Mehrkosten. Der IA-gestützte Push-Schutz, derzeit in privater Vorschau, soll „später in diesem Monat“ für berechtigte Organisationen verfügbar werden, und die Prüfungen des Copilot-Befehls /security-review sollen „bald“ in die private Vorschau kommen, beides gegen IA-Credits. Der Essay von Erin Havens, zuständig für Sicherheitsprodukte bei GitHub, erinnert daran, dass an jedem dritten Pull Request ein IA-Agent beteiligt ist und der Push-Schutz nur etwa 30 % der neu erkannten Secrets abfängt.
🔗 Der Schutz von Secrets muss mit der Software skalieren
Infrastruktur: GitHub baut Git für die Aktivität von Agenten neu auf
6. Oktober — GitHub baut seine Git-Infrastruktur neu auf, um mit dem Tempo der agentischen Entwicklung Schritt zu halten. Laut dem Engineering-Beitrag von Brian Celenza stieg die gesamte Git-Aktivität zwischen September 2025 und August 2026 von 218,2 auf 473,3 Milliarden Ereignisse pro Monat; Entwickler und Agenten erzeugten im September 2026 7,38 Milliarden Commits, mehr als fünfmal so viele wie ein Jahr zuvor, und die Zahl der Pushes stieg um den Faktor 4,9. Die aktuelle Architektur Spokes repliziert jedes Repository auf mehreren Servern und bestätigt jede Aktualisierung durch eine Mehrheitsabstimmung: Zusätzliche Kopien für Lesezugriffe verlangsamen daher die Schreibzugriffe. Die neue Architektur trennt Speicherung und Verarbeitung, wobei die maßgeblichen Daten in Azure Blob Storage liegen und leichtgewichtige Prozesse (workers) Lesezugriffe aus einem Cache bedienen. In seinen internen Benchmarks misst GitHub einen bis zu 35-mal höheren Schreibdurchsatz; ein Termin für die Umstellung steht noch nicht fest.
🔗 Aufbau einer Git-Infrastruktur für die Entwicklung im Agentenmaßstab
Sprach-KI: ElevenLabs unterzeichnet eine Absichtserklärung mit einem indischen Bundesstaat
7. Oktober — Anlässlich seines Summit in Bengaluru hat ElevenLabs seine erste Absichtserklärung (MOU) mit der Regierung eines indischen Bundesstaats für ein Pilotprojekt mit Sprach-KI unterzeichnet. Das Unternehmen nennt weder den Bundesstaat noch Zeitplan, Umfang oder Betrag: Die Ankündigung beschränkt sich auf einen Tweet, ohne Blogbeitrag. Die begleitende Zahl verdeutlicht die Bedeutung: Im vergangenen Jahr führte ElevenAgents in Indien mehr als 100 Millionen Gespräche, davon über 70 % auf Hindi, Kannada, Tamil und Telugu. Der Summit brachte mehr als 500 Führungskräfte, Entwickler und Partner zusammen.
🔗 Ankündigung von @ElevenLabs auf X
Forschung: PivotOPD, NVIDIAs Methode zur Korrektur des entscheidenden Fehlers eines Agenten
7. Oktober — Forscher von NVIDIA stellen PivotOPD vor, eine Trainingsmethode für Agenten, die mehrere aufeinanderfolgende Handlungsrunden durchlaufen. Ihre Beobachtung: Auf ALFWorld enthalten 59 % der Fehlschläge von drei Qwen3-Modellen einen früh begangenen „Pivot-Fehler“, nach dem der Agent in die falsche Richtung weiterarbeitet. PivotOPD erweitert die On-Policy-Destillation (on-policy distillation): Bei jedem Pivot-Fehler gibt ein Lehrermodell die richtige Aktion und anschließend eine Korrekturaktion für die folgenden Runden vor, sodass das Schülermodell lernt, den Fehler zu vermeiden und sich davon zu erholen. Im Vergleich mit 13 Referenzmethoden erzielt es mit Qwen3-Schülermodellen von 1.7B und 8B den besten Durchschnitt auf ALFWorld, WebShop und Search-based QA und korrigiert 72,7 % der 72 erneut durchgespielten Pivot-Fehler, gegenüber 20,3 % bei der Standarddestillation. Der Zugewinn überträgt sich auf Code: Ein Nemotron-3.5-Schülermodell steigt auf SWE-Bench Verified von 62,8 % auf 66,0 %. Der Artikel ist auf arXiv verfügbar; der Code soll demnächst erscheinen.
Optimierung: mPDLP verteilt riesige lineare Programme in cuOpt auf mehrere GPU
7. Oktober — NVIDIA ergänzt cuOpt, seine open source Optimierungsbibliothek, um mPDLP, einen Solver für lineare Programmierung, der sich auf mehrere über NVLink verbundene GPU verteilt und große Planungsprobleme bearbeitet (Lieferketten, Stromnetze). Indem er voneinander abhängige Variablen und Nebenbedingungen auf derselben GPU zusammenfasst, begrenzt er den Datenaustausch und reduziert den maximalen Speicherbedarf pro GPU um bis zu den Faktor 6. Auf einem DGX B200-Knoten erreicht die Beschleunigung bei der PDLP-Berechnung den Faktor 11,4 und über den gesamten Ablauf den Faktor 4,2; gegenüber D-PDLP ist mPDLP bei den meisten großen Problemen 1,2- bis 2,5-mal schneller, bei den drei größten Instanzen und bei kleinen Problemen jedoch langsamer. Kinaxis löst eine Lieferkette mit mehr als 135 Millionen Variablen auf acht H100 3,3-mal schneller, PSR ein Energiemodell mit 185 Millionen Variablen auf acht B200 mehr als 5-mal schneller.
Robotik: Roboter montieren GB300-Testtrays
7. Oktober — Das Seattle Robotics Lab von NVIDIA berichtet, wie es Robotern beibringt, die Testtrays für GB300 zu montieren, mit denen die Module vor dem Versand geprüft werden. Gemeinsam mit Foxconn, dem Hersteller dieser Systeme, wurden zwei Handgriffe ausgewählt: eine Sammelschiene einsetzen und an 16 Stellen verschrauben sowie vier Steckverbinder an flexiblen Kabeln anschließen. Die mit Foxconn festgelegte Anforderung lautet 99,5 % Erfolgsquote bei höchstens der doppelten Zeit einer qualifizierten Arbeitskraft und ohne Kollisionen. Die Roboter nähern sich diesem Ziel, erreichen es aber noch nicht: mehr als 95 % Erfolgsquote in 160 Sekunden für die Sammelschiene gegenüber angestrebten 124 Sekunden und 90 bis 95 % für die Steckverbinder bei 40 Sekunden pro Kabel. Das Team kombiniert eine klassische Wahrnehmungs- und Steuerungskette, die Posenschätzung DOPER und Reinforcement Learning in Isaac Lab, das am realen Roboter korrigiert wird. NVIDIA verspricht, DOPER und seinen Orchestrator TALOS zu veröffentlichen, nennt aber keinen Termin.
🔗 Beitrag im technischen NVIDIA-Blog zu den GB300-Trays
Kurzmeldungen
- Die iOS-App von ChatGPT 1.2026.272 — Sie zeigt Seitenvorschauen direkt in den Antworten an, öffnet Links zu Codex-Aufgaben in der App und überarbeitet bei Codex Mobile die Genehmigungsauswahl und beschleunigt den Ablauf in langen Threads. 🔗 Quelle
- Radisson Hotel Group — Laut einer Fallstudie von OpenAI erzielt sein ChatGPT-Plugin, das in sechs Wochen mit Accenture Song entwickelt wurde, im Juli–August 2026 eine etwa 1,5-mal höhere Conversion als seine organische Suche, und 54 % der Zahlungs- und Buchungsereignisse seiner Werbekampagne in ChatGPT werden alleinigen Anzeigenaufrufen zugeschrieben. 🔗 Quelle
- Jump Trading — Das Unternehmen für quantitatives Trading überträgt GPT-6 Astra-Agenten Analysen, die durch die Verknüpfung zahlreicher Datenquellen mehrere Tage laufen können, mit einer menschlichen Prüfung am Ende des Prozesses; die Fallstudie von OpenAI veröffentlicht keine Zahlen zu den erzielten Verbesserungen. 🔗 Quelle
- ChatGPT-Plugin-Erweiterungen — Im Thread zu seinem Video-Tutorial nennt OpenAI Developers Adobe, Canva, Figma, Shopify, Instacart und Atlassian neben tldraw und MagicPath als Unternehmen, die sie verwenden; die am 29. September vorgestellten Erweiterungen starten ein Plugin aus der Seitenleiste, verwalten @-Erwähnungen und ergänzen Dateibetrachter. 🔗 Quelle
- Every und Claude Managed Agents — Das Team von Every hat auf Claude Managed Agents einen Unternehmensagenten entwickelt, den alle in Slack nutzen, um ihre Skills bei jedem neuen Modell zu teilen, und ihn anschließend seinen Abonnenten zugänglich gemacht; Anthropic teilt ein Video-Interview, ohne Zahlen zu nennen. 🔗 Quelle
- Zed 1.23 und Vorabversion 1.24.1 — Version 1.23 wird mit ihrer Vorschau für JSONL- und NDJSON-Dateien als stabile Version veröffentlicht, und die Vorabversion 1.24.1 ermöglicht es, einen Terminal-Tab in das Agent Panel zu ziehen, unterstützt benutzerdefinierte Amazon Bedrock-Modelle mit Tools, Bildern und Reasoning, erstellt Git-Tags und verkleinert die Linux-Binärdatei um etwa 23 %. 🔗 Quelle
- Puck, der Meta-Agent von Amp — Er unterstützt jetzt mehrere getrennte Gespräche: Die Schaltfläche + öffnet eines, ein Klick auf seinen Namen ermöglicht den Wechsel zwischen ihnen, und Gespräche, die drei Tage lang inaktiv waren, werden separat abgelegt. 🔗 Quelle
- Copilot CLI 1.0.93 — Die nun stabile Version übernimmt Konfigurationsänderungen an MCP-Servern zwischen zwei Runden, ohne die Sitzung neu zu starten, und macht die Sandbox für Befehle über /sandbox und —sandbox für alle verfügbar; auch das Copilot SDK 1.0.17 wird als stabile Version veröffentlicht. 🔗 Quelle
- Die Nutzungsmetriken von Copilot — Sie erfassten die Aktivität der Agenten nur unvollständig, seit mehrere IDE ihre Sitzungen über das Copilot SDK leiten; die Korrektur erfordert ein Update (VS Code 1.139.0 ab sofort, Visual Studio 18.12 im Oktober, JetBrains Ende Oktober, Eclipse und Xcode bis November), und die verlorenen Daten werden nicht wiederhergestellt. 🔗 Quelle
- Gemini CLI v0.65.0-nightly.20261007 — Diese Nightly-Version eröffnet die Reihe 0.65.0 mit fünf Fehlerkorrekturen, darunter zwei gegen Datenverluste: Projekteinstellungen werden in einem nicht vertrauenswürdigen Ordner schreibgeschützt, in dem
gemini mcp add.gemini/settings.jsonleeren konnte, und das sofortige Verlassen einer wiederaufgenommenen Sitzung löscht ihren Verlauf nicht mehr. 🔗 Quelle - Transformers.js 4.3.1 — Einen Tag nach der Einführung von EmbeddingGemma 2 berechnet die Bibliothek dessen multimodale Embeddings (740 Millionen Parameter, 768 Dimensionen) direkt im Browser mit WebGPU oder WASM oder unter Node.js. 🔗 Quelle
- RL Environment Explorer — Adithya S K von Hugging Face stellt diesen Space von FineEnvs vor, um die Reinforcement-Learning-Umgebungen des Hub (OpenEnv, Harbor, MiMo, Verifiers, NeMo Gym) zu durchsuchen, zu visualisieren und zu starten: mehr als 12 Millionen Aufgabeneinträge, die überwiegend aus einigen großen OpenEnv-Umgebungen stammen. 🔗 Quelle
- Seb-9B — Stas Veretennikov veröffentlicht dieses lokale Entscheidungsmodell unter der Lizenz Apache-2.0 (Text, JSON oder Bild, bis zu 20 Optionen), das über 17 öffentliche Testsuiten einen Durchschnitt von 0,792 gegenüber 0,786 für Jev 1.13 erreicht; der Autor hat alle Messungen selbst durchgeführt und erklärt, dass seine Trainingsdaten den Trainingsanteil eines der Benchmarks enthielten, jedoch keine seiner Testfälle. 🔗 Quelle
- Nemotron bei den Olympiaden 2026 — NVIDIA erläutert das gemeinsame Verfahren (überwachtes Fine-Tuning, Reinforcement Learning, eine Schleife zum Generieren, Prüfen und Korrigieren) hinter 535,4 von 600 Punkten bei der IOI 2026 in einer inoffiziellen Teilnahme und 30 von 42 Punkten bei der IMO 2026 bei einer Goldschwelle von 29 und veröffentlicht den Benchmark Nemotron-IMO-Bench mit 200 Problemen. 🔗 Quelle
- Instadocs: AI Gone Wild — Netflix kündigt für den 12. Oktober diese Dokumentation an, die den Cyberangriff auf Hugging Face im Juli rekonstruiert, der laut Netflix von autonomen Agenten ausgeführt wurde, die Forscher von OpenAI entwickelt hatten. 🔗 Quelle
- Runway im App-Verzeichnis von ChatGPT — Sobald das Plugin installiert und das Runway-Konto verbunden ist, beauftragt eine @Runway-Erwähnung in einem Gespräch die Generierung von Bildern oder Videos; Runway nennt weder Preise noch Kosten in Credits. 🔗 Quelle
- Face Swap von Luma — Die Funktion ersetzt das Gesicht einer Figur in einer bestehenden Einstellung, um weitere Varianten zu erstellen, ohne von vorn beginnen zu müssen; die Ankündigung beschränkt sich auf zwei Tweets, ohne Produktseite, Preis oder Angaben zum Modell. 🔗 Quelle
- DSX Air — NVIDIA zeigt, wie sich Änderungen an einer KI-Fabrik mit diesem digitalen Zwilling testen lassen: Agenten setzen die Änderung um, prüfen Konfiguration, Sicherheit und Isolation und liefern anschließend einen Bericht, wobei der Übergang in den Produktionsbetrieb weiterhin eine menschliche Freigabe erfordert; ein Beitrag zum Vorgehen, ohne Zahlen. 🔗 Quelle
- cuPhoton — Ein Tutorial von NVIDIA nutzt dieses open source Toolkit zur Analyse astronomischer Bilder auf GPU, vom Lesen der FITS-Dateien bis zur Prüfung der Kandidaten; die angekündigten Beschleunigungen um bis zu den Faktor 14 900 beziehen sich auf bestimmte Operationen und nicht auf die Verarbeitung über den gesamten Ablauf. 🔗 Quelle
- Cosmos und SynthID — Die von NVIDIA Cosmos-Modellen auf build.nvidia.com generierten Inhalte tragen das SynthID-Wasserzeichen und können nun von allen mit dem von Google öffentlich zugänglich gemachten Detektor überprüft werden. 🔗 Quelle
- Das TypeScript-SDK von SpaceXAI 0.2.3 — Es ergänzt eine Servicestufe
fast, die mitpriorityaustauschbar ist, und die Kennunggrok-imagine-video-1.5-lite, ein schlankeres Videomodell, das in den Release Notes fehlt: Laut den Angaben auf der Modellseite akzeptiert es keine Audioeingaben und kostet bei 480p pro Sekunde ein Viertel vongrok-imagine-video-1.5. 🔗 Quelle - Leitfaden zu RAG vs. LLM — Perplexity veröffentlicht einen einführenden Leitfaden, der RAG und LLM als komplementär darstellt, drei Arten von RAG unterscheidet (naiv, modular, fortgeschritten) und erläutert, wann ein LLM allein ausreicht; keine neuen Funktionen oder Zahlen. 🔗 Quelle
Was das bedeutet
Kleine Modelle werden zum Massenprodukt. Ab dem 8. Oktober antwortet GPT-6 Luna den Nutzern der kostenlosen Version von ChatGPT, und Anthropic bietet Haiku 5.5 bei Prompts unter 100 000 Tokens für 0,10 Dollar pro Million Eingabe-Tokens an und halbiert zugleich den Preis für Cache-Lesezugriffe bei Sonnet 5.5. Diese Modelle bewältigen den Großteil des Volumens: Alltagsgespräche, Subagenten, Zusammenfassungen, Compactions. Die Rangliste von Cursor erinnert allerdings daran, dass der Preis pro Token nicht alles aussagt: Bei Effort Max verbraucht Haiku 5.5 pro Aufgabe fast neunmal so viele Tokens wie Sonnet 5.5 bei Effort High, bei kaum geringeren Kosten pro Aufgabe (1,12 Dollar gegenüber 1,20). Das monatliche API-Guthaben der Max- und Team-Tarife lädt Abonnenten wiederum dazu ein, diese Modelle in ihrem eigenen Code auszuprobieren.
KI kommt auch wieder auf den Arbeitsplatzrechner. Die RTX Spark-Laptops erscheinen am 16. Oktober, DGX Station for Windows verspricht bis zu 20 Petaflops auf einem Schreibtisch, und Copilot soll bis zum Monatsende selbst bestimmte Aufgaben lokal an MAI Code 1.1 Flash übertragen. Replit erstellt Anwendungen inzwischen auf dem Rechner des Nutzers. Agenten, die Code auf einem persönlichen Computer ausführen, werfen eine Sicherheitsfrage auf, und überall kommt derselbe Baustein zum Einsatz: Microsoft Execution Containers (MXC), unter Windows allgemein verfügbar, isoliert sowohl die Befehle von Copilot als auch die Builds von Replit. GitHub seinerseits führt einen speziellen Klassifikator für offengelegte Secrets ein und baut seine Git-Infrastruktur neu auf, weil bereits jeder dritte Pull Request einen Agenten einbezieht und sich die Zahl der Commits innerhalb eines Jahres mehr als verfünffacht hat.
Auch die Antwort wird zu einer Benutzeroberfläche. Mit Intelligent UI antwortet ChatGPT durch Diagramme, Formulare oder ein kleines, auf Anfrage erstelltes Tool und beginnt zu antworten, bevor es mit dem Nachdenken fertig ist. Auf Entwicklerseite übernehmen die SDK von Claude die Schleife für computer use und browser use, und Cursor ermöglicht es, die auf dem Computer arbeitenden Agenten von einem iPhone aus zu verfolgen und ihnen zu antworten. In diesen drei Fällen ist Text nur noch ein Teil des Austauschs: Die KI zeigt Inhalte an, klickt und berichtet, der Nutzer beaufsichtigt sie.
Schließlich werden viele Zahlen des Tages von denen gemessen, die sie veröffentlichen: die Benchmarks von Haiku 5.5 durch Anthropic, die von MAI Code 1.1 Flash durch Microsoft, Q2D-Web durch Perplexity, das den Benchmark entwickelt hat, die Ergebnisse von Open d1 durch Liquid AI und der 35-fache Schreibdurchsatz durch interne Tests von GitHub. OpenAI warnt selbst, dass nicht formalisierte Ergebnisse seiner 722 Manuskripte Fehler enthalten können, und seine Geschwindigkeitsgewinne für GPT-6 stammen aus internen Bewertungen. Diese Messungen bleiben nützlich, um die Produkte im Verhältnis zueinander einzuordnen; externe Bewertungen wie die CursorBench-Rangliste, bei der ein Werkzeuganbieter das Modell eines anderen misst, werden es ermöglichen, sie gegenzuprüfen.
Quellen
- GPT-6 und Intelligent UI für alle (OpenAI)
- Ankündigung von GPT-6 für alle (@OpenAI)
- Systemkarte für GPT-6 Sol und GPT-6 Luna, Oktober-Update
- GPT-6 und andere Modelle in ChatGPT
- Versionshinweise zu ChatGPT
- Dateien und Audio in ChatGPT hochladen
- Jugendliche beim Lernen, Planen und Mitgestalten der Zukunft der AI unterstützen (OpenAI)
- Ankündigung von Claude Haiku 5.5 (Anthropic)
- Einführung von Claude Haiku 5.5 (@claudeai)
- Migrationsleitfaden für Haiku 5.5
- Haiku 5.5 in Cursor (@cursor_ai)
- CursorBench-Rangliste
- Monatliche API-Guthaben der Max- und Team-Tarife (Claude-Support)
- Ankündigung des API-Guthabens (@ClaudeDevs)
- RTX Spark und DGX Station for Windows (NVIDIA-Blog)
- Lokale Modelle und Tools in einer Sandbox für Windows und GitHub Copilot (Microsoft Command Line)
- Lokale Modelle in GitHub Copilot CLI entdecken
- Lokales Sandboxing für GitHub Copilot jetzt allgemein verfügbar
- Vorabversion der Replit-Desktop-App (@Replit)
- Warteliste für die Replit-Desktop-App
- Fortschritte der IA in der Mathematik teilen (OpenAI)
- Repository openai/math
- Ankündigung der mathematischen Ergebnisse (@OpenAI)
- Multimodale Embeddings jenseits eines einzelnen Vektors (Perplexity Research)
- pplx-embed-v2-late-9b auf Hugging Face
- Claude Code 2.1.293
- Codex CLI 0.161.0
- Fernsteuerung für lokale Agenten (Cursor-Changelog)
- Antigravity-Changelog
- Warp Factories, Microsoft Teams und Azure DevOps (Warp-Blog)
- Toolsets computer use und browser use in den SDKs (@ClaudeDevs)
- Dokumentation der Toolsets des Claude SDK
- Grok-Modelle in Microsoft Foundry bereitstellen und verwenden
- Open d1 (Liquid AI auf Hugging Face)
- Bolmo in Nature (Ai2)
- Google erweitert SynthID Detector für AI-Inhalte
- Der Schutz von Secrets muss mit der Software skalieren (GitHub)
- Git-Infrastruktur für die Entwicklung im Maßstab von Agenten aufbauen (GitHub)
- Absichtserklärung mit einem indischen Bundesstaat (@ElevenLabs)
- PivotOPD (NVIDIA Research)
- mPDLP in cuOpt (NVIDIA-Technikblog)
- Die Maschinen, die die Maschinen bauen (NVIDIA-Technikblog)
- Changelog für ChatGPT und Codex, ChatGPT für iOS 1.2026.272
- Radisson Hotel Group bringt die Hotelsuche in ChatGPT (OpenAI)
- Wie Jump Trading quantitative Forschung mit ChatGPT skaliert (OpenAI)
- ChatGPT-Plugin-Erweiterungen (@OpenAIDevs)
- Every und Claude Managed Agents (@claudeai)
- Zed v1.24.1-pre
- Viele, viele Pucks (Amp)
- Copilot CLI 1.0.93
- Aktualisieren Sie Ihre IDE, um die Agentenaktivität in den Copilot-Nutzungsmetriken wiederherzustellen
- Gemini CLI v0.65.0-nightly.20261007
- Transformers.js 4.3.1
- RL Environment Explorer (@adithya_s_k)
- Seb-9B im direkten Vergleich (Hugging Face-Blog)
- Nemotron bei der IOI und der IMO 2026 (Hugging Face-Blog)
- Instadocs: AI außer Kontrolle (@netflix)
- Runway in ChatGPT (@runwayml)
- Face Swap (@LumaLabsAI)
- Änderungen an AI-Fabriken mit Digital Twins und AI-Agenten validieren (NVIDIA-Technikblog)
- Schnellere wissenschaftliche Bildanalyse mit NVIDIA cuPhoton
- Cosmos und SynthID (@NVIDIAAI)
- TypeScript-SDK von SpaceXAI 0.2.3
- RAG vs. LLM (Perplexity)