ai-powered-markdown-translatorArtikel, übersetzt aus dem Französischen ins Deutsche mit gpt-5.6-sol.
Neunundvierzig Ankündigungen am 2. September – das dritthöchste Tagesvolumen seit Beginn dieser Beobachtung. Drei führende Modelle erschienen am selben Tag – Gemini 3.8 Flash von Google, Muse Spark 1.3 von Meta Superintelligence Labs und Qwen3.8-Max-0902 von Alibaba – und keines der drei stellte den Wettlauf um reine Punktzahlen in den Vordergrund.
Vier Strömungen prägen diese Ausgabe. Zunächst der Preis, der bei allen drei Veröffentlichungen zum zentralen Argument geworden ist. Dann die lokale Inferenz: Die Videogenerierung hält Einzug auf Desktop-Rechnern, und noch am selben Abend wird der Code einer Inferenz-Engine für Apple Silicon geöffnet. Hinzu kommt die Modell-Governance in Unternehmen, bei der GitHub für ein Modell die Datenspeicherung vorschreibt und für alle anderen die Wahl des Standardmodells überlässt. Und schließlich die Cybersicherheit mit einem spezialisierten Modell, das ausgewählten Verteidigern vorbehalten ist, sowie einer Allianz, die der Linux Foundation beitritt.
Gemini 3.8 Flash und 3.8 Flash Cyber: ein Modell, das zum gleichen Preis härter arbeitet
2. September — Google hat zwei Modelle vorgestellt, für die Tulsee Doshi (Senior Director, Product Management) und Raluca Ada Popa (Gemini Security Lead, Google DeepMind) verantwortlich zeichnen: Gemini 3.8 Flash und Gemini 3.8 Flash Cyber. Es ist die dritte Flash-Veröffentlichung innerhalb von sechs Wochen, und 3.7 Flash war erst drei Wochen alt.
Beide Varianten teilen dieselbe grundlegende Intelligenz, und Google führt einen Teil der Fortschritte bei Code und Schlussfolgerungen ausdrücklich auf ein intensives Training im Bereich der Cybersicherheit zurück: Die Arbeit am defensiven Modell hat auch das allgemeine Modell verbessert. Der Einführungspreis bleibt gegenüber 3.7 Flash unverändert.
| Merkmal von Gemini 3.8 Flash | Gemessener Wert |
|---|---|
| Eingabepreis | 0,75 Dollar pro Million Tokens |
| Ausgabepreis | 3,75 Dollar pro Million Tokens |
| HLE-Verified | 54,9 % |
Ein Punkt verdient die Aufmerksamkeit von Entwicklern, denn Google formuliert ihn unmissverständlich: Das Modell verbraucht mehr. Der Zuverlässigkeitsgewinn beruht auf einer Designentscheidung – bei komplexen Aufgaben führt 3.8 Flash zusätzliche Schlussfolgerungsschritte aus und ruft Werkzeuge iterativ auf. Bei hohen Aufwandsstufen steigt daher die Token-Rechnung, und Google empfiehlt, die Aufwandsstufe zu senken oder bei Workloads, bei denen Recheneffizienz Vorrang hat, weiterhin 3.7 Flash zu verwenden. Die vorherige Version wird weiterhin vollständig unterstützt.
Die Cyber-Variante ist ungewöhnlicher. Sie ist vertrauenswürdigen Verteidigern über das am selben Tag gestartete Fairwind-Programm vorbehalten und zielt auf die autonome Entdeckung von Schwachstellen und vor allem auf deren automatische Behebung.
| Cybersicherheitsprüfung | Gemini 3.8 Flash Cyber | Vergleichswerte |
|---|---|---|
| CyberGym Pass@1 (Entdeckung von C/C++-Lücken) | 86,2 % | GPT-5.5-Cyber 85,6 % · Mythos 5 83,8 % · GPT-5.6 Sol 83,6 % · 3.5 Flash Cyber 77,5 % |
| Interner Benchmark über 20 Sprachen | mehr als 70 % | Größerer Umfang als nur C/C++ |
| CWE-Bench pass@1 (Behebung, Collinear) | 47,2 % | Führendes Spitzenmodell mit 47,8 %, jedoch zu deutlich höheren Kosten |
Die Zahlen aus der internen Bereitstellung stützen eher die Positionierung beim Preis-Leistungs-Verhältnis als eine absolute Dominanz: Das Chrome-Security-Team erzielt 2,6-mal mehr gültige Korrekturen als mit den besten und deutlich größeren kommerziellen Modellen, Wiz misst bei seinem Penetrationstest-Benchmark einen um 7,5 bis 9,7 % höheren Recall bei 2,3- bis 5,2-mal geringeren Kosten, und das Cloud-Vulnerability-Research-Team identifizierte in weniger als zwei Stunden eine kritische grundlegende Schwachstelle, während eine solche Suche üblicherweise Monate dauert. Das allgemeine Modell ist bereits in Antigravity, in der Gemini API über Google AI Studio und Android Studio, bei der Oberflächengenerierung von Stitch und in Gemini Enterprise verfügbar sowie für Abonnenten von Google AI Pro und Ultra in der Gemini-App, im AI Mode von Google Search und in Google Sheets.
🔗 Ankündigung von Gemini 3.8 Flash und 3.8 Flash Cyber
Der CursorBench-Wert, der die Veröffentlichung dokumentiert
Cursor nahm Gemini 3.8 Flash wenige Stunden nach der Vorstellung in seine Modellauswahl auf, und der unternehmenseigene Benchmark liefert die beste verfügbare Messung der Leistung des Modells unter agentischen Bedingungen. Das auf denselben Tag datierte CursorBench-Protokoll gibt an, dass 3.8 Flash zur Gemini-Version „Latest“ befördert und 3.7 Flash an die zweite Stelle gesetzt wird.
| Modell und Aufwandsstufe | CursorBench-3.2-Wert | Durchschnittskosten pro Aufgabe | Schritte pro Aufgabe |
|---|---|---|---|
| Fable 5.1 Max | 73,4 % | 9,64 Dollar | 70 |
| Grok 4.6 Extra High | 70,8 % | 2,81 Dollar | 46 |
| Fable 5.1 High | 69,4 % | 4,80 Dollar | 44 |
| Opus 5 Extra High | 69,3 % | 7,35 Dollar | 72 |
| Gemini 3.8 Flash High | 69,2 % | 2,38 Dollar | 161 |
| Gemini 3.8 Flash Medium | 67,0 % | 1,93 Dollar | 136 |
| Gemini 3.7 Flash High | 61,6 % | 1,20 Dollar | 99 |
Die Kernaussage lässt sich auf einen Blick erfassen: Mit 69,2 % erreicht Gemini 3.8 Flash High einen mit Fable 5.1 High vergleichbaren Wert für etwa die Hälfte des Preises und einen mit Opus 5 Extra High vergleichbaren Wert für ein Drittel. Der Abstand zur vorherigen Generation beträgt 7,6 Punkte. Die Spalte mit den Schritten verdeutlicht jedoch die versteckten Kosten von Googles Designentscheidung: 161 Schritte pro Aufgabe gegenüber 44 bei Fable 5.1 High. Cursor nennt am Seitenende selbst zwei Vorbehalte – die Ergebnisse weisen Schwankungen auf, und die angegebenen Kosten wurden anhand der öffentlichen Preise pro Million Tokens rekonstruiert und nicht auf Grundlage einer Rechnung gemessen.
🔗 Gemini 3.8 Flash in Cursor · 🔗 CursorBench-Ergebnisse
Muse Spark 1.3, das agentische Modell von Meta Superintelligence Labs
2. September — Meta Superintelligence Labs hat Muse Spark 1.3 veröffentlicht, den Nachfolger von Muse Spark 1.2, der noch am selben Tag in Muse Code und in der über dev.meta.ai zugänglichen Meta Model API bereitgestellt wurde. Es ist die zweite Veröffentlichung des Labors innerhalb von zwei Tagen, nach Muse Voice Transcribe.
Der erklärte Schwerpunkt liegt nicht auf dem Wettlauf um Punktzahlen, sondern auf der tatsächlichen Nutzbarkeit. Das Modell ist darauf ausgelegt, langfristige Aufgaben zu bewältigen und dabei mehrere Arbeitsabläufe in einem einzigen Thread zu koordinieren: Bei einem offenen Ziel nutzt es Werkzeuge, um sich aus ungeordneten und widersprüchlichen Quellen einen eigenen Kontext aufzubauen, Lücken in seinem Plan zu beheben und das Gelernte festzuhalten. Der ungewöhnlichste Teil betrifft die Zusammenarbeit: Muse Spark 1.3 wurde darauf trainiert, bei mehrdeutigen Anweisungen klärende Fragen zu stellen, den Benutzer um Hilfe zu bitten, wenn es feststeckt, und vor folgenreichen Aktionen eine Bestätigung einzuholen. Vergleiche von Meta-Ingenieuren bescheinigen ihm gegenüber Version 1.2 rund 20 % weniger Werkzeugaufrufe und 25 % weniger Tokens – ein Unterschied, der sich direkt auf der Rechnung bemerkbar macht.
| Bewertete Kategorie | Benchmark | Muse Spark 1.3 | Muse Spark 1.2 | GPT-5.6 Sol | Opus 5 |
|---|---|---|---|---|---|
| Agent | GDPVal-AA v2 (Wissensarbeit) | 1754 | 1615 | 1710 | 1824 |
| Agent | OSWorld 2.0 (agentische Desktop-Nutzung) | 66,9 | 47,6 | 62,7 | 68,3 |
| Agent | DeepSearchQA (agentische Navigation) | 89,4 | 85,9 | 93,0 | 90,4 |
| Agent | AutomationBench (End-to-End-Geschäftsabläufe) | 49,4 | 38,2 | 46,7 | 50,3 |
| Langer Kontext | MRCR 512K-1M | 98,1 | 55,5 | 73,8 | – |
| Programmierung | DeepSWE v1.1 (langfristiges agentisches Coding) | 75,4 | 55,0 | 73,0 | 74,0 |
| Programmierung | SWEAtlas CodeBase QnA | 59,4 | 46,2 | 53,5 | 52,7 |
Diese Tabelle verdient eine genaue Betrachtung. Muse Spark 1.3 dominiert deutlich beim langen Kontext und beim Coding, doch Opus 5 liegt bei den vier hier ausgewählten agentischen Prüfungen vorn. Vor allem fand der Vergleich nicht unter gleichen Bedingungen statt, wie aus der von Meta veröffentlichten Methodik hervorgeht: Muse Spark 1.3 und 1.2 wurden mit der Aufwandsstufe xhigh bewertet, während Claude Opus 5 und GPT-5.6 Sol im Modus max getestet wurden. Es gibt nur eine Ausnahme: DeepSWE v1.1, bei dem Muse Spark 1.3 mit max gemessen wurde – ausgerechnet dem Modus, der noch nicht verfügbar ist und laut Meta eingeführt werden soll, sobald die zusätzlichen Sicherheitstests abgeschlossen sind.
Ein Absatz der Roadmap ist für das offene Ökosystem besonders bemerkenswert.
Stay tuned for more updates soon, including bigger models, Muse Spark open weights, and more.
🇩🇪 Bleiben Sie dran für weitere Neuigkeiten in Kürze, darunter größere Modelle, offene Gewichte von Muse Spark und mehr. — @AIatMeta auf X
Nach einem Jahr, in dem Meta seine Veröffentlichungen mit offenen Gewichten deutlich reduziert hat, ist diese Zusage bemerkenswert – es bleibt abzuwarten, welche Version davon betroffen sein wird, da weder ein Datum noch ein Umfang genannt wurden.
🔗 Vorstellung von Muse Spark 1.3
Qwen3.8-Max-0902 übernimmt den ersten Platz in der Code Arena WebDev
2. September — Qwen hat eine Aktualisierung seines Spitzenmodells veröffentlicht: Qwen3.8-Max-0902, ein datierter Snapshot, der auch unter dem Alias qwen3.8-max-2026-09-02 verfügbar ist. Das Modell behält die strukturellen Merkmale der August-Version bei – 2,4 Billionen Parameter und ein Kontextfenster von 1 Million Tokens –, wurde jedoch einer zusätzlichen, auf „Coding & Cowork“ ausgerichteten Post-Training-Phase unterzogen.
| Modellmerkmal | Veröffentlichter Wert |
|---|---|
| Parameter | 2,4 T |
| Kontextfenster | 1 M Tokens |
| Maximale Eingabe | 991 K Tokens (983 K im thinking-Modus) |
| Maximale Ausgabe | 131 K Tokens |
| Schlussfolgerungsbudget | 262 K Tokens |
| Eingabe- und Ausgabepreis | 2 Dollar und 6 Dollar pro Million Tokens |
| Explizites Lesen aus dem Cache | 0,17 Dollar pro Million Tokens |
| Implizites Lesen aus dem Cache | 0,25 Dollar pro Million Tokens |
| Explizite Cache-Erstellung | 2,50 Dollar pro Million Tokens |
| Durchsatzlimits | 1 M Tokens pro Minute, 15 K Anfragen pro Minute |
Das Modell akzeptiert Bilder, Text und Videos als Eingabe und stellt über die Responses API fünf integrierte Werkzeuge bereit: Code-Interpreter, Bild-zu-Bild-Suche, Text-zu-Bild-Suche, Web-Extraktor und Websuche. Es ist noch am selben Tag über die API auf QwenCloud verfügbar.
Am selben Tag veröffentlichte Arena.ai seine Ergebnisse für die Code Arena WebDev. Qwen3.8-Max-0902 steigt dort mit 1.691 Punkten direkt auf Platz eins der Gesamtwertung ein – 22 Punkte mehr als die vorherige Version, 3 Punkte vor Claude Opus 5 mit der Einstellung Max und 17 Punkte vor Kimi K3 mit der Einstellung Max. Bei einem Mischpreis von 5 Dollar pro Million Tokens belegt das Modell die bestbewertete Position an der Pareto-Grenze von Arena und bietet damit das beste Verhältnis zwischen Punktzahl und Kosten in der gesamten Rangliste.
Die Aufschlüsselung nach Kategorien zeichnet ein differenzierteres Bild: Platz eins bei Data & Analytics und Consumer Product, Platz zwei bei Brand & Marketing, Gaming und Simulations sowie Platz drei bei Content Creation Tools und Reference-Based Design. Die Stärke des Modells liegt somit eher bei Datenanwendungen und Verbraucherprodukten als bei überwiegend kreativen Aufgaben. Arena kündigt kommende Agent-Arena-Werte an.
🔗 Ankündigung von Qwen3.8-Max-0902
Inferenz verlässt die Cloud: Video auf einem Desktop, eine lokale Engine unter offener Lizenz
Das ist die grundlegende Entwicklung des Tages, die sich nicht an einer einzelnen Ankündigung festmachen lässt. Zwei wichtige Veröffentlichungen und vier weniger auffällige Signale weisen in dieselbe Richtung: Was gestern noch eine GPU im Rechenzentrum erforderte, soll lokal ausgeführt werden.
2. September — Das FastVideo-Team des Hao AI Lab (UCSD) hat die lokale Portierung von FastH3 veröffentlicht, seiner destillierten Version des offenen Videomodells MiniMax H3. Die gemeinsame Erzeugung von Video und Audio erforderte bislang eine GPU im Rechenzentrum; inzwischen läuft das Modell auf einer NVIDIA DGX Spark, zwei über QSFP verbundenen DGX Spark oder einem Apple-Silicon-Mac mit mindestens 36 GB gemeinsamem Arbeitsspeicher.
Die wichtigste Einschränkung ist nicht die Rechenleistung, sondern der Speicher. Die DGX Spark verfügt über 128 GB gemeinsamen LPDDR5X-Speicher mit rund 270 GB/s, also ungefähr einem Zehntel der Bandbreite von HBM im Rechenzentrum, wobei einer Workload tatsächlich 121 GB zur Verfügung stehen. Die Pipeline arbeitet deshalb phasenweise: Prompt codieren, Text-Encoder freigeben, Transformer laden, entrauschen, freigeben und anschließend den VAE laden. Auf einer diskreten GPU gibt das Kopieren der Gewichte zum Host den Device-Speicher frei; bei Spark landet diese Kopie wieder im selben Pool. Das Team hat sie zugunsten des direkten Ladens des DiT auf die GPU entfernt — dadurch sinkt die Ladezeit des Transformers von 445 s auf 39 s und die Laufzeit eines Durchlaufs mit 768×1344 und 124 Bildern von 772 s auf 336 s.
| Testmaschine | Erste Generierung | Wiederholte Generierung |
|---|---|---|
| Apple M4 Max | 504 s | 465 s |
| DGX Spark | 264 s | 243 s |
| 4x GB200 | 10,2 s | 5,1 s |
Gegenüber dem öffentlichen vLLM-Omni-Rezept für DGX Spark, das für fünf Sekunden Video in 1024×576 und 50 Schritten 1 881 s benötigt, erreicht FastH3 in vier Schritten 268 s, also etwa 7x; bei 832×480 steigt das Verhältnis auf 8,4x und sinkt bei 1344×768 wieder auf 7,9x. Auf dem M4 Max verkürzt sich die Codierung eines nicht zwischengespeicherten Prompts von etwa 80 s auf etwa 17 s, während der TAEH3-Decoder die Decodierung von 102 s auf 1 s reduziert und dabei den Spitzenspeicherbedarf von 11,0 auf 3,6 GiB senkt. Die MLX-Gewichte werden in INT8, INT6 und INT4 auf Hugging Face veröffentlicht, zusammen mit dem erstmals publizierten FastVideo Cookbook. Als nächstes Ziel wurde die RTX-Familie einschließlich 5090 und 4090 angekündigt.
Am selben Abend hat Perplexity den Quellcode von Lily geöffnet, der lokalen Inferenz-Engine, die den On-Device-Teil seines hybriden Computings auf dem Mac ausführt. Die Engine war am Vortag in einem Forschungsbeitrag vorgestellt worden; neu ist die Veröffentlichung des Codes unter der Apache-2.0-Lizenz im Repository perplexityai/pplx-garden, wo er nun neben fabric-lib und pplx-unigram steht.
Der Code bestätigt den Ansatz extremer Spezialisierung. Lily ist keine generische Engine: Sie lädt nur einen einzigen Checkpoint, Qwen3.6-35B-A3B, der im MLX-Format mit affiner 4-Bit-Quantisierung und einer Gruppengröße von 64 vorliegt und beim Laden überprüft wird. Dichte Qwen-Checkpoints, kleinere Varianten, BF16, GGUF, AWQ, GPTQ, int8 und fp8 werden ausdrücklich abgelehnt. Die Engine ist in Rust geschrieben, kompiliert beim Start Metal-Kernel aus dem Quellcode, nutzt in ihrem Ausführungspfad weder PyTorch noch MLX und erfordert mindestens eine Apple-GPU der Familie 10 — einen M5 oder neuer — sowie macOS 26. Auch die API-Oberfläche ist ebenso eng gefasst: nur drei Routen, stets Greedy-Decodierung; Sampling-Parameter, Streaming, Tools und multimodale Inhalte werden abgelehnt statt ignoriert. Gerade diese Enge ist interessant: Perplexity liefert keinen Konkurrenten zu MLX-LM, sondern den Beleg dafür, dass eine maßgeschneiderte Engine für eine bestimmte Plattform und ein bestimmtes Modell ein universelles Framework übertrifft.
Vier weitere Veröffentlichungen des Tages weisen in dieselbe Richtung und werden in den Kurzmeldungen aufgegriffen: TranslatePsy-Nano, Übersetzungsmodelle mit 17 bis 42 MB für siebzehn Sprachen; die Arbeit von i64 Systems zu Experten eines MoE-Modells, die auf NVMe liegen, ohne ein einziges Byte der Ausgabe zu verändern; der Beitrag von Cohere, der sich für die richtige Dimensionierung kleiner Modelle in Unternehmen ausspricht; und der DGX-Spark-Livestream von NVIDIA zur lokalen Ausführung des Portable Computer von Perplexity. Für sich genommen hat keine davon großes Gewicht, gemeinsam verlagern sie jedoch die Rechenleistung vom Rechenzentrum auf das Gerät.
🔗 FastH3 lokal · 🔗 Öffnung des Lily-Quellcodes · 🔗 pplx-garden-Repository
Anthropic öffnet den Quellcode von Claude Commerce Agents
2. September — Anthropic hat Claude Commerce Agents als Open Source veröffentlicht, ein Referenz-Repository unter der Apache-2.0-Lizenz zum Aufbau von Handelsagenten. Die Ankündigung erfolgt bewusst vor der Feiertagssaison, in der E-Commerce-Teams ihre Bereitstellungen planen.
Der Blueprint enthält zwei vollständige Agenten. Der Einkaufsagent ist in der Anwendung des Unternehmens angesiedelt: Er durchsucht den Katalog, stellt für eine in natürlicher Sprache formulierte Anfrage eine Auswahl von Artikeln zusammen, merkt sich die Präferenzen des Kunden, zeigt Produkte, Vergleiche und den Warenkorb in der Unterhaltung an, übergibt anschließend an den Checkout — und beantwortet im selben Thread Fragen des Kundendienstes. Der Händleragent richtet sich an die Teams, die den Shop betreiben: Verkaufsanalysen, Warnungen vor einem Artikel, der vor einer Werbeaktion ausverkauft zu sein droht, historienbasierte Preisempfehlungen und das Verfassen von Kampagnen.
| Bestandteil des Repositorys | Bereitgestellter Inhalt |
|---|---|
| Bereitgestellte Agenten | Einkaufsagent (Kunde) und Händleragent (Backoffice) |
| Ausführbare Branchen | Einzelhandel, Reisen, Telekommunikation, Ticketing |
| Runtimes | Messages API, Claude Agent SDK, Claude Managed Agents (beta) |
| Bereitstellungsplattformen | Claude API, Amazon Bedrock, Microsoft Foundry, Google Cloud Vertex AI |
| Claude-Code-Plugin | commerce-builder@claude-commerce-agents |
| Technische Voraussetzungen | Python 3.11 oder höher, Node 22 |
| Bereits beobachtete Ergebnisse | Bei Einzelhändlern, die Einkaufsagenten auf Claude ausführen: bis zu 35 % größere Warenkörbe, Käufer schließen den Kauf mit 60 % höherer Wahrscheinlichkeit ab |
Die Trennung zwischen dem, was das Modell entscheidet, und dem, was tatsächlich ausgeführt wird, ist strukturell und nicht nur deklarativ. Auf Verbraucherseite enthält die vom Agenten aufgerufene Backend-Schnittstelle schlicht keine Zahlungsmethode. Auf Händlerseite erzeugt jedes Schreib-Tool eine vorgemerkte Änderung mit einer serverseitig generierten Kennung, und die Funktion apply_change wird nur für Kennungen erfolgreich ausgeführt, die über eine echte Oberfläche zur menschlichen Validierung genehmigt wurden. Anthropic weist darauf hin, dass es sich um eine nicht gepflegte Referenzimplementierung handelt, die keine Beiträge annimmt: ein Ausgangspunkt zum Forken, keine Abhängigkeit, deren Entwicklung man folgen sollte. Alle Unternehmen in den Demonstrationen sind fiktiv, und nichts löst eine Bestellung aus oder belastet eine Karte.
🔗 Ankündigung von Claude Commerce Agents · 🔗 commerce-agents-Repository
Der technische Teil: Cache, Latenz und Schutzmechanismen im Code
Der am selben Tag veröffentlichte und von Ali Shazal und Matthew Koen verfasste Engineering-Leitfaden, der den Blueprint begleitet, fasst ein Jahr Arbeit mit Einzelhändlern, Marktplätzen und Reiseanbietern zusammen. Seine erste Empfehlung ist kontraintuitiv: Für einen Agenten, der zahlreiche Kategorien abdecken muss, sollte nicht für jeden Bereich ein Unteragent erstellt werden. Eine Handelsunterhaltung ist eine einzige, eng gekoppelte Sitzung, und ihre Aufteilung verschlechtert die Qualität — die Fähigkeiten stammen aus Skills und nicht aus der Vervielfachung von Agenten.
| Behandeltes Thema | Von Anthropic genannter Richtwert |
|---|---|
| Ausgegebene Handelsantwort | 500 bis 700 Ausgabe-Token |
| Lesen zwischengespeicherter Token | Ein Zehntel der Kosten neuer Token |
| Cache-Schreibvorgang | Aufschlag von etwa 1,25x, ab der zweiten Nutzung amortisiert |
| Angestrebte Cache-Trefferrate | 90 bis 99 % |
| Geschwindigkeit von Cache-Lesevorgängen | 1,5 bis 2x schneller bei etwa 100 000 Token |
| Nutzen des Speichers | 13 % mehr Faktenabruf in der internen Evaluierungssuite |
| Evaluierungsfälle pro Ablauf | Zu Beginn 50 bis 100 |
Bei der Modellauswahl lautet die Empfehlung, für Händleragenten, bei denen die Analyse dominiert, mit Opus und für Verbraucheragenten, bei denen die Latenz stärker ins Gewicht fällt, mit Sonnet zu beginnen — und anschließend die gesamte Evaluierungssuite für jedes Modell und jede Aufwandsstufe durchlaufen zu lassen, wobei die Kosten pro erledigter Aufgabe statt pro Modellaufruf gemessen werden. Der Abschnitt zur Sicherheit ist hingegen unmissverständlich.
The prompt is where safe behavior starts, but in commerce it can’t be where safety is enforced. The failures are financial and often irreversible, and a prompt rule is one injection or one bad sample away from being skipped.
🇩🇪 Der Prompt ist der Ort, an dem sicheres Verhalten beginnt, aber im Handel kann er nicht der Ort sein, an dem Sicherheit durchgesetzt wird. Fehler haben finanzielle Folgen und sind oft unumkehrbar, und eine Prompt-Regel ist nur eine Injection oder ein schlechtes Sample davon entfernt, umgangen zu werden. — Anthropic, Ein Leitfaden zur Anatomie effektiver Handelsagenten
Vier Regeln werden deshalb im Code durchgesetzt und einmalig definiert, damit sie von allen drei Runtimes gemeinsam genutzt werden: Das Modell bereitet vor, aber ein Mensch oder eine Richtlinie führt aus; Schreibvorgänge und Renderings akzeptieren nur vom Server ausgegebene Kennungen; Transaktionen mit Obergrenze müssen wiederholten Anfragen standhalten; Inhalte Dritter werden bereinigt.
Computersteuerung läuft in Claude Code und Claude Cowork im Hintergrund
2. September — Die Computersteuerung (computer use) durch Claude beansprucht nicht mehr den gesamten Bildschirm. Bislang bedeutete der Start einer solchen Aufgabe, den eigenen Rechner abzugeben: Die anderen Fenster wurden ausgeblendet, während Claude in der genehmigten Anwendung arbeitete. Jetzt läuft die Aufgabe sowohl in Claude Cowork als auch im Code-Tab der Desktop-Anwendung im Hintergrund weiter, während man sich anderen Dingen widmet.
Die Änderung befindet sich in der Beta-Phase, ist den Pro- und Max-Tarifen vorbehalten und auf macOS beschränkt — während computer use selbst weiterhin als research preview unter macOS und Windows verfügbar ist. Wer die Funktion bereits verwendet hat, muss nichts aktivieren; alle anderen finden sie unter Settings > General, wobei macOS zusätzlich die Systemberechtigungen für Bedienungshilfen und Bildschirmaufnahme verlangt.
Am Sicherheitsrahmen ändert sich nichts. Anders als das Bash-Tool, das in einer Sandbox läuft, wird computer use auf dem tatsächlichen Desktop ausgeführt. Die Zugriffsstufen bleiben nach Anwendungskategorie festgelegt und können nicht geändert werden: reine Ansicht für Browser und Handelsplattformen, nur Klickzugriff für Terminals und IDEs — wodurch Claude zum dedizierten Tool statt zur Bildschirmsteuerung gelenkt wird — und vollständige Kontrolle für alles andere. Eine Genehmigung gilt für die aktuelle Sitzung oder für dreißig Minuten in einer über Dispatch gestarteten Sitzung.
🔗 Ankündigung von computer use im Hintergrund
Cursor führt seine Cloud-Agenten auf kundenseitig verwalteten Maschinen aus
2. September — Cursor hat einen von Jack Pertschuk verfassten Produktbeitrag veröffentlicht, der seine Cloud-Agenten für eine Infrastruktur öffnet, die dem Kunden gehört. Bislang lief ein Cursor-Cloud-Agent auf einer dedizierten virtuellen Maschine in der Cloud des Anbieters. Mit Self-Hosted Machines wird die Ausführung der Tools auf Maschinen im Unternehmensnetzwerk verlagert, während Agentenschleife, Inferenz und Planung bei Cursor verbleiben.
Die Zahl, die diesen Schritt begründet, wird gleich zu Beginn genannt: Cloud-Agenten erstellen inzwischen mehr als 60 % der Pull Requests, die Cursor intern zusammenführt. Wenn ein wachsender Teil der Arbeit über diese Agenten läuft, ist die Maschine, auf der sie ausgeführt werden, kein nebensächliches Detail mehr. Der Anbieter nennt drei Situationen, die ein Team zu eigenen Maschinen bewegen: Tools in direkter Nähe zur Quellcodeverwaltung und zu internen Diensten auszuführen, besondere Hardware wie GPUs oder Macs für die iOS-Entwicklung bereitzustellen oder ein Betriebssystem auszuführen, das sich nur schwer in ein Cloud-Agent-Image packen lässt.
| Aspekt des Systems | Technisches Detail |
|---|---|
| Registrierungsbefehl | agent worker start, langlebige ausgehende HTTPS-Verbindung |
| Verbindungsrichtung | Cursor initiiert niemals eine eingehende Verbindung zum Kundennetzwerk |
| Verfügbare Konfigurationen | My Machines (einzelner Arbeitsplatz oder einzelne VM) und Pools (gemeinsame Team-Warteschlange) |
| Wiederaufnahme nach Inaktivität | Ruhezustand per Snapshot, Wiederherstellung mit derselben Worker-Kennung |
| Sandbox-Anbieter | AWS Lambda, Cloudflare, Coder, Daytona, E2B, Modal, Namespace, Vercel |
| Computersteuerung | Linux wird jetzt zusätzlich zu Macs über Chrome oder Chromium unterstützt |
Pools skalieren über einen Controller, der die Anfragewarteschlange überwacht und Maschinen mit einem vom Team bereitgestellten Skript startet; wenn kein Worker frei ist, wartet die Anfrage. Für den Mittelweg zwischen dem Zurücksetzen einer Maschine und ihrem dauerhaften Betrieb, die beide kostspielig sind, führt Cursor den Ruhezustand ein: Von der inaktiven Maschine wird ein Snapshot erstellt und sie wird heruntergefahren; trifft innerhalb des Wiederverbindungsfensters ein neuer Startauftrag ein, wird der Snapshot wiederhergestellt. Da ein Pool nicht an ein Repository gebunden ist, kann dieselbe Warteschlange mehrere Repositorys bedienen.
Eine Einschränkung nennt der Beitrag selbst: Nur die Ausführungsumgebung wird verlagert. Die Tool-Ausgaben werden zur Inferenz an Cursor zurückgesendet und können Code enthalten, und Agententranskripte können dort verarbeitet und gespeichert werden. Es handelt sich daher nicht um eine vollständige Isolation, sondern um eine Verlagerung des Ausführungsorts.
Claude Fable 5.1 wird bei Integratoren allgemein verfügbar
1. und 2. September — Noch am Tag seiner Veröffentlichung wurde Claude Fable 5.1 in GitHub Copilot allgemein verfügbar; am folgenden Tag integrierte Genspark das Modell in seinen Code Agent und in Claw. Zwei Integratoren in zwei Tagen beim selben Modell: Das ist eine Adoptionswelle, keine zwei isolierten Meldungen.
Bei GitHub ist die Abdeckung breit — Visual Studio Code, Visual Studio, Copilot CLI, der Coding Agent, die GitHub-Copilot-Anwendung, github.com, GitHub Mobile unter iOS und Android, die JetBrains-IDEs, Xcode und Eclipse — für die Tarife Pro+, Max, Business und Enterprise, mit einer schrittweisen Einführung und Abrechnung zum öffentlichen Tarif des Anbieters. Der bemerkenswerteste Aspekt dieser Bereitstellung ist jedoch nicht technischer, sondern vertraglicher Natur.
| Zugangsbedingung | Was für Fable 5.1 gilt |
|---|---|
| Administratorrichtlinie | Standardmäßig deaktiviert, muss ausdrücklich aktiviert werden |
| Datenspeicherung | Standardmäßig verpflichtend, für die Sicherheitsklassifikatoren von Anthropic |
| Nutzung gespeicherter Daten | Kein Training der Anthropic-Modelle |
| Andere Claude-Modelle | Weiterhin keine Speicherung, außer bei Fable 5 und Fable 5.1 |
| Ausnahme von der Nullspeicherung | Berechtigte Unternehmen, bis zum Ende des Kalenderjahres |
| Nach Ablauf der Ausnahme | Enterprise Frontier Safeguards erforderlich |
Im Gegensatz zu den anderen Claude-Modellen in Copilot verlangt Fable 5.1 standardmäßig die Speicherung von Daten: Anthropic speichert Prompts und Ausgaben, um seine Sicherheitsklassifikatoren zu betreiben. Die Aktivierung der Richtlinie bedeutet somit die ausdrückliche Zustimmung zu dieser Einschränkung; bleibt sie deaktiviert, ist das Modell schlicht nicht verfügbar. Der Ausweg ist zeitlich begrenzt und selektiv: Berechtigte Unternehmen können bis zum Ende des Kalenderjahres bei der Nullspeicherung bleiben, während Anthropic seine Enterprise Frontier Safeguards einführt, die eine automatisierte Sicherheitsüberwachung sowie vom Kunden kontrollierte Speicher- und Verschlüsselungsschlüssel bereitstellen sollen. Die Berechtigung kann nicht im Self-Service erlangt werden: Sie muss über das GitHub-Vertriebsteam beantragt werden, das der Support nicht umgehen kann, und selbst nach der Genehmigung wird nichts automatisch aktiviert.
Genspark wiederum wirbt mit einer Integration ab dem ersten Tag in Genspark Code Agent und Claw, ohne Benchmark oder Angaben zur Preisgestaltung. Der Anbieter reiht sich damit in die Liste agentischer Plattformen ein, die innerhalb weniger Stunden nach der Veröffentlichung des Modells umgestellt haben, neben Cursor, Devin, Warp, v0, Amp und Perplexity Computer.
🔗 Fable 5.1 in GitHub Copilot · 🔗 Ankündigung von Genspark
GitHub erläutert, wie Copilot günstiger wurde, ohne an Qualität einzubüßen
2. September — GitHub hat einen von Erik Kristensen gemeinsam mit Napalys Klicius verfassten Engineering-Artikel über die Senkung der Copilot-Kosten veröffentlicht. Der Text ist für dieses Genre ungewöhnlich: Er nennt Zahlen, beschreibt gescheiterte Experimente und erklärt, warum eine offensichtliche Optimierung nach hinten losgehen kann.
Die Ausgangsthese ist kontraintuitiv. Das Zählen der Tokens einer einzelnen Interaktion misst nicht die Effizienz: Eine knappe Tool-Antwort, in der eine vom Agenten benötigte Information fehlt, zwingt ihn dazu, den Befehl erneut auszuführen, wodurch die Aufgabe insgesamt langsamer und teurer wird. GitHub veranschaulicht diese Falle anhand von RTK (Rust Token Killer), einem Hilfsprogramm, das die Shell-Ausgabe vor dem Einlesen kürzt. Es verkürzte zwar einige Antworten, doch die anschließenden Wiederherstellungsschritte fügten weitere Runden hinzu: lokal eingesparte Tokens wurden global wieder ausgegeben. Es wurde nicht eingeführt.
| Bewertete Änderung | Gemessener Nutzen |
|---|---|
| Entfernung der Zeilennummern in Offline-Tests | Rund 5 % geringere Inferenzkosten |
| Entfernung der Zeilennummern in der CLI-Produktion | Rund 3 % geringere durchschnittliche tägliche Kosten pro Benutzer |
Komprimierung des Tool-Prompts task | 1.300 Tokens pro Runde entfernt, 2,9 % geringere normalisierte Kosten pro aktiver Stunde |
| Direkte Zustellung abgeschlossener Hintergrundarbeit | Rund 2,3 % geringere tokenbezogene Nutzung, gemessen in AI Credits |
| Zeilennummern und Komprimierung bei Copilot code review | Jeweils rund 5 % weniger Prompt-Tokens pro Review |
| Frühere Migration zu gemeinsam genutzten Datei-Tools | Rund 20 % geringere Review-Kosten |
| RTK (Rust Token Killer) | Verworfen, da die Gesamtkosten in der getesteten Konfiguration stiegen |
Die gewählte Komprimierungsrichtlinie ist bewusst konservativ und besteht aus drei Teilen: Ausgaben, die wie Quellcode aussehen, unverändert bewahren, Suchergebnisse neu anordnen, ohne etwas zu entfernen, und ausschließlich wiederkehrendes Rauschen aus Installations-, Build- und Testvorgängen komprimieren. Die Komprimierung von git diff war Teil der ersten Versionen; sie wurde entfernt, nachdem Benchmark-Aufgaben gezeigt hatten, dass Agenten die ursprüngliche Ausgabe erneut öffneten.
Die aufschlussreichste Episode betrifft die Prompt-Komprimierung. Eine Meta-Prompting-Schleife, in der Copilot seine eigene Anweisung iterativ umschreibt, halbierte den Prompt des Tools task — doch das erste Online-Experiment offenbarte eine Regression, die bei den Offline-Evaluierungen übersehen worden war: Die Schleife hatte eine vorsichtige Anweisung zur Parallelität in eine strikte Reihenfolgeregel umgewandelt und damit unabhängige Agenten serialisiert. Die Korrektur ersetzte Positiv- und Negativlisten durch einen einzigen Satz, der die Entscheidung dem Modell überlässt. Die letzte und nützlichste Erkenntnis: Verbesserungen lassen sich nicht von einem Produkt auf ein anderes übertragen. Ein strafferer Satz von Anweisungen, inspiriert von den guten Ergebnissen bei Copilot code review, ließ die Kosten bei Copilot CLI steigen.
None of these changes made the model smarter. They removed work the model never needed to do.
🇩🇪 Keine dieser Änderungen hat das Modell intelligenter gemacht. Sie haben Arbeit entfernt, die das Modell nie hätte erledigen müssen. — GitHub Blog, Wie wir AI-Coding kosteneffizienter machen
Der Modellkatalog von Copilot wird neu geordnet
1. und 2. September — Zwei zeitgleiche Changelogs beschreiben die beiden Seiten derselben Neuordnung: was aus dem Copilot-Katalog entfernt wird und wer künftig über das Standardmodell entscheidet.
Sechs Modelle gelten seit dem 1. September in den meisten Copilot-Erfahrungen als veraltet — Copilot Chat, Online-Bearbeitungen, Ask- und Agent-Modi sowie Codevervollständigungen.
| Entferntes Modell | Von GitHub vorgeschlagene Alternative |
|---|---|
| Gemini 3.1 Pro | Gemini 3.7 Flash |
| Claude Opus 4.5 | Claude Opus 4.7, Claude Opus 4.8 oder Claude Opus 5 |
| Claude Opus 4.6 | Claude Opus 4.7, Claude Opus 4.8 oder Claude Opus 5 |
| Claude Sonnet 4.5 | Claude Sonnet 5 |
| Claude Sonnet 4.6 | Claude Sonnet 5 |
| Raptor Mini | MAI-Code-1.1-Flash |
Eine Ausnahme bleibt bestehen: Claude Sonnet 4.6 ist für Einzelabonnenten mit Jahrestarif weiterhin verfügbar. Benutzer müssen nichts unternehmen, doch Administratoren von Copilot Enterprise müssen die Ersatzmodelle gegebenenfalls ausdrücklich in ihren Richtlinien aktivieren; andernfalls erscheinen sie weder in VS Code noch auf github.com.
Gleichzeitig können unternehmensverwaltete Einstellungen nun jedes beliebige Modell als Standard für neue Unterhaltungen festlegen. Die Granularität reicht über die Unternehmensebene hinaus: Indem ein Administrator den Schlüssel model als overridable deklariert und die Team-Konfigurationsdateien in team-mappings.json bearbeitet, kann er jedem Team die Wahl seines eigenen Standardmodells überlassen; nicht erfasste Benutzer übernehmen die globale Einstellung. Die Funktion ist für Copilot Business und Copilot Enterprise in der GitHub-Copilot-Anwendung, Copilot CLI und Visual Studio Code allgemein verfügbar.
🔗 Veraltete Modelle · 🔗 Standardmodell im Unternehmen
Das Ship Log für August: Copilot in Slack und Teams sowie Medien in der CLI
1. und 2. September — Die von GitHub als X-Artikel veröffentlichte monatliche Zusammenfassung ist zwar eine Werbemaßnahme, weist jedoch auf eine bisher nicht weitergemeldete Veröffentlichung im August hin: GitHub Copilot ist jetzt über Slack und Microsoft Teams verfügbar. Die Integration bringt die agentischen Fähigkeiten von Copilot CLI und der GitHub-Copilot-Anwendung in Teamunterhaltungen — durch eine Erwähnung von GitHub lassen sich Änderungen planen, Probleme untersuchen oder Coding-Aufgaben weiterleiten, ohne den Thread zu verlassen.
| Element des Ship Logs für August | Was veröffentlicht wurde |
|---|---|
| Copilot in Slack und Microsoft Teams | Agentische Fähigkeiten von Copilot CLI und der Copilot-Anwendung |
| Copilot code review, Tiefe Balanced | Allgemeine Verfügbarkeit neben Lite, Standard auf Organisations- oder Repository-Ebene einstellbar |
| Erwähnte neue Modelle | Gemini 3.7 Flash, MAI-Code-1.1-Flash, Kimi K3, gehostet von Fireworks AI |
| Aktion für GPT-5.6 Sol | Halber Preis bis zum 3. September |
| Aktion für die automatische Auswahl | 30 % Rabatt für Benutzer von Copilot Max |
| GitHub Copilot Day | 10. September 2026 |
Die Zusammenfassung dokumentiert außerdem die Tiefe Balanced von Copilot code review, die neben Lite allgemein verfügbar wurde: Balanced zielt auf eine gründlichere Analyse von Pull Requests, Lite auf direkte Änderungen, und die Standardtiefe lässt sich auf Organisations- oder Repository-Ebene festlegen.
Eine weitere Veröffentlichung des Monats vervollständigt das Bild auf der Kommandozeilenseite: Das wiederholbare Flag --attach der GitHub CLI, verfügbar seit gh v2.99.0, lädt ein lokales Bild oder Video hoch und referenziert es inline in einem Issue, einem Pull Request oder einem Kommentar. Es funktioniert bei den sechs Befehlen, die Markdown schreiben; entscheidend für die Nutzbarkeit ist der Umgang mit vorhandenem Markdown: Ein bereits im Text referenzierter lokaler Pfad wird direkt umgeschrieben, sodass  seinen Alternativtext behält und auf das hochgeladene Asset verweist. Der Alternativtext wird nach einem # im Pfad angegeben. Unterstützte Formate: PNG, JPEG, GIF, WebP, SVG, MP4, MOV und WebM, mit 10 MB für Bilder und 100 MB für Videos bei kostenpflichtigen Tarifen. GitHub Enterprise Server wird in dieser Version nicht unterstützt. GitHub hebt ausdrücklich hervor, dass Coding Agents diese Fähigkeit übernehmen und nun ein Ergebnis zeigen können, statt es zu beschreiben.
🔗 Ship Log für August 2026 · 🔗 Medien in GitHub CLI
Fairwind Program, Googles Cyberabwehr für vertrauenswürdige Verteidiger
2. September — Am selben Tag wie Gemini 3.8 Flash Cyber startete Google das Fairwind Program, den Kanal, über den dieses Modell bereitgestellt wird. Die von Four Flynn, Vice President für Sicherheit und Datenschutz, dargelegte Argumentation geht von einem konkreten Dilemma für Verteidigungsteams aus: entweder massive, kostspielige Frontier-Modelle einzusetzen, die auf Codebasen von Unternehmen schwer zu kontrollieren sind, oder auf kleinere Open-Weight-Modelle zurückzugreifen, die bei der Behebung komplexer Schwachstellen an ihre Grenzen stoßen.
Die Antwort kombiniert Gemini 3.8 Flash Cyber mit CodeMender, Googles System zur automatischen Fehlerbehebung. Das zentrale Argument betrifft nicht die Erkennung, sondern die Behebung: Schwachstellen aufzuspüren schafft Bewusstsein und Angst, während ihr automatisches Auffinden und Beheben Sicherheit schafft. Das Versprechen besteht darin, innerhalb der sicheren Cloud-Umgebung der Kundenorganisation in wenigen Minuten statt in Wochen geprüfte und einsetzbare Korrekturen zu erzeugen.
Der Zugang wird bewusst gestaffelt und umfasst drei vorrangige Kreise: Regierungen und nationale Cyberbehörden, Betreiber kritischer Infrastrukturen im Gesundheitswesen, in der Telekommunikation, im Energie- und Finanznetzsektor sowie zentrale Technologieplattformen. Teilnehmende Organisationen akzeptieren strenge Auflagen — den Zugang auf interne Teams für Cybersicherheit, Incident Response oder Penetrationstests zu beschränken und Schutzmaßnahmen wie Multi-Faktor-Authentifizierung einzusetzen. Google nennt weltweit mehr als 650 teilnehmende Partner. Außerhalb des Programms kann jeder Google-Cloud-Kunde CodeMender mit öffentlich verfügbaren Modellen auf der Gemini Enterprise Agent Platform als Ergänzung zu AI Threat Defense nutzen. Das Unternehmen gibt außerdem an, über Google.org inzwischen insgesamt mehr als 100 Millionen US-Dollar an Finanzmitteln für Cybersicherheit bereitgestellt zu haben, darunter 36 Millionen für 35 Cyberkliniken, die mehr als 1.250 US-amerikanische Krankenhäuser, Schulbezirke und kommunale Dienste unterstützt haben.
Googles Kommandozeilen-Tools: drei Versionen in zwei Tagen
1. und 2. September — Google hat innerhalb von zwei Tagen drei Versionen für denselben Bereich veröffentlicht, die zusammen eine klare Priorität erkennen lassen: weniger Funktionen, mehr Abschottung und Stabilität.
| Veröffentlichte Version | Datum | Vorherrschender Inhalt |
|---|---|---|
| Gemini CLI v0.58.0 | 1. September | Sieben überwiegend sicherheitsbezogene Änderungen, Beförderung in den Stable-Kanal |
| Antigravity CLI 1.1.23 | 1. September | Zwei Verbesserungen, elf Fehlerbehebungen |
| Antigravity 2.12.0 | 2. September | Sieben Verbesserungen, neun Fehlerbehebungen |
Der Stable-Kanal von Gemini CLI wurde auf v0.58.0 aktualisiert, eine Beförderung, die unbemerkt blieb, weil sie zweiunddreißig Minuten nach der Veröffentlichung der Preview v0.59.0 erfolgte. Der Inhalt ist fast vollständig defensiver Natur. Die umfangreichste Fehlerbehebung betrifft die macOS-Sandbox: Das Seatbelt-Profil isoliert nun die Sockets und Binärdateien von Docker und Container-Runtimes und schließt damit einen klassischen Fluchtweg — ein eingeschränkter Prozess, der den Docker-Socket des Hosts erreicht, kann in der Praxis aus seiner Umgebung ausbrechen. Zwei weitere Änderungen härten den Kern ab: Die Auswertung symbolischer Links erfolgt bei der Verwaltung ignorierter Pfade nun konsistent, und die übergeordneten Sicherheitsprüfer werden in der Konfiguration der Schreibrichtlinie ausdrücklich deklariert.
Antigravity 2.12.0 bringt zwei funktionale Neuerungen. Mit dem Zitieren von Antworten lässt sich ein Teil einer Antwort hervorheben und als Kontext in den nächsten Prompt einfügen — eine direkte Antwort auf ein alltägliches Problem langer agentischer Sitzungen. Der zahlenden Nutzern vorbehaltene Befehl /boost erhöht zudem den Denkaufwand durch eine Multi-Agent-Reasoning-Pipeline. Er erscheint am selben Tag wie Gemini 3.8 Flash, bei dem Google offen einräumt, dass es auf Kosten zusätzlicher Tokens intensiver arbeitet: Beide Entwicklungen weisen in dieselbe Richtung, nämlich hin zu einer expliziten Steuerung des Aufwandsniveaus durch den Nutzer. Der Rest behebt konkrete Ärgernisse: Die allgemeinen Einstellungen zeigen an, welche Projekte eine Einstellung überschreiben, Terminal-Layouts mit geteiltem Bildschirm bleiben nach dem Neuladen eines Fensters erhalten, und während einer laufenden Spracheingabe kann eine Nachricht gesendet werden.
Antigravity CLI 1.1.23 reduziert schließlich den Streaming-Aufwand der Subagents, indem Trajektorienmetadaten einmal pro Teiltrajektorie statt bei jedem Schritt gesendet werden, und übernimmt über Tab den als Ghost Text vorgeschlagenen Modellnamen in /model. Die elf Fehlerbehebungen legen im Alltag lästige Mängel offen: Abstürze durch Prompt-Hooks, bei der Rekonstruktion des Verlaufs für Gemini-Modelle ausgelassene Tool-Call-IDs, Berechtigungsdialoge mit generischen Titeln anstelle verständlicher Aktionsbeschreibungen — ein echtes Problem, da um die Genehmigung einer nicht beschriebenen Aktion gebeten wird — sowie mit enable_mcp_tools=true deklarierte Subagents, die wegen eines fehlenden MCP-Dispatchers scheiterten.
🔗 Versionshinweise zu Gemini CLI v0.58.0 · 🔗 Antigravity-Changelog
Die Short Video Overviews von Gemini Notebook werden auf mehr als 70 Sprachen erweitert
1. September — Gemini Notebook hat seine Short Video Overviews auf mehr als 70 Sprachen ausgeweitet und drei neue englische Varianten hinzugefügt. Die Funktion verwandelt die Quellen eines Notebooks in etwa 60 Sekunden lange vertikale Videos, die nun in der Sprache des Nutzers erstellt werden können.
Die Einführung betrifft Web und Mobilgeräte und bleibt Ultra- und Pro-Abonnenten vorbehalten — wobei das Team im selben Thread darauf hinweist, dass die Bereitstellung für Pro-Nutzer noch nicht abgeschlossen ist. Zwei Details ergänzen die Ankündigung: Die Anzahl der in einem Notebook enthaltenen Quellen fließt nicht in die Berechnung des Token-Verbrauchs ein, und Pro-Nutzer können weiterhin Cinematic Video Overviews auf Englisch erstellen. Der Sprung von Englisch auf 70 Sprachen macht aus der Funktion eine tatsächlich außerhalb der englischsprachigen Welt nutzbare Anwendung statt einer bloßen Demonstration.
🔗 Ankündigung zu Gemini Notebook
Editoren werden zu Modell-Multiplexern
1. und 2. September — Zwei scheinbar nicht zusammenhängende Ankündigungen beschreiben dieselbe Entwicklung: Die Entwicklungsumgebung wird zum Zugangspunkt für Modelle von Drittanbietern, und das Unterscheidungsmerkmal verlagert sich von der Qualität des Modells zu den Bedingungen, unter denen es ausgeführt wird.
Zed hat seine Stable-Version 1.18.0 veröffentlicht, deren bedeutendster Inhalt im KI-Abschnitt der Versionshinweise zu finden ist. Der Editor holt dort mehrere aktuelle Veröffentlichungen auf einmal nach: Das Kontextfenster mit 1 Million Tokens von GPT-5.6 wird auf Amazon Bedrock unterstützt, Gemini 3.5 Flash-Lite ergänzt die Google-AI-Modelle, Grok 4.5 und Grok 4.6 ergänzen die xAI-Modelle, und die Unterstützung für das am Vortag veröffentlichte Claude Fable 5.1 wurde verbessert. Zwei dieser vier Einträge gehen laut Versionshinweisen auf externe Beiträge zurück. Hinzu kommen ergonomische Verbesserungen für die Arbeit mit Agents — eine unterbrochene Verbindung zu einem externen Agent kann ohne Neustart neu geladen werden, der Speicherverbrauch langer Sitzungen wurde reduziert, und Verbindungsfehler nennen den nicht erreichbaren Host — sowie eine erwähnenswerte Fehlerbehebung für Nutzer von MCP-Servern: Die OAuth-Authentifizierung schlug bei Servern fehl, die nicht standardmäßige Scopes verlangten.
Mistral wiederum hat GLM 5.2 in seinem Coding-Agent Vibe Code für die Tarife Pro und Team verfügbar gemacht. Bemerkenswert ist nicht das Modell, sondern die Art seiner Bereitstellung: Mistral hostet es in Europa auf seiner eigenen Infrastruktur. Ein europäischer Entwickler, der GLM 5.2 über Vibe Code verwendet, nutzt somit eine von Mistral betriebene Inferenz, ohne dass seine Anfragen über die Server von Z.ai laufen. Das ist die konkrete Umsetzung der Positionierung für regionale Inferenz, die der Anbieter seit August vertritt — und die Situation ist gleich in zweifacher Hinsicht aufschlussreich, denn Mistral verfügt mit Devstral über eine eigene Modellfamilie und entscheidet sich dennoch dafür, in seinem Tool ein Open-Weight-Modell eines konkurrierenden Labors anzubieten.
🔗 Versionshinweise zu Zed 1.18.0 · 🔗 GLM 5.2 in Vibe Code
NVIDIA: zwei technische Beiträge und eine Allianz unter neuer Trägerschaft
2. September — Drei Veröffentlichungen von NVIDIA am selben Tag, zwei technischer Art und eine zur Governance.
Der erste Beitrag, der dritte Teil der Reihe zum Modell-Co-Design, nennt fünf Regeln für die Abstimmung von Speculative Decoding. Die Technik ist bekannt: Ein kleines Draft-Modell schlägt mehrere Tokens vor, die das Zielmodell in einem parallelen Durchlauf überprüft. Die praktische Frage bleibt offen — wie viele Tokens sollen spekuliert werden und mit welchem Mechanismus? Während der Überprüfung steigt der Rechenaufwand mit (1 + D), die Speicherzugriffe bleiben jedoch unverändert: Die Draft-Länge D muss daher bis zu dem Punkt erhöht werden, an dem die Überprüfung von memory-bound zu compute-bound übergeht. Bei einem repräsentativen Experten-GEMM wird dieser Zustand mit D = 7 bei einem Achtel der für D = 0 erforderlichen Batch-Größe erreicht. Wenn die Attention die Decodierzeit dominiert, beträgt die optimale Länge D = 128/G − 1, wobei G die Anzahl der Query-Heads ist, die sich einen KV-Head teilen. Darüber hinaus empfiehlt es sich, Werte zu wählen, bei denen G × (1 + D) ein Vielfaches von 128 ist, der Kachelgröße des Attention-Kernels. Die Messungen basieren auf SPEED-Bench, dem Speculative-Decoding-Benchmark von NVIDIA: Mit Qwen 3.5 122B A10B als Ziel erreicht das externe Draft-Modell 35B A3B bei D = 9 eine Akzeptanzlänge von 6. Der Beitrag betont einen häufig übersehenen Punkt — eine höhere Akzeptanz bedeutet nicht zwangsläufig eine stärkere Beschleunigung — und endet mit einer Warnung: Fine-Tuning des Zielmodells verändert dessen Ausgabeverteilung, sodass ein für einen bestimmten Checkpoint trainierter Drafter selbst dann an Akzeptanz verlieren kann, wenn sich das Zielmodell verbessert.
Der zweite Beitrag ist ein CUDA-Optimierungsleitfaden in sechs Schritten, der sich um ein einziges Beispiel dreht: drei RGB-Bilder in Graustufen umzuwandeln und anschließend den Median jeder Kachel von 32 × 32 Pixeln zu berechnen. Ausgangspunkt ist absichtlich fehlerhafter Code, den Compute Sanitizer sofort diagnostiziert — ein Schreibzugriff außerhalb der Grenzen des Shared Memory, verursacht durch die Verwendung eines globalen Index anstelle des erwarteten Blockindex.
| Optimierungsschritt | Gesamtzeit | Gewinn des Schritts |
|---|---|---|
| Ausgangscode | 6,8 s | — |
| CUB (DeviceTransform und BlockRadixSort) | 635 ms | etwa 10x |
| Gepoolte Speichercontainer | etwa 244 ms | etwa 2,6x |
| Gepinnter Speicher | 25 ms | etwa 10x |
| Ein CUDA-Stream pro Bild | 23 ms | insgesamt etwa 300x |
Allein der Ersatz des selbst entwickelten Bubble Sort durch cub::BlockRadixSort reduziert die Berechnung der Mediane von 2,142 s auf 773 µs, also um den Faktor 2717. Keiner dieser Schritte ist Low-Level-Optimierung: Es handelt sich um den Austausch von APIs.
Schließlich tritt die von NVIDIA mitgegründete Open Secure AI Alliance der Linux Foundation bei. Die von der Allianz vertretene These verschiebt den Schwerpunkt der üblichen Debatte: Ein Agent ist nicht nur ein Sprachmodell, sondern ein Softwaresystem aus Modellen, Harnesses, die ihm Kontext geben, und Guardrails, die seine Handlungsmöglichkeiten begrenzen. Die Sicherheitsdebatte hat sich jedoch weitgehend allein auf das Modell konzentriert, obwohl die Sicherheit vom Gesamtsystem abhängt — Harnesses, Alignment-Mechanismen, Ausführungsumgebungen, Identität, Richtlinien, Observability und Wiederherstellung. In Zusammenarbeit mit OpenSSF läuft ein Aufruf zur Stellungnahme zu SAFE (Shared AI Findings Exchange), einem Verfahren zur vertraulichen Erfassung von KI-bezogenen Vorfällen und Beinahevorfällen.
🔗 Speculative Decoding · 🔗 CUDA-Optimierung Schritt für Schritt · 🔗 Open Secure AI Alliance
Equinix Inference Exchange: offene Modelle in 280 Rechenzentren
2. September — Equinix hat Equinix Inference Exchange angekündigt, ein Programm für verteilte KI-Inferenz, das die Zusammenarbeit mit NVIDIA erweitert und Together AI einbezieht. Das Konzept beruht auf drei Ebenen: Equinix stellt die über Equinix Fabric mit den Clouds verbundene physische Grundlage bereit, NVIDIA liefert seine validierten Enterprise-Referenzarchitekturen, und Together AI betreibt darüber die Plattform mit Unterstützung für mehr als 200 Open-Source-Modelle, wahlweise als gemeinsam genutzte Bereitstellung oder in einer dedizierten Single-Tenant-Umgebung.
Im Mittelpunkt steht die Lokalisierung der Inferenz und nicht die Wahl des Modells, wobei drei Anwendungsfälle vorgesehen sind: Inferenz am Rand metropolitaner Netze zur Verringerung der Latenz, die Migration von Workloads von geschlossenen proprietären Modellen zu offenen Alternativen und souveräne KI für regulierte Unternehmen. Die Kennzahlen zur Präsenz verdeutlichen die Größenordnung des eingesetzten Netzwerks: mehr als 280 Rechenzentren in 77 Metropolregionen, 230 Cloud-On-Ramps und über 10.500 miteinander verbundene Unternehmen.
Beim Zeitplan ist jedoch Vorsicht geboten: In der Mitteilung von Equinix steht ausdrücklich, dass die Lösung ab dem ersten Quartal 2027 verfügbar sein wird, während Together AI seine Plattform als bereits in den weltweiten Rechenzentren von Equinix aktiv beschreibt. Es handelt sich um die Ankündigung einer Partnerschaft und einer Roadmap, nicht um eine Inbetriebnahme.
BenchMIRT, die Methode von Ai2 zur Prüfung dessen, was Benchmarks tatsächlich messen
1. September — Ai2 hat BenchMIRT veröffentlicht, eine Methode, die eine selten direkt behandelte Frage stellt: Misst ein Benchmark tatsächlich die Fähigkeit, die er zu messen vorgibt? Statt nur die Endpunktzahl zu betrachten, setzt sie auf der Ebene der einzelnen Fragen an und schätzt, welche Fähigkeiten den Erfolg tatsächlich bestimmen. Dabei stützt sie sich auf die aus der Psychometrie stammende Item-Response-Theorie (Item Response Theory) in ihrer multidimensionalen Variante. Das Training basierte auf den Ergebnissen von 100 Open-Weight-Modellen, 16 Benchmarks und mehr als 34.000 Fragen.
Das belastbarste Ergebnis ist methodischer Natur: Ohne vorzugeben, welcher Benchmark was messen sollte, brachte BenchMIRT von selbst zwei vorherrschende Dimensionen hervor — Sicherheit und allgemeines Schlussfolgern —, die bei einer vollständigen Wiederholung der Analyse identisch wiedergefunden wurden.
| Geprüfter Benchmark | Korrelation mit Schlussfolgern | Korrelation mit Sicherheit | Prüfergebnis |
|---|---|---|---|
| MMLU-Pro | 0,97 | -0,21 | Entspricht seinem erklärten Ziel |
| BBQ | 0,85 | -0,06 | Folgt trotz seines Status als Sicherheitstest dem Schlussfolgern |
| WMDP | -0,89 | 0,21 | Misst das Fehlen gefährlichen Wissens |
| ToxiGen | 0,40 | -0,32 | Bei beiden schwach, Benchmark bei 92 % gesättigt |
BBQ wurde entwickelt, um zu prüfen, ob sich ein Modell auf soziale Stereotype stützt, korreliert jedoch mit 0,85 mit dem allgemeinen Schlussfolgern und überhaupt nicht mit der Sicherheit: Eine schlechte Punktzahl sagt möglicherweise mehr über die Fähigkeit des Modells zum Schlussfolgern als über sein Verhalten aus. Der zweite Beitrag ist praktischer Natur: Durch die Sortierung der Fragen nach ihrer Trennschärfe zeigt Ai2, dass bei einer Beschränkung auf 10 % der Fragen ungefähr dieselbe Rangfolge der Modelle erhalten bleibt und dass die Methode die Antwort auf eine nicht beobachtete Frage in 79 % der Fälle korrekt vorhersagt, gegenüber 70 % bei einem naiven Ansatz. Zwei ausdrücklich eingeräumte Grenzen: Alle Trainingsmodelle stammen aus der Zeit vor März 2025, und die entdeckten Dimensionen hängen von der bereitgestellten Benchmark-Sammlung ab.
Runway Dev MCP: Der Coding-Agent übernimmt die Medienintegration
2. September — Runway hat Runway Dev MCP gestartet, einen gehosteten MCP-Server, der seine Entwicklerplattform direkt mit dem täglich verwendeten Coding-Tool verbindet — Claude, ChatGPT, Codex oder Cursor. Das Argument lässt sich in einem Satz zusammenfassen: Der Agent, der die Integration geschrieben hat, kann nun das passende Modell dafür auswählen, die verwendeten Tools konfigurieren und die Integration debuggen.
Der Dienst deckt die drei Phasen einer Integration ab. Vor dem ersten API-Aufruf fragt der Agent den Katalog ab, um zu erfahren, welche Modelle ein Projekt zu welchem Preis und mit welchen Eingaben verwenden kann, und ruft anschließend das genaue Request-Schema des ausgewählten Modells ab — mit dem Ziel, den ersten Aufruf direkt korrekt auszuführen, statt zu raten. In der Produktion erstellt und konfiguriert er einen Model Router, der je nach Kosten, Latenz oder Qualität zwischen mehreren Modellen entscheidet, wobei sich ein Kostenlimit pro Generierung festlegen lässt; außerdem kann er ermitteln, welches Modell der Router für einen bestimmten Aufruf ausgewählt hat. Dieselbe Logik gilt für Characters. Die dritte Phase ist das Debugging: Wenn eine Generierung fehlschlägt, ruft der Agent die Aufgabe über ein definiertes Tool ab und liest den genauen Ablehnungsgrund — Moderationsablehnung, Größenlimit eines Assets oder fehlerhaft formatierter Request-Body —, bevor er die Integration korrigiert und erneut ausführt. Ein Quickstart-Menü erstellt den API-Schlüssel und öffnet anschließend Claude Code, Codex oder Cursor mit einer bereits formulierten Nachricht.
DreamX-Creator 1.0, native Audio-Video-Generierung in 2K aus einem einzigen Bild
2. September — Das AMAP-Team von Alibaba hat DreamX-Creator 1.0 vorgestellt, ein Modell mit 7 Milliarden Parametern unter der Apache-2.0-Lizenz, das aus einem einzigen Bild und einem Text-Prompt einen nativ synchronisierten Video- und Audiostream in 2K erzeugt, ohne ein Video- und ein Audiomodell hintereinanderzuschalten.
Drei Bausteine bilden die Grundlage des Systems: eine gesteuerte modalitätsübergreifende Aufmerksamkeit (Gated Cross-Modal Attention) in Verbindung mit einem progressiven gemeinsamen Training, die eine bidirektionale Interaktion zwischen beiden Streams ermöglicht; Reinforcement Learning für Audio und Video, gespeist durch modalitätssensitives multimodales Feedback; und eine einstufige autoregressive Verfeinerung, die das Video auf 2K bringt und dabei die Bewegung sowie die zeitliche Abstimmung des Audios bewahrt.
Die Veröffentlichung ist zum jetzigen Zeitpunkt noch unvollständig. Das am Vortag initialisierte GitHub-Repository enthält die Projektvorstellung und die Roadmap, während der technische Bericht auf arXiv erschienen ist. Die validierten Gewichte, der Inferenzcode, die Konfigurationen und die Evaluierungswerkzeuge sind weiterhin als noch nicht erreichte Meilensteine aufgeführt. Die Arbeit baut auf Wan2.2 und MOVA von OpenMOSS auf, denen beiden ausdrücklich gedankt wird.
🔗 Ankündigung von DreamX-Creator 1.0
Die OpenAI API unterscheidet zwischen zu schnellem Hochskalieren und einer Modellüberlastung
2. September — OpenAI hat geändert, wie seine API zwei Situationen meldet, die Client-Anwendungen bislang nicht unterscheiden konnten.
| HTTP-Status | Fehlercode | Bedeutung | Empfohlenes Vorgehen |
|---|---|---|---|
| 429 | slow_down | Die Anfragerate ist zu schnell gestiegen | Retry-After beachten, Rate senken und anschließend schrittweise erhöhen |
| 503 | server_is_overloaded | Das angeforderte Modell ist vorübergehend überlastet | Retry-After beachten und erneut versuchen; bei anhaltendem Fehler die Wartezeit verlängern |
Diese Unterscheidung hat unmittelbare praktische Folgen für jeden Retry-Code. Die Dokumentation stellt klar, dass ein slow_down-Fehler selbst dann auftreten kann, wenn der Datenverkehr innerhalb der organisationsweiten Grenzwerte für Anfragen und Tokens pro Minute bleibt: Er weist nicht auf ein ausgeschöpftes Kontingent hin, sondern auf eine als zu abrupt bewertete Beschleunigung — mit anderen Worten kann eine Anwendung gedrosselt werden, ohne irgendeinen angezeigten Grenzwert überschritten zu haben. Der Leitfaden zu Ratenbegrenzungen nennt eine Faustregel: Sobald der Datenverkehr eine Million Eingabe-Tokens pro Minute erreicht hat, sollte er höchstens alle fünfzehn Minuten um 50 % erhöht werden. Wenn der Header Retry-After fehlt, empfiehlt OpenAI exponentielles Backoff mit einer kleinen zufälligen Verzögerung, damit nicht alle Instanzen desselben Dienstes gleichzeitig einen neuen Versuch starten. Organisationen, deren nutzungsabhängiger Datenverkehr regelmäßig an diese Grenzen stößt, werden auf Scale Tier und für GPT-5.6 sowie nachfolgende Modelle auf Reserved Tier verwiesen.
Kurzmeldungen
- Claude Code 2.1.258 — reine Fehlerbehebungsversion: Der seit 2.1.255 fehlerhafte Start unter macOS 12 Monterey funktioniert wieder, und entfernte sowie geplante Sitzungen schlagen nach einer erneuten Genehmigung von Berechtigungen nicht mehr fehl. 🔗 CHANGELOG
- Claude Campus Ambassadors — Bewerbungen sind in diesem Jahr für drei unterschiedliche Laufbahnen möglich: Grundstudium, weiterführendes Studium sowie Promotion und Postdoc-Phase. 🔗 Ankündigung
- Nokia analysiert 50 Millionen Codezeilen mit Cursor — Zwei Ingenieure der Sparte Core Networks erledigten dies in zwei Wochen, während das Team davon ausgegangen war, etwa ein Dutzend Fachleute mehrere Monate lang einsetzen zu müssen. Fallstudie des Anbieters ohne unabhängiges Messprotokoll. 🔗 Fallstudie
- TranslatePsy-Nano — Tether AI Research veröffentlicht zwei Familien kompakter Übersetzungsmodelle: EuroNano für neun europäische und AfriNano für acht afrikanische Sprachen, jeweils in Varianten mit 42, 31 und 17 MB sowie einem einzigen Checkpoint pro Sprachgruppe. 🔗 Ankündigung
- Puffin-World — ein einheitliches multimodales Modell, das die Welt durch drei native Zustände darstellt: Physik, Geometrie und Erscheinungsbild. Es wurde zusammen mit dem Datensatz Puffin-16M veröffentlicht. 🔗 Vorstellung
- Auf NVMe gespeicherte Experten eines MoE — i64 Systems belässt die Gewichte der Experten auf NVMe, prüft sie über ein SHA-256-Manifest und misst zwischen dem ausgelagerten und dem residenten Pfad bytegenau identische Ausgaben. 🔗 Technischer Beitrag
- Sakana AI auf der CiNet International Conference — CTO Llion Jones und Forscher Kai Arulkumaran werden vom 5. bis 7. Oktober 2026 in Osaka einen Vortrag über die Verbindungen zwischen Neurowissenschaften und Machine Learning halten. 🔗 Ankündigung
- Gemini CLI, Nightly vom 2. September — eine einzige Änderung: eine verbesserte Zielvalidierung und Verbindungsweiterleitung in den Dienstprogrammen zum Abrufen von Webinhalten, als Fortsetzung der Ende August begonnenen Netzwerkhärtung. 🔗 Versionshinweise
- MrBeast schließt eine mehrjährige Partnerschaft mit Google — Die Vereinbarung erweitert die Beziehung zu Beast Industries über YouTube hinaus auf Gemini und Google Health. Das erste Video erscheint am 5. September und zeigt, wie Gemini beim Überleben im Dschungel, in der Wüste und in der Arktis hilft. 🔗 Ankündigung
- Zusammenfassung der KI-Ankündigungen von Google im August — monatlicher Beitrag, der bereits im Laufe des Monats behandelte Punkte zusammenfasst, ohne eigene Neuigkeiten. 🔗 Zusammenfassung
- Enterprise Live Migrations allgemein verfügbar — nahezu unterbrechungsfreie Migration von Repositorys aus GitHub Enterprise Server in die Cloud mit Datenresidenz, gesteuert über die Erweiterung
gh elm. Kein Bezug zu KI; der Vollständigkeit halber erwähnt. 🔗 Changelog - ElevenLabs ernennt Ashley Kramer zur Chief Revenue Officer — die einzige Veröffentlichung des Unternehmens in diesem Zeitraum; der Produkt-Changelog wurde seit dem 24. August nicht aktualisiert. 🔗 Ankündigung
- NVIDIA überträgt einen DGX-Spark-Livestream zum Portable Computer von Perplexity — sechsundzwanzig Minuten zu dessen lokaler Ausführung, ohne Beschreibungstext oder Transkript. Es ist die zweite Demonstration des Tages, die DGX Spark als Ziel für eine lokale Portierung präsentiert. 🔗 Übertragung
- Kling AI dokumentiert die Elements seines MCP-Servers — Tutorial zur Wahrung der Identität einer Figur über mehrere Einstellungen hinweg; Produktanleitung und keine Markteinführung. 🔗 Tutorial
- Codex CLI 0.152.1 — Fehlerbehebungsversion, die rund zwanzig Stunden nach 0.152.0 erschien: Die Guardian-Genehmigungsprüfung berücksichtigt nun die über die Modellmetadaten übermittelten Richtlinien des Node-REPL. 🔗 Versionshinweise
- Cohere verteidigt den Einsatz kleiner Modelle in Unternehmen — Der Anbieter führt Command R7B, Tiny Aya mit 3,35 Milliarden Parametern und North Mini Code zusammen, dem im Coding Index von Artificial Analysis ein Wert von 33,4 zugeschrieben wird, um für die passende Dimensionierung zu argumentieren. Keine Markteinführung. 🔗 Beitrag
- Perplexity veröffentlicht zwei Lehrleitfäden — über persönliche Assistenten und die Erkennung von Halluzinationen. Der zweite beschreibt ein zweistufiges Post-Training: In der ersten Phase werden die Produktverhaltensweisen entwickelt, die zweite stützt sich auf schwierigere Rechercheaufgaben. 🔗 Leitfaden
Was das bedeutet
Der Preis ist zum wichtigsten Argument geworden, auch bei Frontier-Modellen. Drei Markteinführungen am selben Tag, und keine wirbt mit einem Rekordwert. Google behält für Gemini 3.8 Flash den Preis der vorherigen Generation bei und räumt ein, dass sein Modell mehr Tokens verbraucht — ein seltenes Eingeständnis, das die Preisfrage vom ausgewiesenen Tarif auf die tatsächlichen Kosten einer Aufgabe verlagert. Qwen beansprucht ausdrücklich die Spitze der Pareto-Grenze von Arena statt schlicht den ersten Platz. Meta beziffert seinen Fortschritt nicht in Benchmark-Punkten, sondern mit 20 % weniger Tool-Aufrufen und 25 % weniger Tokens. Die CursorBench-Tabelle liefert die aussagekräftigste Kennzahl des Tages: Mit 69,2 % kostet Gemini 3.8 Flash 2,38 Dollar pro Aufgabe, während ein vergleichbarer Wert bei Fable 5.1 4,80 Dollar und bei Opus 5 7,35 Dollar kostete. Die Spalte mit den Schritten zeigt allerdings, dass dieser Preis an anderer Stelle bezahlt wird — 161 Schritte gegenüber 44.
Die Entwicklung des Harness wird zu einem messbaren wirtschaftlichen Hebel. Der GitHub-Artikel ist das nützlichste Dokument des Tages für alle, die auf diesen Modellen aufbauen: vier Optimierungen, die das Modell selbst nicht verändern und jeweils 2 bis 5 % einsparen, einschließlich dokumentierter fehlgeschlagener Experimente. Der Leitfaden von Anthropic zur Agentenentwicklung sagt aus einer anderen Perspektive dasselbe — bereits beim Entwurf eine Cache-Trefferquote von 90 bis 99 % anstreben und die Kosten pro abgeschlossener Aufgabe statt pro Aufruf betrachten. Beide stimmen in einem Punkt überein, den das Wettrennen um Modelle verdeckt: Bei gleichbleibendem Modell bestimmt der Harness einen erheblichen Teil der Kosten, und Verbesserungen lassen sich nicht von einem Produkt auf ein anderes übertragen. GitHub belegt dies mit einer Optimierung, die bei Code Reviews wirksam war, im CLI jedoch die Kosten erhöhte.
Die Inferenz wandert auf den Arbeitsplatzrechner, und der Ort der Berechnung wird zu einem Designparameter. FastH3 ermöglicht Videogenerierung auf einem Mac oder Desktop-Rechner, Perplexity öffnet den Code einer Engine, die nur ein einziges Modell auf einem einzigen Hardwaretyp ausführt, Tether veröffentlicht Übersetzungsmodelle mit 17 MB, i64 Systems lässt MoE-Experten auf NVMe laufen, und Cohere plädiert für die passende Dimensionierung. Diese Entwicklung trifft von oben auf die von Equinix, NVIDIA und Together AI, die Inferenz aus Gründen der Latenz und Souveränität über 280 Rechenzentren verteilen. Der gemeinsame Nenner ist nicht Miniaturisierung, sondern Spezialisierung: Lily gewinnt, weil es alles außer Qwen3.6-35B-A3B auf Apple Silicon ablehnt, und Perplexity setzt darauf, dass diese enge Ausrichtung ein Vorteil und keine Einschränkung ist.
Kontrolle und Governance werden strenger und erfolgen inzwischen ebenso über Verträge wie über Technik. GitHub schreibt für Fable 5.1 die Datenspeicherung vor — mit einer Ausnahmeregelung, die am Ende des Kalenderjahres ausläuft —, ermöglicht zugleich jedem Unternehmensteam die Wahl des Standardmodells und entfernt am selben Tag sechs Modelle aus dem Katalog. Cursor verlagert die Ausführung der Agenten in das Netzwerk des Kunden, weist jedoch darauf hin, dass Transkriptionen weiterhin bei Cursor verarbeitet werden. Google beschränkt sein Cyberabwehrmodell unter schriftlich festgelegten Betriebsbedingungen auf 650 ausgewählte Partner. Mistral stellt ein chinesisches Modell aus Europa bereit und macht dies zum Verkaufsargument. Schließlich erinnert BenchMIRT daran, dass auch die Evaluierungswerkzeuge, auf denen ein Teil dieser Entscheidungen beruht, einer Prüfung bedürfen: Ein Benchmark für soziale Verzerrungen, der mit allgemeinem Schlussfolgern zu 0,85 und mit Sicherheit zu -0,06 korreliert, misst nicht das, was seine Bezeichnung verspricht.
Quellen
- Gemini 3.8 Flash und 3.8 Flash Cyber
- CursorBench-Ergebnisse
- Gemini 3.8 Flash in Cursor
- Vorstellung von Muse Spark 1.3
- Roadmap von Muse Spark
- Qwen3.8-Max-0902
- Ergebnisse von Code Arena WebDev
- FastH3 lokal auf DGX Spark und Apple Silicon
- Quellcode von Lily
- Offenlegung des Codes von Lily
- Claude Commerce Agents
- Repository commerce-agents
- Leitfaden zur Entwicklung von Handelsagenten
- Computer use im Hintergrund
- Cursor Self-Hosted Machines
- Claude Fable 5.1 in GitHub Copilot
- Genspark integriert Fable 5.1
- Wie wir KI-Programmierung kosteneffizienter machen
- Veraltete Copilot-Modelle
- Standardmodell in zentral verwalteten Unternehmenseinstellungen
- Auslieferungsprotokoll für August 2026
- Medien in GitHub CLI
- Fairwind Program
- Gemini CLI v0.58.0
- Changelog von Antigravity
- Kurze Videoübersichten in 70 Sprachen
- Zed v1.18.0
- GLM 5.2 in Vibe Code
- Co-Design und Speculative Decoding
- Die moderne CUDA-Toolbox in der Praxis
- Open Secure AI Alliance
- Equinix Inference Exchange
- BenchMIRT
- Runway Dev MCP
- DreamX-Creator 1.0
- Changelog der OpenAI API
- Claude Code CHANGELOG
- Claude Campus Ambassadors
- Nokia und Cursor
- TranslatePsy-Nano
- Puffin-World
- MoE-Experten auf NVMe
- Sakana AI auf der CiNet International Conference
- Gemini CLI, Nightly vom 2. September
- MrBeast, Gemini und Google Health
- KI-Ankündigungen von Google im August 2026
- Enterprise Live Migrations
- ElevenLabs ernennt Ashley Kramer
- DGX-Spark-Livestream und Perplexity Portable Computer
- Die Elements von Kling MCP
- Codex CLI 0.152.1
- Cohere und kleine Modelle
- Lehrleitfäden von Perplexity