Szukaj

Boris Cherny nie koduje już ręcznie od listopada 2025, Gemini 3.7 Flash trafia do Google Search, Gemma przekracza miliard pobrań

Artykuł wygenerowany przez sztuczną inteligencję
Boris Cherny nie koduje już ręcznie od listopada 2025, Gemini 3.7 Flash trafia do Google Search, Gemma przekracza miliard pobrań

ai-powered-markdown-translator

Przetłumaczony artykuł z fr na pl za pomocą gpt-5.4-mini.

Zobacz projekt na GitHubie ↗

23 sierpnia dzień mówi mniej o nowych możliwościach, a bardziej o realnym użyciu. Boris Cherny, twórca Claude Code, wyjaśnia, że od listopada 2025 nie pisze już kodu ręcznie i przedstawia Claude’a na trzech poziomach możliwości; przy okazji uznaje rozwlekłość Opusa za priorytet do naprawy dla Anthropic. W Google Gemini 3.7 Flash, wydany 13 sierpnia, staje się najszybciej zaadaptowanym modelem Gemini i trafia do Google Search, podczas gdy otwarta rodzina Gemma przekracza miliard pobrań. Amp nadaje czytelne nazwy domenowe aplikacjom hostowanym na swoich orbach, a otwarty benchmark do przewidywania właściwości leków publikuje swój poziom szumu obok każdego wyniku.


Boris Cherny przedstawia Claude na trzech poziomach i nie koduje już ręcznie od listopada 2025

23 sierpnia — Twórca Claude Code rozkłada postęp modeli na trzy poziomy: kodować lepiej niż on; wykonywać lepiej niż on pracę inżynierską wokół kodu, od debugowania po projektowanie systemów; a następnie przewyższać większość ludzi w większości zadań możliwych do wykonania na komputerze. Umieszcza Claude’a na pierwszym poziomie i części drugiego, a Opus 4.8 wskazuje jako pierwszy model, który wydał mu się lepszy od niego. Dodał też zastrzeżenie: według Andersa Hejlsberga, twórcy TypeScript, pierwszy poziom być może wcale nie został jeszcze osiągnięty.

Back in Nov 2025 I fully stopped writing code by hand, though I continue to code (using agents) every day. […] But engineering is more than coding.

🇵🇱 W listopadzie 2025 całkowicie przestałem ręcznie pisać kod, choć nadal codziennie koduję (z agentami). […] Ale inżynieria to coś więcej niż samo kodowanie.@bcherny na X


Anthropic uznaje rozwlekłość Opusa za priorytet i dostarcza środek zaradczy

23 sierpnia — Zapytany o wady Opusa, Boris Cherny udziela bezpośredniej publicznej odpowiedzi: rozwlekłość jest zidentyfikowanym problemem i priorytetem dla zespołu. Na razie komenda claude /config outputStyle=concise aktywuje styl Concise ogłoszony 20 sierpnia. To jest właściwa informacja: Concise nie jest opcją dla wygody, ale tymczasową odpowiedzią na zachowanie, które zespół stara się naprawić u źródła.

Ta sama wymiana zawiera wskazówkę dotyczącą użycia sformułowaną dzień wcześniej, 22 sierpnia: Opus ma być zbyt rzadko wykorzystywany do iteracyjnej optymalizacji — zużycia CPU i pamięci, czasu CI, opóźnień, liczby klatek na sekundę — według powtarzalnego wzorca, iterować na X z profilerem i zestawem danych aż do osiągnięcia Y.

We know Opus is not perfect, and it is a big priority for the team to fix it.

🇵🇱 Wiemy, że Opus nie jest idealny, a naprawienie tego to duży priorytet dla zespołu.@bcherny na X

🔗 Opus i iteracyjna optymalizacja


Gemini 3.7 Flash trafia do Google Search po rekordowej adopcji

22 sierpnia — Sundar Pichai nie ogłasza nowego modelu: Gemini 3.7 Flash został wydany 13 sierpnia. Ogłasza adopcję, najszybszą w rodzinie Gemini, oraz wdrożenie: model działa teraz w Google Search, oprócz aplikacji Gemini. Przy starcie był dostępny tylko dla subskrybentów Pro i Ultra przez Spark, w Gemini Enterprise Agent Platform oraz przez API — jego wejście do Search zmienia skalę ekspozycji.

Oceniany benchmarkUzyskany wynikKoszt na zadanie (USD)
ARC-AGI-195,5 %0,12
ARC-AGI-284,6 %0,25

Gemini 3.7 Flash smashed previous Gemini growth records in its first week, making it our fastest growing model yet.

🇵🇱 Gemini 3.7 Flash pobił wcześniejsze rekordy wzrostu Gemini już w pierwszym tygodniu, co czyni go naszym najszybciej rosnącym modelem do tej pory.@sundarpichai na X

🔗 Wyniki ARC-AGI opublikowane 20 sierpnia przez ARC Prize


Gemma przekracza miliard pobrań, a Google publikuje repozytorium Awesome Gemma

20 sierpnia — Clement Farabet i Olivier Lacombe z Google DeepMind ogłaszają, że rodzina otwartych modeli Gemma przekroczyła łącznie miliard pobrań, a społeczność opublikowała ponad 100 000 wariantów w ciągu dwóch lat. Wymienione wdrożenia pokazują skalę tego zasięgu: NASA, Satlyt i Starcloud uruchamiają Gemmę na pokładzie satelitów do wbudowanej analizy obrazów; w Indiach National Health Authority zintegrował Gemmę 4 w Aarogya Setu 2.0, aby normalizować raporty medyczne. Po stronie badań C2S-Scale, zbudowany na Gemmie przez Yale i Google, zidentyfikował ścieżkę terapeutyczną przeciwnowotworową, później zweryfikowaną na żywych komórkach. Google uzupełnia ten kamień milowy o materiał dla deweloperów: repozytorium GitHub Awesome Gemma, oficjalny katalog projektów i samouczków tego ekosystemu.

Mierzony wskaźnikOgłoszona wartość
Łączna liczba pobrań Gemmaponad 1 miliard
Warianty opublikowane przez społecznośćponad 100 000
Projekty zgłoszone do Gemma Challengeponad 1 600

🔗 Wpis Google DeepMind


Amp nadaje czytelne nazwy domenowe portalom swoich orbów

23 sierpnia — Orb to zdalna, jednorazowa maszyna, na której Amp uruchamia agenta; portal to HTTP-owe wejście, które pozwala otworzyć w przeglądarce aplikację aktualnie budowaną na tym orbie. Każdy portal otrzymywał nieczytelny, automatycznie generowany adres, w rodzaju t-01a0095e-9568-whatever-p1234.onamp.dev — wystarczający do szybkiego podglądu, dużo mniej do linku przekazywanego zespołowi. Zastępują go trzy opcje: niestandardowy prefiks, domena osobista albo domena przestrzeni roboczej (workspace). Amp podaje przykład park.mixfox.org, zwykłego adresu służącego aplikacji hostowanej na orbie. Konfigurację można wykonać z poziomu zakładki Portal albo prosząc o to agenta. Podawany motyw jest równie ważny jak funkcjonalność: portale coraz mniej służą do jednorazowych podglądów, a coraz bardziej do trwałych aplikacji. Jedno ograniczenie pozostaje, co potwierdza Quinn Slack: udostępnianie nie wykracza poza granice przestrzeni roboczej.

🔗 Ogłoszenie Amp


LEADBOARD publikuje poziom szumu swoich benchmarków przewidywania leków

22 sierpnia — Kolektyw FINAL-Bench opublikował na Hugging Face otwarty benchmark przewidywania właściwości leków: 21 tabel, 7 dziedzin, 212 670 związków treningowych i 18 382 testowych. Artykuł jest mniej premierą, a bardziej demonstracją metodologiczną. W tabeli hERG zamiana podziału czasowego na losowy podnosi AUROC z 0,606 do 0,818, przy tych samych molekułach, fingerprintach, algorytmie i hiperparametrach: losowanie rozdziela tę samą serię chemiczną po obu stronach zbioru testowego. Drugi wniosek dotyczy jakości etykiet: poziom szumu hERG wynosi 0,421, a w 19 tabelach regresyjnych proste przewidywanie średniej daje najlepszy błąd bezwzględny w siedmiu z nich.

Podział danych hERGUzyskany AUROCMAE modeluMAE stałej
Czasowy, cięcie w 2022 roku0,6060,5990,589
Losowy, średnia z 5 seedów0,8180,4570,671

🔗 Artykuł FINAL-Bench na Hugging Face


Krótkie informacje

  • Dlaczego logowanie sesji z telefonu trwało tak długo — Dzień po wczorajszej zapowiedzi Boris Cherny wyjaśnia 22 sierpnia, że domyślne zabezpieczenia ustaliły harmonogram: zaufanie i weryfikacja urządzenia, ochrona przed prompt injection. Kolejne aktualizacje pojawią się później. 🔗 Wątek @bcherny
  • GitHub ponownie promuje cooldown Dependabota — Aktualizacje wersji niezwiązane z bezpieczeństwem czekają trzy dni, aby skanery mogły wykryć zatrutą wersję; poprawki bezpieczeństwa pozostają natychmiastowe. Opóźnienie regulowane przez cooldown. Wpis z 23 lipca ponownie promowany 23 sierpnia. 🔗 Tweet @github
  • Stable Audio 3.0 na Music Technology Hackathon w Montrealu — 48-godzinny hackathon 22 i 23 sierpnia z Music Hackspace i MUTEK, wokół narzędzi dla producentów muzyki. Stability AI broni tam otwartych wag: przejrzystości, kontroli artystycznej, prawa głosu w kwestii użycia technologii. 🔗 Wideo zamykające
  • DOOM działa na procesorze zaprojektowanym przez GPT-5.6 Sol — Model złożył w grze Turing Complete procesor RV32IM nazwany Codex-R32, na którym uruchamia się port PureDOOM skompilowany do natywnego kodu maszynowego. Demonstracja udostępniona 23 sierpnia przez @OpenAIDevs. 🔗 Wątek @Angaisb_

Co to oznacza

Żaden model nie został wydany w ten weekend, i właśnie dlatego ten dzień jest czytelny. To, co się zmienia, to wdrażanie istniejących modeli, liczba rąk, które z nich korzystają, oraz naprawianie tego, co przeszkadza w użyciu. Gracze pracują nad adopcją, nie nad samym ogłoszeniem.

W obszarze narzędzi deweloperskich świadectwo Borisa Cherny’ego jest ważne przede wszystkim przez granicę, którą stawia w tym samym zdaniu: kodowanie wydaje mu się rozwiązane dla części praktyków, inżynieria — nie, i starannie cytuje eksperta, dla którego pierwszy poziom nie został nawet osiągnięty. Uznanie rozwlekłości Opusa idzie w tym samym kierunku: domyślne zachowanie modelu staje się osobnym tematem produktowym. Konfiguracyjny środek zaradczy, taki jak outputStyle=concise, przerzuca ciężar na użytkownika, co Anthropic otwarcie akceptuje, nazywając go tymczasową poprawką.

Wdrożenie na skalę przybiera w ten weekend trzy różne formy. Gemini 3.7 Flash wychodzi poza obszar subskrybentów i deweloperów, by trafić do Search, co ekonomicznie uzasadnia koszt 0,25 USD na zadanie w ARC-AGI-2 przy wyniku 84,6 %. Gemma z kolei mierzy swoją adopcję pobraniami i wariantami społeczności, z wdrożeniami na orbicie i w zdrowiu publicznym, które nie przypominają żadnego demonstracyjnego przypadku użycia. Amp wreszcie wyciąga wnioski z użycia, którego nie przewidział: kiedy jednorazowe podglądy stają się trwałymi aplikacjami, trzeba nadać im stały adres.

Pozostaje kwestia pomiaru, a LEADBOARD trafia w odpowiedni moment. Różnica 0,21 punktu AUROC uzyskana bez zmiany ani jednej linii modelu, stała predykcja bijąca modele w siedmiu z dziewiętnastu tabel regresyjnych: wynik opublikowany bez podziału danych, poziomu szumu i trywialnych punktów odniesienia nie jest interpretowalny. To właśnie nadaje wagę liczbom ARC-AGI, na które tego samego weekendu zwrócił uwagę Google — pomiarom zewnętrznym, w trybie weryfikowanym, a nie wynikom własnym.


Źródła