ai-powered-markdown-translatorArtykuł przetłumaczony z francuskiego na polski za pomocą gpt-5.6-sol.
W tę niedzielę nie pojawił się żaden nowy model, ale są dwie konkretne nowości dla deweloperów. DeepSeek V4.1 Flash, wydany 10 września, trafia do Together AI w standardowej taryfie DeepSeek, a Together twierdzi, że kosztuje on trzy razy mniej na zadanie niż GPT-5.6 Sol — to deklaracja, którą należy odczytywać z uwzględnieniem pewnych niuansów; z kolei Perplexity pozwala jednorazowo zarejestrować serwer MCP w swoim Agent API. Sakana AI wraca do specjalnego wydania Royal Society, a trzech autorów społecznościowego bloga Hugging Face przygląda się — każdy na swój sposób — weryfikacji wyników.
Together AI udostępnia DeepSeek V4.1 Flash i twierdzi, że kosztuje on trzy razy mniej na zadanie niż GPT-5.6 Sol
13 września — DeepSeek V4.1 Flash trafia do Together AI zarówno w wariancie serverless, jak i jako dedykowane wdrożenie, w cenie 0,30 dolara za milion tokenów wejściowych i 1,20 dolara za milion tokenów wyjściowych: są to dokładnie ceny API DeepSeek w godzinach szczytu, które DeepSeek obniża o połowę poza godzinami szczytu.
Together twierdzi, powołując się na pomiary Artificial Analysis, że model przewyższa GPT-5.6 Sol w benchmarkach agentowych przy koszcie zadania równym jednej trzeciej:
| Porównywana miara | DeepSeek V4.1 Flash | GPT-5.6 Sol (high) |
|---|---|---|
| AutomationBench-AA | 69 % | 55 % |
| Terminal-Bench v4.0 | 27 % | 21 % |
| GDPval-AA v2 | 1632 | 1524 |
| Średni koszt zadania (Intelligence Index) | 0,27 dolara | 0,81 dolara |
Dwa zastrzeżenia: sama karta Together plasuje V4.1 Flash za GPT-5.6 Sol pod względem rozumowania (90,9 wobec 94,1 % w GPQA Diamond oraz 36,8 wobec 47 % w HLE), a w Terminal-Bench v4.0 przewaga zmierzona przez Artificial Analysis odwraca się w tabeli opublikowanej przez DeepSeek 10 września, która podawała wynik 31,2 dla V4.1 Flash wobec 39,9 dla GPT-5.6 Sol.
Perplexity otwiera swoje Agent API na niestandardowe konektory — serwer MCP rejestrowany raz na zawsze
13 września — Perplexity dodaje do swojego Agent API niestandardowe konektory (custom connectors). Administrator jednorazowo rejestruje zdalny serwer MCP w konektorach swojego projektu (Project), podając nazwę, URL, uwierzytelnianie za pomocą klucza API lub jego brak oraz transport Streamable HTTP albo SSE. Perplexity przechowuje klucz dostępu do serwera, a żądania wysyłane przy użyciu dowolnego klucza API projektu muszą jedynie wskazać identyfikator konektora za pomocą type: "connector".
Natomiast w przypadku serwera MCP przekazywanego w żądaniu (type: "mcp") jego URL i dane uwierzytelniające towarzyszą każdemu wywołaniu, wyłącznie przez Streamable HTTP. Konektory te rozszerzają funkcjonalność zarządzanych konektorów (managed connectors), które pojawiły się 27 sierpnia dla GitHub, Slack, Google Drive i Datadog, a obecnie jest ich sześć po dodaniu Linear i Notion. Odkrywanie narzędzi, domyślnie odroczone, sprawia, że model najpierw je wyszukuje, zanim załaduje potrzebne schematy, dlatego należy ustawić odpowiednio wysoki max_steps. Nie podano żadnej specjalnej taryfy.
🔗 Dokumentacja konektorów Perplexity 🔗 Dziennik zmian API Perplexity
W skrócie
- Sakana AI wraca do specjalnego wydania poświęconego modelom świata (world models) — opublikowany 12 września wpis w języku japońskim dotyczący wydania Philosophical Transactions of the Royal Society A, które ukazało się 14 maja 2026 roku i którego wstęp David Ha, dyrektor generalny Sakana AI, współtworzył z trzynastoma innymi autorami. Aktualnością jest sam wpis, a nie publikacja wydania. 🔗 źródło
- REINFORCE wydostaje się z pułapki, w której dokładne wznoszenie gradientowe pozostaje zablokowane — indywidualny wpis na społecznościowym blogu Hugging Face, a nie publikacja laboratorium: po czterdziestu dwóch rundach weryfikacji przeprowadzonych przez tego samego czytelnika RDTvlokip pokazuje, że po 20 000 kroków dokładne wznoszenie w żadnej z 12 prób nie prowadzi do jednoznacznego kodu (bijekcji), podczas gdy REINFORCE osiąga go w 11 z 12 prób. Wszystkie te liczby zależą jednak od optymalizatora Adam. 🔗 źródło
- Phionyx proponuje kontrakt dowodowy dla audytów AI — kolejny indywidualny wpis: Ali Toygar Abak chce zapobiec sytuacjom, w których dashboard lub raport po cichu rozszerza zakres tego, co rzeczywiście wynika z dowodu, na przykład gdy odrzucone wywołanie narzędzia zostaje ostatecznie przedstawione jako incydent powstrzymany przez mechanizm zabezpieczający. Jego propozycja, obejmująca osiem grup metadanych dołączanych do każdego twierdzenia, pozostaje planem prac inżynieryjnych i testów, bez wyników eksperymentalnych. 🔗 źródło
- darkc0de proponuje oceniać modele agentowe według czasu potrzebnego do uzyskania zweryfikowanego wyniku — trzeci indywidualny wpis: Sonny DeSorbo argumentuje, że słabszy, lecz szybszy model może poprawić się kilka razy, zanim wolny model zakończy swoją pierwszą próbę, i szkicuje benchmark Persistent Challenge Completion, który mierzy zweryfikowaną pracę na sekundę. To rozważania bez eksperymentów, których — jak zachęca autor — nie należy traktować zbyt poważnie. 🔗 źródło
Co to oznacza
Pierwszy wątek dotyczy narzędzi dla agentów. Dzięki niestandardowym konektorom serwer MCP staje się zasobem projektu, a nie parametrem powtarzanym w każdym żądaniu: administrator rejestruje go raz, Perplexity przechowuje jego klucz dostępu, a kod wywołujący Agent API nie musi już go przekazywać. Perplexity rozszerza w ten sposób na serwery MCP użytkowników — chronione kluczem API lub pozbawione uwierzytelniania — rozwiązanie znane z zarządzanych konektorów wprowadzonych pod koniec sierpnia, przy okazji obsługując transport SSE obok Streamable HTTP. Ceną za to jest odroczone odkrywanie narzędzi, które wymaga pozostawienia modelowi wystarczającej liczby kroków na ich wyszukanie przed rozpoczęciem działania. Podłączenie narzędzia staje się więc operacją administracyjną wykonywaną raz dla całego projektu, a nie ustawieniem odtwarzanym przy każdym wywołaniu.
Drugi wątek dotyczy ceny i sposobu pomiaru. Together AI oferuje otwarty model opublikowany na licencji MIT dokładnie w taryfie DeepSeek obowiązującej w godzinach szczytu: dla tych, którzy mogą skoncentrować wywołania poza godzinami szczytu, API DeepSeek pozostaje dwa razy tańsze. Eksponowany koszt zadania również należy interpretować z uwzględnieniem rozbieżności. Deklaracja Together dotyczy benchmarków agentowych, a nie rozumowania, w którym V4.1 Flash pozostaje za GPT-5.6 Sol. Nawet w przypadku benchmarku agentowego takiego jak Terminal-Bench v4.0 kolejność zależy od źródła: według Artificial Analysis V4.1 Flash wyprzedza GPT-5.6 Sol (27 wobec 21 %), ale w tabeli DeepSeek znajduje się za nim (31,2 wobec 39,9). Każdy z trzech dzisiejszych wpisów społecznościowych nawiązuje do tego samego wymogu weryfikacji: RDTvlokip poddał swoje wyniki czterdziestu dwóm rundom ponownej analizy przez tego samego czytelnika, Phionyx chce zapobiec sytuacjom, w których raport po cichu rozszerza zakres tego, co wynika z dowodu, a darkc0de proponuje mierzenie zweryfikowanej pracy na sekundę zamiast powodzenia przy pierwszej próbie. Niezależnie od tego, czy chodzi o wynik, koszt, czy wniosek z audytu, kluczowym pytaniem pozostaje, w jakich warunkach uzyskano daną liczbę.
Źródła
- Together AI na X, DeepSeek V4.1 Flash
- Together AI, karta modelu DeepSeek V4.1 Flash
- DeepSeek, strona Models & Pricing API
- DeepSeek, dziennik zmian API
- Perplexity, dokumentacja konektorów Agent API
- Perplexity, dziennik zmian API
- Sakana AI, wpis o specjalnym wydaniu Royal Society
- Hugging Face, Czterdzieści dwie kolejne rundy z tym samym czytelnikiem
- Hugging Face, Dostęp nie oznacza jeszcze weryfikowalności
- Hugging Face, Uwielbiam szybkość. Wszyscy uwielbiamy szybkość