खोजें

Sol-H3 वीडियो को उसके चलने की अवधि से भी तेज़ बनाता है, CMS Manhattan का निशाना प्रोसेसर पर, एक कॉर्पस 58 भाषाओं में 106 892 शोरों को समयांकित करता है

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
Sol-H3 वीडियो को उसके चलने की अवधि से भी तेज़ बनाता है, CMS Manhattan का निशाना प्रोसेसर पर, एक कॉर्पस 58 भाषाओं में 106 892 शोरों को समयांकित करता है

ai-powered-markdown-translator

लेख का fr से hi में अनुवाद gpt-5.6-sol द्वारा किया गया।

GitHub पर प्रोजेक्ट देखें ↗

NVIDIA Research ने Sol-H3 जारी किया है, जो एक inference स्टैक है और पाँच सेकंड का वीडियो उसकी चलने की अवधि से भी कम समय में बनाता है तथा Apache 2.0 लाइसेंस के अंतर्गत उपलब्ध है। उसी दिन एक प्रकाशक ने Hugging Face पर प्रोसेसर के लिए तैयार की गई मॉडलों की दो शृंखलाएँ प्रकाशित कीं, जिनके दावों को किसी माप ने प्रमाणित नहीं किया है; वहीं एक भारतीय टीम ने शोरयुक्त वाणी का ऐसा कॉर्पस खोला, जिसमें प्रत्येक समयांकन एक दस्तावेजीकृत सत्यापन शृंखला से गुजरता है। इसके अलावा, Google Research ने संघनन-रेखाओं से बचने वाले हवाई मार्गों के अपने परीक्षणों का विस्तार एशिया तक किया है।


Sol-H3 पाँच सेकंड का वीडियो 1,653 सेकंड में बनाता है, यानी उसके चलने से भी तेज़

7 सितंबर — NVIDIA Research की Efficient AI टीम ने अपने सिंगापुर प्रयोगशाला के साथ मिलकर MiniMax-H3 वीडियो मॉडल के लिए एक पूर्ण inference स्टैक Sol-H3 जारी किया है। परिणाम को एक वाक्य में कहा जा सकता है: आठ B300 Blackwell एक्सेलरेटर वाले सिस्टम पर 1344×768 रिज़ॉल्यूशन और प्रति सेकंड 24 फ़्रेम वाला पाँच सेकंड का वीडियो, उसी पास में बनाए गए स्टीरियो ऑडियो सहित, 1,653 सेकंड में तैयार होता है। इसलिए मॉडल क्लिप को दर्शक द्वारा उसे देखे जाने से भी तेज़ बनाता है।

तुलना पूर्ण प्रोफ़ाइलों के बीच है, केवल attention kernel में साधारण बदलाव की नहीं। संदर्भ प्रोफ़ाइल Base H3 Dense में scheduler के 50 चरण लगते हैं, यानी DiT नेटवर्क के 49 forward pass; Sol-H3 केवल चार का उपयोग करता है।

हार्डवेयर विन्यासबनाई गई अवधिBase H3, 50 चरणSol-H3, 4 चरणगति-वृद्धि
8× B3005 s18,250 s1,653 s11,04×
8× B30010 s50,660 s3,732 s13,57×
8× B30015 s99,513 s6,612 s15,05×
4× B3005 s35,328 s2,918 s12,11×
4× B30015 s194,930 s12,542 s15,54×
1× B3005 s129,898 s13,745 s9,45×

गति-वृद्धि अधिकतम 15,54× तक पहुँचती है, जो चार B300 पर पंद्रह सेकंड के वीडियो के लिए हासिल हुई। परीक्षण विधि असामान्य रूप से स्पष्ट है: warm-up के बाद तीन निष्पादनों की माध्यिका, समान prompt और seed के साथ; समय-मापन में text encoding, DiT denoising और VAE decoding शामिल हैं, लेकिन मॉडल लोड करना और अंतिम MP4 encoding शामिल नहीं हैं।

इस स्टैक में अलग-अलग विकसित किए गए दो घटक शामिल हैं: वीडियो inference runtime के लिए Sol-Engine और बिना दोबारा प्रशिक्षण के तत्काल लागू होने वाले विरल attention (sparse attention) के लिए Sol-Attn। इनके साथ fused kernels, QKV projections पर INT8 और outputs पर FP8 में inter-GPU communication, समानांतर तथा batch में किया गया VAE decoding और AdaLN parameters की caching भी शामिल हैं। विरल attention की तैयारी का समय 1,206 से घटकर 0,285 मिलीसेकंड, VAE decoding का समय 7,55 से घटकर 0,602 सेकंड हो जाता है और प्रति GPU लगभग 24 GB memory मुक्त होती है।

दो निर्णय इस प्रकाशन को प्रदर्शन से आगे भी उपयोगी बनाते हैं: code Apache 2.0 लाइसेंस के तहत जारी हुआ है और MiniMax-H3 के लिए पहले से प्रशिक्षित कोई भी कम-चरण वाला (few-step) LoRA इसी runtime से जुड़ सकता है। पहले ही दिन Reactor के साथ खुली API पहुँच इसे आज़माने के लिए आठ B300 को व्यस्त रखने की आवश्यकता समाप्त करती है।

For us, the bigger milestone is crossing from “fast generation” into “faster than playback.” That opens the path toward continuous 24 FPS generation and truly interactive video systems.

🇮🇳 हमारे लिए वास्तविक उपलब्धि «तेज़ निर्माण» से «चलने की अवधि से भी तेज़» तक पहुँचना है। यह 24 FPS पर निरंतर निर्माण और वास्तव में संवादात्मक वीडियो प्रणालियों का रास्ता खोलता है।X पर @xieenze_jr

🔗 Sol-H3 परियोजना पृष्ठ, NVIDIA Research

🔗 Reactor के माध्यम से पहले ही दिन API पहुँच


एक खुला कॉर्पस 58 भारतीय भाषाओं में 106 892 वास्तविक शोरों को समयांकित करता है

7 सितंबर — Indian Institute of Science की ARTPARK टीम ने Vaani Noise Event Timestamp Dataset जारी किया है, जो Project Vaani के स्वतःस्फूर्त वाणी कॉर्पस पर जोड़ी गई मानवीय annotation परत है। इसमें प्रत्येक पृष्ठभूमि शोर के प्रकार तथा मिलीसेकंड की सटीकता से उसके आरंभ और अंत के समय दर्ज हैं।

कॉर्पस का गुणमान
कुल annotation किया गया ऑडियो122 घंटे से अधिक
समयांकित शोर घटनाएँ106 892, 7 श्रेणियों में
वाणी खंड और वक्ता72 756 खंड, 38 541 आवाज़ें
भाषाई और भौगोलिक कवरेज58 भाषाएँ, 30 राज्य
सत्यापित समूह और अपरिष्कृत समूहलगभग 22 h और लगभग 100 h

विधि का मुख्य बिंदु यह है: वाणी और शोर को साधारण फ़ोन पर एक साथ रिकॉर्ड किया गया, बिना कृत्रिम शोर जोड़ने या बाद में mixing किए। खाँसी और हँसी जैसी गैर-वाचिक मानवीय ध्वनियाँ लगभग 38 प्रतिशत खंडों में दिखाई देती हैं, लेकिन आधे सेकंड से कम रहती हैं; पशुओं और यातायात की ध्वनियाँ अधिक दुर्लभ तथा कहीं लंबी हैं और मिलकर शोर की कुल अवधि में सबसे बड़ा हिस्सा रखती हैं। प्रत्येक समयांकन annotation, संगति सत्यापन, आंतरिक पुनःसत्यापन और फिर यादृच्छिक रूप से चुने गए कॉर्पस के दसवें हिस्से पर स्वतंत्र audit से गुजरता है: यदि केवल एक भी विफल होता है, तो पूरा batch दोबारा तैयार किया जाता है।

🔗 Hugging Face पर ARTPARK-IISc का लेख


CMS Manhattan ने बिना किसी सहायक benchmark के प्रोसेसर हेतु मॉडलों की दो शृंखलाएँ जारी कीं

6 सितंबर — प्रकाशक CMS Manhattan ने Hugging Face पर प्रोसेसर पर inference के लिए बनाए गए open-weight मॉडलों के दो प्रकाशन उपलब्ध कराए हैं, जिनका लक्ष्य graphics card नहीं है। दोनों लेख मॉडलों के प्रकाशक ने स्वयं प्रकाशित किए हैं और आगे की सारी जानकारी इसी रूप में प्रस्तुत है।

पहली, JiRack Ultra शृंखला, BitNet शैली के 1,58 bit ternary weights वाले चार मॉडलों को एक साथ लाती है, जो प्रकाशक के अनुसार DeepSeek-R1-Distill-Qwen-32B architecture से व्युत्पन्न हैं। सबसे रोचक तत्व quantization नहीं, बल्कि tokenizer है, जिसे routing, tool calling, robotic control tags और media के लिए समर्पित tokens के साथ विस्तारित किया गया है, जिससे agentic systems और embedded robotics को लक्ष्य बनाया गया है। दूसरी, JiRackDeltaNet_27b, 27 अरब parameters वाले Qwen 3.8 को DeltaNet architecture पर स्थानांतरित करती है, जो full attention और state-space models से संबंधित Gated DeltaNet layers को बारी-बारी से इस्तेमाल करता है तथा जिसके लिए 262 144 tokens का context घोषित किया गया है।

मॉडल शृंखलाप्रकाशक द्वारा घोषित आधारप्रकाशित weights का formatलाइसेंस और packaging
JiRack Ultra, चार आकारDeepSeek-R1-Distill-Qwen-32B1,58 bit ternary weights, GGUF Q2_K से Q4_K_M तकHub पर weights, Docker images और सदस्यता-आधारित interface
JiRack DeltaNet 27BQwen 3.8 27B को DeltaNet पर स्थानांतरित किया गयाFP16 से तैयार किए गए सामान्य GGUF llama.cppMIT लाइसेंस के तहत weights, Docker image और प्रति उपयोगकर्ता प्रति वर्ष 12 डॉलर का interface

पाठक के लिए दो आपत्तियाँ महत्त्वपूर्ण हैं। DeltaNet repository के ternary और bitnet labels के बावजूद, प्रकाशित GGUF शृंखला किसी अलग ternary checkpoint के बजाय सामान्य llama.cpp quantizations के अनुरूप है, जिसे लेख स्वयं स्वीकार करता है। और दूसरे लेख के शीर्षक में किया गया Opus 4.6 Max के निकट गुणवत्ता का दावा किसी benchmark परिणाम से समर्थित नहीं है: इन मॉडलों को केवल उनके documentation के बजाय वस्तुनिष्ठ रूप से परखने के लिए ठीक इसी की, यानी एक प्रकाशित तुलनात्मक माप की कमी है।

🔗 Hugging Face पर JiRack Ultra शृंखला

🔗 Hugging Face पर JiRack DeltaNet 27B


RL environments आज काम क्यों करते हैं और 2016 में क्यों नहीं करते थे

7 सितंबर — Sergio Paniego ने Hugging Face के blog पर एक पूर्वावलोकन प्रकाशित किया है, जिसकी शुरुआत एक चौंकाने वाले अवलोकन से होती है: दिसंबर 2016 में प्रकाशित OpenAI Universe का विवरण आज किसी अग्रणी प्रयोगशाला के लेख में ज्यों का त्यों आ सकता था। फिर भी repository archived है।

समयरेखा 2012 के Arcade Learning Environment से 2016 के OpenAI Gym और उसकी न्यूनतम शब्दावली, reset() और step(), तक जाती है, जो तब से Farama Foundation के अंतर्गत Gymnasium में स्थानांतरित हो चुकी है। इसके बाद domain-आधारित लहर आती है, World of Bits से WebArena और फिर SWE-bench तथा Terminal-Bench तक: कोई task अक्सर training ground बनने से पहले benchmark के रूप में शुरू होता है।

विश्लेषण का केंद्र 2016 में अनुपस्थित पाँच हिस्सों पर टिका है: शुरुआती बिंदु बनने योग्य कोई pre-trained model नहीं, पहुँच से बाहर task, machine के बजाय मानव के अनुरूप interface, sparse rewards के लिए कोई recipe नहीं और हज़ारों disposable sandboxes को orchestrate करने की असंभवता। आज GRPO और verifiable rewards चौथा हिस्सा उपलब्ध कराते हैं। लेख OpenEnv पर समाप्त होता है, जो Meta की PyTorch टीम और Hugging Face द्वारा अक्टूबर 2025 में घोषित standard interface है, तथा environments के उस बाज़ार पर, जिसमें Prime Intellect और Mechanize शामिल हैं।

🔗 RL environments का पूर्वावलोकन


Google ने Cathay Pacific की 80 से अधिक उड़ानों को संघनन-रेखाओं से बचने वाला मार्ग अपनाने में मदद की

7 सितंबर — Google Research ने Cathay Pacific को क्षेत्र का पहला वाणिज्यिक airline partner बनाते हुए संघनन-रेखाओं से बचाव के अपने परीक्षणों का विस्तार एशिया-प्रशांत तक किया है। कागज़ पर उपाय सरल है: ऊँचाई को थोड़ा समायोजित करके उन ठंडे और नम क्षेत्रों से बचना, जहाँ संघनन-रेखाएँ गर्मी रोकने वाली परतों के रूप में बनी रहती हैं।

पहले चरण का मापमान
Cathay Pacific network पर लक्षित उड़ानें100 से अधिक
वास्तव में बचाव वाला मार्ग अपनाने वाली उड़ानें80 से अधिक
संघनन-रेखाओं के तापवर्धक प्रभाव में अनुमानित कमीलगभग 40 %
लाभ में Hong Kong-Singapore corridor का हिस्सा50 % से अधिक
विमानन के जलवायु प्रभाव में संघनन-रेखाओं का हिस्सालगभग एक-तिहाई

यह व्यवस्था Google के models द्वारा तैयार predictions, satellite imagery और उन्नत मौसम संबंधी data को जोड़ती है। forecasts, onboard Wi-Fi और airline के electronic flight log (Electronic Flight Folder) के माध्यम से cockpit तक पहुँचते हैं, नियमित प्रक्रियाओं में बाधा डाले बिना, और समायोजन स्थापित safety parameters के भीतर रहते हैं। Contrails.org को partner बनाकर एक विस्तृत दूसरा चरण शुरू हो रहा है।

Contrail mitigation remains one of the most immediately available, scalable, and cost-effective ways to reduce aviation’s climate footprint, and it can get started now, with today’s aircrafts and fuel.

🇮🇳 संघनन-रेखाओं को कम करना विमानन की जलवायु छाप घटाने के सबसे तुरंत उपलब्ध, सर्वाधिक व्यापक रूप से लागू किए जा सकने वाले और सबसे किफ़ायती उपायों में से एक है, और इसे आज के विमानों तथा ईंधनों के साथ अभी शुरू किया जा सकता है। — Kemal Armada और Max Vogler, Google Research

🔗 Google Research का लेख


Genspark ने अपने तीन उत्पादों में Muse Spark 1.3 जोड़ा

7 सितंबर — Genspark ने घोषणा के पाँच दिन बाद Meta के model Muse Spark 1.3 को AI Chat, Code Agent और Claw से जोड़ा है। platform इस चयन को उचित ठहराने के लिए Meta द्वारा प्रस्तुत दो आँकड़े दोहराता है: tool calls में 20 प्रतिशत की कमी और token expenditure में 25 प्रतिशत की कमी—दो ऐसे metrics जो लंबे tasks पर loop में चलने वाले agent की लागत को सीधे प्रभावित करते हैं।

गति ही असली संकेत है। छह दिनों में Genspark ने अलग-अलग providers के चार models integrate किए: 2 सितंबर को Claude Fable 5.1, 3 को Gemini 3.8 Flash, 5 को GPT-6 Astra और 7 को Muse Spark 1.3। platform स्वयं को एक model की अपेक्षा orchestration layer के रूप में स्थापित करता है, जो सभी प्रयोगशालाओं की releases को उनके प्रकाशन के कुछ ही दिनों के भीतर समाहित कर लेती है।

🔗 X पर Genspark की घोषणा


संक्षिप्त समाचार

  • Replit ने लंदन में अपना पहला अंतरराष्ट्रीय कार्यालय खोला — कंपनी ने London के मेयर Sadiq Khan, ब्रिटिश सरकार और London & Partners के साथ मिलकर इसे अपने यूरोपीय परिचालनों का केंद्र बनाया है और बेरोज़गार तथा शिक्षा या प्रशिक्षण से बाहर युवा लंदनवासियों के कौशल-विकास के लिए TLMA के साथ एक प्रायोगिक कार्यक्रम की घोषणा की है। 🔗 प्रकाशन
  • Tolquane, संयोज्य समानांतरता की एक Python लाइब्रेरी — एक ही ग्राफ़ बिना कोड बदले threads, processes, async, distributed या sequential मोड में चलता है और वैश्विक लॉक के बिना Python 3.14t पर संदर्भ गति से 5.6 गुना तेज़ प्रदर्शन करता है, जबकि GIL के साथ threads में यह 0.9 गुना है। अवरोध न होना इसकी डिज़ाइन का नियम है और त्रुटि संदेश अवरुद्ध नोड्स के नाम बताता है। 🔗 लेख
  • एजेंट कौशल स्थापित करने के लिए समर्पित action — Aiden firmware अब किसी कौशल के URL को एकल action तक पहुँचाता है, जो उसे तैयार और सत्यापित करने के बाद परमाण्विक ढंग से प्रकाशित करता है। वास्तविक एजेंट पर इसे दोहराने से कई tools वाली trace घटकर एक ही call रह जाती है। 🔗 लेख
  • Together AI ने प्रति कार्य लागत के आधार पर GLM-5.3 Flash की तुलना GPT-5.6 Terra से की — Artificial Analysis के intelligence index पर दोनों का score समान है, लेकिन hosting provider के अनुसार प्रति कार्य लागत 82 प्रतिशत कम है; हालाँकि उसने न तो गणना की पद्धति प्रकाशित की है, न विस्तृत लेख, और तुलना किए गए model को वह स्वयं उपलब्ध कराता है। 🔗 प्रकाशन
  • ब्राज़ीलियाई AI पारिस्थितिकी तंत्र के लिए एक घोषणापत्र — पुर्तगाली भाषा में लिखा यह पाठ देश के AI समुदाय के लिए प्राकृतिक पारिस्थितिकी तंत्र के रूपक का विस्तार करता है, लेकिन इसमें कोई model, dataset या माप नहीं है। पूर्णता के लिए उल्लेखित। 🔗 लेख
  • Google DeepMind ने एशिया-प्रशांत में अपने AI for the Planet accelerator के लिए 16 संगठनों का चयन किया — इसका पहला समूह Singapore में एक गहन bootcamp के साथ शुरू हुआ, जिसके बाद AnthroKrishi, ForestCast, AlphaEarth Foundations, SpeciesNet और Perch models तक तीन महीने की पहुँच दी जाएगी; ये संगठन प्रकृति संरक्षण, सतत कृषि और carbon समाधानों के क्षेत्रों में विभाजित हैं। 🔗 लेख
  • GitHub ने अपने Copilot application के canvases को फिर प्रमुखता दी — 17 अगस्त के एक लेख को दोबारा प्रस्तुत किया गया है, जिसमें canvas को एक साझा और स्थायी सतह बताया गया था जहाँ कार्य की स्थिति दिखाई देती रहती है। इसमें एक ऐसा आँकड़ा भी है जो विरले ही प्रकाशित होता है: बताए गए दोनों उदाहरणों में से प्रत्येक को बनाने के लिए 2 000 से 3 000 AI Credits। 🔗 प्रकाशन
  • GitHub ने GitHub Universe के लिए alias generator उपलब्ध कराया — अक्टूबर 2026 के संस्करण से पहले की एक प्रचारात्मक सामुदायिक गतिविधि, जिसका न तो AI से संबंध है और न किसी product feature से। 🔗 प्रकाशन
  • Synthesia ने ECCV 2026 के लिए अपने तीन शोध क्षेत्रों का विवरण दिया — audio द्वारा संचालित generative avatars, speech recognition पर लागू voice research और interactive avatars, सभी मानव-केंद्रित world model की अवधारणा के अंतर्गत। 🔗 प्रकाशन
  • Mati Staniszewski के अनुसार संवादात्मक Turing test छह से बारह महीने दूर है — ElevenLabs के सह-संस्थापक और मुख्य कार्यकारी अधिकारी ने GDIY podcast में यह बात कही, जिसका साक्षात्कार कंपनी की audio service द्वारा फ़्रांसीसी में dub करके भी उपलब्ध कराया गया है। 🔗 प्रकाशन
  • QwenCloud ने Qwen Conference Thailand 2026 की रिपोर्ट प्रकाशित की — 4 सितंबर को Bangkok में लगभग 400 ग्राहक और developers शामिल हुए तथा शुरुआत से अंत तक ऐसा प्रदर्शन किया गया जिसमें agent स्वयं ग्राहक था और पंजीकरण से लेकर भुगतान तथा billing तक की पूरी प्रक्रिया बिना मानवीय हस्तक्षेप के हुई। 🔗 प्रकाशन
  • Cohere ने Toronto को वैश्विक AI केंद्र बताने वाली CNN की रिपोर्ट साझा की — बिना किसी product घोषणा वाला यह संचार CBRE के अनुसार तकनीकी प्रतिभा के मामले में शहर की विश्व में तीसरी रैंक, कनाडा की राष्ट्रीय रणनीति द्वारा प्रतिबद्ध 2 अरब डॉलर से अधिक की राशि और Anthropic models पर export controls लागू होने के बाद Cohere द्वारा बताई गई ग्राहक अनुरोधों की बढ़ोतरी का उल्लेख करता है। 🔗 प्रकाशन

इसका क्या अर्थ है

Sol-H3 द्वारा पार की गई सीमा किसी सूची में जुड़ा एक और रिकॉर्ड भर नहीं है। जब तक किसी clip को बनाने में उसे देखने से अधिक समय लगता है, video generation एक batch प्रक्रिया बनी रहती है: उसे शुरू किया जाता है, प्रतीक्षा की जाती है और फिर देखा जाता है। इस सीमा से नीचे पहुँचने पर उपयोग की एक नई श्रेणी खुलती है, जिसमें image देखते समय ही तैयार होती है। किसी व्यावहारिक विशेषज्ञ के लिए महत्वपूर्ण बात यह है कि यह लाभ किसी नए model से नहीं आया: model वही है, केवल inference stack बदला है। इसलिए 15 गुना सुधार weights में नहीं, बल्कि execution engineering में छिपा था, और इसे मौजूदा LoRA की अनुकूलता के साथ Apache 2.0 के अंतर्गत प्रकाशित किया गया है।

आज का परिदृश्य open weights प्रकाशित करने के दो तरीकों को आमने-सामने रखता है। एक ओर स्वयं प्रकाशित दो लेख हैं, जिनके गुणवत्ता संबंधी दावे किसी तुलनीय माप पर आधारित नहीं हैं; repository labels वास्तव में उपलब्ध कराए गए format से मेल नहीं खाते; और प्रति कार्य लागत की तुलना विजेता model के hosting provider ने किसी प्रकाशित पद्धति के बिना घोषित की है। दूसरी ओर speech corpus है, जिसमें प्रत्येक timestamp audit chain से गुज़रता है और team स्पष्ट रूप से 22 सत्यापित घंटों को उन 100 घंटों से अलग करती है जो सत्यापित नहीं हैं। ऐसी public repository में जहाँ कोई भी प्रकाशित कर सकता है, सत्यापन का अनुशासन ही एकमात्र उपयोगी संकेत बन जाता है और इसे तैयार करने की लागत किसी आकर्षक शीर्षक से अधिक होती है।

RL environments पर retrospective और Genspark की integration गति, दो अलग पैमानों पर, एक ही बदलाव की कहानी बताते हैं। पहला समझाता है कि 2016 का एक विचार आज क्यों काम करता है: कमी algorithms की नहीं, बल्कि उनके आसपास के infrastructure की थी—starting model से लेकर disposable sandboxes तक। दूसरा दिखाता है कि यह infrastructure उपलब्ध होने पर क्या रूप लेता है, जब कोई platform छह दिनों में चार providers के चार models जोड़ देता है। दोनों ही मामलों में मूल्य model से हटकर उसके आसपास की layer में पहुँच रहा है और यह layer standardize हो रही है—एक ओर OpenEnv और दूसरी ओर multi-model orchestrators।

अब वे काम बचते हैं जो models की दौड़ का हिस्सा नहीं हैं। Cathay Pacific के साथ परीक्षण मौजूदा विमानों और fuels से संबंधित है: इसमें केवल सही समय पर cockpit में पहुँचाया गया forecast जोड़ा गया है, जिससे संबंधित flights में लगभग 40 प्रतिशत की अनुमानित कमी आती है। Vaani corpus में 58 भारतीय भाषाएँ शामिल हैं, जिनमें से कई के लिए noisy speech का कोई resource उपलब्ध नहीं था, और DeepMind का Asia-Pacific accelerator सोलह field teams को specialized models वितरित करता है। इन तीनों कार्यों को किसी benchmark को हराना नहीं है। इनकी बाधा कहीं और है—एकत्र किए जाने वाले data और सफल बनाए जाने वाले deployment में—और demonstration तथा मापने योग्य प्रभाव के बीच का अंतर भी यहीं तय होता है।


स्रोत