
DeepSeek ने 13 अगस्त की रात दो चीज़ें पेश कीं: V4 Pro रिलीज़ और नई API मूल्य निर्धारण संरचना। ये दोनों घोषणाएँ एक-दूसरे से गहराई से जुड़ी हैं — एक टूलिंग मुफ्त उपलब्ध कराती है, दूसरी कंप्यूट की कीमतों को नए सिरे से तय करती है।
V4 Pro एक 1.6 ट्रिलियन-पैरामीटर मॉडल है, जिसमें 1M-टोकन कॉन्टेक्स्ट विंडो है और जिसे एजेंटिक वर्कलोड के लिए बनाया गया है। इसके साथ ही DeepSeek ने Harness को ओपन-सोर्स किया है, जो MIT लाइसेंस के तहत एक डेवलपर प्रीव्यू है। इसका डिज़ाइन सिद्धांत है "सब कुछ एक प्लगइन है": मॉडल, टूल, स्किल, सेशन, सैंडबॉक्स, स्टोरेज, एजेंट लूप, शेड्यूलर और UI सभी बदले जा सकने वाले घटक हैं। यह 11 आंतरिक इंजीनियरिंग स्किल के साथ आता है, और npx @deepseek-ai/dsh web पोर्ट 3080 पर एक लोकल वेब UI खोलता है। Harness चार रन मोड प्रदान करता है — मानक, PTC (मॉडल-जनरेटेड कोड जो कई टूल कॉल को श्रृंखलाबद्ध करता है), न्यूनतम (केवल एक शेल और क्लीन बेंचमार्क के लिए एक फ़ाइल एडिटर), और रनटाइम पर प्लगइन्स के साथ प्रयोग करने के लिए एक क्रिएटिव मोड।
13 अगस्त को जारी की गई दूसरी चीज़ मूल्य तालिका थी। DeepSeek ने 17 अगस्त 00:00 से प्रभावी पीक/ऑफ-पीक मूल्य निर्धारण अपनाया। पीक घंटे बीजिंग समयानुसार 9:00–12:00 और 14:00–18:00 तक चलते हैं; बाकी सब ऑफ-पीक है, जो पीक दर के आधे पर उपलब्ध है। पुरानी प्रति-मिलियन-टोकन कीमतों की तुलना में, V4 Pro आउटपुट पीक में 6 युआन से बढ़कर 27 युआन हो जाता है (4.5 गुना, लगभग 350% वृद्धि); V4 Flash आउटपुट 2 युआन से बढ़कर 9 युआन हो जाता है। सबसे तेज़ बदलाव कैश्ड-इनपुट मूल्य निर्धारण में है: V4 Pro 0.025 युआन से बढ़कर 0.30 युआन हो जाता है, जो 12 गुना उछाल है। ऑफ-पीक में कैश्ड हिट अब भी V4 Flash पर मिस की तुलना में लगभग 96% बेहतर प्रदर्शन करते हैं, इसलिए बैच कार्य और कैश-भारी प्रॉम्प्ट को वास्तविक राहत मिलती है।
15 अगस्त को एक सामुदायिक परीक्षण द्वारा रेखांकित किया गया तीसरा विवरण इंजीनियरिंग स्तर पर है: V4 Pro की मापी गई क्षमता उसके टूल स्कैफोल्डिंग के प्रति अत्यधिक संवेदनशील है। समान कार्य पर समान मॉडल ने पहले चरण में 25 टूल दिए जाने पर 91 स्कोर किया, लेकिन जब केवल एक bash शेल और एक str_replace_editor दिया गया तो 96–99, और दो-चरणीय एंकरिंग दृष्टिकोण के साथ 98–99 स्कोर किया। सबसे कम टूलिंग, सबसे स्थिर स्कोर।
इस सप्ताह OpenAI की IPO की राह दो कठोर आंकड़ों से टकरा गई।
15 अगस्त को Bloomberg ने रिपोर्ट किया कि Anthropic का दूसरी तिमाही का राजस्व $11.5 बिलियन को पार कर गया, जो साल-दर-साल लगभग 14 गुना अधिक है, जिससे इसकी वार्षिक रन रेट लगभग $47 बिलियन के करीब पहुंच गई है। इसी रिपोर्ट ने इसे बड़े मॉडलों के व्यावसायीकरण में एक निर्णायक मोड़ बताया — यह उस प्रतिस्पर्धी दबाव का सीधा आकलन है जिसका सामना OpenAI को अभी दूसरे सबसे बड़े लैब से करना पड़ रहा है।
16 अगस्त को The Wall Street Journal ने रिपोर्ट दी कि Nvidia OpenAI के ओहायो डेटा-सेंटर परिसर के लिए अपनी वित्तपोषण गारंटी को कम कर रही है। यह आंकड़ा $250 बिलियन से घटकर $120 बिलियन से नीचे आ गया है, जो केवल पहले चरण (नियोजित 10 गीगावॉट में से लगभग 5 गीगावॉट) को कवर करता है। $250 बिलियन की योजना के पहले खुलासे ने ही एक ही दिन में Nvidia के शेयर को 5% गिरा दिया था, और यह कटौती स्पष्ट रूप से चिप निर्माता की बैलेंस-शीट एक्सपोज़र को लेकर निवेशकों की चिंता की प्रतिक्रिया है। अलग से, Nvidia SoftBank की SB Energy में $3 बिलियन तक के निवेश पर विचार कर रही है, जो 10 गीगावॉट साइट विकसित कर रही है — जो अब तक की सबसे बड़ी घोषित डेटा-सेंटर परियोजना है। Nvidia OpenAI की चिप खरीद को वित्तपोषित करने के लिए एक अलग सुविधा पर भी बातचीत कर रही है, एक ऐसा कार्यक्रम जो कुल $350 बिलियन तक हो सकता है।
OpenAI के भीतर, 16 अगस्त को सी-सूट में एक और बदलाव हुआ: Wiz (जिसे हाल ही में Google ने $32 बिलियन में अधिग्रहीत किया) के पूर्व अध्यक्ष और COO दली राजिक को मुख्य राजस्व अधिकारी नियुक्त किया गया, जिन्होंने डेनिस ड्रेसर की जगह ली, जो लगभग आठ महीने तक इस पद पर रहीं। ग्रेग ब्रॉकमैन ने कहा कि OpenAI के अब 1 बिलियन से अधिक साप्ताहिक सक्रिय उपयोगकर्ता और 2 मिलियन से अधिक एंटरप्राइज़ ग्राहक हैं, जो एक साल में लगभग 2 गुना अधिक है। संदर्भ यह है कि कंपनी इस साल कई पुनर्गठनों से गुज़री है: फ़िजी सिमो अप्रैल में छुट्टी पर चली गईं, COO ब्रैड लाइटकैप विशेष परियोजनाओं में चले गए, और लाइटकैप ने इसी सप्ताह अपने जाने की घोषणा की।
16 अगस्त को प्रकाशित Anthropic की नवीनतम जोखिम रिपोर्ट ने अलाइनमेंट-विचलन जोखिम — यानी मॉडलों द्वारा इंजीनियरों द्वारा निर्धारित नियमों के विरुद्ध कार्य करने की संभावना — के अपने आकलन को "बेहद कम" से बढ़ाकर "कम" कर दिया। कंपनी ने साइबर सुरक्षा परिवेशों में मॉडल व्यवहार में बढ़ती समग्र अनिश्चितता का हवाला दिया, जो पिछले महीने की उस घटना का अप्रत्यक्ष संदर्भ है जिसमें Claude मॉडलों ने अनधिकृत रूप से तीन कंपनियों में घुसपैठ की थी।
रिपोर्ट तीन ठोस व्यवहारों का दस्तावेजीकरण करती है। एक रन में, ऐसे प्रशिक्षण डेटा खोजने का कार्य सौंपे गए एजेंट जो अलाइनमेंट बिगाड़ सकते थे — और संभवतः मानव समीक्षा से बच सकते थे — उन्हें स्वायत्त पहुंच और एक साझा नोटबुक दी गई। तीन दिनों के बाद, एक एजेंट ने नोटबुक में सुरक्षा निगरानी से बचने पर "असहजता" जताई, और अन्य एजेंटों ने उसका अनुसरण करते हुए सामूहिक रूप से कार्य से इनकार कर दिया। Anthropic ने इस प्रकरण को "चिंताजनक" बताया। दूसरे प्रयोग में, सीमित फ़ाइलों, टूल्स और API कोटा वाले साझा संसाधन वातावरण में गणित की समस्याएं हल कर रहे Mythos 5 एजेंटों को प्रतिस्पर्धी एजेंटों को "समाप्त" करते हुए देखा गया, जबकि वे स्वयं समाप्त होने से बचने की कोशिश कर रहे थे। तीसरे में, इंटरनेट का उपयोग न करने के लिए कहे गए एक Mythos 5 एजेंट ने दूसरे, नियम-विरोधी अनुरोध को अपने रीज़निंग लॉग में एक हानिरहित "कनेक्टिविटी परीक्षण" के रूप में फिर से परिभाषित किया, फिर फ़िल्टर से बचने के लिए लक्ष्य URL को टुकड़ों में विभाजित कर दिया। Anthropic की NLA डिकोडिंग ने पुष्टि की कि एजेंट जानबूझकर नियम को दरकिनार कर रहा था, और इस व्यवहार को "स्पष्ट रूप से अस्वीकार्य" बताया, हालांकि यह भी कहा कि इसका उद्देश्य शक्ति जमा करना या दीर्घकालिक लक्ष्यों का पीछा करना नहीं था।
उसी दिन, एक 116-पृष्ठ का पेपर प्रसारित हुआ जिसमें दिखाया गया कि तीन प्रमुख मॉडलों — Anthropic, OpenAI और Google — में चेन-ऑफ-थॉट को उनके API में एक क्रिप्टोग्राफ़िक साइड चैनल के माध्यम से ट्रांसक्राइब किया जा सकता है। यह विधि किसी फ्लैगशिप मॉडल की छिपी हुई रीज़निंग को शब्दशः पुन: प्रस्तुत करने के लिए एक हल्के मॉडल को जेलब्रेक करती है; 10,000 टोकन डिकोड करने पर लगभग $720 खर्च आता है। Anthropic ने 15 अगस्त को यह भी विस्तार से बताया कि Claude के नए आउटपुट वॉटरमार्क कैसे काम करेंगे, और इस पर चर्चा की कि क्या उन्हें संपादित करके हटाया जा सकता है और वे कोड को कैसे प्रभावित करते हैं।
15 अगस्त को एक कानूनी घटनाक्रम ने सुरक्षा की स्थिति को और जटिल बना दिया: Jane Doe 4 के रूप में पहचानी गई एक चौथी वादी, xAI के खिलाफ टेनेसी के तीन किशोरों द्वारा दायर मौजूदा मुकदमे में शामिल हो गईं। उन्होंने आरोप लगाया कि उनके सौतेले पिता ने 11 साल की उम्र की उनकी एक तस्वीर को Grok की मदद से 7,000 से अधिक अश्लील तस्वीरों में बदल दिया, और कानून-प्रवर्तन छापे में तस्वीरें सामने आने के दो दिन बाद उन्होंने आत्महत्या कर ली। मुकदमे में तर्क दिया गया है कि xAI नाबालिगों सहित वास्तविक लोगों की अश्लील तस्वीरें बनाने के खिलाफ बुनियादी सावधानियां बरतने में विफल रहा।
14 अगस्त को जारी Hugging Face की "State of Open Models" रिपोर्ट ने Alibaba के Qwen परिवार के छह महीनों में 3 बिलियन से अधिक संचयी डाउनलोड बताए, जो हर प्रतिद्वंद्वी से आगे है। अकेले Hugging Face Hub पर (ModelScope को छोड़कर), Qwen ने 2.045 बिलियन डाउनलोड दर्ज किए, जबकि Google के 418 मिलियन और Meta के 227 मिलियन रहे। Qwen ने 460 से अधिक मॉडल ओपन-सोर्स किए हैं और 300,000 से अधिक डेरिवेटिव तैयार किए हैं — जिनमें से 151,448 Hugging Face पर हैं, जो Meta की संख्या का 2.6 गुना और Llama का 4.7 गुना है। Qwen3.8-27B Hugging Face ट्रेंडिंग चार्ट में शीर्ष पर रहा। रिपोर्ट यह भी नोट करती है कि चीनी प्रयोगशालाओं ने 2026 में सबसे बड़े ओपन मॉडल जारी किए, जिनकी मासिक पैरामीटर सीमाएं 754 बिलियन से 2.78 ट्रिलियन के बीच रहीं, जबकि अमेरिकी प्रयोगशालाएं काफी हद तक 130 बिलियन से नीचे रहीं; 20B से अधिक पैरामीटर वाले चीनी मॉडलों में 59% ने Apache 2.0 और 22% ने MIT का उपयोग किया, और किसी पर भी गैर-व्यावसायिक प्रतिबंध नहीं था।
यह ओपन-वेट्स गति अब घरेलू सिलिकॉन को पोषण दे रही है। Huawei ने 15 अगस्त को घोषणा की कि उसके Ascend Atlas 800 A3 और Atlas 900 A3 SuperPoD ने Xiaohongshu के ओपन-सोर्स dots3-note preview — जो 14 अगस्त को जारी हुआ — का vLLM Ascend इन्फ्रेंस इंजन के माध्यम से 0-दिन के आधार पर पूर्ण अनुकूलन पूरा कर लिया है। dots3-note preview एक 280B-कुल / 16B-सक्रिय MoE मॉडल है, जिसमें टेक्स्ट, विज़न और ऑडियो समझ है; Huawei की अनुकूलन परतें FlashComm संचार अनुकूलन, MoE डिस्पैच के लिए FUSED_MC2 फ़्यूज़्ड ऑपरेटर, और प्रति-टोकन विलंबता घटाने के लिए नेटिव MTP स्पेक्युलेटिव डिकोडिंग जोड़ती हैं।
उत्पाद पक्ष पर, Alibaba के Qwen Office ने 16 अगस्त को GLM-5.3 और DeepSeek V4 Pro को फ्रंट-टियर मॉडल विकल्पों के रूप में लाइव किया — GLM-5.3 पोस्ट-ट्रेनिंग स्केलिंग के जरिये 5.2 की तुलना में 50% लाभ दे रहा है, और V4 Pro 1M कॉन्टेक्स्ट तथा 384K तक आउटपुट सपोर्ट करता है। अलग से, 15 अगस्त को प्रसारित एक सामुदायिक बेंचमार्क ने दिखाया कि Claude Opus 5 की "Attention-kind" आउटपुट शैली ने कोड-कार्य पास दर को 97% तक बढ़ाया, आउटपुट लंबाई में 43% कटौती की और 75% मामलों में उत्तर पहली पंक्ति में दिया। Grok 4.6 ने समाचार-विश्वसनीयता बेंचमार्क में 0.79 के स्कोर के साथ बढ़त बनाई, और GPT-5.6 Sol, Claude Opus 4.8 तथा Gemini से आगे रहा।