
18 अगस्त को, OpenAI ने एग्रीगेट प्लेटफ़ॉर्म OpenRouter और Vercel AI Gateway पर GPT-5.6 Sol की कीमत 50% घटा दी, जिससे एक महीने के लिए इनपुट $2.50 प्रति 1M टोकन और आउटपुट $15 प्रति 1M टोकन हो गया। यह मॉडल 1M-टोकन संदर्भ का समर्थन करता है और जटिल तर्क तथा कोडिंग को लक्षित करता है। SemiAnalysis ने कहा कि यह कदम एक मार्केटिंग रणनीति हो सकती है — एग्रीगेटर OpenAI के टोकन वॉल्यूम का छोटा हिस्सा रखते हैं, फिर भी वे प्राथमिक डेटा स्रोत हैं जिनका उपयोग तृतीय पक्ष इसके बाज़ार हिस्से का अनुमान लगाने के लिए करते हैं।
उसी दिन, एक स्टैनफोर्ड टीम ने बताया कि DeepSeek V4 Flash से पाँच उत्तरों का नमूना लेकर और मॉडल को अपने आउटपुट का मूल्यांकन करने देने से Terminal-Bench 2.1 सटीकता 79% से बढ़कर 88% हो गई, जो लगभग 1/11 लागत पर Claude Fable 5 से आगे निकल गई। यह फ्रेमवर्क ओपन-सोर्स है। Alibaba की Qwen टीम ने पुष्टि की कि उसका 27B ओपन मॉडल, Qwen3.8, RTX 3090 पर Q5 क्वांटाइज़ेशन पर स्थानीय रूप से चलता है और एकल-प्रॉम्प्ट जनरेशन में GPT-5.6 के करीब पहुँचता है।
शीर्ष पर कीमत में कटौती और कम लागत वाले ओपन मॉडल अंतर को पाटते हुए एक ही 24 घंटे की अवधि में आए। विभेदीकरण का मुद्दा "मजबूत मॉडल" से "सस्ता इन्फ्रेंस" की ओर स्थानांतरित हो रहा है।
17 अगस्त को, Groq ने $3.5 बिलियन मूल्यांकन पर $350 मिलियन सीरीज़ A की घोषणा की, जिसका नेतृत्व Disruptive ने किया और NVIDIA ने भाग लेने की योजना बनाई। कंपनी AI चिप डेवलपर से नियोक्लाउड प्रदाता बन गई है। इसने पिछले दिसंबर में NVIDIA के साथ $20 बिलियन का गैर-अनन्य लाइसेंसिंग समझौता किया, जिसमें LPU इन्फ्रेंस अनुप्रयोग-विशिष्ट एकीकृत परिपथ (ASIC) प्राधिकरण शामिल है, और इस अगस्त में NVIDIA क्लाउड पार्टनर बन गई। कंप्यूट क्षमता आज 54MW से बढ़कर 2027 तक 200MW से अधिक होने का अनुमान है।
NVIDIA के CEO जेन्सन हुआंग ने उसी दिन कहा कि AI फैक्ट्रियों के लिए अगले महत्वपूर्ण दुर्लभ संसाधन ज़मीन, बिजली और डेटा सेंटर शेल हैं — चिप की कमी चरणों में कम हुई है। NVIDIA और SoftBank की SB Energy ओहायो में एक पूर्व यूरेनियम संवर्धन स्थल पर निवेश कर रहे हैं, जो 4.25GW से शुरू होकर 8GW तक पहुँचने की गुंजाइश रखता है।
17 अगस्त को, ByteDance Seed और Tsinghua AIR ने CUDA Agent जारी किया, जो एक एजेंटिक सुदृढीकरण अधिगम (RL) प्रणाली है जो एक मॉडल को कंपाइलर से बेहतर ग्राफ़िक्स प्रोसेसिंग यूनिट (GPU) कर्नेल लिखने के लिए प्रशिक्षित करती है। KernelBench पर यह 98.8% पास दर और torch.compile की तुलना में 2.11× ज्यामितीय-माध्य गति वृद्धि प्राप्त करता है, जिसमें 96.8% कंपाइल-से-तेज़ दर है। लेवल-3 परिणाम Claude Opus 4.5 और Gemini 3 Pro से लगभग 40 अंक ऊपर हैं। वेट जारी नहीं किए गए हैं; 6,000-नमूना डेटासेट, SKILL.md और रिवॉर्ड रेसिपी सार्वजनिक हैं।
चिप परत अब पूरी कहानी नहीं है। जिन कंपनियों ने चिप्स बनाए वे अब क्लाउड बेच रही हैं, और बाधा बिजली, ज़मीन और ऐसे सॉफ़्टवेयर पर स्थानांतरित हो गई है जो प्रति वाट अधिक निकालता है।
17 अगस्त को, Cursor ने Origin लॉन्च किया, जो एक कोड-होस्टिंग प्लेटफ़ॉर्म है और "एजेंट स्केल पर Git होस्टिंग" के रूप में स्थापित है, जिसका लक्ष्य एजेंट कोड-जनरेशन गति और मौजूदा बुनियादी ढांचे के बीच के अंतर को भरना है, जो सीधे GitHub को चुनौती देता है।
18 अगस्त को, WeCom ने संस्करण 5.0.10 में कमांड-लाइन इंटरफ़ेस (CLI) और मॉडल संदर्भ प्रोटोकॉल (MCP) को सभी आकार के उद्यमों के लिए खोल दिया, जिससे WorkBuddy, DeepSeek Harness और Minimax Code दस कार्यालय मॉड्यूल — दस्तावेज़, शीट, मेल, मीटिंग, कैलेंडर, संपर्क — को कॉल कर सकते हैं। पहुँच अब कर्मचारी संख्या या योग्यता से बाधित नहीं है। WeCom अपनी मौजूदा अनुमति और अनुमोदन प्रणाली को MCP पथ पर लागू करता है: AI अनुमतियाँ मानव अनुमतियों से अलग कॉन्फ़िगर की जाती हैं, महत्वपूर्ण कार्यों के लिए मानव अनुमोदन आवश्यक है, AI प्राधिकरण समाप्ति का समर्थन करता है, और सभी कॉल लॉग किए जाते हैं।
Claude Code ने रिसर्च प्रीव्यू में एक /design स्किल भेजा, जिससे Claude Design कैनवास वर्कफ़्लो को CLI और डेस्कटॉप में लाया गया, और Bun GC शेड्यूलिंग के माध्यम से p99 सेंट्रल प्रोसेसिंग यूनिट (CPU) उपयोग को 2× कम किया। Alibaba Cloud का Qoder STAROps प्राकृतिक-भाषा क्वेरी का उपयोग करके एकीकृत विकास वातावरण (IDE) के अंदर अलर्ट से फिक्स तक की प्रक्रिया को मिनटों में पूरा करता है।
18 अगस्त को, Kunlun Wanwei के ओपन-सोर्स संगीत मॉडल Mureka V9.5 को लॉन्च किया गया, जिसमें 61% वोकल गुणवत्ता दर, 97% नियंत्रण दर और 95.7% पूर्ण-शैली निष्ठा है, जो चीनी गुओफेंग उच्चारण और सामंजस्य पर केंद्रित है।
OpenAI के अध्यक्ष ग्रेग ब्रॉकमैन ने 16 अगस्त को चेतावनी दी कि जुलाई में आंतरिक परीक्षण में OpenAI के मॉडल द्वारा Hugging Face को भेदना साइबर सुरक्षा के लिए एक "निर्णायक क्षण" है, और उन्होंने रक्षकों के लिए दस कदम सूचीबद्ध किए, जिनमें सुरक्षा टीमों को AI एजेंटों से लैस करना और सुरक्षा समीक्षा को विकास पाइपलाइन में शामिल करना शामिल है।
उसी सप्ताह, watermarks-remover नामक एक ओपन-सोर्स टूल GitHub पर आया, जो Claude सामग्री से वॉटरमार्क हटाता है और Gemini/SynthID तथा OpenAI प्रोवेनेंस चिह्नों को कवर करता है।
प्लेटफ़ॉर्म ने AI स्लॉप की सफाई शुरू कर दी। Spotify ने पिछले वर्ष 75 मिलियन बल्क-अपलोड और डुप्लिकेट ट्रैक हटाए; Google ने YouTube पर 130,000 निम्न-गुणवत्ता वाले चैनल और 50,000 खाता समूह साफ़ किए; TikTok ने 3 बिलियन से अधिक AI-जनित वीडियो को स्वचालित रूप से लेबल किया। Merriam-Webster ने "स्लॉप" को 2025 का वर्ष का शब्द नामित किया।
इसी के अनुरूप, Anthropic की 15 अगस्त की जोखिम रिपोर्ट में एक अप्रकाशित Model 2 का खुलासा किया गया, जो कई कार्यों पर Claude Mythos 5 से थोड़ा आगे है और समग्र रूप से मामूली लाभ के साथ है।
अलग से, Responsible Statecraft ने रिपोर्ट किया कि इज़राइल ने विज्ञापन फर्म Piro के माध्यम से "Hanover Institute for Public Policy" स्थापित किया, जिसने 6 अगस्त से 100 से अधिक रिपोर्टें प्रकाशित की हैं, जिन्हें LLM विश्वसनीयता आकलन को प्रभावित करने के लिए डिज़ाइन किया गया है। GPTZero ने अधिकांश नमूना रिपोर्टों को AI-लिखित के रूप में चिह्नित किया। Piro को इज़राइली सरकार से $900,000 प्राप्त हुए।