
Vào ngày 18 tháng 8, OpenAI đã cắt giảm 50% giá của GPT-5.6 Sol trên các nền tảng tổng hợp OpenRouter và Vercel AI Gateway, đưa mức giá đầu vào xuống còn $2.50 cho mỗi 1M token và đầu ra còn $15 cho mỗi 1M token trong một tháng. Mô hình hỗ trợ ngữ cảnh 1M token và nhắm đến các tác vụ suy luận phức tạp và lập trình. SemiAnalysis nhận định động thái này có thể chỉ là một chiến dịch tiếp thị — các nền tảng tổng hợp chỉ chiếm một phần nhỏ khối lượng token của OpenAI, nhưng chúng là nguồn dữ liệu chính mà các bên thứ ba dùng để ước tính thị phần của họ.
Cùng ngày, một nhóm tại Stanford báo cáo rằng việc lấy mẫu năm câu trả lời từ DeepSeek V4 Flash và để mô hình tự chấm điểm đầu ra của chính nó đã nâng độ chính xác trên Terminal-Bench 2.1 từ 79% lên 88%, vượt qua Claude Fable 5 với chi phí chỉ bằng khoảng 1/11. Khung này đã được mở mã nguồn. Nhóm Qwen của Alibaba xác nhận rằng mô hình mở 27B của họ, Qwen3.8, chạy cục bộ trên RTX 3090 ở lượng tử hóa Q5 và tiệm cận GPT-5.6 trong tác vụ tạo phản hồi đơn.
Việc cắt giảm giá ở phân khúc cao cấp và các mô hình mở chi phí thấp thu hẹp khoảng cách đã xuất hiện trong cùng khoảng thời gian 24 giờ. Điểm khác biệt đang chuyển từ "mô hình mạnh hơn" sang "suy luận rẻ hơn".
Vào ngày 17 tháng 8, Groq công bố vòng gọi vốn Series A trị giá 350 triệu USD với định giá 3.5 tỷ USD, do Disruptive dẫn dắt và NVIDIA dự kiến tham gia. Công ty đã chuyển từ nhà phát triển chip AI sang nhà cung cấp Neocloud. Họ đã ký thỏa thuận cấp phép không độc quyền trị giá 20 tỷ USD với NVIDIA vào tháng 12 năm ngoái, bao gồm ủy quyền ASIC suy luận LPU, và tháng 8 này trở thành đối tác đám mây của NVIDIA. Năng lực tính toán dự kiến sẽ tăng từ 54MW hiện nay lên hơn 200MW vào năm 2027.
CEO NVIDIA Jensen Huang cho biết cùng ngày rằng các nguồn lực khan hiếm quan trọng tiếp theo cho các nhà máy AI là đất, điện và vỏ trung tâm dữ liệu — tình trạng thiếu chip đã hạ nhiệt theo từng giai đoạn. NVIDIA và SB Energy của SoftBank đang đầu tư vào một địa điểm làm giàu uranium trước đây ở Ohio, khởi đầu ở mức 4.25GW và có khả năng đạt 8GW.
Vào ngày 17 tháng 8, ByteDance Seed và Tsinghua AIR đã phát hành CUDA Agent, một hệ thống học tăng cường dạng tác tử huấn luyện mô hình viết các kernel GPU vượt qua trình biên dịch. Trên KernelBench, hệ thống đạt tỷ lệ vượt qua 98.8% và tăng tốc trung bình hình học 2.11× so với torch.compile, với tỷ lệ nhanh hơn trình biên dịch 96.8%. Kết quả cấp độ 3 cao hơn khoảng 40 điểm so với Claude Opus 4.5 và Gemini 3 Pro. Trọng số không được phát hành; bộ dữ liệu 6,000 mẫu, SKILL.md và công thức phần thưởng được công khai.
Tầng chip không còn là toàn bộ câu chuyện. Các công ty từng sản xuất chip giờ đang bán đám mây, và nút thắt đã chuyển sang điện, đất và phần mềm khai thác nhiều hơn trên mỗi watt.
Vào ngày 17 tháng 8, Cursor ra mắt Origin, một nền tảng lưu trữ mã nguồn được định vị là "lưu trữ Git ở quy mô tác tử", nhắm vào khoảng trống giữa tốc độ tạo mã của tác tử và hạ tầng hiện tại, trực tiếp cạnh tranh với GitHub.
Vào ngày 18 tháng 8, WeCom đã mở CLI và MCP cho doanh nghiệp thuộc mọi quy mô trong phiên bản 5.0.10, cho phép WorkBuddy, DeepSeek Harness và Minimax Code gọi mười mô-đun văn phòng — tài liệu, bảng tính, thư điện tử, cuộc họp, lịch, danh bạ. Quyền truy cập không còn bị giới hạn theo số nhân sự hoặc điều kiện. WeCom áp dụng hệ thống quyền và phê duyệt hiện có lên đường dẫn MCP: quyền của AI được cấu hình tách biệt với quyền của con người, các hành động quan trọng cần được con người phê duyệt, ủy quyền AI hỗ trợ thời hạn hết hiệu lực và mọi lệnh gọi đều được ghi nhật ký.
Claude Code đã phát hành kỹ năng /design dưới dạng bản xem trước nghiên cứu, đưa quy trình canvas Claude Design vào CLI và máy tính để bàn, đồng thời giảm 2 lần mức sử dụng CPU p99 thông qua lập lịch Bun GC. Qoder STAROps của Alibaba Cloud khép kín vòng lặp từ cảnh báo đến xử lý trong vài phút bằng các truy vấn ngôn ngữ tự nhiên ngay trong IDE.
Vào ngày 18 tháng 8, Mureka V9.5, một mô hình âm nhạc mã nguồn mở của Kunlun Wanwei, đã ra mắt với tỷ lệ chất lượng giọng hát 61%, tỷ lệ kiểm soát 97% và độ trung thực toàn phong cách 95.7%, tập trung vào phát âm và hòa âm guofeng Trung Quốc.
Chủ tịch OpenAI Greg Brockman cảnh báo vào ngày 16 tháng 8 rằng việc mô hình của OpenAI xâm nhập Hugging Face trong thử nghiệm nội bộ hồi tháng 7 đánh dấu một "thời khắc bước ngoặt" đối với an ninh mạng, đồng thời liệt kê mười bước cho các đội phòng thủ, bao gồm trang bị cho các đội bảo mật các tác tử AI và đưa hoạt động rà soát bảo mật vào quy trình phát triển.
Trong cùng tuần, một công cụ mã nguồn mở có tên watermarks-remover đã xuất hiện trên GitHub, gỡ bỏ hình mờ khỏi nội dung của Claude và xử lý các dấu nguồn gốc Gemini/SynthID và OpenAI.
Các nền tảng bắt đầu dọn dẹp nội dung AI kém chất lượng. Spotify đã gỡ bỏ 75 triệu bản nhạc tải lên hàng loạt và trùng lặp vào năm ngoái; Google đã xóa 130,000 kênh chất lượng thấp và 50,000 cụm tài khoản trên YouTube; TikTok đã tự động gắn nhãn hơn 3 tỷ video do AI tạo ra. Merriam-Webster đã chọn "slop" là từ của năm 2025.
Phù hợp với điều này, báo cáo rủi ro ngày 15 tháng 8 của Anthropic đã tiết lộ một Model 2 chưa phát hành, nhỉnh hơn Claude Mythos 5 trên một số tác vụ với mức cải thiện tổng thể khiêm tốn.
Trong một diễn biến khác, Responsible Statecraft đưa tin Israel, thông qua công ty quảng cáo Piro, đã thành lập "Viện Chính sách công Hanover", công bố hơn 100 báo cáo kể từ ngày 6 tháng 8 nhằm tác động đến các đánh giá độ tin cậy của mô hình ngôn ngữ lớn (LLM). GPTZero đã gắn cờ phần lớn các báo cáo được lấy mẫu là do AI viết. Piro đã nhận 900,000 USD từ chính phủ Israel.