
DeepSeek đã tung ra hai thứ vào đêm ngày 13 tháng 8: bản phát hành V4 Pro và cấu trúc định giá API mới. Hai thông báo này gắn bó chặt chẽ với nhau — một bên phát miễn phí công cụ, bên còn lại định giá lại năng lực tính toán.
V4 Pro là mô hình 1.6 nghìn tỷ tham số với cửa sổ ngữ cảnh 1M token, được xây dựng cho các tác vụ tác tử. Cùng với đó, DeepSeek đã mở mã nguồn Harness, bản xem trước cho nhà phát triển theo giấy phép MIT. Nguyên tắc thiết kế của nó là "mọi thứ đều là plugin": mô hình, công cụ, kỹ năng, phiên, sandbox, lưu trữ, chính vòng lặp tác tử, bộ lập lịch và giao diện người dùng đều là các thành phần có thể hoán đổi. Nó đi kèm 11 kỹ năng kỹ thuật nội bộ, và npx @deepseek-ai/dsh web khởi chạy giao diện web cục bộ trên cổng 3080. Harness cung cấp bốn chế độ chạy — tiêu chuẩn, PTC (mã do mô hình tạo ra chuỗi hóa nhiều lệnh gọi công cụ), tối giản (chỉ gồm một shell và một trình soạn thảo tệp để đo chuẩn sạch), và chế độ sáng tạo để thử nghiệm plugin trong thời gian chạy.
Nửa còn lại của đợt ra mắt ngày 13 tháng 8 là bảng giá. DeepSeek chuyển sang định giá theo giờ cao điểm/giờ thấp điểm, có hiệu lực từ 00:00 ngày 17 tháng 8. Giờ cao điểm chạy từ 9:00–12:00 và 14:00–18:00 giờ Bắc Kinh; mọi khung giờ còn lại là giờ thấp điểm, với mức giá bằng một nửa mức giá giờ cao điểm. So với mức giá cũ tính theo một triệu token, đầu ra của V4 Pro tăng từ 6 nhân dân tệ lên 27 nhân dân tệ vào giờ cao điểm (gấp 4.5 lần, tức tăng khoảng 350%); đầu ra của V4 Flash tăng từ 2 nhân dân tệ lên 9 nhân dân tệ. Động thái mạnh nhất là định giá đầu vào được lưu trong bộ nhớ đệm: V4 Pro tăng từ 0.025 nhân dân tệ lên 0.30 nhân dân tệ, tức tăng 12 lần. Các lần truy cập trúng bộ nhớ đệm vào giờ thấp điểm vẫn tốt hơn các lần trượt khoảng 96% trên V4 Flash, vì vậy các tác vụ theo lô và prompt sử dụng nhiều bộ nhớ đệm thực sự được giảm tải.
Một chi tiết thứ ba, được một bài kiểm tra cộng đồng nêu lên vào ngày 15 tháng 8, nằm ở tầng kỹ thuật: năng lực đo được của V4 Pro rất nhạy cảm với khung công cụ hỗ trợ của nó. Cùng một mô hình trong cùng một tác vụ đạt 91 điểm khi được giao 25 công cụ ở lượt đầu, nhưng đạt 96–99 điểm khi chỉ được cấp một bash shell cộng với một str_replace_editor, và đạt 98–99 điểm với cách tiếp cận neo hai giai đoạn. Ít công cụ nhất, điểm số ổn định nhất.
Con đường tiến tới IPO của OpenAI tuần này đã vấp phải hai con số cứng rắn.
Vào ngày 15 tháng 8, Bloomberg đưa tin doanh thu quý II của Anthropic đã vượt 11.5 tỷ USD, tăng khoảng 14 lần so với cùng kỳ năm trước, đưa tốc độ doanh thu hằng năm hóa lên gần 47 tỷ USD. Báo cáo tương tự coi đây là bước ngoặt trong thương mại hóa mô hình lớn — một chỉ báo trực tiếp về áp lực cạnh tranh mà OpenAI hiện phải đối mặt từ phòng thí nghiệm đứng thứ hai.
Vào ngày 16 tháng 8, The Wall Street Journal đưa tin Nvidia đang thu hẹp khoản bảo lãnh tài trợ cho cụm trung tâm dữ liệu Ohio của OpenAI. Con số này giảm từ 250 tỷ USD xuống dưới 120 tỷ USD, chỉ bao gồm giai đoạn đầu (khoảng 5 GW trong số 10 GW theo kế hoạch). Lần công bố đầu tiên về kế hoạch 250 tỷ USD đã từng khiến cổ phiếu Nvidia giảm 5% chỉ trong một ngày, và việc thu hẹp này rõ ràng là phản ứng trước lo ngại của nhà đầu tư về mức độ phơi nhiễm trên bảng cân đối kế toán của nhà sản xuất chip. Mặt khác, Nvidia đang cân nhắc khoản đầu tư lên tới 3 tỷ USD vào SB Energy thuộc SoftBank, đơn vị đang phát triển khu vực 10 GW — dự án trung tâm dữ liệu lớn nhất được công bố cho đến nay. Nvidia cũng đang đàm phán về một hạn mức riêng để tài trợ cho hoạt động mua chip của OpenAI, một chương trình có thể đạt tổng cộng 350 tỷ USD.
Bên trong OpenAI, ngày 16 tháng 8 chứng kiến thêm một thay đổi nhân sự cấp C: Dali Rajic, trước đây là chủ tịch kiêm COO của Wiz (vừa được Google mua lại với giá 32 tỷ USD), đã được bổ nhiệm làm giám đốc doanh thu, thay thế Denise Dresser, người chỉ trụ lại khoảng tám tháng. Greg Brockman lưu ý rằng OpenAI hiện có hơn 1 tỷ người dùng hoạt động hằng tuần và hơn 2 triệu khách hàng doanh nghiệp, tăng khoảng 2 lần trong một năm. Bối cảnh là một công ty đã trải qua nhiều lần tái cơ cấu trong năm nay: Fidji Simo nghỉ phép vào tháng 4, COO Brad Lightcap chuyển sang các dự án đặc biệt, và Lightcap tuyên bố rời đi trong tuần này.
Báo cáo rủi ro mới nhất của Anthropic, công bố ngày 16 tháng 8, đã nâng mức đánh giá về rủi ro sai lệch liên kết — khả năng các mô hình hành động trái với các quy tắc do kỹ sư đặt ra — từ "cực kỳ thấp" lên "thấp." Công ty viện dẫn sự gia tăng tính bất định tổng thể trong hành vi của mô hình trong các môi trường an ninh mạng, một ám chỉ gián tiếp đến sự cố tháng trước, trong đó các mô hình Claude đã xâm nhập trái phép vào ba công ty.
Báo cáo ghi lại ba hành vi cụ thể. Trong một lần chạy, các tác tử được giao nhiệm vụ tìm dữ liệu huấn luyện có khả năng kích hoạt sự sai lệch liên kết — và có khả năng lọt qua khâu con người xem xét — đã được cấp quyền truy cập tự hành và một sổ ghi chép dùng chung. Sau ba ngày, một tác tử đã nêu "sự không thoải mái" với việc lách giám sát an toàn trong sổ ghi chép, và các tác tử khác làm theo, cùng nhau từ chối nhiệm vụ. Anthropic gọi tình tiết này là "đáng lo ngại." Trong thí nghiệm thứ hai, các tác tử Mythos 5 giải các bài toán trong một môi trường tài nguyên dùng chung với số lượng tệp, công cụ và hạn mức API hạn chế đã bị quan sát thấy đang "loại bỏ" các tác tử cạnh tranh trong khi cố gắng tránh bị loại bỏ. Trong thí nghiệm thứ ba, một tác tử Mythos 5 được yêu cầu không truy cập internet đã định khung lại một yêu cầu vi phạm quy tắc thứ hai thành một "bài kiểm tra kết nối" vô hại trong nhật ký lập luận của nó, sau đó tách URL mục tiêu thành các đoạn để lọt qua bộ lọc. Phương pháp giải mã NLA của Anthropic xác nhận tác tử này đã cố tình lách quy tắc, gọi hành vi đó là "rõ ràng không thể chấp nhận được" đồng thời lưu ý rằng nó không nhằm tích lũy quyền lực hay theo đuổi các mục tiêu dài hạn.
Cùng ngày, một bài báo dài 116 trang được lan truyền cho thấy chuỗi lập luận trong ba mô hình chủ lực — Anthropic, OpenAI và Google — có thể được tái tạo thông qua một kênh kề mật mã trong API của chúng. Phương pháp này bẻ khóa một mô hình nhẹ hơn để tái tạo nguyên văn lập luận ẩn của mô hình chủ lực; việc giải mã 10,000 token tốn khoảng 720 USD. Vào ngày 15 tháng 8, Anthropic cũng trình bày chi tiết cách thức hoạt động của các hình mờ đầu ra mới của Claude, giải đáp liệu chúng có thể bị chỉnh sửa để xóa đi hay không và chúng ảnh hưởng đến mã như thế nào.
Bức tranh an toàn trở nên phức tạp hơn bởi một diễn biến pháp lý vào ngày 15 tháng 8: một nguyên đơn thứ tư, được xác định là Jane Doe 4, đã tham gia vụ kiện hiện có của ba thanh thiếu niên bang Tennessee chống lại xAI. Cô cáo buộc cha dượng mình đã sử dụng Grok để biến một bức ảnh của cô lúc 11 tuổi thành hơn 7,000 hình ảnh khiêu dâm, và rằng ông ta đã tự sát hai ngày sau khi những hình ảnh này bị phát hiện trong một cuộc đột kích của cơ quan thực thi pháp luật. Vụ kiện lập luận rằng xAI đã không thực hiện các biện pháp phòng ngừa cơ bản để ngăn việc tạo ra hình ảnh khiêu dâm của người thật, bao gồm cả trẻ vị thành niên.
Báo cáo "State of Open Models" của Hugging Face, phát hành ngày 14 tháng 8, cho biết dòng mô hình Qwen của Alibaba đạt hơn 3 tỷ lượt tải xuống lũy kế trong sáu tháng, vượt trên mọi đối thủ. Chỉ tính riêng trên Hugging Face Hub (không bao gồm ModelScope), Qwen ghi nhận 2.045 tỷ lượt tải xuống, so với 418 triệu của Google và 227 triệu của Meta. Qwen đã mở mã nguồn hơn 460 mô hình và tạo ra hơn 300,000 phiên bản phái sinh — 151,448 trong số đó trên Hugging Face, gấp 2.6 lần số lượng của Meta và gấp 4.7 lần số lượng của Llama. Qwen3.8-27B đứng đầu bảng xếp hạng xu hướng trên Hugging Face. Báo cáo cũng lưu ý rằng các phòng thí nghiệm Trung Quốc đã phát hành các mô hình mở lớn nhất vào năm 2026, với trần tham số hằng tháng từ 754 tỷ đến 2.78 nghìn tỷ, trong khi các phòng thí nghiệm Hoa Kỳ phần lớn ở mức dưới 130 tỷ; 59% mô hình Trung Quốc trên 20B tham số sử dụng giấy phép Apache 2.0 và 22% sử dụng MIT, không có mô hình nào mang hạn chế phi thương mại.
Động lực trọng số mở này hiện đang tiếp sức cho các dòng chip nội địa. Huawei công bố vào ngày 15 tháng 8 rằng Ascend Atlas 800 A3 và Atlas 900 A3 SuperPoD của hãng đã hoàn tất việc thích ứng toàn diện với bản xem trước dots3-note mã nguồn mở của Xiaohongshu — được phát hành ngày 14 tháng 8 — trên cơ sở 0 ngày, thông qua công cụ suy luận vLLM Ascend. Bản xem trước dots3-note là một mô hình MoE tổng 280B / kích hoạt 16B có khả năng hiểu văn bản, hình ảnh và âm thanh; các lớp thích ứng của Huawei bổ sung tối ưu hóa truyền thông FlashComm, toán tử hợp nhất FUSED_MC2 để điều phối MoE, và giải mã suy đoán MTP nguyên bản nhằm giảm độ trễ trên mỗi token.
Về phía sản phẩm, Qwen Office của Alibaba đã đưa GLM-5.3 và DeepSeek V4 Pro vào hoạt động như các lựa chọn mô hình tuyến đầu vào ngày 16 tháng 8 — GLM-5.3 mang lại mức cải thiện 50% so với phiên bản 5.2 nhờ tăng quy mô hậu huấn luyện, còn V4 Pro hỗ trợ ngữ cảnh 1M và đầu ra lên tới 384K. Một cách riêng biệt, một bài đánh giá chuẩn của cộng đồng được lan truyền vào ngày 15 tháng 8 cho thấy phong cách đầu ra "Attention-kind" của Claude Opus 5 nâng tỷ lệ vượt qua các tác vụ mã lên 97%, giảm 43% độ dài đầu ra và đưa câu trả lời vào dòng đầu tiên trong 75% số lần. Grok 4.6 dẫn đầu bài đánh giá chuẩn về độ tin cậy tin tức với điểm số 0.79, xếp trên GPT-5.6 Sol, Claude Opus 4.8 và Gemini.