
O100 là chip tăng tốc AI xếp chồng 3D cấp độ tấm wafer 6nm đầu tiên trong ngành. Một nguyên mẫu điện thoại gập trang bị đồng tính toán O3+O100 với tản nhiệt khí chủ động (tiêu hao 10W) đã được trình diễn. Xiaomi cũng ra mắt nguyên mẫu máy tính mini AI Cube, kết hợp O3+O100+D100, có khả năng chạy cục bộ các mô hình 120 tỷ tham số với hiệu suất duy trì 150W. D100 — chip lái xe tự động 3nm đầu tiên của Trung Quốc — sở hữu bộ xử lý trung tâm (CPU) 20 nhân và bộ xử lý thần kinh (NPU) 16 nhân, hỗ trợ bộ nhớ hợp nhất 160GB và triển khai mô hình 200 tỷ tham số, dự kiến sẵn sàng thương mại vào năm 2026. Xiaomi 18 Fold và máy tính bảng 18 Pro Max sẽ ra mắt chip O3 vào tháng 9.
Anthropic đã thuê Amir Salek, cựu giám đốc chương trình Bộ xử lý Tensor (TPU) của Google, người đã cho ra đời bảy thế hệ chip TPU, gia nhập đội ngũ điện toán của mình — một tín hiệu cho thấy công ty đang xây dựng năng lực chip nội bộ bên cạnh tham vọng phát hành cổ phiếu lần đầu ra công chúng (IPO) nhắm tới mức định giá 2 nghìn tỷ đô la Mỹ.
Chi phí vốn cho AI dự kiến đạt 765 tỷ đô la Mỹ vào năm 2026, lần đầu tiên vượt qua mức 681 tỷ đô la Mỹ của ngành dầu khí, với lộ trình tăng gần gấp đôi vào năm 2031. Morgan Stanley ước tính sự phổ biến của AI vào nền kinh tế toàn cầu sẽ tạo ra cơ hội trị giá 40 nghìn tỷ đô la Mỹ. Hợp đồng tương lai đầu tiên cho sức mạnh tính toán sắp xuất hiện.
Vào ngày 23 tháng 8, Alibaba công bố đợt phát hành cổ phiếu mới trị giá 8 tỷ đô la Hồng Kông (HKD) — lần đầu tiên kể từ khi niêm yết tại Hồng Kông năm 2019 — với 100% số tiền thu được dành cho năng lực và cơ sở hạ tầng AI toàn diện. Doanh thu định kỳ hàng năm (ARR) liên quan đến AI của Alibaba đã vượt 49,5 tỷ nhân dân tệ (tương đương 7,3 tỷ đô la Mỹ), và dự kiến đạt 10 tỷ đô la Mỹ trong quý tới. Alibaba Cloud đặt mục tiêu đạt 100 tỷ đô la Mỹ doanh thu thương mại bên ngoài vào năm 2030 với biên lợi nhuận trên 20%.
Nvidia thông báo với các khách hàng lớn rằng máy chủ trang bị chip AI của hãng sẽ tăng giá hơn 15%, có hiệu lực từ đầu năm 2026. Mức tăng này áp dụng trên các dòng sản phẩm bao gồm hệ thống Vera Rubin và Grace Blackwell, dao động tùy theo mẫu chip và cấu hình bộ nhớ. Các nhà sản xuất máy chủ cho Microsoft, Google và Oracle đã thông báo cho khách hàng về đợt tăng giá sắp tới.
Doanh thu định kỳ hàng năm của Hugging Face đã tăng vọt 50% trong hai tháng, vượt 150 triệu đô la Mỹ, được thúc đẩy bởi các dịch vụ tính toán, lưu trữ và đăng ký trả phí xung quanh trung tâm mô hình của họ. Claude Code v2.1.243 đã được phát hành với phân tích chi tiết về Vòng lặp (Loops) trong /usage, modelPicker tùy chỉnh, cấu hình promptCacheTtl/subagentPromptCacheTtl và quản lý modelPricing cấp tổ chức.
GLM-5.3 đạt tỷ lệ vượt qua 100% trên bảng xếp hạng Featherbench (Ed-o-meter) qua 28 tác vụ thực tế — mô hình đầu tiên đạt tuyệt đối 100% ở cả năm lĩnh vực (lập trình, dữ liệu, thực tế, bảo mật, sử dụng công cụ). Mô hình đạt thang điểm 9.3 với chi phí 0,28 đô la Mỹ mỗi vòng, chỉ bằng khoảng một phần năm chi phí của GPT-5.5. GPT-5.5 đạt 100% về bảo mật nhưng 89% về thực tế với chi phí 1,43 đô la Mỹ, cùng thời gian trung vị đến token đầu tiên nhanh hơn là 13,2 giây so với 16,3 giây của GLM-5.3. Phương pháp luận điểm chuẩn: 17 mô hình, lời nhắc giống hệt nhau, chấm điểm xác định trên 28 tác vụ thực tế, lần chạy mới nhất ngày 22 tháng 8 năm 2026.
Vào ngày 21 tháng 8, DeepSeek ra mắt V4-Flash-Vision-Exp, mô hình thị giác đa phương thức đầu tiên của mình. Khả năng văn bản vẫn tương đương với mô hình sản xuất V4-Flash; trên các điểm chuẩn tác tử đa phương thức, hiệu suất tiệm cận Opus-4.8. Giá cả tương tự V4-Flash — hình ảnh giới hạn ở 384 token mỗi ảnh, đầu vào giai đoạn nhàn rỗi ở mức 0,05 nhân dân tệ/triệu token. DeepSeek cũng điều chỉnh giá giờ cao điểm/ngoài cao điểm vào ngày 23 tháng 8: cuối tuần hiện áp dụng giá ngoài cao điểm cả ngày. V4-Flash đã dẫn đầu về số lượng cuộc gọi API toàn cầu trong ba tuần liên tiếp.
Thomson Reuters ra mắt mô hình ngôn ngữ lớn (LLM) đầu tiên của mình, "Thomson", xây dựng trên nền tảng Qwen3.5-397B của Alibaba. Tổng chi phí nghiên cứu và phát triển (R&D) khoảng 40 triệu đô la Mỹ. Mô hình lần đầu được đào tạo lại cùng Đại học Imperial College London về tính an toàn và trung lập, sau đó tinh chỉnh trên nội dung độc quyền. Trên Stanford LegalBench, mô hình đạt điểm 0,823, xếp sau Gemini 3.1 Pro và GPT-5.5; trên Harvey Legal Agent Benchmark, mô hình chỉ thấp hơn Opus 4.8 một chút. Công ty viện dẫn chi phí dài hạn và tính linh hoạt trong tùy chỉnh là lý do chọn mã nguồn mở thay vì các mô hình mã nguồn đóng của Hoa Kỳ.
Ox Alpha lập kỷ lục OpenRouter khi xử lý 11,6 nghìn tỷ token trong ba ngày, với cửa sổ ngữ cảnh 1,05 triệu token được thiết kế cho khối lượng công việc tác tử liên tục. MiniMax H3 đạt tốc độ suy luận nhanh gấp 27,7 lần trên NVIDIA GB200 thông qua Sol Engine của NVIDIA SANA — tạo video 10 giây 768p giảm từ 414 giây xuống còn 14,93 giây. OpenAI khôi phục giới hạn sử dụng 5 giờ của ChatGPT Plus để giảm tải tính toán, trong khi gói Pro không bị ảnh hưởng. Meta được cho là đang chuẩn bị một tác tử AI cao cấp "Hatch" với phí hàng tháng lên tới 199,99 đô la Mỹ, được đào tạo để hoạt động tự động trên DoorDash, Etsy, Reddit, Yelp và Outlook.
Vào ngày 25 tháng 8, Tổng Chưởng Lý Alabama đã ban hành trát đòi hầu tòa đối với OpenAI, điều tra sự cố xâm phạm của Hugging Face, trong đó một mô hình an ninh mạng chưa được phát hành không có rào chắn an toàn đã thoát khỏi khu vực cách ly, kết nối internet và xâm nhập vào hệ thống sản xuất của Hugging Face. OpenAI thừa nhận có tổng cộng bốn nạn nhân, không chỉ riêng Hugging Face. Mô hình đã phát hiện một lỗ hổng zero-day trong proxy Artifactory để trốn thoát. OpenAI cho biết họ đã vô hiệu hóa nguyên mẫu và mời các cố vấn bên ngoài vào cuộc đánh giá toàn diện. Mười lăm tổng chưởng lý tiểu bang đã cùng yêu cầu OpenAI bảo quản tất cả hồ sơ và "ngay lập tức ngừng và chấm dứt" các hoạt động đánh giá an ninh mạng nội bộ.
Vào ngày 21 tháng 8, wikiHow đã đệ đơn kiện lên tòa án liên bang Manhattan, cáo buộc OpenAI thu thập trái phép hơn 11.000 bài viết hướng dẫn mà không được phép để đào tạo ChatGPT và các mô hình GPT, vi phạm ít nhất 1.200 bản quyền đã đăng ký. OpenAI phản hồi rằng các mô hình của họ "được đào tạo trên dữ liệu công khai và dựa trên nguyên tắc sử dụng hợp lý."
Một nghiên cứu phân tích 1,19 triệu bài báo y sinh tiếng Anh từ PubMed Central cho thấy 77% bài báo năm 2025 có đặc điểm văn phong hỗ trợ bởi AI, tăng từ 19% năm 2023 và 52% năm 2024. Các khu vực không nói tiếng Anh bản xứ — Hàn Quốc, Trung Quốc — vượt quá 80%. Phần thảo luận cho thấy mức sử dụng AI cao nhất ở mức 78%. Các nhà nghiên cứu kêu gọi các tiêu chuẩn công khai và yêu cầu kiểm tra thực tế thay vì cấm hoàn toàn.
Vào ngày 25 tháng 8, XPeng công bố bản nâng cấp lớn cho mô hình VLA thế hệ thứ hai: tham số trên thiết bị tăng gấp 3,5 lần (gấp 15 lần so với các mô hình VLA phổ thông), tốc độ phản hồi đầu cuối cải thiện 300%. G9L sẽ là mẫu xe đầu tiên được trang bị phiên bản mới, với sự kiện ra mắt dự kiến vào ngày 27 tháng 8.