
Ngày 13 tháng 8, OpenAI và Cerebras đã ra mắt Chế độ Ultrafast, một gói dịch vụ được vận hành bởi Wafer-Scale Engine của Cerebras, chạy GPT-5.6 Sol với tốc độ lên tới 750 token đầu ra mỗi giây. Cerebras cho biết gói này nhanh gấp 11 lần so với Fable 5 và nhanh gấp 5 lần so với Opus 4.8 ở Chế độ Fast, mà không suy giảm chất lượng. Trong bài đánh giá Humanity's Last Exam, bộ chuẩn gồm 2.500 câu hỏi chỉ có thể được trả lời bởi các chuyên gia trình độ tiến sĩ, Ultrafast hoàn thành trong 11 giờ 11 phút, trong khi Claude Fable 5 cần 78 giờ 27 phút. Trên GDP-Val, bộ chuẩn dành cho công việc tri thức có giá trị kinh tế, Ultrafast mang lại mức tăng tốc đầu cuối gấp 5,6 lần. Dịch vụ này trước tiên khả dụng trong giao diện lập trình ứng dụng (API) của OpenAI cho một nhóm khách hàng được chọn.
Ngày 13 tháng 8, Google đã phát hành Gemini 3.7 Flash, nhắm đến các ca sử dụng lập trình và tác nhân, chỉ ba tuần sau bản 3.6 Flash. Đến hết ngày 31 tháng 12, mô hình này có giá bằng một nửa so với 3.6 Flash — 0,75 USD cho mỗi triệu token đầu vào và 3,75 USD cho mỗi triệu token đầu ra. Google cũng đang đưa mô hình này vào Gemini Spark cho người đăng ký AI Pro và Ultra trên hơn 160 khu vực.
Ngày 14 tháng 8, DeepSeek công bố biểu giá API theo khung giờ cao điểm và thấp điểm, có hiệu lực từ ngày 17 tháng 8, với giờ thấp điểm bằng một nửa mức giá cao điểm. Một số mô hình có mức tăng giá hơn 3 lần. Mô hình chủ lực deepseek-v4-pro ghi nhận mức tăng giá đáng kể theo mỗi triệu token trong giờ cao điểm. Động thái này đảo ngược định vị trước đây của DeepSeek là nhà cung cấp chi phí thấp.
Ngày 13 tháng 8, Lenovo công bố kết quả quý 1 năm tài khóa 2026: doanh thu liên quan đến trí tuệ nhân tạo (AI) tăng 60% so với cùng kỳ năm trước, đạt 8,5 tỷ USD, chiếm 35% tổng doanh thu. Chủ tịch Yang Yuanqing nói với truyền thông rằng việc phân bổ năng lực tính toán đang dịch chuyển từ giai đoạn đầu "80% huấn luyện" sang mục tiêu "80% suy luận, 20% huấn luyện", với tỷ lệ phân bổ hiện tại khoảng 50/50.
Nhóm thông báo cùng ngày — một mô hình tiên phong đạt 750 token/giây, một mô hình Flash giá bằng một nửa và một nhà cung cấp Trung Quốc tăng giá trong khi các bên khác giảm giá — cho thấy cuộc cạnh tranh đã chuyển từ "ai mạnh nhất" sang "ai nhanh nhất và rẻ nhất".
Ngày 14 tháng 8, DeepSeek đã phát hành phiên bản chính thức của V4-Pro, một mô hình 1,6 nghìn tỷ tham số với trọng số được phát hành theo giấy phép MIT, hỗ trợ nguyên bản cho OpenAI Responses API và khả năng thích ứng theo mục tiêu cho Codex. Hệ sinh thái plugin Harness đã bước vào giai đoạn thử nghiệm công khai.
Cùng ngày, GLM-5.3 của Zhipu được báo cáo có mô hình nền 743B đạt 84,5 điểm trên CyberGym, cao hơn GPT-5.6 Sol, được xây dựng cho phòng thủ mạng và lập trình. Meituan đã ra mắt LongCat-2.0, một mô hình hỗn hợp chuyên gia (MoE) 1,6 nghìn tỷ tham số với cửa sổ ngữ cảnh 1M, đạt 70,8 điểm trên Terminal-Bench 2.1, tập trung vào lập trình tác nhân.
Ngày 14 tháng 8, Grok 4.6 đã dẫn đầu bảng xếp hạng lập trình thực tế CursorBench, xếp trên Claude Opus 5 và GPT-5.6 Sol. xAI cũng đã phát hành mã nguồn mở cho trọng số của Phoenix, thuật toán xếp hạng X của mình, một transformer dựa trên Grok có các trọng số điểm tổng hợp ưu tiên ý định lan truyền và hội thoại chân thực, trong đó các lượt thích bị xem là tín hiệu rẻ nhất.
Ngày 13 tháng 8, một nghiên cứu của Meta/Đại học Oxford cho thấy tiền huấn luyện đa phương thức chỉ cần 5% dữ liệu tạo hình ảnh, với tỷ lệ tối ưu là 70% ngôn ngữ, 25% hiểu hình ảnh và 5% tạo hình ảnh — giảm 5 lần token tạo hình ảnh.
Làn sóng trọng số mở từ DeepSeek, Meituan và xAI, cùng với các bộ chuẩn chuyên biệt cho lập trình và phòng thủ mạng, đánh dấu sự dịch chuyển sang các mô hình chuyên môn hóa năng lực, cạnh tranh ở những tác vụ hẹp, đo lường được thay vì các tuyên bố năng lực chung.
Ngày 13 tháng 8, Fortune đưa tin Anthropic lên kế hoạch phát hành lần đầu ra công chúng (IPO) vào tháng 10 với định giá 2 nghìn tỷ USD, mức sẽ vượt qua đợt IPO trị giá 1,77 nghìn tỷ USD của SpaceX vào ngày 12 tháng 6 để trở thành đợt IPO lớn nhất từ trước đến nay. Doanh thu quy năm của Anthropic đã vượt 47 tỷ USD vào tháng 5, và công ty đã nộp hồ sơ bảo mật lên Ủy ban Chứng khoán và Giao dịch Mỹ (SEC) vào tháng 6.
Ngày 14 tháng 8, Nikkei đưa tin Tencent sẽ mua lại cổ phần của Meta trong nhà phát triển AI Manus để trở thành cổ đông lớn nhất của công ty này. Manus, ra mắt vào tháng 3 năm 2025 bởi Butterfly Effect, đã chuyển trụ sở đến Singapore và cắt giảm hoạt động tại Trung Quốc sau khi nhận đầu tư từ Mỹ. Vào tháng 4, hoạt động rà soát an ninh đầu tư nước ngoài của Trung Quốc đã cấm thương vụ Meta-Manus; vào ngày 11 tháng 8, Manus tuyên bố tách khỏi Meta và khôi phục hoạt động độc lập.
Ngày 14 tháng 8, truyền thông đưa tin Google DeepMind đang tái cơ cấu theo hướng rời xa nghiên cứu mô hình tiên phong để chuyển sang các mô hình lớp Flash tiết kiệm chi phí, với khả năng cắt giảm nhân sự có thể lên tới một phần ba hoặc nhiều hơn. Demis Hassabis đã từ chức giám đốc điều hành (CEO) vào ngày 5 tháng 8, trở thành chủ tịch và giám đốc khoa học của Alphabet. Việc tái cơ cấu này liên quan đến sự chậm trễ của mô hình Gemini chủ lực tiếp theo của Google và các tranh cãi nội bộ về ưu tiên phát triển.
Ngày 14 tháng 8, Reuters đưa tin Apple đã huấn luyện một mô hình ngôn ngữ lớn (LLM) dành riêng cho thị trường Trung Quốc cùng với Alibaba, chấm dứt việc phụ thuộc trước đây vào các mô hình bên thứ ba. Apple Intelligence dự kiến sẽ ra mắt tại Trung Quốc trong vòng vài tháng, sau khi hồ sơ ngày 15 tháng 7 về dịch vụ AI tạo sinh trên thiết bị "Apple Intelligence" được nộp lên các cơ quan quản lý.
Ngày 13 tháng 8, Musk nói với các nhân viên SpaceX rằng công suất điện của trung tâm dữ liệu SpaceXAI (trước đây là xAI) sẽ tăng khoảng 7 lần lên 10GW vào cuối năm 2027, từ mức 1,4GW hiện tại trên khắp Memphis và Southaven. Ông ước tính 10GW có thể mang lại doanh thu hàng năm từ 300 tỷ đến 500 tỷ USD.
Cùng ngày mang lại hai tín hiệu ở quy mô 2 nghìn tỷ USD và hai động thái tại thị trường Trung Quốc: định giá IPO của Anthropic và chiến lược mô hình Trung Quốc của Apple — trong khi Tencent tiếp quản Manus và Google rút lui khỏi nhóm tiên phong.
Ngày 13 tháng 8, tại Hội nghị Bảo mật USENIX ở Baltimore, các nhà nghiên cứu từ Đại học Birmingham và Đại học Durham đã công bố "Download More RAM", một cuộc tấn công khai thác lỗ hổng thiếu bảo vệ chống ghi trong các chip SPD của DDR4/DDR5 để vượt qua lớp phòng thủ của Windows 11 mà không cần truy cập vật lý. Lỗ hổng này cho phép phần mềm ghi lại dữ liệu cấu hình bộ nhớ, khiến Windows báo sai dung lượng RAM gấp 2 lần và tạo ra các bí danh bộ nhớ để đọc hoặc sửa đổi các vùng được bảo vệ. Nó có thể vô hiệu hóa phần mềm diệt virus, xâm nhập các hệ thống doanh nghiệp bị khóa và vượt qua cơ chế chống gian lận cấp kernel. Microsoft đã gán mã CVE-2026-23670 và bổ sung biện pháp giảm thiểu trong bản cập nhật bảo mật tháng 4 năm 2026; các hệ thống đã bật Secure Boot được bảo vệ. Corsair, G.Skill và ADATA mỗi hãng có ít nhất một dòng sản phẩm tiêu dùng bị ảnh hưởng.
Ngày 6 tháng 8, một bài báo được chấp nhận tại Hội nghị thượng đỉnh ACM AI Leadership Summit cho thấy các công cụ phát hiện AI thương mại không thể phân biệt một cách đáng tin cậy giữa chỉnh sửa bằng AI và bản thảo hoàn toàn do AI viết. Các chỉnh sửa nhẹ kiểu "chỉ tinh chỉnh phần tóm tắt" bị gắn cờ ở mức 64–80% (Pangram/GPTZero), trong khi các bản gốc chưa chỉnh sửa từ 2023–2025 bị gắn cờ ở mức 9–15%. Sau khi "nhân hóa" bằng Undetectable AI, chưa tới 4% các bản viết lại bị gắn nhãn AI vẫn còn bị gắn cờ. Việc chỉnh sửa AI một cách trung thực mang rủi ro bị xử phạt cao hơn so với việc né tránh nhờ công cụ nhân hóa.
Cũng trong tuần này, một phân tích kỹ thuật lập luận rằng các hình mờ văn bản bằng AI sẽ luôn dễ dàng bị gỡ bỏ, trước yêu cầu tại Điều 50 của Đạo luật AI EU rằng các đầu ra phải "có thể phát hiện là do AI tạo ra", có hiệu lực từ tháng 8 năm 2026. Việc lấy mẫu token kiểu SynthID có thể bị vô hiệu hóa bằng cách diễn giải lại qua bất kỳ LLM yếu nào, và các hình mờ homoglyph Unicode có thể bị gỡ bỏ bằng cách thay thế ký tự. Phân tích lưu ý Claude Code trước đây từng sử dụng kỹ thuật giấu tin homoglyph để gắn thẻ một số yêu cầu.
Ngày 13 tháng 8, OpenAI đã ra mắt Computer History cho ứng dụng ChatGPT Mac, thay thế bản xem trước dạng ảnh chụp màn hình của Chronicle bằng tính năng ghi nhật ký sự kiện trợ năng của macOS (cú nhấp chuột, thao tác gõ, phím tắt, chuyển ứng dụng). Các sự kiện được lưu cục bộ tối đa 48 giờ, sau đó bị xóa sau khi quá trình tạo bộ nhớ phía máy chủ hoàn tất. Hoạt động ở chế độ riêng tư được loại trừ. Tính năng được triển khai cho người dùng Pro, Business và Enterprise, ngoại trừ Khu vực Kinh tế Châu Âu (EEA), Thụy Sĩ và Vương quốc Anh.
Ngày 14 tháng 8, ChatGPT có thêm khả năng chỉnh sửa trực tiếp Google Docs, Sheets và Slides mà không cần chuyển tab, được triển khai cho người dùng Plus, Pro, Business và Enterprise.
Cuộc tấn công cấp phần cứng, các công cụ phát hiện hoạt động kém và hình mờ dễ dàng bị gỡ bỏ đều có chung một tiền đề: hạ tầng để xác minh nội dung AI và bảo mật hệ thống đang tụt hậu so với chính các mô hình.