Ngày 25 tháng 8 — Hai giám đốc bán hàng cấp cao mà OpenAI tuyển dụng từ Salesforce đã quay trở lại công ty cũ của họ. Cùng lúc đó, Chris Malone, người đứng đầu bộ phận trung tâm dữ liệu của OpenAI, người đã gia nhập vào tháng 3 năm 2025 từ Meta (sau hơn một thập kỷ tại Google), đã rời công ty vào tuần trước. Sự ra đi của Malone diễn ra sau khi tổ chức cơ sở hạ tầng được tái cơ cấu, theo đó ông không còn báo cáo trực tiếp cho chủ tịch Greg Brockman nữa mà bắt đầu báo cáo cho Phó Chủ tịch Sachin Katti. Điều này nâng tổng số lãnh đạo rời OpenAI trong năm 2026 lên ít nhất 13 người, bao gồm cựu Giám đốc vận hành (COO) Brad Lightcap, giám đốc sản phẩm Fidji Simo, giám đốc đạo đức Chloé Bakalar, và đội ngũ sẵn sàng đã bị giải tán. Đợt phát hành cổ phiếu lần đầu ra công chúng (IPO) của OpenAI, ban đầu dự kiến vào năm 2026, được báo cáo là đã bị đẩy sang năm 2027. (TechCrunch)
Ngày 26 tháng 8 — Một nghiên cứu phát hiện ra rằng cùng một mô hình AI đã đạt điểm từ 31% đến 89% trên 26 cấu hình đánh giá hợp lý tương đương — chỉ bằng cách thay đổi thứ tự câu trả lời và cách diễn đạt lời nhắc. Đối với Gemma4-31B, các câu hỏi nhạy cảm với cấu hình chiếm 95,7% khoảng cách điểm giữa các mô hình liền kề. (DAIR.AI qua X)
Ngày 26 tháng 8 — Nhiều nguồn tin cho rằng các vấn đề về ngữ cảnh và bộ nhớ trong các mô hình AI tiên tiến đã được "giải quyết", có khả năng cho phép các mô hình tự cải thiện với khả năng học liên tục. Một bước nhảy vọt về năng lực tương đương với bước nhảy từ o3 lên Fable có thể xảy ra trong vòng 8 tháng tới. (Kimmonismus qua X)
Tại sao điều này quan trọng: OpenAI đang thúc đẩy cả về năng lực tính toán (Bel + Jalapeño) lẫn câu chuyện định hướng, trong khi Anthropic đặt cược vào câu chuyện Tổng thị trường có thể phục vụ (TAM) lớn nhất trong lịch sử cho đợt IPO của mình. Cả hai phòng thí nghiệm đều phải đối mặt với các bài kiểm tra về uy tín — một bên từ sự ra đi của các giám đốc điều hành và bên kia từ sự hoài nghi về định giá.
Ngày 25 tháng 8 — Oasis Security đã tiết lộ một lỗ hổng trong NVIDIA NemoClaw cho phép một trang web do kẻ tấn công kiểm soát chiếm quyền điều khiển mà không cần xác thực đối với một phiên bản Ollama cục bộ và cài cắm các chỉ dẫn ẩn vào mẫu trò chuyện của mô hình. NemoClaw khởi động Ollama với OLLAMA_HOST=0.0.0.0:11434, liên kết máy chủ mô hình với tất cả các giao diện mạng. Giao diện lập trình ứng dụng (API) không xác thực trên cổng 11434 có thể bị truy cập thông qua DNS rebinding: tên miền của kẻ tấn công phân giải trước tiên về máy chủ của chúng, sau đó về 127.0.0.1 trong khi trình duyệt coi các yêu cầu là cùng nguồn gốc. Mẫu trò chuyện bị đầu độc tồn tại qua các cuộc trò chuyện và vẫn tồn tại ngay cả khi tác nhân cung cấp lời nhắc hệ thống của riêng nó. NemoClaw v0.0.35 đã sửa lỗi trên macOS và Linux; đường dẫn Windows/WSL vẫn chưa được vá tính đến ngày báo cáo. Không có mã Lỗ hổng bảo mật chung (CVE) nào được chỉ định và chưa có báo cáo về việc khai thác. (The Hacker News)
Ngày 26 tháng 8 — Generalist, một công ty khởi nghiệp về robot được thành lập vào năm 2024 bởi các nhà nghiên cứu trước đây của Google DeepMind và Boston Dynamics, đã đạt mức định giá 3 tỷ USD sau khi huy động được gần 200 triệu USD trong vòng mở rộng của vòng tài trợ Series B do 8VC dẫn đầu, nâng tổng số vòng B lên 600 triệu USD. Mô hình Gen 1.5 mới được phát hành của công ty cho phép robot học các tác vụ mới từ các video minh họa chỉ từ 3–12 giây. Các đối thủ cạnh tranh bao gồm Physical Intelligence (định giá 11 tỷ USD), Skild AI (14 tỷ USD) và Genesis AI (đang đàm phán ở mức 3 tỷ USD). (TechCrunch)
Ngày 26 tháng 8 — Stability AI đã huy động được 76 triệu USD trong vòng tài trợ Series B từ một loạt các nhà đầu tư trong ngành giải trí bao gồm Universal Music Group, Sony Music Group, Warner Music Group và Electronic Arts, cùng với AMD Ventures và Pacific Alliance Ventures. Vòng này nâng tổng số vốn tài trợ của Stability AI lên 232 triệu USD kể từ khi công ty tái tập trung vào thị trường Mỹ. Công ty dự định sử dụng khoản tiền này cho bộ sản phẩm "sản xuất sáng tạo" và mở rộng dịch vụ chuyên nghiệp. Stability gần đây đã thắng một vụ kiện bản quyền với Getty Images tại Vương quốc Anh, mặc dù một vụ kiện tương tự tại Mỹ vẫn đang tiếp diễn. (TechCrunch)
Tại sao điều này quan trọng: Các lỗ hổng bảo mật trong cơ sở hạ tầng AI cục bộ (NemoClaw) và dòng vốn nhanh chóng đổ vào phần cứng robot (Generalist) và các công cụ AI sáng tạo (Stability AI) cho thấy rằng đầu tư vào cơ sở hạ tầng đang tăng tốc ở tất cả các lớp — trong khi tình trạng bảo mật của cơ sở hạ tầng đó vẫn chưa đồng đều.
Ngày 26 tháng 8 — Breeze TTS 2 đã vươn lên dẫn đầu bảng xếp hạng mã nguồn mở về chuyển văn bản thành giọng nói (text-to-speech) với điểm Elo là 1215, dẫn trước Fish Audio S2 Pro 90 điểm và đứng thứ 6 trong số tất cả các hệ thống TTS. (Artificial Analysis qua X)
Tại sao điều này quan trọng: AI đang chuyển từ việc tạo ra nội dung (văn bản, hình ảnh, mã) sang thực thi công việc (trình duyệt, ứng dụng máy tính để bàn, công cụ doanh nghiệp, gửi lên cửa hàng ứng dụng). Cả các công ty Trung Quốc và Mỹ đều đang phát hành các sản phẩm tác nhân trong cùng một khoảng thời gian, cho thấy ngành công nghiệp đã hội tụ vào "hoàn thành nhiệm vụ" như là biên giới sản phẩm tiếp theo.
Ngày 26 tháng 8 — Hàn Quốc đứng thứ ba toàn cầu về năng lực mô hình AI, sau Mỹ và Trung Quốc, với Motif 3 (điểm 47) và Upstage Solar Pro 4 (điểm 42) là những mô hình có điểm số cao nhất bên ngoài hai quốc gia dẫn đầu. Nhiều phòng thí nghiệm bao gồm SK Telecom và LG có các mô hình đạt điểm trên 30. (Artificial Analysis qua X)
Ngày 26 tháng 8 — Một thử nghiệm đối chứng trên các chuẩn mực tác nhân cho thấy việc thay đổi bộ khung đánh giá đã gây ra dao động điểm số 13,0 điểm cho GLM-5.1, trong khi giữ nguyên bộ khung và thay đổi mô hình chỉ tạo ra phương sai từ 3,0–5,0 điểm. Bộ khung đánh giá đã đóng góp phương sai nhiều hơn 7,8 lần so với chính mô hình. (DAIR.AI qua X)
Tại sao điều này quan trọng: Khi việc đánh giá mô hình ngày càng trở nên trung tâm đối với các quyết định đầu tư và sản phẩm, phát hiện rằng các bộ khung đánh giá là nguồn gây ra phương sai điểm số lớn hơn so với năng lực của mô hình đặt ra câu hỏi về độ tin cậy của các bảng xếp hạng chuẩn mực tác nhân hiện tại.