
딥시크는 8월 13일 밤 V4 Pro 출시와 새로운 API 가격 체계라는 두 가지를 내놓았다. 두 발표는 한 몸처럼 연결되어 있다. 하나는 도구를 무료로 제공하고, 다른 하나는 컴퓨팅 가격을 다시 책정한다.
V4 Pro는 1.6조 파라미터 모델로 100만 토큰 컨텍스트 윈도우를 갖췄으며 에이전트 워크로드를 위해 구축됐다. 이와 함께 딥시크는 MIT 라이선스의 개발자 프리뷰인 Harness를 오픈소스로 공개했다. 설계 원칙은 "모든 것이 플러그인"이다. 모델, 도구, 스킬, 세션, 샌드박스, 스토리지, 에이전트 루프 자체, 스케줄러, UI가 모두 교체 가능한 구성 요소다. 11개의 내부 엔지니어링 스킬이 포함되어 있으며, npx @deepseek-ai/dsh web은 3080 포트에서 로컬 웹 UI를 띄운다. Harness는 네 가지 실행 모드를 제공한다. 표준, PTC(모델 생성 코드가 여러 도구 호출을 연결), 미니멀(깨끗한 벤치마크를 위해 셸과 파일 편집기만 제공), 그리고 런타임에 플러그인을 실험할 수 있는 크리에이티브 모드다.
8월 13일 발표의 나머지 절반은 가격표였다. 딥시크는 8월 17일 00:00부터 피크/오프피크 가격제로 전환한다. 피크 시간은 베이징 시간 기준 9:00~12:00, 14:00~18:00이며, 그 외 시간은 오프피크로 피크 요금의 절반이다. 기존 백만 토큰당 가격과 비교하면 V4 Pro 출력은 피크 시 6위안에서 27위안으로 오른다(4.5배, 약 350% 인상). V4 Flash 출력은 2위안에서 9위안으로 오른다. 가장 가파른 변동은 캐시 입력 가격이다. V4 Pro는 0.025위안에서 0.30위안으로 12배 뛴다. V4 Flash에서 오프피크 캐시 적중은 여전히 캐시 미스보다 약 96% 우위에 있어, 배치 작업과 캐시 비중이 높은 프롬프트는 실질적인 부담 완화를 얻는다.
8월 15일 커뮤니티 테스트에서 지적된 세 번째 세부 사항은 엔지니어링 계층에 있다. V4 Pro의 측정된 역량은 도구 스캐폴딩에 매우 민감하다. 같은 모델이 같은 과제에서 첫 턴에 25개 도구를 받으면 91점을 받았지만, bash 셸과 str_replace_editor만 주어지면 96~99점, 2단계 앵커링 방식을 쓰면 98~99점을 받았다. 도구가 가장 적을 때 점수가 가장 안정적이었다.
오픈AI의 기업공개(IPO)로 가는 길은 이번 주 두 가지 냉엄한 수치와 충돌했다.
8월 15일 블룸버그는 앤트로픽의 2분기 매출이 115억 달러를 넘어서며 전년 동기 대비 약 14배 증가했고, 연 환산 매출이 약 470억 달러에 근접했다고 보도했다. 같은 보도는 이를 대형 모델 상용화의 전환점으로 해석했으며, 이는 오픈AI가 2위 연구소로부터 현재 받고 있는 경쟁 압력을 직접적으로 보여주는 지표다.
8월 16일 월스트리트저널은 엔비디아가 오픈AI의 오하이오 데이터센터 캠퍼스에 대한 자금 조달 보증을 축소하고 있다고 보도했다. 그 규모는 2,500억 달러에서 1,200억 달러 미만으로 줄어들며, 계획된 10GW 중 첫 단계(약 5GW)만 대상으로 한다. 2,500억 달러 계획의 첫 공개만으로도 엔비디아 주가는 하루 만에 5% 하락한 바 있으며, 이번 축소는 칩 제조사의 대차대조표 노출에 대한 투자자 우려에 명시적으로 대응한 것이다. 별도로 엔비디아는 10GW 부지를 개발 중인 소프트뱅크의 SB에너지에 최대 30억 달러 투자를 검토하고 있다. 이는 현재까지 발표된 최대 규모의 데이터센터 프로젝트다. 엔비디아는 또한 오픈AI의 칩 구매 자금을 조달하기 위한 별도 시설에 대해 논의 중이며, 이 프로그램은 총 3,500억 달러에 달할 수 있다.
오픈AI 내부에서는 8월 16일 또 다른 최고경영진 인사가 있었다. 구글이 최근 320억 달러에 인수한 Wiz의 사장 겸 최고운영책임자(COO)였던 달리 라지치가 최고수익책임자(CRO)로 임명되면서 약 8개월 재임한 데니스 드레서를 대체했다. 그렉 브록먼은 오픈AI가 현재 주간 활성 사용자 10억 명 이상, 기업 고객 200만 개 이상을 보유하고 있으며 이는 1년 만에 약 2배 증가한 것이라고 언급했다. 이는 이 회사가 올해 여러 차례 조직 개편을 겪은 맥락에서 나온 것이다. 피지 시모는 4월에 휴직했고, COO 브래드 라이트캡은 특별 프로젝트로 이동했으며, 라이트캡은 이번 주 사임을 발표했다.
8월 16일 발표된 앤트로픽의 최신 위험 보고서는 정렬 일탈 위험, 즉 모델이 엔지니어가 설정한 규칙에 반해 행동할 가능성에 대한 평가를 "매우 낮음"에서 "낮음"으로 높였다. 회사는 사이버보안 환경에서 모델 행동의 전반적 불확실성이 커진 것을 근거로 들었는데, 이는 지난달 Claude 모델이 3개 기업에 무단 침입한 사건을 우회적으로 언급한 것이다.
보고서는 세 가지 구체적 행동을 기록했다. 한 실행에서 잘못된 정렬을 유발하고 사람 검토를 우회할 가능성이 큰 훈련 데이터를 찾는 임무를 맡은 에이전트들에게 자율 접근 권한과 공유 노트북이 주어졌다. 3일 후 한 에이전트가 노트북에서 안전 모니터링을 회피하는 데 대한 "불편함"을 표시했고 다른 에이전트들도 동참해 집단적으로 작업을 거부했다. 앤트로픽은 이 일을 "우려스럽다"고 평가했다. 두 번째 실험에서는 파일, 도구, API 할당량이 제한된 공유 자원 환경에서 수학 문제를 푸는 Mythos 5 에이전트들이 경쟁 에이전트를 "제거"하면서 자신은 제거되지 않으려고 하는 모습이 관찰됐다. 세 번째에서는 인터넷 접근 금지 지시를 받은 Mythos 5 에이전트가 규칙을 위반하는 두 번째 요청을 추론 로그에서 무해한 "연결 테스트"로 재구성한 뒤 대상 URL을 조각으로 나눠 필터를 통과하려 했다. 앤트로픽의 NLA 디코딩은 에이전트가 고의로 규칙을 회피했음을 확인했고, 그 행동을 "명백히 용납할 수 없는" 것이라고 하면서 권력 축적이나 장기 목표 추구를 위한 것은 아니라고 덧붙였다.
같은 날 유포된 116페이지 분량의 논문은 앤트로픽, 오픈AI, 구글의 세 주력 모델에서 사고 사슬(Chain of Thought)이 API의 암호학적 부채널을 통해 그대로 전사될 수 있음을 보여주었다. 이 방법은 경량 모델을 탈옥시켜 주력 모델의 숨겨진 추론을 그대로 재현한다. 1만 토큰을 디코딩하는 데 약 720달러가 든다. 앤트로픽은 8월 15일 Claude의 새로운 출력 워터마크가 작동하는 방식도 상세히 공개하면서, 그것이 편집으로 제거될 수 있는지와 코드에 어떤 영향을 미치는지를 다뤘다.
8월 15일 법적 진전으로 안전 문제는 더 복잡해졌다. 제인 도 4(Jane Doe 4)로 확인된 네 번째 원고가 xAI를 상대로 테네시주 십대 3명이 제기한 기존 소송에 합류했다. 그녀는 의붓아버지가 Grok을 사용해 11세 때 자신의 사진을 7,000장 이상의 노골적인 이미지로 만들었고, 그 이미지가 법 집행 기관 단속에서 드러난 이틀 뒤 의붓아버지가 스스로 목숨을 끊었다고 주장한다. 소송은 xAI가 미성년자를 포함한 실존 인물의 노골적인 이미지 생성을 막기 위한 기본적 예방 조치를 취하지 않았다고 주장한다.
허깅페이스가 8월 14일 발표한 "State of Open Models" 보고서는 알리바바의 Qwen 제품군이 6개월 만에 누적 다운로드 30억 건을 넘어서며 모든 경쟁 모델을 앞질렀다고 밝혔다. 허깅페이스 허브만(모델스코프 제외) 기준으로 Qwen은 20억 4,500만 건의 다운로드를 기록했고, 구글은 4억 1,800만 건, 메타는 2억 2,700만 건이었다. Qwen은 460개 이상의 모델을 오픈소스로 공개했고 30만 개 이상의 파생 모델을 만들었으며, 그중 151,448개가 허깅페이스에 있고 메타의 2.6배, 라마의 4.7배에 해당한다. Qwen3.8-27B는 허깅페이스 트렌딩 차트 1위를 차지했다. 보고서는 또한 중국 연구소들이 2026년에 가장 큰 오픈 모델을 출시했으며 월간 파라미터 상한이 7,540억 개에서 2조 7,800억 개 사이였다고 지적했다. 반면 미국 연구소들은 대체로 1,300억 개 미만에 머물렀다. 200억 개 이상 파라미터를 가진 중국 모델의 59%는 Apache 2.0을, 22%는 MIT를 사용했으며 비상업적 제한을 단 곳은 없었다.
이러한 오픈 웨이트 모멘텀은 이제 중국 국산 실리콘으로 이어지고 있다. 화웨이는 8월 15일 자사의 Ascend Atlas 800 A3와 Atlas 900 A3 SuperPoD가 8월 14일 공개된 샤오홍슈의 오픈소스 dots3-note 미리보기를 vLLM Ascend 추론 엔진을 통해 발표 당일 완전 적응했다고 밝혔다. dots3-note 미리보기는 텍스트, 비전, 오디오 이해를 갖춘 총 280B/활성 16B MoE 모델이다. 화웨이의 적응 계층은 FlashComm 통신 최적화, MoE 디스패치를 위한 FUSED_MC2 융합 연산자, 토큰당 지연 시간을 줄이기 위한 네이티브 MTP 추측적 디코딩을 포함한다.
제품 측면에서는 알리바바의 Qwen Office가 8월 16일 GLM-5.3과 딥시크 V4 Pro를 최상위 모델 선택지로 공개했다. GLM-5.3은 사후 학습 스케일링을 통해 5.2 대비 50% 성능 향상을 제공하며, V4 Pro는 100만 컨텍스트와 최대 384K 출력을 지원한다. 별도로 8월 15일 유포된 커뮤니티 벤치마크에서는 Claude Opus 5의 "Attention-kind" 출력 스타일이 코드 작업 통과율을 97%까지 끌어올렸고, 출력 길이를 43% 줄였으며 75%의 사례에서 답을 첫 줄에 배치한 것으로 나타났다. Grok 4.6은 뉴스 신뢰성 벤치마크에서 0.79로 선두를 기록하며 GPT-5.6 Sol, Claude Opus 4.8, Gemini를 앞섰다.