★★★
SpaceXAI Debuts Grok 4.6, Overtaking Kimi K3's Performance and Matching GPT-5.6-Sol for World's Third Best on Artificial Analysis
SpaceXAI가 Grok 4.6을 공개했다. Artificial Analysis 기준 세계 3위(GPT-5.6-Sol과 동점), Kimi K3를 추월했다.
기존 Grok 4.5 대비 추론·코딩·수학 전 영역에서 개선됐으며, 특히 대형 컨텍스트 처리에서 두각을 나타냈다. API 가격은 이전 대비 소폭 인상됐으나 경쟁 모델 수준을 유지한다.
중국 Kimi K3를 직접 제치며 서방 모델이 다시 리더보드 상위권을 차지한 점이 주목된다. 글로벌 LLM 경쟁 구도가 재편되는 신호다.
★★★
DeepSeek's Top-Ranked V4 Flash Stumbles on Real Agent Tasks as Its Prices Surge
DeepSeek V4 Flash가 벤치마크 1위임에도 실제 에이전트 작업에서 53.8% 완료율에 그쳤다. 8월 16일부터 출력 토큰 가격이 $0.28→$1.32/M으로 11배 급등했다.
실전 에이전트 시나리오에서 도구 사용 오류·중간 실패·맥락 유실 등이 복합적으로 발생했다. 가격 인상은 공지 없이 즉각 적용됐으며, 이미 DeepSeek API를 활용한 스타트업 다수가 비용 충격을 받았다.
벤치마크와 실전 성능 간 괴리가 다시 드러났다. 가격 11배 급등은 DeepSeek 의존 사업 모델의 리스크를 부각한다.
★★
Z.ai Debuts GLM-5.3 with Long-Horizon Coding and Cybersecurity Upgrades
중국 Z.ai가 743B 파라미터 기반 GLM-5.3을 출시했다. 포스트트레이닝만으로 Terminal-Bench 3.0 점수가 4.6에서 28.3으로 6배 이상 향상됐다.
장기 코딩 태스크와 사이버보안 특화 설계가 특징이다. CyberBench에서 84.5%를 기록하며 동급 최고 수준을 달성했다. 베이스 모델 교체 없이 포스트트레이닝만으로 도달한 점이 주목받는다.
포스트트레이닝의 가능성을 재확인한 사례로, 기업용 보안·코딩 에이전트 시장에서 중국 모델의 경쟁력이 높아지고 있다.
★★
Google Will Shut Down Three Imagen 4 API Models August 17
구글이 Imagen 4 API 3개 엔드포인트를 2026년 8월 17일부로 종료했다. 대체 모델인 Gemini 3.1 Flash Image 가격은 기존 대비 최대 3배 높다.
Imagen 4 계열 3종($0.02~0.06/1K)이 폐지되고, Gemini 3.1 Flash Image($0.067/1K)로 전환이 필요하다. API 코드 변경이 수반되며 기존 워크플로 마이그레이션이 필요하다.
구글이 이미지 생성 API를 Gemini 생태계로 통합하는 과정에서 개발자 전환 비용이 발생한다. 이미지 생성 시장에서 가격 상승 압력이 지속된다.