SpaceXAI, 에이전트 업무 겨냥 Grok 4.6을 $2/$6 요금으로 출시
Grok 4.6은 종합 지표에서 GPT-5.6 Sol Max와 동률을 기록하고 장시간 에이전트 성능을 끌어올리면서 API 가격대를 유지했다. 동시에 NVIDIA는 30B 공개 실행층 모델과 라우팅 라이브러리를 공개해 작업 단가 절감을 겨냥한다.
한 줄 요약
SpaceXAI가 Grok 4.6을 $2/$6 요금으로 출시하고, NVIDIA가 30B 실행층 공개 모델과 라우팅을 내놓으면서, 에이전트 시대의 평가는 토큰 단가가 아니라 작업 단가로 이동하고 있다.
Big Tech
SpaceXAI Grok 4.6: 장시간 에이전트 성능과 중간 가격
SpaceXAI가 장시간 에이전트, 코딩, 지식 업무에 맞춘 프론티어 모델 Grok 4.6을 공개했다. API 요금은 입력 100만 토큰당 $2, 출력 100만 토큰당 $6에서 시작하며, Grok Build와 Cursor, API, OpenRouter·Vercel·Cloudflare 같은 파트너를 통해 쓸 수 있다. 출시 첫 주에는 Grok Build와 Cursor에서 포함 사용량을 두 배로 제공한다. 1
평가에서는 종합 지표인 Artificial Analysis Intelligence Index에서 61점을 기록해 GPT-5.6 Sol Max와 동률을 이뤘고, Grok 4.5 대비 GDPVal-AA v2 Elo 1,753 대 1,526, CursorBench v3.2 69.9% 대 66.7% 등 상승을 보였다. 다만 DeepSWE v1.1(65.9%)은 Sol Max 73%·Fable 5 Max 70%에 뒤지고, Terminal-Bench v3.0(26%)도 Sol Max 34.6%·Fable 5 Max 34.1%에 못 미친다. 1
SpaceXAI는 핵심 변화를 ‘에이전트 행동’ 개선이라고 설명한다. 더 긴 보충 훈련, Grok 4.5로 재생성한 지도 미세조정(SFT) 경로, 코딩·웹 개발·커널 최적화·CAD·지식 업무 전반의 강화학습을 적용해 장기 작업에서 중간 점검과 자기 검증이 늘었다는 것이다. The New Stack은 이를 ‘실패에서 학습해 긴 작업을 버티는’ 방향 전환으로 해석하지만, 이러한 관측치는 독립 검증이 이뤄지지 않았다고 덧붙인다. 2
VentureBeat는 2026-08-12 기준 Artificial Analysis 평가를 종합해 Grok 4.6이 지능-작업당 비용 파레토 경계에서 작업당 $0.84를 기록했다고 전했다. 또 AA-Briefcase에서는 평균 약 53턴과 5억 개 내외 입력 토큰으로 완료했으며, Claude Opus 5 Max는 약 103턴과 20억 개 내외 입력 토큰이 걸렸다고 비교했다. Grok 4.6은 최대 50만 토큰 컨텍스트를 지원하지만 프롬프트가 20만 토큰을 넘으면 입력/캐시/출력 단가가 각각 $4/$1/$12로 상승하므로, 총비용 추정은 토큰가가 아니라 ‘작업 완료 비용’ 기준으로 해야 한다. 3
Industry & Biz
NVIDIA Nemotron 3.5 Lightning·NeMo Switchyard: 에이전트용 공개 모델과 라우팅
NVIDIA는 항상 켜져 있는 에이전트의 ‘실행층’에 맞춘 300억 매개변수 전문가 혼합(MoE) 모델 Nemotron 3.5 Lightning(활성 30억)을 공개하고, 각 단계별로 최적 모델을 자동 선택하는 오픈소스 라우팅 라이브러리 NeMo Switchyard를 함께 발표했다. NVIDIA에 따르면 Lightning은 유사급 대비 최대 4배 출력 속도와 30% 빠른 에이전트 작업 완료를 보이며, Switchyard는 여러 모델을 조합해 품질을 유지하면서 비용·지연을 줄이는 것을 목표로 한다. 4
모델 카드는 100만 토큰 컨텍스트, Mamba-2+MoE+어텐션의 하이브리드 구조, NVFP4·BF16 체크포인트, OpenMDW-1.1 라이선스를 명시한다. 커스터마이즈 전제로 설계된 대형 언어 모델(LLM)이라는 점을 강조한다. 5
NVIDIA는 내부/파트너 테스트 초기 결과도 제시했다. LangChain은 145개 멀티턴 Deep Agents 과제에서 프런티어 호출을 7%만 쓰는 라우팅으로 비용을 74% 낮추고 정확도는 약 6포인트 낮아졌다고 보고했다. Ramp는 Ramp SWE-Bench에서 비용 58% 절감, 실행 시간 33% 단축을, Cognition은 FrontierCode Main에서 평균 비용 28% 절감을 밝혔는데, 모두 파트너·내부 수치로 독립 검증 수치는 아니다. 4
커뮤니티 반응
Hacker News (255↑) — 속도 향상은 체감되지만 워크플로 변화를 만들 정도인지는 의문이고, 하드웨어·통합 관련 지원 문서 부재가 지적된다. 6
"공유해줘서 고마워요. 네, 제 경험도 비슷했어요(2배 또는 3배는 확실히 빨라지긴 했지만), 하지만 초당 45건이라는 기준에서는 워크플로를 바꿀 정도로 획기적이진 않아요. 특히 비동기 작업(제가 로컬 3090으로 사람 개입 없이 계속 돌려놓고 싶은 목적)에선 더 그렇습니다. MTP 결과는 어땠나요? MTP는 "무손실" 아닌가요? 도메인별로 여러 쿼리어들을 평균냈을 때 결과는 여전히 유의미해야 할 것 같아요." — Hacker News 6
"여러 모델 카드에서 Spark 호환성을 주장하는 걸 봤지만, 증거나 지침 없이 그런 경우가 많았어요. NVFP4 모델과 대충 작동하는 vLLM의 패치된 이미지들이 있긴 한데, NVIDIA의 공식 지원을 본 적이 없습니다. 왠지 우선순위가 아닌 것 같아요." — Hacker News 6
나에게 주는 의미
에이전트를 도입한다면 비교 기준을 ‘토큰 단가’가 아닌 ‘작업 완료 비용’으로 전환해야 한다. Grok 4.6의 $2/$6 요금과 Artificial Analysis의 작업당 $0.84 관점은 턴 수, 재시도, 도구 호출이 비용을 좌우함을 보여준다. 긴 컨텍스트 단가는 임계 구간을 넘으면 달라지므로, 실제 워크플로로 소규모 비용 기준선을 만들어 본 뒤 결정을 내려야 한다. 3
복수 모델을 쓰는 조직이라면 라우팅을 검토할 만하다. Switchyard처럼 쉬운 단계는 특화 실행 모델로, 어려운 단계는 프런티어 모델로 보내는 방식은 품질 손실을 최소화하며 비용을 낮출 여지가 있다. 플랫폼 팀에 지원 라우터와 재현 가능성(귀사의 데이터 기준)을 문의해 보자. 4
실사 평가는 간단하다. Grok Build나 Cursor에서 Grok 4.6으로 실제 코딩·리서치 과제를 수행해 보고, 토큰·턴·시간을 기록해 작업당 비용을 계산하라. 회사가 공개한 수치는 가설로 보고 귀사 워크플로에서 검증하는 태도가 필요하다. 1
통합 세부가 성패를 가른다. 커뮤니티는 일부 호환성 가이드와 지원 공백을 지적한다. 문서 품질과 운영 부담까지 고려해 모델·라우팅 선택을 해야 한다. 6
지금 할 일
- Grok 4.6을 Grok Build에서 시험: 20–30분짜리 코딩/리서치 과제를 돌리고 토큰·턴·시간을 기록해 작업당 비용을 계산한다.
- Cursor의 Grok 4.6 혜택 활용: 프로젝트를 Grok 4.6으로 전환해 비 trivial한 코드 변경을 수행하고, 재시도 횟수와 완료 시간을 기존 모델과 비교한다.
- 작업 단가 자료 요청: 사용하는 AI 플랫폼/공급사에 대표 워크플로의 작업당 비용 추정치와 대형 프롬프트에서의 가격 변동 여부를 문의한다.
- 오픈 실행층 모델 체험: 호스팅된 엔드포인트로 NVIDIA Nemotron 3.5 Lightning에 간단한 에이전트형 작업을 던져 보고, 기본 모델 대비 단계 수와 지연을 비교한다.
- 모델 라우팅 소규모 파일럿: Switchyard나 게이트웨이/프록시 플러그인 지원 여부를 플랫폼 팀에 확인하고, 단일 워크플로로 파일럿을 해 본다.
댓글 (0)