제01권 · 제10호 데일리 디스패치 2026년 9월 23일

최신 AI 뉴스 모음집

AI · 논문데일리 큐레이션공개 아카이브
AI 뉴스Research
약 10분

오픈AI, GPT-6 Sol·Luna 토큰 요금 50% 인하—캐싱 효율도 강화

중간급 GPT‑6 모델이 100만 토큰당 $2/$10, $0.10/$0.50로 출시되고, 캐시된 입력은 90% 할인된다. 오픈AI는 단순 점수보다 ‘작업 1건당 비용’ 개선을 전면에 내세운다.

읽기 모드

한 줄 요약

오픈AI가 비용을 크게 낮춘 GPT‑6 모델과 캐싱 개선을 내놓았고, 연구에서는 8비트 강화학습의 안정화와 모델·에이전트의 최신화 방법을 제시했으며, 서빙·프런트엔드 오픈소스 스택도 성숙해지고 있다.

LLM & SOTA Models

오픈AI GPT-6 Sol·Luna: API 가격 50% 인하

오픈AI는 일상적 업무를 더 적은 비용으로 처리하도록 토큰 가격을 절반으로 낮추고, 재사용되는 문맥을 더 싸게 읽게 만든 두 모델을 공개한다. GPT‑6 Sol은 100만 입력 토큰당 $2, 출력 토큰당 $10(이전 GPT‑5.6 Sol의 $4/$20에서 인하), GPT‑6 Luna는 $0.10/$0.50(이전 $0.20/$1.20에서 인하)이다. 플러스·프로·비즈니스·엔터프라이즈·에듀 사용자는 ChatGPT Work와 Codex에서, 무료·Go 사용자는 데스크톱 앱에서 Luna를 쓸 수 있다. 오픈AI 응용프로그램 인터페이스(API)에서는 ‘gpt‑6‑sol’, ‘gpt‑6‑luna’로 제공되며, Chat에는 아직 제공되지 않는다(2026-09-22 기준). 1

엔드투엔드 워크플로 벤치마크에서 오픈AI는 GPT‑6 Sol이 AutomationBench에서 초고효력 설정으로 33.2%를 기록하며 작업당 비용 $0.27을 달성했다고 보고한다. Agents’ Last Exam에서는 Sol이 56.4%를 기록했고, 해당 비교 설정에서 Claude Opus 5 대비 작업당 비용이 60% 낮았다. 코딩에서는 Sol이 DeepSWE 1.1에서 68.8%(비교군 Claude Fable 5는 더 높은 효력에서 69.9%)로 유사 정확도를 보이면서 작업당 비용을 크게 낮췄고, Luna는 66.6%로 비교된 Anthropic 구성 대비 비용을 크게 줄였다. 내부 사실성 평가에서는 Sol이 GPT‑5.6 Sol 대비 사실 오류를 절반가량 줄여, 더 낮은 비용으로 Astra에 근접한 신뢰도를 보였다고 한다. 1

오픈AI는 긴 대화와 에이전트의 총비용도 바꾸고 있다. GPT‑6의 프롬프트 캐싱 기본 적중률을 높이고, 캐시된 입력 토큰 읽기에 90% 할인을 적용한다. 개발자는 추론 노력 수준이나 도구 켜짐/꺼짐을 바꿔도 캐시가 깨지지 않으며, 대시보드와 진단 도구로 캐시 누락 원인을 확인할 수 있다. GitHub는 수개월 동안 이러한 개선으로 오픈AI 모델에 대한 수십억 건 요청에서 새로 처리해야 하는 프롬프트 토큰 비율이 50% 이상 줄었다고 보고했다. 1

경쟁 구도에서 VentureBeat는 Sol·Luna 가격이 상시 가격이라고 전하며, 오픈AI가 ‘작업 1건당 비용’을 강조한다고 정리한다. Anthropic의 Opus 5.5는 100만 토큰당 $4/$20, Claude Sonnet 5는 $2/$10이며, 구글 Gemini 3.8 Flash는 2026-12-31까지 $0.75/$3.75 후 2027-01-01부터 $1.50/$7.50로 인상된다. 또한 Sol과 Opus 5.5의 ‘동일 조건’ 공개 비교 결과는 아직 없다고 지적한다. 2

Open Source & Repos

SGLang: 대형·멀티모달 모델 고속 서빙

SGLang은 대형 언어 모델과 멀티모달 모델을 낮은 지연과 높은 처리량으로 제공하는 고성능 서빙 프레임워크다. v0.5.20 릴리스는 237명의 기여자가 올린 713개의 PR 등 활발한 개발 현황을 보여주며, 지원 모델 추가와 함께 문서·쿠크북을 갱신했다. 3

에이전트·어시스턴트를 만드는 팀에 서빙 계층은 배칭을 효율화하고 규모가 커져도 응답 시간을 일정하게 유지하는 데 중요하며, 공유 GPU 환경에서도 예측 가능한 운영을 돕는다. 3

CopilotKit: 에이전트·생성형 UI 프런트엔드 스택 업데이트

CopilotKit은 React, Angular, Vue, React Native와 Slack·Microsoft Teams 등 채널 전반에서 에이전트 지향 애플리케이션과 생성형 UI를 구축하는 프런트엔드 스택이다. v1.73.3 업데이트는 온보딩에서 명령줄 대신 ‘호스팅된 프롬프트 링크 복사’ 기능을 추가하고, 대화 결과·실패의 정확도를 높이는 인스펙터 수정을 포함한다. 4

공유 상태, 휴먼 인 더 루프 워크플로, AG‑UI 프로토콜을 제공해 다양한 프레임워크와 채널을 아우르는 제안형 인터페이스를 빠르게 도입하도록 돕는다. 4

Research Papers

FP8 전과정 강화학습: 보정형 클리핑으로 안정화

이 논문은 대형 언어 모델(LLM)을 위한 강화학습(RL) 전 과정을 8비트 부동소수점(FP8)으로 돌릴 때 발생하는 불안정성을 다룬다. 저자들은 학습 중반 엔트로피 급등과 출력 붕괴의 원인을 FP8 양자화 잡음이 중요도 비율을 왜곡해 음의 어드밴티지 토큰을 신뢰 구역 밖으로 밀어내고 그레이디언트를 0으로 만드는 데서 찾았고, bfloat16(BF16) 분포에 맞춰 FP8 클리핑 경계를 동적으로 정렬하는 ‘보정형 클리핑(Calibrated Clipping)’을 제안한다. 5

8B~32B 규모와 다양한 FP8 스케일링 설정에서 실험한 결과, 제안 방법은 엔트로피 급등을 제거하고 BF16 기준선에 준하는 성능을 회복했다. 기존의 학습·추론 불일치 보정보다 한 단계 더 근본적인 불안정성을 해결하는 접근으로, 제한된 자원에서 RL 파이프라인의 속도와 안정성을 함께 노릴 길을 시사한다. 5

연속 학습: 모델·에이전트를 최신 상태로 유지하는 방법

‘Time‑Incremental Continued Pretraining of LLMs’는 학습 컷오프 이후 데이터만으로 모델을 갱신하는 설정을 다루며, OLMo2 1B/7B, Llama‑3.2 1B/3B, Llama‑3.1‑8B, Gemma‑3‑1B 등 여섯 개 공개 가중치 모델이 새로운 지식을 흡수하면서도 파국적 망각 없이 기존 지식을 유지함을 보인다. 13개 다운스트림 과제의 거시 평균 정확도는 모든 모델에서 기준선 대비 0.01 이내였고, 선별한 60억(6B) 토큰이 400억(40B) 토큰과 맞먹는 효과를 보였으며, 지식 습득과 일반 능력 최적 학습률은 약 10배 차이가 났다. 충분한 랭크의 저차원 적응(LoRA)은 전체 CPT에 필적했고, 이후 지도 미세조정(SFT)에서도 이득이 유지되며 직접 선호도 최적화(DPO)의 영향은 패밀리별로 달랐다. 6

ACLArena는 에이전트의 연속 학습을 분석하며 온정책 다중 교사 증류, 자체 증류 미세조정, 모델 병합을 비교했다. 이어 고품질 궤적에 대한 오프라인 리플레이와, RL로 전문화한 다중 LoRA 전문가를 라우팅하는 네트워크를 결합한 레시피를 제안해 도메인을 가로질러 능력을 보존·확장한다. 7

EvoPathBench는 자기 진화 에이전트를 능력 단위로 과정 평가하는 벤치마크를 제시해, 특정 능력이 언제 생기고 이후 업데이트가 그것을 강화·유지·약화하는지 추적한다. 하이브리드 실거래 데이터와 생성 궤적으로 만든 1,800개 스트림에서, 분포 이동 시 일반화 이득이 약화되고 망각은 소수 경로에 집중되며 안정적인 규칙 적응은 아직 확립되지 않았다는 점을 보고하며, 후보 평가·선정이 핵심 병목임을 지적한다. 8

커뮤니티 반응

Hacker News (931↑) — 큰 폭의 가격 인하에 대한 기대와, 일부 성능 후퇴 가능성 및 공급사마다 다른 토큰 계산 방식에 대한 우려가 교차한다. 9

"눈에 띄는 점은 Luna가 가격을 60% 내리면서 코딩 성능이 약간 후퇴했다는 것입니다. 대량 작업에는 그 가격이면 사실상 공짜나 다름없어 괜찮은 거래지만, 최신이 항상 더 낫다는 건 아님을 보여줍니다." — Hacker News 9

"와, Luna가 더 싸지고 있다니 믿기지 않네요. 제 생각엔 이 모델이 세상을 바꿀 겁니다. 모두가 토큰 비용이 너무 비싸다고 했지만, 이젠 환상적인 성능을 유지하면서 거의 무료에 가까워지고 있습니다." — Hacker News 9

Hacker News (197↑) — CopilotKit의 방향성에 호감이 있으나, 제안 지연 시간과 프레임워크 범위 표기의 명확성을 요구하는 목소리가 있다. 10

"OpenAI 요금 폭탄 맞기 쉬운 한 방의 트릭! 농담이고 — 깔끕해 보이네요! 데모에서 보이는 것보다 제안 지연 시간을 줄일 계획이 있으신가요?" — Hacker News 10

"이걸 React 플러그인이라고 더 명확히 표시하면 좋겠어요. 'textarea의 드롭인 대체'라고 보고 웹 컴포넌트인 줄 알았고, 더 읽어보고 나서야 React 플러그인이라는 걸 알았어요. 큰 문제는 아니지만 플러그인이지 독립 실행형이 아니니 처음부터 명확히 하는 편이 좋을 것 같아요." — Hacker News 10

왜 중요한가

토큰 가격 인하와 캐시된 입력 90% 할인은 긴 대화·에이전트의 ‘작업 1건당 비용’을 바꾸는 지렛대다. 공급사마다 토큰 계산과 캐시 정책이 달라지는 만큼, 단순 토큰 단가보다 실제 워크플로 완수당 비용을 측정하는 것이 명확하다. 2

연구 측면에서는 FP8 전과정 강화학습 안정화와 시계열 지속 사전학습이 더 저렴하고 안정적인 훈련·유지보수를 가리키며, 과정 중심의 에이전트 평가가 일반화·보존·규칙 적응 같은 핵심 지표를 정리해준다. 동시에 SGLang과 CopilotKit 같은 서빙·UI 스택이 이러한 시스템의 제품화를 현실적으로 뒷받침한다. 5

이번 주 시도해볼 것

  1. GPT‑6 Luna 체험: ChatGPT 데스크톱 앱에서 ‘GPT‑6 Luna’를 선택해 문서 요약·추출 작업을 현재 기본 모델과 속도·품질로 비교해 보자. 안내: https://openai.com/index/introducing-gpt-6-sol-and-luna/
  2. SGLang 로컬 실행: GitHub 퀵스타트를 따라 서빙을 띄우고 배칭/지연 특성을 직접 확인해 보자. https://github.com/sgl-project/sglang

출처 11

도움이 되었나요?

댓글 (0)