구글, Gemini 3.6 Flash와 3.5 Flash‑Lite 출시 — 에이전트 속도 개선과 비용 절감
새 Flash 모델은 3.5 Flash 대비 출력 토큰 17% 절감, Lite의 최대 1초당 350토큰, CodeMender용 사이버보안 특화 모델을 더 낮은 토큰 단가로 제공한다.
한 줄 요약
구글의 새 Gemini Flash 모델은 에이전트 실행의 지연과 토큰 비용을 줄이고, Kimi K3 공개 가중치로 자체 호스팅 선택지가 넓어졌으며, 연구계는 데이터 준비와 에이전트 메모리 관리로 병목을 정면 돌파한다.
LLM & SOTA Models
구글, Gemini 3.6 Flash·3.5 Flash-Lite·사이버 변형 공개
구글은 실제 서비스용 AI 에이전트를 더 빠르고 저렴하게 만들기 위해 Gemini 3.6 Flash, 3.5 Flash‑Lite, 그리고 CodeMender용 사이버보안 특화 3.5 Flash Cyber를 내놓는다. 3.6 Flash는 3.5 Flash 대비 출력 토큰을 17% 적게 쓰며(일부 벤치마크에서는 최대 65%), 요금은 입력 토큰 100만 개당 1.50달러, 출력 토큰 100만 개당 7.50달러로 낮아졌다. 3.5 Flash‑Lite는 인공지능 분석(Artificial Analysis) 기준 1초당 350토큰의 처리 속도에 초점을 맞춘다. 1
3.6 Flash는 다양한 과제에서 3.5 Flash 대비 뚜렷한 개선을 보인다. 코딩 성능 DeepSWE 49% 대 37%, ML 연구 성능 MLE Bench 63.9% 대 49.7%, 컴퓨터 사용 능력 OSWorld‑Verified 83.0% 대 78.4%다. “컴퓨터 사용” 기능은 이제 Gemini 응용 프로그램 인터페이스(API)와 Gemini Enterprise의 클라이언트 측 도구로 기본 제공된다. 지식 작업 벤치마크 GDPval‑AA v2는 1421 대 1349로 상승했다. 1
3.5 Flash‑Lite는 입력 토큰 100만 개당 0.30달러, 출력 토큰 100만 개당 2.50달러로 책정되었고, 이전 Lite 세대를 크게 앞선다. 또한 SWE‑Bench Pro(54.2% 대 49.6%)와 OSWorld‑Verified(74.0% 대 65.1%) 등 일부 평가에서는 3 Flash보다도 높게 나온다. Terminal‑Bench 2.1 54% 대 31%, GDM‑MRCR v2 72.2% 대 60.1%, GDPval‑AA v2 1140 대 642 수치도 제시된다. 1
구글은 3.6 Flash가 화학·생물·방사선·핵(CBRN)과 사이버 오용에 대한 안전장치를 강화해 탈옥(jailbreak) 저항성을 높이는 동시에 정당한 요청에 대한 불필요한 거절을 줄였다고 밝힌다. 3.5 Flash Cyber는 정부와 신뢰 파트너를 대상으로 한 제한적 파일럿으로 CodeMender 내에서 제공될 예정이며, Gemini 3.5 Pro는 파트너 테스트 중이고 Gemini 4 사전 학습도 시작됐다고 덧붙인다. 1
Open Source & Repos
문샷 Kimi K3: 공개 가중치로 2.8조 파라미터 모델 배포 가능
Moonshot AI는 Kimi K3의 가중치를 공개해 누구나 자체 인프라에서 이 대형 언어 모델(LLM)을 실행·미세조정할 수 있게 했다. 파라미터 2.8조 규모로, 더 버지는 이를 현재 공개 가중치 기준 최대 규모 모델이라고 소개한다. 2
Kimi K3는 전문가 혼합(Mixture of Experts, MoE) 구조로 896개 전문가 중 토큰당 16개를 활성화하고, 100만 토큰 컨텍스트 창, 기본 비전 입력, Kimi Delta Attention 등 새로운 주의(attention) 메커니즘을 갖췄다. 설계 초점은 긴 컨텍스트에서도 계산·메모리 급증을 피하는 효율성이다. 3
가중치는 수익 구간을 둔 Kimi K3 라이선스로 배포된다. “모델‑서비스(Model‑as‑a‑Service)”를 제공하는 사업자는 연속 12개월 동안 총매출 2,000만 달러를 넘기면 별도 계약이 필요하고, 매우 대규모 배포는 UI에 “Kimi K3”를 명시적으로 표기해야 한다. 내부 사용은 해당 조건에서 제외된다. 배포 가이드(예: 가속기 64+ 장비의 수퍼노드), vLLM용 캐시 기여, 입력 100만 토큰당 3달러·출력 100만 토큰당 15달러의 호스팅 API 가격도 문서화되어 있다. 4
Research Papers
DataPrep-Bench: 학습 데이터 준비 품질을 한 번에 평가
이 연구는 대형 언어 모델(LLM), 에이전트, 데이터 중심 워크플로가 학습 데이터를 끝단까지 얼마나 잘 준비하는지 두 능력으로 평가한다. 원천을 감독 학습용으로 만드는 구성(데이터 구성)과, 학습 전 후보 데이터셋의 유용성을 예측하는 품질 평가다. 저자들은 Llama‑3.1‑8B Finance에서 Dolly만 사용한 기준선을 거의 20포인트 끌어올린 Data‑Construction‑Skill 에이전트를 공개한다. 5
품질 평가는 분포 정렬 점수(Distributional Alignment Score, DAS)를 제안한다. 이는 후보 데이터셋과 도메인 프록시 간 최대 평균 차이(MMD)를 이용하는 방식이다. DAS는 6개 도메인 중 4개에서 교차 모델 상관이 가장 높았고, 수학·과학·의학에서 동시에 상관 r > 0.70을 넘긴 유일한 지표였다. 5
에이전트 컨텍스트를 수명주기로 본다: Agentic Context Management
이 논문은 실제 서비스 에이전트의 실패가 추론력보다 컨텍스트 관리 실패에서 더 자주 비롯된다고 본다. 누적 대화 이력, 거대한 프롬프트, 비대한 도구 정의·출력으로 토큰 비용이 회차마다 불어난다. 저자들은 메모리를 저장·검색 문제가 아니라 “무엇을 기억·구조화·저장·통합·망각할지, 지금 무엇이 중요하고 다음에 무엇이 필요할지, 예산 안에서 핵심을 잃지 않고 압축할지”를 다루는 수명주기로 재정의하고, 다섯 가지 원시 연산(설계, 수집, 범위화, 예측, 압축·통합)으로 분해한다. 6
경제적으로는 순진한 누적이 대화 길이에 따라 토큰 비용을 제곱으로 키우고, 조잡한 요약은 선형 비용을 사지만 정확도 절벽을 낳는다. 검증된 압축만이 정확도를 유지한 채 선형 비용을 달성한다. 참조 구현 Maximem Synap은 특정 설정에서 LongMemEval 92%, LoCoMo 93.2% 점수를 보고한다. 6
Interactive Training 2: 실시간 학습을 조종하는 공개 제어면
Interactive Training 2는 학습기별 코드 수정 없이 공유 프로토콜로 실시간 학습을 조종하는 공개 제어면을 제안한다. 학습 앱이 조정 가능한 설정·동작을 선언하고, 사람·자동 제어기가 동일 인터페이스로 요청을 제출하면, 학습 루프가 안전 제어 지점에서 검증·적용한다. 맞춤 Aim 워크스페이스는 라이브 지표, 컨트롤, 요청·결과의 연대기 기록을 결합한다. 7
저자들은 자연어 처리(NLP)와 강화 학습(RL) 워크플로 다섯 가지에서 시스템을 시연하며, 단순 실험 추적을 넘어 감사 가능한 사람·에이전트 주도 학습의 재사용 토대를 제시한다. 7
커뮤니티 반응
Hacker News (758↑) — Gemini의 탁월한 다국어 능력을 인정하는 의견과, 경쟁력·과대평가에 대한 회의가 엇갈린다. 8
"선택의 여지가 없습니다. 제 애플리케이션은 많은 모델을 테스트하고 벤치마크했지만, 다국어 지원과 이해력 면에서 어떤 모델도 Gemini와 같은 수준이 될 수 없습니다." — Hacker News 8
"제 생각엔 그들은 한동안 뒤처져 있었습니다 - Flash는 glm 5.2와도 경쟁력이 없고, 3.5 Flash 출시 당시의 과대광고는 분명 의도한 바가 아니었을 겁니다" — Hacker News 8
왜 중요한가
오늘의 소식은 AI 에이전트를 프로토타입에서 운영 단계로 옮기는 동력에 가깝다. 토큰 사용 감소, 처리량 향상, 안전장치 강화는 실제 비용과 지연을 함께 낮추면서 성능을 유지한다. 1
동시에 Kimi K3 같은 공개 가중치는 도입 선택지(자체 호스팅 대(API) 사용)를 넓히고, 데이터 준비·컨텍스트 관리 연구는 품질과 비용을 갉아먹는 숨은 병목 두 가지에 직접 대응한다. 4
이번 주 시도해볼 것
- Gemini 3.6 Flash 체험: Google AI Studio에서 새 모델로 대화 시작해 응답 속도·토큰 길이를 비교한다 (https://aistudio.google.com/prompts/new_chat?model=gemini-3.6-flash)
- DataPrep‑Bench 훑어보기: 초록과 도표 1을 통해 데이터 구성·품질 평가의 두 축을 이해한다 (https://arxiv.org/abs/2607.20465)
댓글 (0)