제01권 · 제10호 데일리 디스패치 2026년 9월 24일

최신 AI 뉴스 모음집

AI · 논문데일리 큐레이션공개 아카이브
AI 뉴스Business
약 12분

구글, 맞춤형·세밀 제어 가능한 Gemini 3.8 음성 합성 공개

Flash TTS와 Flash‑Lite TTS가 완전히 새로운 목소리를 만들고 대사 한 줄씩 말투를 지시하며, 동의 검증과 워터마크를 갖춘 음성 복제를 지원한다. 배포는 Google AI Studio와 Gemini API에서 시작해 Google Vids와 파트너 앱으로 확대된다.

읽기 모드

한 줄 요약

구글이 음성 합성을 전면 배치하고 유튜브가 크리에이터용 AI를 강화하는 가운데, 샤오미와 BFL의 오픈 웨이트 모델이 더 저렴하고 도입 쉬운 선택지를 넓힌다.

Big Tech

Gemini 3.8 Flash TTS: 맞춤 음성 제작용 신형 합성 모델

구글은 텍스트 음성 변환(TTS) 모델인 Gemini 3.8 Flash TTS와 Flash‑Lite TTS를 공개해, Google AI Studio·Gemini API·Gemini Notebook·Google Vids에서 사실적인 맞춤 음성을 만들고 대사 한 줄씩 말투를 지시할 수 있게 했다. 두 모델은 100개가 넘는 언어를 지원하고 2,000개 이상 제작용 음성 라이브러리를 제공하며, 완전히 새로운 음성을 프롬프트로 설계할 수 있다. 1

창작자는 대사 단위 지시, 장시간 내레이션에서의 음색 유지, 2인 대화 장면의 자연스러운 턴테이킹, 백채널 신호 추가까지 정교하게 제어할 수 있다. 30초 샘플만으로 음성 복제를 지원하며, 동의 검증이 내장되고 모든 오디오에는 SynthID 워터마크와 C2PA 인증이 포함된다. AI Studio의 음성 복제는 일리노이·텍사스·유럽경제지역·영국·스위스·인도에서는 제공되지 않는다. 1

구글은 성능 지표도 제시했다. Gemini 3.8 Flash TTS는 Hume AI의 Voice Design Benchmark에서 71.4 점으로 1위를, 악센트 모델링에서도 60.8로 선두를 기록했고, Flash와 Flash‑Lite는 Hume AI Overall Quality Index에서 각각 1위와 2위를 차지했다. Voice Arena 블라인드 평가에서는 일본어, 브라질 포르투갈어, 베트남어, 현대 표준 아랍어, 멕시코 스페인어, 힌디어 등에서 선호도가 높게 나타났다. 1

배포는 2026년 9월 23일부터 Google AI Studio와 Gemini API에서 시작되며, 기업용은 Gemini Enterprise API로 제공 예정이다. Google Vids에도 적용되고, Agora·LiveKit·Pipecat·Vercel 등 개발자 플랫폼과 Figma·HeyGen·Linguana·Wondercraft·99.co·Ollang 등 파트너가 더빙·현지화·음성 에이전트에 통합한다. 1

유튜브 스튜디오: 초안 피드백·썸네일 테스트·리서치 피드 도입

유튜브는 스튜디오 앱에 AI를 추가해 공개 전 영상의 속도·구성·스토리텔링을 분석해주는 초안 피드백을 제공하고, AI Q&A인 Ask Studio를 iOS와 안드로이드로 확대했다. 또한 플랫폼에서 잘 먹히는 주제를 보여주는 리서치 피드를 도입하고, 영상 내용과 채널 톤에 맞춘 썸네일·제목 생성과 동적 썸네일 A/B 테스트를 지원한다. 2

유튜브에 따르면 크리에이터들은 제목·썸네일 A/B 테스트를 4천만 회 이상 실행했다. 조만간 세 가지 오프닝 컷까지 테스트할 수 있고, 썸네일 성과를 자동 감시해 저성과 이미지는 교체한다. 업데이트된 분석은 단순 지표를 넘어 ‘왜’ 성과가 났는지 설명하고 개선 조언을 제시한다. 2

추가로 쇼핑 제휴 프로그램을 연말까지 35개국으로 확대(참여 크리에이터 130만 명 이상)하고, 크리에이터 설정에 적응하는 옵트인 AI 댓글 모더레이션과 음성·얼굴 결합 유사성 보호를 시험한다. 미국에서는 맞춤 피드(Custom Feeds)를 웹·모바일·TV에 제공하고, TV의 Ask YouTube에 쇼핑 질의와 음성 명령을 추가한다는 내용이 Idaho Statesman(로이터 보도 게재)을 통해 전해졌다. 3

Industry & Biz

블랙 포리스트 랩스 FLUX 3 Action: 오픈 웨이트 로봇 정책 모델 공개

블랙 포리스트 랩스는 카메라 관측·로봇 상태·자연어 지시를 물리 행동으로 바꾸는 70억 매개변수의 오픈 웨이트 ‘세계 행동 모델(WAM)’ FLUX 3 Action을 발표했다. 이 모델은 NVIDIA의 RoboLab‑120에서 42.92% 성과로 공개 리더보드 상의 기존 모델을 앞선다고 밝혔고, 160억 매개변수의 NVIDIA Cosmos3‑Nano‑Policy 대비 1.43배 빠르면서 파라미터는 44%에 그친다. 4

BFL은 가중치·코드·미세조정 레시피·벤치마크·재현 예제(저가 SO‑101 로봇과 Hugging Face LeRobot 연동 포함)를 공개할 계획이라고 했으며, 드론 비행과 게임 ‘둠’ 무사고 클리어 등 아키텍처 데모를 제시했다. 다만 이러한 결과는 초기 실험이며, NVIDIA의 공개 리더보드는 출시 전 확인 시점에 아직 갱신되지 않았다고 VentureBeat는 전했다. 4

개발자 관점에서는 추론 속도와 안정성이 핵심이다. BFL은 압축 변종이 RoboLab 성공률과 실시간성 간 새로운 파레토 경계를 제시한다고 주장하지만, WAM·시각‑언어‑행동(VLA)·액션 추론 모델은 범주가 달라 직접 비교가 어렵다. 실제 도입 전에는 자신들의 로봇과 과제에서 저지연 성능을 검증해야 한다. 4

샤오미 MiMo‑V2.6‑Pro: 오픈 웨이트 1위와 초저가 요금

VentureBeat에 따르면 샤오미 MiMo‑V2.6‑Pro는 Artificial Analysis Intelligence Index에서 46점을 받아 2026년 9월 21~22일 기준 오픈 웨이트 모델 1위를 기록했으며, Grok 4.7과 동률이고 일부 상용 모델을 그 지수에서 앞선다. 함께 더 저렴한 MiMo‑V2.6‑Flash와 Pro‑UltraSpeed 변형도 발표되었다. 5

Times of AI는 샤오미가 MIT 라이선스로 가중치를 Hugging Face에 공개했으며, 텍스트·이미지·비디오·오디오 입력을 네이티브로 받고 컨텍스트 창은 100만 토큰이라고 전했다. 샤오미 API 요금은 Pro가 입력 100만 토큰당 0.435달러, 출력 0.87달러이고, Flash는 0.14/0.28달러이며, 캐시 적중 입력은 100만 토큰당 0.0036달러로 제시된다. 6

샤오미는 대규모 강화학습(RL) 실행이 성능 도약을 이끌었다고 설명한다. 모델별로 약 6일 이내에 30단계 RL과 약 75만 개 궤적을 수행했으며, 비용은 Pro 262만 달러, Flash 85만 달러 수준이라고 보고했다. 또한 학습 환경과 RL 코드를 함께 공개한다고 밝혔다. 긴 컨텍스트 작업을 저비용으로 시험하려는 팀에는 실험 장벽을 낮추는 조합이다. 6

커뮤니티 반응

Hacker News (216↑) — 가격 경쟁력은 인정하지만 과장된 운율·감정 표현을 싫어하고 절제된 ‘컴퓨터 음성’을 선호한다는 의견이 엇갈린다. 7

"제 생각엔 명백합니다: 벤치마크 최고 수준 모델들과는 경쟁할 수 없어요. 대신 가격으로는 경쟁할 수 있고 실제로 경쟁합니다." — Hacker News 7

"네, 제가 써본 거의 모든 "SOTA" 음성 모델은 과장된 표현/감정 때문에 들을 수가 없습니다. 무작위로 강조를 주느라 집중을 뺏기기 때문입니다. ChatGPT 음성 모델은 45초 이상 대화를 이어가기엔 견딜 수 없을 정도예요. 저는 거의 모든 사용 사례(오디오북 제외)에 대해 명료하고 기술적으로 흠잡을 데 없는, 고르게 절제된 "컴퓨터 음성"만 원합니다. 하지만 그런 음성은 화려한 데모를 만들진 못하고 RLHF 평가자 점수도 잘 못 받겠죠." — Hacker News 7

나에게 주는 의미

구글의 새 TTS는 ‘목소리 프리셋’이 아니라 안전장치를 갖춘 ‘브랜드 음성 스튜디오’에 가깝다. 교육 영상, 고객 지원, 내외부 홍보에 맞춘 일관된 보이스를 빠르게 제작할 수 있고, 동의 검증과 워터마크로 공개·고지 정책을 지키기 쉬워진다. Gemini·워크스페이스를 쓰는 조직이라면 연동 장벽도 낮다. 1

크리에이터에게 유튜브 스튜디오의 AI 피드백과 썸네일·오프닝 훅 테스트는 추가 인력 없이 클릭률과 시청지속시간을 끌어올릴 수 있는 도구다. 리서치 피드는 아이데이션 시간을 줄여주고, 개선 포인트 ‘왜’를 설명하는 분석은 운영 의사결정을 더 쉽게 만든다. 핵심은 제품 운영처럼 ‘초안–테스트–반복’이다. 2

예산 측면에서는 샤오미의 MIT 라이선스 오픈 웨이트가 문서·코드베이스·장시간 에이전트 워크로드의 100만 토큰 작업을 더 싸게 만든다. 고성능 모델과 저가 오픈 모델을 작업별로 라우팅하면 긴 컨텍스트 비용을 줄이면서 품질을 유지할 수 있다. 새 API의 보안·법무 검토는 선행해야 한다. 5

로보틱스나 인터랙티브 3D를 다루는 팀이라면, BFL의 오픈 웨이트 정책 모델은 체감 지연이 중요한 과제에서 시행착오를 빠르게 줄일 단서를 준다. 다만 도입 여부는 하드웨어·과제·지연 목표에 달려 있으니, 본격 도입 전 소규모 파일럿으로 계측·검증하길 권한다. 4

지금 할 일

  1. Google AI Studio에서 브랜드 보이스 설계: 새 오디오 플레이그라운드로 맞춤 음성 1개와 60초 스크립트를 만들고, 대사 지시·2인 대화·동의·워터마크 흐름을 점검한다.
  2. 유튜브 스튜디오 최적화 스프린트: 비공개 영상 1개로 AI 초안 피드백을 받고, 썸네일 3종·제목 2종 A/B 테스트를 실행해 1주간 클릭률·잔존을 비교한다.
  3. MiMo‑V2.6 장문 작업 체험: 샤오미 API(Pro 또는 저가 Flash)로 20만 토큰 사양서나 코드베이스 요약을 실행해 현행 모델 대비 비용·속도를 비교한다.
  4. 음성 복제 내부 정책 1페이지 작성: 동의 녹음, 워터마크 보관, 공개 문구를 정의해 합성 음성을 책임 있게 사용할 수 있게 한다.
  5. FLUX 3 Action 적합성 검토: 모델 자료와 RoboLab 과제 목록을 읽고, 지연 민감도가 높은 업무 1건을 다음 단계 프로토타입 대상으로 선정한다.

출처 8

도움이 되었나요?

댓글 (0)