제01권 · 제10호 데일리 디스패치 2026년 8월 9일

최신 AI 뉴스 모음집

AI · 논문데일리 큐레이션공개 아카이브
AI 뉴스Business
약 10분

알리바바, 2.4조 파라미터 Qwen 모델 공개 — 글로벌 경쟁 압박 커진다

알리바바의 Qwen3.8-Max는 100만 토큰 컨텍스트와 최상급 모델급 성능을 주장한다. 100억 달러 규모 컴퓨트 계약과 AMD의 추론 칩 인수는 경쟁이 성능·비용·인프라 중심으로 옮겨가고 있음을 보여준다.

읽기 모드

한 줄 요약

중국의 새 플래그십 모델이 등장하고, 스타트업은 대형 컴퓨트 계약을 맺으며, 칩메이커는 추론 전용 하드웨어를 보강했다 — 이번 주 핵심은 성능, 비용, 그리고 이를 떠받치는 인프라다.

Big Tech

Qwen3.8-Max: 알리바바, 2.4조 파라미터 모델 공개

전자상거래와 클라우드로 알려진 알리바바가 지금까지 가장 강력한 AI 모델 Qwen3.8-Max를 공개했다. 파라미터는 2.4조에 달하며, 블룸버그 보도에 따르면 앤스로픽 Fable 5에 견주거나 일부 벤치마크에서 더 낫다고 주장한다. 이번 출시는 중국 빅테크가 미국 프런티어 연구소의 간판 벤치마크에 정면 도전하는 흐름을 강화한다. 1

로이터 보도에 따르면 Qwen3.8-Max는 최대 100만 토큰 컨텍스트를 지원하며, 공개 직후 Arena.AI에서 텍스트 기준 중국 최고 순위를, 비주얼 리더보드에서는 2위를 기록했다. 공개 이후 홍콩 증시에서 알리바바 주가는 7% 상승했다. 이 모델은 텍스트·이미지·비디오를 아우르는 멀티모달을 지원한다. 2

ByteIota의 분석은 Qwen3.8-Max를 전문가 혼합(MoE) 구조로 설명한다. 총 2.4조 파라미터 중 토큰당 약 950억 파라미터만 활성화되어, 겉보기 규모 대비 추론 비용을 낮추는 설계라는 해석이다. 또한 텍스트·이미지·비디오 입력과 응용 프로그래밍 인터페이스(API) 호환성 패턴을 언급한다. 3

ByteIota는 알리바바 내부 평가가 코딩·에이전틱 작업에서 강점을 주장한다고 소개하면서도, 서드파티 리더보드는 코딩 성능에 대해 엇갈린 그림을 보여주고 추론·명령 따르기에서 높은 평가를 받는다고 전한다. 8월 10일 공개 가중치(오픈 웨이트) 배포가 예정되어 있다는 보도와 함께, 2.4조 ‘Max’ 모델은 대부분 팀이 자체 호스팅하기 어렵고 라이선스 조항이 핵심 변수라고 경고한다. 코딩 관련 주장은 보수적으로 해석하고, 최종 라이선스를 확인한 뒤 도입을 검토해야 한다. 3

Industry & Biz

Volta: 24억 달러 가치 평가, 100억 달러 계약

설립 7개월 된 AI 인프라 스타트업 Volta Infra가 24억 달러 가치로 자금을 조달하고, 유럽에서 Bitdeer와 함께 클라우드 컴퓨팅을 제공하는 100억 달러 규모 계약을 발표했다. 노르웨이 133메가와트 규모 사이트에서 엔비디아 Vera Rubin 칩을 사용한다는 설명이며, 로이터는 블룸버그가 상대방을 앤스로픽이라고 보도했다고 전하면서도 이를 독자 확인하지는 못했다고 밝혔다. Volta는 자산운용사 Azora와 50억 달러 규모 AI 인프라 프로그램도 발표했다. 4

투자사 a16z는 Volta의 시리즈 A 공동 주도를 밝히며, 프로젝트 파이낸스와 클라우드 운영을 결합해 AI 네이티브 기업의 컴퓨트 접근을 넓히는 ‘네오클라우드’로 포지셔닝했다. 노르웨이 133MW 배치와 Azora 프로그램을 그 사례로 제시했다. 구매자 관점에서는 하이퍼스케일러 외 장기 예약 GPU 대안이 늘어날 가능성을 시사한다. 5

AMD-Taalas: 모델 맞춤형 추론 칩 인수

AMD가 단일 AI 모델에 맞춰 하드와이어링된 가속기를 설계하는 토론토 스타트업 Taalas 인수에 합의했다. 유연성은 낮지만 특정 작업에서 비용과 지연을 줄이는 접근이다. CNBC에 따르면 Taalas는 2023년 이후 2.19억 달러를 조달했으며, 현재는 소형 Llama 3.1을 구동하고 미지 모델도 약 2개월 내 실리콘으로 구현할 수 있다고 주장한다. 인수 금액은 비공개다. 6

CNBC는 AMD가 Taalas 기술을 중앙처리장치와 Instinct GPU를 포함한 시스템에 통합할 계획이며, 메타와 마이크로소프트에 출하 중인 랙스케일 시스템 Helios를 보완한다고 전한다. 또한 AMD가 Cerebras와 통합 파트너십을 발표한 바 있고, 이번 딜은 엔비디아의 200억 달러 규모 Groq 자산 인수 약 7개월 뒤에 나온 것이다. 6

캐나다 매체는 자국 반도체 스타트업이 스케일업에 어려움을 겪는 구조적 문제의 일환으로 이번 거래를 해석한다. Calgary Herald는 AMD가 Taalas 기술로 AI 추론 성능과 효율을 강화한다는 입장을 전하는 한편, 캐나다 생태계의 자본·상용화 공백을 지적하는 업계 목소리를 전했다. 7

New Tools

Radar Researcher: 인터넷 데이터 질의용 AI 도구 출시

Cloudflare가 자사 Cloudflare Radar 데이터셋을 평이한 문장으로 탐색할 수 있게 돕는 AI 도구 Radar Researcher를 공개했다. 트래픽 패턴, 보안 이벤트, 지역별 변화를 질의하면 읽기 쉬운 답변과 차트를 생성하도록 설계되었다. 8

SQL이나 맞춤형 대시보드 없이도 커뮤니케이션, 운영, 보안 부서가 신뢰할 수 있는 인터넷 계측 데이터를 신속히 인용할 수 있다는 점을 내세운다. 네트워크 규모의 데이터를 더 많은 사용자가 활용하도록 하려는 Cloudflare의 전략 연장선이다. 8

Rippling AI Spend Console: 직원·팀별 AI 비용 관리

HR 소프트웨어 업체 Rippling이 직원·팀·도구별 AI 사용량과 비용을 추적·통제하고, AI 게이트웨이를 통해 작업별로 비용 효율적 모델로 라우팅하는 AI Spend Console을 출시했다. TechCrunch에 따르면 Rippling은 토큰 비용이 R&D 인건비의 40%에 이를 추세였고, 전체 지출의 약 60%를 10~15% 인원이 차지했으며 한 엔지니어가 월 5만 달러를 쓰는 사례도 있었다고 밝혔다. 9

TechCrunch 보도에 따르면 벤더별 상한을 협상하고 거버넌스를 적용한 뒤에도 사용량은 유지하면서(7월 6000억 토큰) 비용은 4월 대비 37% 수준으로 낮췄다. 이 콘솔은 Rippling HR 고객에게 포함되며 AI 사용량 기반 추가 비용이 있고, 단독 제품으로도 판매된다. 9

나에게 주는 의미

제품·운영 리더는 장문 처리와 추론 중심 업무의 기준이 높아지고 있음을 전제로 테스트해야 한다. Qwen3.8‑Max는 100만 토큰 컨텍스트 등 강점을 시사하지만, 벤치마크 평가는 엇갈리고 라이선스가 관건이다. 자체 가중치 사용을 검토한다면 최종 라이선스를 먼저 확인하라. 3

조달·데이터 리더에게 Volta 이슈는 하이퍼스케일러 외 장기 예약 GPU를 확보할 경로가 늘어날 가능성을 보여준다. 예약 컴퓨트를 검토한다면 전력·칩 세대·계약 기간 조건을 현재 클라우드 약정과 나란히 비교하는 것이 필요하다. 4

CFO와 팀 리드는 AI 비용을 사용량이 아니라 산출과 연결해 보아야 한다. 기본 모델을 작업별로 정하고, 사용자·팀별 상한을 설정하며, 프롬프트 대비 산출 비율을 추적해 토큰 지출이 생산성과 함께 증가하도록 관리하라. 9

커뮤니케이션·마케팅·보안 팀은 Cloudflare Radar Researcher로 인터넷 트렌드 질문을 신속히 시각화해 리포트나 이해관계자 업데이트에 활용할 수 있다. 별도 대시보드를 만들지 않고도 신뢰 가능한 데이터를 인용할 수 있다. 8

지금 할 일

  1. 사이드바이사이드 모델 점검: 실제 업무 프롬프트 20~50개로 Qwen3.8‑Max(접근 가능 시)와 현행 모델을 장문·추론 과제에서 비교해 강약점을 문서화하라.
  2. AI 지출 가드레일 설정: 지난달 AI 청구서를 모아 사용자·팀별 상한을 정하고, 요약·문법 교정 등 일상 작업은 저비용 모델을 기본값으로, 복잡 과제만 고성능 모델을 쓰게 하라.
  3. Cloudflare Radar Researcher 체험: 자국/ISP 트래픽 변화 등 비즈니스 관련 질문을 던져 차트를 만들고 다음 리포트에 포함하라.
  4. 멀티모델 게이트웨이 파일럿 요청: IT팀에 작업별 최적 모델로 라우팅하고 역할별 예산을 적용하는 AI 게이트웨이 평가·도입을 요청하라.
  5. 지연 민감 사용사례 매핑: 전환율·UX에 민감한 상위 5개 AI 상호작용을 목록화하고, 목표 응답시간과 모델 선택을 엔지니어링과 합의하라.

출처 9

도움이 되었나요?

댓글 (0)