AI 및 선도 기술 뉴스 요약 – Muse Spark 1.3, Gemini 3.8 Flash, Qwen 3.8, 로봇 기술 발전

TL;DR: 메타의 Muse Spark 1.3은 비용 효율성을 유지하면서도 에이전트형 및 과학적 추론 능력을 강화했고, 구글의 Gemini 3.8 Flash는 적은 비용으로 강력한 코딩 및 에이전트 기능을 제공하며, Qwen 3.8-Max와 Qwen 3.8-Flash는 성능과 속도가 향상되었으며, NVIDIA는 엣지 하드웨어에서 실시간으로 작동하는 로봇 정책을 선보였습니다.


메타 Muse Spark 1.3 – 더 빠르고, 더 에이전트형, 여전히 저렴

  • Muse Spark 1.3 (max)는 인공지능 분석 지능 지수에서 62를 기록해 클로드의 최상위 버전에 이어 두 번째로 높은 점수를 받았으며, xhigh 버전은 61을 기록해 GPT-5.6 Sol (max) 및 그록 4.6 (high)와 동점입니다. @ArtificialAnlys
  • 성능 향상은 더 높은 추론 토큰 사용량에서 비롯되었으며, Tau3-Bench Banking에서 12점 상승, Terminal-Bench 2.1에서 5점 상승을 기록했습니다. 1.2 버전 대비 @ArtificialAnlys
  • 작업당 비용은 xhigh 버전에서 $0.55로 상승했지만, 여전히 GPT-5.6 Sol의 $0.95보다 저렴하며, 지능 대 비용의 파레토 최적 경계에 위치합니다. @ArtificialAnlys
  • 과학적 추론 능력은 CritPt (+8점), GPQA 다이아몬드 (+4점) 등 다양한 벤치마크에서 향상되었으며, AA-LCR 및 AA-Omniscience에서 높은 회피율로 인해 약간의 성능 저하가 발생했습니다. @ArtificialAnlys
  • 모델 세부 정보: 1M 토큰 컨텍스트 창, 멀티모달(텍스트, 이미지, 비디오), 1.2 버전과 동일한 가격 정책, 메타 API 및 Muse Code를 통해 이용 가능. @ArtificialAnlys

구글 Gemini 3.8 Flash – $0.58/작업에 에이전트 및 코딩 성능 급상승

  • Gemini 3.8 Flash (high)는 인공지능 분석 지능 지수에서 59를 기록해 3.7 Flash 대비 3점 상승하며, GPT-5.6 Sol (xhigh)와 동점입니다. @ArtificialAnlys@OfficialLoganK@Google
  • 성능 향상은 Tau3-Bench Banking에서 12점 상승과 더 나은 Terminal-Bench v2.1 코딩 점수에서 비롯되었습니다. @ArtificialAnlys
  • 가격은 입력당 $0.75/M-토큰(할인 적용) 유지, 지능 지수 작업당 비용은 $0.58로, 이 지능 수준에서 가장 저렴한 모델입니다. @ArtificialAnlys
  • 출력 속도는 약 300 토큰/초, 고수준 추론 시 작업당 시간은 약 2.5분으로, 클로드 패블 5.1(medium)보다 약간 느립니다. @ArtificialAnlys
  • 컨텍스트 창은 여전히 1M 토큰이며, 멀티모달 지원은 텍스트, 이미지, 비디오, 음성 포함. @ArtificialAnlys

Qwen 모델 업데이트 – 더 큰 컨텍스트, 더 빠른 로컬 추론

  • Qwen 3.8-Max-0902 (2.4T 파라미터)는 1M 토큰 컨텍스트를 제공하며 기업, 과학, 장기적 작업에서 더 강력한 성능을 보입니다. 가격은 입력당 $2/M-토큰, 출력당 $6/M-토큰입니다. @Alibaba_Qwen
  • Qwen 3.8-Flash는 MTP를 통해 RTX PRO 6000에서 로컬 추론 속도가 1.7배 빨라졌으며(170 토큰/초), 정확도 손실 없이 작동합니다. @UnslothAI
  • Qwen 3.8-27B는 EXL3 압축과 사전 추론을 사용해 단일 RTX 3090에서 256K 토큰 컨텍스트에서 ~65 토큰/초로 작동하며, 소비자 하드웨어에서도 장문 문서의 에이전트 작업이 가능해졌습니다. @Oluwaphilemon1

퍼플렉시티의 릴리 엔진 – 온디바이스 LLM을 위한 하이브리드 컴퓨팅

  • 퍼플렉시티는 릴리(Lily)를 오픈소스로 공개했으며, 애플 실리콘에서 Qwen 3.6-35B-A3B를 최적화해 온디바이스 컴퓨팅을 가능하게 하여 하이브리드 AI 작업의 병목 현상을 방지합니다. @perplexity_ai

로봇 및 물리적 AI – 실시간 엣지 정책과 데이터 루프

  • NVIDIA는 작은 크기의 로봇 정책을 공개했는데, Jetson AGX Thor T5000에 내장되어 2.13초 운동에 대해 1.53초 내에 재계획을 수행하며, 하드웨어 평가 전에 120개의 언어 조건부 조작 작업에서 폐쇄 루프 시뮬레이션을 수행했습니다. @NVIDIARobotics
  • NVIDIA의 Cosmos 3 Edge 정책도 유사한 실시간 성능을 달성하며, 엣지에서 언어 조건부 로봇 제어의 실현 가능성을 입증했습니다. @NVIDIARobotics@NVIDIARobotics
  • 애시스 로봇ics(Axis Robotics)는 인간이 수정한 실패 데이터(정적 대규모 데이터셋이 아닌)를 활용해 지속적인 로봇 정책 개선을 위한 피드백 루프를 구축했다고 보고하며, 빠른 실패-데이터 파이프라인의 가치를 강조했습니다. @0xALTF4
  • 월드 랩스의 애틀라스(World Labs’ Atlas)는 몇 장의 스마트폰 사진만으로 환경을 재구성할 수 있어, "실제→시뮬레이션→실제" 훈련 파이프라인을 가능하게 하며 로봇 적응을 위한 데이터 수집 비용을 크게 줄였습니다. @IlirAliu_@MTSlive

AI 에이전트를 위한 보안 및 도구

  • NVIDIA에서 새롭게 공개한 레포지토리는 AI 에이전트의 스킬을 실행 전에 보안 위험 여부를 검사하여 GitHub에서 악성 도구 설치의 증가하는 위협에 대응합니다. @gregisenberg
  • 스페이스XAI의 그록봇(SpaceXAI’s Grok Bot) 플레이북은 단일 봇을 24/7 다중 에이전트 워크플로우로 전환하기 위한 7단계 아키텍처를 설명하며, 지속 가능한 작업 공간, 최고 라우터 위임, 인간 전용 승인을 위한 신뢰 계층을 포함합니다. @adiix_official
  • GitHub의 AI 관련 레포지토리 라운드업(Greg Isenberg 제공)은 AI 기반 CRM, 영상 편집, CapCut 대안 등 오픈소스 도구를 소개하며, 에이전트 기능을 확장하는 데 초점을 맞추고 있습니다. @gregisenberg

이미지 편집 벤치마크 – 전문화된 모델의 부상

  • 인공지능 분석 이미지 편집 아레나(Artificial Analysis Image Editing Arena)는 MAI-Image-2.6-Preview를 전체 최고로 평가하며, 장면/스타일 편집 및 추론 기반 변환에서 뛰어난 성능을 보입니다. @ArtificialAnlys
  • **GPT Image 2 (high)**는 객체 수준 편집에서 선두를 달리고 있으며, 시드림 5.0 Pro는 정체성 보존 편집에서 우위를 점합니다. 비용 효율적인 옵션인 MAI-Image-2.5-Flash는 1,000장당 $20로 GPT Image 2 (high)의 $211보다 훨씬 저렴합니다. @ArtificialAnlys

전반적인 통찰: AI의 전면은 대규모 멀티모달 모델의 빠른 반복 개선을 통해 에이전트형 추론 능력을 향상시키면서도 비용 효율성을 강화하고 있습니다(Muse Spark 1.3, Gemini 3.8 Flash). 동시에 모델 확장(Qwen 3.8)과 로컬 추론 최적화(Lily, EXL3)를 통해 장문 컨텍스트 작업이 일반화되고 있습니다. 로봇 기술 분야에서는 엣지 대응 정책과 데이터 중심 피드백 루프가 물리적 AI의 시뮬레이션에서 실제 세계 적용으로 전환되고 있으며, 보안 도구와 다중 에이전트 프레임워크는 강력한 에이전트를 더 안전하고 사용하기 쉽게 만들기 위한 노력입니다.