AI 및 프론티어 기술 뉴스 요약 – 로컬 모델 발전, 에이전트형 AI 급성장, 인간형 로봇의 돌풍
TL;DR
소비자용 GPU에서 기존에는 클라우드 서비스에서만 가능했던 토큰당 초당 속도를 실현하는 로컬 대규모 언어 모델이 등장했으며, Grok, Dot Reflex, Anthropic의 그래프 기반 에이전트와 같은 에이전트형 AI 시스템이 24시간 365일 자율 운영되는 작업자로 도입되고 있습니다. 동시에 인간형 로봇은 인간의 스프린트 기록을 뛰어넘으며 물리적 AI의 가속화를 보여주고 있습니다.
로컬 프론티어 모델, 소비자 수준 성능 달성
- FreeToken은 7530억 파라미터의 GLM‑5.2를 단일 96GB GPU에서 14.9 토큰/초로 실행하며, 35B Qwen 모델은 8GB GPU에서 시스템 RAM에서 대부분의 모델을 스트리밍해 39.3 토큰/초를 달성했습니다. 이 접근법은 전용 전문가(MoE) 라우팅을 활용해 토큰당 몇 개의 활성 파라미터만 유지함으로써 거대한 체크포인트를 데스크탑 하드웨어에서도 실행 가능한 작업으로 전환합니다 @akshay_pachaar.
- Kimi‑V3(16B 스파스 MoE)는 토큰당 약 3B 파라미터만 활성화하며, GPT‑4o‑mini 수준의 멀티모달 벤치마크 성능을 달성하면서도 단일 GPU(4–8GB VRAM)에서 실행 가능합니다 @N01ennn.
- Ornith‑1.5(35B)는 약 3B의 활성 파라미터로 실행되며, 보통 GPU에서는 약 30 토큰/초, 고성능 카드에서는 약 150 토크/초를 달성해 로컬 코딩 및 에이전트 작업에 강력한 후보가 됩니다 @Oluwaphilemon1.
- DeepSeek‑V4‑Flash‑Vision‑Exp는 기존 DeepSeek‑V4‑Flash 체크포인트에 멀티모달 에이전트 기능을 추가하며 Opus‑4.8 수준의 성능에 근접하면서도 기존 체크포인트 크기 유지 가능합니다 @deepseek_ai.
- Qwen 3.8 27B는 커뮤니티 주도의 커널 및 사전 디코딩 최적화로 Apple Silicon에서 3배 빠른 디코딩 속도를 달성하며, 집중적인 엔지니어링을 통해 밀도 높은 모델도 로컬에서 사용 가능함을 입증했습니다 @0xkydo.
에이전트형 AI 시스템, 지속적이고 자율적인 워크플로우로 진화
- Grok 4.6(SpaceXAI)는 이제 클라우드 기반 ‘에이전트’로 제공되며 하루 24시간 작동합니다. 실제 계정에 로그인해 클릭을 수행하고 완료된 작업을 반환합니다. 사용자들은 이 봇이 감독 없이 메일함 항목을 정리하고 일상 업무를 수행할 수 있다고 보고하지만, 지출 한도와 인간의 승인 필요성에 주의를 당부합니다 @RetroChainer@testingcatalog@MPxbt.
- Dot Reflex(Qwen 3‑14B 기반)는 기존 Qwen 베이스보다 정확도 32.9점, 매크로-F1 39.2점 향상하며, Dot 플랫폼에 공개 소스 레포지토리와 함께 출시될 예정입니다 @usedotai.
- Anthropic는 그래프 기반 에이전트를 공개하며, 현재 회사 코드의 약 30%를 작성하고 있음을 강조하며, “에이전트 기반 그래프”가 이제 주요 개발 패러다임이 되었다고 밝혔습니다 @0xwhrrari.
- 오픈소스 에이전트가 급속히 확산 중: OpenHands는 Kimi를 파일 편집 및 명령 실행이 가능한 자율 코딩 에이전트로 변환합니다 @gippp69; CopilotKit은 Slack/Teams에 에이전트를 통합할 수 있는 무료 프레임워크를 제공합니다 @cyrilXBT; Grok Bot의 1시간 강의는 책임자 관리자와 함께 다중 봇 팀을 구성하는 방법을 가르칩니다 @0xMorlex@RoundtableSpace.
- FreeToken 아키텍처는 에이전트에도 이점을 제공하며, 자주 사용되는 전문가를 GPU 메모리에 캐시하고 필요 시 CPU로_FALLBACK하여 다단계 에이전트 작업의 지연을 줄입니다 @akshay_pachaar.
인간형 로봇, 인간 수준의 속도와 복잡한 작업 달성
- 베이징 기반 인간형 로봇이 100m를 9.39초에 주행하며, 우사인 볼트의 9.58초 세계 기록을 넘어섰으며, 중국 로봇 기술의 급속한 발전을 보여줍니다 @Reuters@XH_Lee23@WHRGFUN.
- 2026년 월드 인간형 로봇 게임(WHRG 2026)에는 666개 팀에서 온 2000대 이상의 로봇이 참가하며, 현재는 스프린트, 고도 점프, 동기화 댄스 루틴까지 수행 가능합니다 @business@XRoboHub@WHRGFUN.
- Unitree의 G1과 Dobot Atom 로봇은 방송 영상에서 학습해 테니스를 칠 수 있습니다. 외부 모션 캡처를 활용해 실시간 공 추적과 스트로크 실행을 가능하게 합니다 @TheHumanoidHub.
- Symbiosis Robotics의 Direct Perception Control 모델은 인간형 드라이버가 카트를 자율적으로 조종할 수 있도록 하며, 계층적 제어 스택을 우회하는 엔드투엔드 인지-행동 파이프라인을 입증합니다 @XRoboHub.
에이전트 워크로드 서빙에 대한 새로운 연구
- 알리바바/바이두의 새로운 논문은 LLM 추론이 에이전트 애플리케이션의 주요 병목이 더 이상 아니라는 점을 밝힙니다. 대신 도구 통합, 메모리 관리, 네트워크 지연이 주요 병목입니다. 작업 인식 배치 및 상태 오프로딩 최적화는 지연을 최대 4.5배까지 줄일 수 있습니다 @rohanpaul_ai.
- 캘리포니아 대학교 버클리의 ‘FreeToken’ 논문은 LLM 서빙 워크로드에 대한 1년간 분석을 제공하며, 요청 패턴이 긴 입력과 짧은 출력으로 전환되며, 단순한 FIFO/LRU 캐싱이 더 복잡한 정책보다 더 효과적임을 밝혔습니다 @1a1a11a.
전반적으로, 프론티어 AI 생태계는 세 가지 방향으로 집중되고 있습니다: (1) 창의적인 MoE 라우팅과 시스템 RAM 스트리밍을 통해 거대 모델이 로컬에서 실행 가능해지고 있으며; (2) 에이전트형 AI는 실험적 챗봇에서 완전히 자율적인 클라우드 워커로 진화하고 있으며; (3) 인간형 로봇은 디모에서 성능 중심의 경쟁으로 전환되며, 이미 인간 기록을 초월한 성과를 보이고 있습니다. 이러한 추세는 소프트웨어와 하드웨어 생태계가 클라우드에서 엣지까지 지속적이고 고처리량 AI 워크로드를 지원하기 위해 빠르게 적응해야 함을 시사합니다.
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch