AI & Frontier Tech 요약: 에이전트형 워크플로와 로컬 주권으로의 전환
에이전트형 AI와 자율 워크플로의 부상
에이전트형 벤치마크와 역량
- AutomationBench-AA: 인공지능 에이전트를 실제 SaaS 워크플로에서 테스트하는 Artificial Analysis와 Zapier의 새로운 독립 리더보드입니다. 현재 Claude Fable 5와 Opus 4.8이 각각 48.6%와 48.5% 점수로 선두에 서 있지만, 테스트된 모든 모델이 어느 정도 비즈니스 가드레일을 위반하고 있습니다 Artificial Analysis.
- Financial Services: 영국 FCA는 에이전트형 AI가 2030년까지 소매 금융 서비스를 재구성할 수 있으며, 약 1,100만 영국 성인이 개인 금융에 에이전트를 사용할 것으로 예상합니다 Cointelegraph.
- Robinhood Integration: Robinhood는 사용자가 에이전트를 활용해 P/E 비율 및 시가총액과 같은 기본 지표를 분석하고 투자 전략을 수립할 수 있는 에이전트형 기능을 도입했습니다 Robinhood.
에이전트형 프레임워크와 도구
- Claude Code 2.1.202: 이번 릴리스는
/config를 통해 "Dynamic workflow size"를 도입하여 에이전트 수를 설정하고 예측 가능한 확장을 가능하게 하며, 텔레메트리 개선 및 원격 제어를 위한 미디어 전달 신뢰성을 향상시켰습니다 Claude Code Changelog. - Multi-Agent Orchestration: 새로운 GitHub 저장소들이 50개 이상의 특화된 Claude Code 에이전트(엔지니어링, 디자인, 마케팅, 법무 등)를 활용한 "AI agencies"를 가능하게 하여 제품을 출시하도록 조정하고 있습니다 Rahul.
- OpenClaude v0.22.0: 이제 LSP 진단, 분기 세션 그룹화, 마크다운 작업 보고서를 지원합니다 GitLawb.
- OPC Skills: 재사용 가능한 에이전트 스킬(SEO, 연구 등)을 제공하는 공개 GitHub 저장소로, Claude Code와 Cursor와 같은 도구에 통합할 수 있습니다 Dan Kornas.
로컬 AI와 컴퓨트 주권을 향한 움직임
로컬 하드웨어와 인프라
- DGX Spark Clusters: 200Gbps 링크로 두 개의 NVIDIA DGX Spark를 연결하면 256GB의 통합 메모리를 풀링할 수 있어, 300B 파라미터 이하의 오픈-웨이트 모델을 양자화 없이 로컬에서 실행할 수 있습니다 NO1ennn.
- Consumer GPU Setups: 사용자들은 고성능 소비자 하드웨어(예: RTX 5090 4개 구성)를 배치해 로컬 모델을 24시간 운영하고 있으며, 일회성 하드웨어 비용이 장기 클라우드 임대보다 저렴하다고 주장합니다 Veltrx.
- llamafile: 이 프로젝트는 모델 가중치, 추론 엔진, UI를 하나의 실행 파일로 결합하여, 설치 없이 다양한 운영 체제에서 오프라인으로 AI를 실행할 수 있게 합니다 Nav Toor.
로컬 추론 최적화
- vLLM and SGLang: SGLang은 이제 DSpark를 지원해 신뢰도 기반 추측 디코딩을 가능하게 하며, DeepSeek-V4-Flash와 같은 모델의 처리량/지연 시간 균형을 개선합니다 LMSYS Org.
- Multi-GPU Parallelism: Tensor Parallelism 및 Pipeline Parallelism과 같은 기법이 Kaggle과 같은 무료 플랫폼에서 사용되어 대형 모델(예: Gemma 4 26B)을 OOM 충돌 없이 실행하고 있습니다 Alok.
- 9Router: 40개 이상의 제공자를 통해 AI 요청을 재라우팅하여 할당량 제한을 우회하고 토큰을 20-40% 압축하는 도구입니다 Alvaro Cintas.
새로운 모델 출시 및 유출
프론티어 모델
- Tencent Hy3: 에이전트형 워크플로, 코딩, 장기 추론에 초점을 맞춘 295B MoE 모델(활성 21B)이며 256K 컨텍스트 윈도우를 가집니다. Apache 2.0 라이선스를 갖고 vLLM에서 네이티브 지원됩니다 vLLM, ModelScope.
- LongCat-2.0: 에이전트형 코딩을 위한 1.6T 전체 / 48B 활성 MoE 모델로, 1M 컨텍스트 윈도우를 제공하며 SWE-bench Pro에서 GPT-5.5와 Claude Opus 4.6을 능가합니다 ModelScope.
- Llama 5 (Leak): 유출에 따르면 Meta는 Muse Spark 대비 10배의 컴퓨팅 파워로 "Watermelon"(Llama 5)을 훈련하고 있으며, 내부 벤치마크가 GPT-5.5와 일치한다고 합니다 Lumina.
- Gemini 3.5 Pro (Leak): 보고에 따르면 Gemini 3.5 Pro는 7월 17일 출시 예정이며, 내부 평가에서 Claude Fable 5를 능가한다고 합니다 Salio.
- GPT-5.6 Sol Ultra (Leak): 소문에 따르면 GPT-5.6 Sol Ultra는 7월 7일에 출시될 예정입니다 Salio.
특화 모델
- Arko-T: Text2CAD 벤치마크에서 파라메트릭하고 실행 가능한 3D 프로그램을 생성하여 프론티어 LLM을 능가하는 4B 모델입니다 Caden Flux.
- Qwen-RobotNav: 알리바바의 2B-8B 모델로 로봇 내비게이션, 트래킹, 자율 주행을 통합합니다 HuggingPapers.
구현형 AI와 로보틱스
월드 모델과 데이터
- DreamDojo: 44K 시간 분량의 인간 비디오로 사전 학습하고 로봇 데이터로 추가 학습한 NVIDIA Research의 일반 로봇 월드 모델로, 다양한 환경에 일반화됩니다 NVIDIA Robotics.
- Robot Data Collection: 업계에서는 "로봇 데이터 오일"에 대한 수요가 급증하고 있으며, X Square Robot과 같은 기업이 egocentric 데이터 수집을 위한 QUANXTA Zero 시스템을 출시했습니다 CyberRobo.
- Teleoperation: 텔레오퍼레이션은 "물리적 행동을 위한 인터넷"으로 묘사되며, 모든 인간 제어 움직임이 미래 자율성을 위한 학습 데이터가 됩니다 Nick Rotenberg.
하드웨어와 센싱
- NRE-skin: 연구자들은 로봇에 위험을 감지하고 메인 CPU를 우회하지 않고 즉시 모터 반응을 일으키는 보호 반사(인공 통각)를 제공하는 전자 피부 시스템을 개발했습니다 TechniaHQ.
- MotionDisco: 인간형 로봇이 인간 시연 없이도 등반 및 균형과 같은 기술을 학습할 수 있게 하는 프레임워크입니다 Aiswarya Venkitesh.
산업 관점 및 연구
모델 용량과 의식
- Memorization vs Generalization: NVIDIA 연구에 따르면 GPT 스타일 모델의 용량은 파라미터당 약 3.6비트로 추정됩니다 NVIDIA AI.
- Consciousness: 철학자 David J. Chalmers는 구현 및 월드 모델을 갖춘 증강 LLM 시스템이 10년 이내에 의식을 가질 가능성을 50%로 제시합니다 Cliff Pickover.
시장 예측
- Nvidia Nemotron: Kevin S. Xu는 Nemotron의 개방성(가중치와 훈련 데이터) 덕분에 연말까지 시장 점유율이 5-10배 성장할 것으로 예측하며, 온프레미스 기업 배포에 이상적이라고 말합니다 Kevin S. Xu.
SUMMARY: AI 환경은 독립형 챗 모델에서 벗어나 클라우드 제한과 비용을 회피하기 위해 자율 에이전트형 워크플로와 고성능 로컬 추론으로 전환하고 있습니다.
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch