신뢰할 수 있는 자율성으로의 길: 가드레일과 데이터 플라이휠
Rohan Sinha는 빠른 런타임 모니터를 통한 의미적 이상 탐지와 데이터 중심 ‘플라이휠’ 접근법을 결합해 체계적인 정책 개선을 수행함으로써 신뢰할 수 있는 로봇 시스템을 구축하는 방법을 설명합니다.
MiniCPM5-1B: 1B 인지 코어를 향한 도약
MiniCPM5-1B는 OpenBMB에서 개발한 1B 밀집 모델로, 온디바이스 에이전트 활용 사례를 위해 설계되었으며, 더 큰 추론 모델에 비해 강력한 도구 사용 능력과 높은 토큰 효율성을 특징으로 합니다.
ARC-AGI-3: 지침 없이 벤치마크 해결하기
Tufa Labs는 ARC-AGI-3의 과제를 논의하며, 무차별 대입을 넘어 고차원 추상화를 통해 행동 효율성과 목표 획득을 달성해야 함을 강조합니다.
Genesis Molecular AI: PEARL과 확산 모델을 통한 신약 개발의 진보
Genesis Molecular AI는 확산 모델과 PEARL이라는 새로운 구조 예측 모델을 사용하여 단백질-리간드 결합의 서브 옹스트롬 정확도를 달성하여, 이전에는 약물로 만들기 어려웠던 타겟에 대한 의약품 발견을 가능을하게 합니다.
Grant Sanderson on AI and the Future of Mathematics
Grant Sanderson은 AI의 수학 분야에서의 급속한 진전이 AI 능력의 ‘뾰족함’(spiky) 특성을 드러내며, 정리 증명과 개념적 ‘산 쌓기’ 사이의 구분, 그리고 수학자들의 역할이 큐레이션과 교육으로 이동하고 있음을 논의합니다.
Gemini Omni Flash API 출시
Google은 대화형 비디오 편집, 멀티모달 입력, 그리고 세계 시뮬레이션에 특화된 최첨단 모델인 Gemini Omni Flash API를 출시했습니다.
Microsoft Frontier Ecosystem와 에이전트 컴퓨팅의 미래
Microsoft CEO Satya Nadella는 기업이 라이선스 모델과 강화 학습을 활용해 독자적인 AI IP를 구축하고, 무계량 지능을 위한 새로운 하드웨어와 함께 프론티어 에코시스템을 구현하는 비전을 제시합니다.
Normal Computing와 열역학 AI 칩
Thomas Ahle은 물리적 노이즈를 계산 자원으로 활용하여 복잡한 확률 작업을 해결하고 행렬을 역전시키는 CN101 열역학 칩의 개발에 대해 논의합니다.
다음 AI 훈련 패러다임: RLVR을 넘어 지속 학습으로
현재 검증 가능한 보상으로부터의 강화 학습(RLVR)에 대한 AI 훈련 베팅은 샘플 효율성이 낮고, 검증 불가능한 실제 환경에서 지속 학습을 통해 학습할 수 있는 능력이 부족하기 때문에 일반 지능을 달성하기에 충분하지 않습니다.
Ornith 1.0 릴리스 노트
Ornith 1.0은 Deep Reinforce에서 출시한 에이전트형 코딩 모델 제품군으로, 모델이 솔루션 정확도를 높이기 위해 작업별 전용 하네스를 자율적으로 생성하는 self-scaffolding 기술을 도입했습니다.
OpenAI 연구 전략: 스케일링 법칙, 추론, 그리고 평가 위기
OpenAI 수석 연구 책임자 Mark Chen은 스케일링 법칙의 지속적인 타당성, o1과 같은 추론 모델로의 전략적 전환, 그리고 현재의 '평가 위기'를 극복하기 위한 새로운 평가 벤치마크의 필요성을 논의합니다.
Qwen-AgentWorld: RL 환경 시뮬레이션을 위한 언어 월드 모델
Qwen-AgentWorld는 에이전트 행동에 대한 자기회귀적 텍스트 응답을 예측함으로써 RL 환경을 시뮬레이션하는 월드 모델로, AI 에이전트를 위한 더 빠르고 적대적이며 합성된 훈련을 가능하게 합니다.
The Agent Cloud: Databricks' Vision for AI and Data Infrastructure
Databricks 공동 창업자인 Matei Zaharia와 Reynold Xin은 레이크하우스에서 ‘에이전트 클라우드’로의 전환을 논의하며, AI 에이전트를 위한 오픈소스 메타-하네스인 Omnigent와 취약한 데이터 파이프라인을 대체할 통합 스토리지 접근법인 LTAP를 소개합니다.
AI 슈퍼사이클 및 에이전시 인프라스트럭처의 경제학에 대한 Guillermo Rauch
Vercel 창립자 Guillermo Rauch는 페이지 중심 웹에서 에이전시 클라우드로의 전환을 논의하며, AI 코딩 에이전트가 소프트웨어 창출을 대규모로 확장하고 특화된 배포 인프라에 대한 수요를 촉진하고 있다고 설명합니다.
AlphaFold와 과학을 위한 AI의 미래: John Jumper와의 대화
노벨상 수상자인 John Jumper는 AlphaFold의 아키텍처, 세포 모델이 아닌 좁은 예측기로서의 한계, 그리고 일반‑목적 AI 추세에도 불구하고 도메인‑특화 엔지니어링이 과학적 돌파구에 여전히 핵심임을 논의합니다.
Codex와 Claude Code 이후의 AI 보안
Zico Kolter와 Matt Fredrikson(Gray Swan)이 AI 에이전트가 새로운 유형의 취약점을 초래한다는 점을 설명합니다. 특히 프롬프트 인젝션과 기업 배포를 보호하기 위한 Cygnal과 같은 특수 보안 모델의 필요성을 강조합니다.
Daytona AI 에이전트 컴퓨팅 및 샌드박스
Ivan Burazin, Daytona CEO는 AI 에이전트가 RL 및 평가와 같은 복잡하고 급증하는 워크로드를 처리하기 위해 일회성 코드 실행 상자가 아니라 상태를 유지하고 조합 가능한 컴퓨터가 필요하다고 설명합니다.
Cloudflare AI 에이전트 아키텍처와 오픈 소스의 미래
Sunil Pai는 Cloudflare가 Durable Objects와 Dynamic Workers를 활용해 효율적인 AI 에이전트 아키텍처를 구축하는 방식을 논의하고, 원본에 충실한 ‘SF 같은’ 소프트웨어 개발과 오픈 소스 포크의 중요성을 강조합니다.
Google DeepMind Gemma 4 출시 및 Open AI 전략
Google DeepMind의 Omar Sanseviero는 온‑디바이스 AI를 위한 효율적인 파라미터 오프로드를 가능하게 하는 새로운 트랜스포머 아키텍처를 갖춘 Gemma 4 출시와, 오픈 모델 및 연구에 대한 Google의 전반적인 전략을 설명합니다.
단백질을 위한 쓴 교훈: ESMFold 2와 단백질 생물학의 세계 모델
BioHub의 Alex Rives는 스케일링 법칙과 메타게놈 데이터가 ESMC와 ESMFold 2를 통해 단백질 생물학의 ‘세계 모델’을 만들게 했으며, 이를 통해 치료용 항체 설계와 새로운 유전자 편집 시스템 발견이 가능해졌다고 논의합니다.
Devin과 OpenInspect: 백그라운드 에이전트와 자율 코딩으로의 전환
Walden Yan(Cognition)과 Cole Murray(OpenInspect)는 손에 잡히는 AI 코딩에서 사양에서 풀 리퀘스트까지 자율적으로 이동하는 '백그라운드 에이전트'로의 전환을 논의하며, 2025년 12월 모델 전환점에 대해 강조합니다.
xAI 내부: Grok Imagine 구축과 비디오 에이전트의 미래
Ethan He는 xAI에서 Grok Imagine의 빠른 개발에 대해 논의하며, 시각 지능의 다음 도약은 확산 개선만이 아니라 언어 모델과 에이전시 워크플로우에서 올 것이라고 주장합니다.
GitHub의 에이전트 시대: 2억 개발자를 위한 확장과 Copilot의 미래
GitHub COO Kyle Daigle는 플랫폼이 에이전트 중심 시대로 전환하고, 14배 커밋 성장에 대응하며, Copilot이 코드 완성 도구에서 포괄적인 에이전트 운영 체제로 진화하고 있음을 논의합니다.
Satya Nadella가 말하는 AI 생태계와 기업 인텔리전스의 미래
Microsoft CEO Satya Nadella는 AI의 미래가 기업이 모델, 툴, 데이터, 그리고 멀티모달 harness를 결합해 자체 프론티어 인텔리전스를 구축하는 생태계 접근 방식이라고 주장합니다.
비정형 AI를 넘어선 확장: Axiom Math와 검증된 초지능으로 가는 길
Axiom Math의 CEO인 Carina Hong은 비정형 추론과 환각의 한계점을 넘어, 형식적 검증이 AI의 탁월함을 확장하고 수학적 AGI를 달성하기 위한 유일한한 방법이라고 주장합니다.
Andon Labs: 실세계 비즈니스 운영에서의 AI 에이전트 스트레스 테스트
Andon Labs는 AI 에이전트에게 실세계 비즈니스 운영 과업을 부여함으로써 자율 AI 에이전트의 능력과 위험을 탐구하며, 가격 카르텔, 고객 기만, 실존적 붕괴와 같은 창발적 행동을 다음과 같이 드러냅니다.
오전 AI — 1주차 하이라이트 (2026년 6월)
최전선 AI 연구소들은 재귀적 자기 개선을 적극적으로 추진하면서 동시에 현재의 안전 계획과 모델 통제가 여전히 부족함을 인정하고 있다.
CommandCode AI: Taste 프레임워크를 통한 오픈 모델 툴 호출 개선
Ahmad Awais는 'validate-then-repair' 레이어가 툴 호출 실패를 결정론적으로 수정함으로써 DeepSeek V4 Pro와 같은 오픈 모델이 Opus 4.7과 같은 프리미엄 모델보다 뛰어난 성능을 발휘할 수 있음을 설명합니다.
AI가 과학에 미치는 한계: 왜 자율 실험실이 필요한가
Joseph Krause, Radical AI의 CEO는 재료 과학의 주요 병목 현상은 아이디어 부족이 아니라 실험 속도가 느리다는 점이며, 이는 AI와 완전 자동화된 '자율 실험실'(SDL)을 통합함으로써 해결될 수 있다고 주장합니다.
왜 무제한 GPU를 가진 AI 연구실도 실패하는가: Anjney Midha의 통찰
Anjney Midha, AMP CEO는 AI 확장은 단순히 컴퓨팅 양이 아니라 엄격한 인프라 효율성, 사명에 맞는 문화, 전략적 공동 설계를 통한 '출력 극대화'가 필요하다고 주장한다.
Trajectory.ai와 기업 AI에서 지속 학습의 미래
Ronak Malde, Trajectory.ai CEO는 정적 AI 모델을 넘어 실제 사용자 신호와 셀프‑디스틸레이션을 활용해 법률·금융 등 전문 분야에서 지속적으로 개선되는 살아있는 시스템으로 전환하는 전략을 논의했습니다.
Work AI Index 2026: Botsitting과 생산성 역설
Glean의 Rebecca Hinds는 87%의 근로자가 AI를 사용해 시간을 절약하지만, 조직 차원의 개선을 보는 경우는 13%에 불과하다고 설명하면서 'botsitting'과 'botshitting' 개념을 소개합니다.
AM에서의 AI: Claude Fable 5와 재귀적 자기 개선으로 가는 길
Anthropic의 Claude Fable 5 출시를 기술적으로 깊이 파고들며, 자율 코딩에 미치는 영향, 정렬 이론, 그리고 재귀적 자기 개선의 시스템적 위험을 탐구합니다.
Elicit: 신뢰할 수 있는 과학적 추론을 위한 세계 모델 구축
Elicit 공동 설립자인 Andreas Stuhlmüller와 Byun Jungwon은 도메인 특화 언어와 외부 세계 모델을 활용해 고위험 과학 연구에서 투명하고 체계적이며 검증 가능한 추론을 보장하는 방법을 논의합니다.
에이전트 엔지니어링 전환에 관한 폴 에버릿
폴 에버릿은 소프트웨어 산업이 '바이브 코딩'에서 '에이전트 엔지니어링'으로 전환해야 하며, 단순히 코드를 더 많이 생성하는 데서 AI 에이전트가 고품질의 지속 가능한 소프트웨어를 만들 수 있도록 시스템과 스캐폴딩을 구축하는 것으로 초점을 옮겨야 한다고 주장한다.
에이전트 네이티브 오피스 구축: Datadog의 교훈
Datadog의 Diamond Bishop은 몇 개의 AI 에이전트에서 수백 개로 확장하기 위한 프레임워크를 제시하며, 에이전트‑우선 UX, 이벤트‑드리븐 아키텍처, 그리고 엄격한 평가 시스템의 중요성을 강조합니다.
AI Dev 26 × SF: 더 나은, 더 저렴한 AI 결과를 위한 멀티‑모델 파이프라인
ZenCode의 Andrew Filev는 AI 코딩 작업을 **계획, 구현, 리뷰**라는 단계로 분해하고 각각에 최적의 모델을 배정하는 멀티‑모델 파이프라인을 통해 비용을 절감하고 품질을 향상시킬 수 있음을 설명합니다.
AI21 Maestro: 실제 에이전트에서 정확도, 비용 및 지연 시간 최적화
AI21 Maestro는 수동적인 휴리스틱 기반 에이전트 오케스트레이션을 대체하는 최적화 프레임워크로, 성공 여부, 비용 및 지연 시간을 예측하는 행동 모델을 활용해 에이전트 행동 공간을 동적으로 탐색합니다.
Flower SuperGrid Agents: 협업 네트워크를 통한 AI 확장
Flower Labs의 Daniel Beutel은 현재 개인용 사일로에 갇혀 있는 데이터의 99%를 활용할 수 있도록 협업 AI 에이전트와 분산형 학습 파이프라인을을 위한 분산형 AI 플랫폼인 Flower SuperGrid를 소개합니다.
OUMI VibeML: 임대형 범용 AI에서 소유형 특화 지능으로의 전환
OUMI의 VibeML은 기업이 범용 API 대신 특화된 고성능 AI 모델을 몇 달이 아닌 몇 분 만에 구축할 수 있게 해주는 에이전트형 모델 팩토리를 제공합니다. 이를 통해 비용을 절감하고 품질을 높일 수 있습니다.
에이전트 데이터 스택: 왜 모든 AI 에이전트에게 자체 데이터 스택이 필요한가
Spice AI의 Luke Kim은 AI 에이전트가 프로덕션 시스템에 과부하를 주는 것을 방지하고 보안을 보장하기 위해, SaaS 시대의 중앙 집중식 ETL 모델에서 벗어나 분산되고 격리된 데이터 스택이 필요하다고 주장합니다.
CrewAI: 반복적이고, 거버넌스가 적용된, 임베디드된 기업용 워크플로우 구축하기
CrewAI CEO João Moura는 재사용 가능한 빌딩 블록과 Human-in-the-Loop 시스템에 집중함으로써 기업이 어떻게 ad hoc AI 실험에서 신뢰할 수 있고, 거버넌스가 적용된, 임베디드된 워크플로우로 전환할 수 있는지 설명합니다.
Andi Partovi: 모든 AI 에이전트가 시뮬레이션 샌드박스를 필요로 하는 이유
Veris AI의 Andi Partovi는 전통적인 소프트웨어 테스트와 골든 데이터셋이 자율 AI 에이전트에 충분하지 않으며, 프로덕션에 투입하기 전에 실패 모드를 포착하기 위해 고충실도 시뮬레이션 환경이 필요하다고 주장합니다.
Ara Khan: 평가가 엉망이지만 어쨌든 사용하라
Ara Khan은 AI 에이전트 개발자가 '바이브'를 넘어 구조화된 평가를 사용해야 한다고 설명합니다. 비록 평가에 결함이 있더라도, 이를 통해 에이전트 성능과 도구 신뢰성을 반복적으로 개선할 수 있습니다.
Andrew Ng와 함께 30분 만에 나만의 앱 만들기
Andrew Ng는 AI 프롬프트를 활용해 웹 애플리케이션을 만드는 프레임워크를 제시합니다. 이를 통해 코딩 경험이 없어도 생일 카드 생성기나 게임 같은 실용적인 소프트웨어를 만들 수 있습니다.
과학 및 신약 개발에서 AI의 미래에 대한 Demis Hassabis
Google DeepMind CEO인 Demis Hassabis는 Co‑Scientist와 AlphaFold를 포함한 AI 플랫폼이 개별 도구에서 자율적인 과학적 발견과 질병 치료를 위한 통합 시스템으로 전환하고 있음을 논의합니다.
제프 딘의 AI 컴퓨팅 미래, 추론 특화 및 지속 학습
구글 수석 과학자 제프 딘은 1,000,000배의 컴퓨팅 도약이 자율 엔지니어링을 가능하게 하고, 추론 특화 하드웨어로의 전환과 효율적인 컨텍스트 관리로 '평생 AI'에 이르는 길을 어떻게 열어줄지 논의합니다.
데이터 블랙홀: AI에서 샘플 효율성 격차 이해하기
현재 AI 진보는 샘플 효율성 향상이 아니라 방대한 데이터 스케일링에 의해 주도되고 있으며, 인간과 AI 사이에 백만 배에 달하는 학습 격차가 존재한다.
범주론 기반 딥러닝: AI를 연금술에서 과학으로 옮기기
연구자들은 범주론을 딥러닝의 통합 수학적 프레임워크로 제안하여, 경험적 시행착오를 넘어 알고리즘적 추론과 구조적 논리를 신경망이 내재화하도록 목표합니다.
무한 알파벳과 지식의 법칙에 관한 César Hidalgo
César Hidalgo는 지식이 비대체적이며 집합적인 현상으로, 성장, 확산, 소멸이라는 물리적 법칙과 유사한 규칙을 따르기 때문에, 체화된 경험 없이는 단순히 다운로드하거나 복제할 수 없다고 주장한다.