101

AutoGrad와 베이지안 뇌: 제프 벡 박사의 AI 미래 전망

제프 벡 박사는 진정한 지능은 함수 근사와 LLM을 넘어, 언어가 아닌 거시 물리학에 기반한 객체 중심 베이지안 모델로 이동해야 한다고 주장합니다.

102

왜 역사 속 모든 뇌 은유는 틀렸는가

이 영상은 수압 펌프에서 컴퓨터에 이르기까지 과학적 단순화와 은유가 어떻게 현실로 굳어지는지를 탐구하며, 이해는 이러한 모델의 한계를 인식하는 데서 시작된다고 주장한다.

103

왜 AI는 플라톤 문제를 가지고 있는가: 마즈비타 치리무타의 신경과학 철학

마즈비타 치리무타 교수는 AI 연구가 종종 우주가 수학적 코드로 쓰여 있다는 '플라톤식' 가정에 의존하고, 인간 인지에서 생물학적 구현과 적극적 상호작용의 필수적 역할을 무시한다고 주장한다.

104

뇌는 단지 서로 대화하는 전문화된 에이전트일 뿐 — Dr. Jeff Beck

Beck 박자는 에이전시의 수학적 기반, 에너지 기반 모델(EBM)의 메커니즘, 그리고 뇌를 전문화된 에이전트들의 집합으로 보는 모듈식 지능 이론을 논의합니다.

105

Blaise Agüera y Arcas의 공생 발생과 삶의 계산적 본질

Blaise Agüera y Arcas는 삶이 구현된 계산이며, 복제자들의 융합인 공생 발생이 무작위 돌연변이보다 진화적 새로움과 복잡성의 주요 동력이라고 주장한다.

106

AI 코딩의 위험한 착각: 제레미 하워드가 말하는 소프트웨어 엔지니어링 vs. 코딩

제레미 하워드는 AI가 스타일 전이 문제로서 ‘코딩’에는 뛰어나지만 ‘소프트웨어 엔지니어링’이라는 근본적인 역량은 부족하다고 주장한다. 이는 ‘이해 부채’와 조직 약화라는 미래 위험을 초래한다.

107

Shinka Evolve: 과학적 발견을 위한 개방형 프로그램 탐색

Robert Lange은 LLM과 진화 알고리즘을 결합한 샘플 효율적인 프레임워크인 Shinka Evolve를 소개합니다. 이 프레임워크는 문제와 해결책이 함께 진화하도록 함으로써 프로그램 탐색과 과학적 발견을 자동화합니다.

108

AI 진행 측정: METR 시간 지평선 프레임워크

Beth Barnes와 David Rein(METR)은 인간이 작업을 완료하는 시간을 통합 축으로 사용해 AI 능력을 측정하고 향후 진행을 예측하는 '시간 지평선' 방법론을 논의한다.

109

지능은 인공이 아니라 집합적이다: 마이클 I. 조던 교수의 AI와 경제학에 대한 관점

마이클 I. 조던 교수는 지능이 무형의 초지능이 아니라 집합적 경제 시스템이라고 주장하며, AI 과대광고에서 벗어나 컴퓨터 과학, 통계학, 경제학을 결합한 다학제적 접근으로 전환할 것을 촉구한다.

110

브래드 카슨이 말하는 AI 무기, 책임성, 그리고 AI 군비 경쟁의 오류

전직 펜타곤 관계자인 브래드 카슨은 AI 개발이 필연적인 화물열차가 아니며, 서방이 전략적 자제와 칩 수준의 통제를 통해 AI 거버넌스를 적극적으로 형성하고, 치명적인 자율 무기를 방지하며, 재앙적인 군비 경쟁을 피할 수 있다고 주장한다.

111

Stanford CS336 Lecture 15: Mid-Training and Post-Training (SFT and RLHF)

이 강의는 Supervised Fine‑Tuning(SFT)과 Reinforcement Learning from Human Feedback(RLHF)를 통해 기본 언어 모델을 지시‑추종 어시스턴트로 전환하는 과정을 설명합니다. 알고리즘의 복잡성보다 데이터 품질과 큐레이션이 더 중요함을 강조합니다.

112

Stanford CS336 Lecture 16: Reinforcement Learning from Verifiable Rewards (RLVR)

이 강의에서는 검증 가능한 보상으로부터의 강화 학습(RLVR)을 탐구하며, GRPO와 같은 알고리즘이 복잡한 가치 함수를 그룹 기반 보상으로 대체해 수학 및 코딩에서 복잡한 추론이 가능한 ‘사고 모델’을 가능하게 하는 방식을 상세히 설명합니다.

113

Stanford CME296 Lecture 7: Evaluation of Text-to-Image Generation Models

이 강의에서는 텍스트‑투‑이미지 모델을 평가하는 방법론을 소개합니다. 미학과 프롬프트 충실도를 구분하고, 전통적인 수학적 메트릭에서 MLLM‑as‑a‑Judge 프레임워크로의 전환 과정을 상세히 설명합니다.

114

Stanford CME296 Diffusion & Large Vision Models Lecture 8 Summary

이미지 및 비디오 생성 패러다임에 대한 포괄적인 검토로, 확산·스코어 매칭에서 흐름 매칭으로의 전환을 다루고 이 기술들을 비디오, 이미지 편집, LLM에 적용하는 방식을 탐구한다.

115

Stanford CS336 Lecture 17: Multimodal Language Modeling

이 강의에서는 멀티모달 모델의 아키텍처를 탐구하며, 비전-언어 모델(VLM)이 시각적 추론을 달성하기 위해 CLIP 및 SigLIP과 같은 이미지 인코더를 대규모 언어 모델(LLM)과 어떻게 통합하는지에 초점을 맞춥니다.

116

Stanford CS25: 트랜스포머 서빙 - 현장의 교훈

Modal의 Charles Frye는 대규모 트랜스포머 모델 서빙의 엔지니어링 과제에 대해 논의하며, 프리필 단계와 디코드 단계 사이의 중요한 차이점 및 하드웨어 활용 최적화에 초점을 맞춥니다.

117

Stanford CS25: Transformers United V6 - 언어 모델에서 네이티브 멀티모달 인텔리전스로

Victoria Lin은 네이티브 멀티모달 언어 모델의 진화를 논의하며, 모달리티 전반에 걸친 토큰화와 Mixture of Transformers(MoT)와 같은 특화된 아키텍처가 텍스트, 이미지, 오디오를 원활히 통합하도록 어떻게 가능하게 하는지 상세히 설명합니다.

118

로봇 학습에서 기하학 활용하기: 스탠포드 로보틱스 세미나

플랫 교수는 로봇 학습 모델에 기하학적 구조 사전 지식과 등변성을 도입하면, 일반주의 VLA 모델에 비해 데이터 효율성과 자세에 대한 일반화가 크게 향상될 수 있음을 논의합니다.

119

Stanford CS336 Language Modeling from Scratch: Inference Engines and Full-Stack Innovation

게스트 강사 Dan Fu는 LLM을 수학적 객체에서 실제 지능으로 전환하는 데 있어 inference 엔진과 GPU 커널의 핵심 역할을 논의하고, Megakernel 및 Parcae 재귀 아키텍처와 같은 최적화 기법을 소개합니다.

120

AI 슈퍼사이클의 경제학: Baseten과 맞춤형 추론으로의 전환

Tuhin Srivastava Baseten CEO는 AI 경제가 최첨단 모델에서 맞춤형, 사후 학습 오픈소스 모델로 전환하고 있으며, 이는 수익성, 방어성, 낮은 지연 시간을 달성하기 위한 전략이라고 주장합니다.

121

Sam Altman의 규모, AGI, 그리고 프론티어 시스템의 미래에 대해

OpenAI CEO Sam Altman은 규모의 경험적 힘, ChatGPT와 Codex의 진화, 그리고 AI 시대의 컴퓨팅 부족과 권력 집중의 시스템적 위험에 대해 논의합니다.

122

헬스케어 분야 AI: 사이버보안 위험, 환자 권한 부여 및 규제 샌드박스

전 미국 수석 데이터 과학자 DJ Patil은 AI 기반 사이버공격에 대한 의료 시스템의 심각한 취약성과 규제 샌드박스 및 환자 권한 부여를 통해 AI가 건강 접근성을 민주화할 가능성을 논의합니다.

123

Stanford MS&E435 Economics of the AI Supercycle: Building AI Factories

Chase Lochmiller, Crusoe의 CEO는 기가와트 규모 AI 데이터 센터 구축에 필요한 막대한 자본 지출을 논의하며, AI를 GDP 성장을 견인하는 디지털 노동 형태로 정의합니다.

124

프로덕션 에이전트를 위한 필수 요소

LLM 에이전트를 데모 단계에서 프로덕션 단계로 옮기려면 팀이 일곱 가지 핵심 제어를 구현해야 합니다: 모델 제어, 프롬프트 레지스트리, 가드레일, 예산 제한, 툴/MCP 보안, 모니터링/트레이싱, 그리고 체계적인 평가.

125

에이전트의 시대: 로건 킬패트릭이 말하는 AI 스튜디오와 빌딩의 미래

로건 킬패트릭은 AI 스튜디오가 ‘바이브 코딩’ 플랫폼으로 진화하고, 에이전트 엔지니어링이 부상하며, 코딩 경험과 관계없이 누구나 소프트웨어를 만들 수 있는 구글의 비전을 설명합니다.

126

NVIDIA Nemotron 3 Nano Omni Release

NVIDIA는 텍스트, 이미지, 비디오, 오디오를 하나의 효율적인 아키텍처에서 네이티브로 지원하는 소형 올인원 멀티모달 모델인 Nemotron 3 Nano Omni를 출시했습니다.

127

Claude Design Agentic Architecture: 6 Patterns for Vertical AI Agents

Claude Design은 컨텍스트 그라운딩, 구조화된 메모리, 자체 QA 루프 등 여섯 가지 에이전시 패턴을 결합한 정교한 스택을 활용해 고품질 수직형 에이전트를 만들며, 이를 어떤 산업에도 복제할 수 있습니다.

128

IBM Granite Speech 4.1 릴리스: 고처리량 ASR 모델

IBM은 엣지 배포를 위해 설계된 2B 파라미터 ASR 모델 3종을 포함하는 Granite Speech 4.1을 출시했으며, 정확도, 화자 다이어리제이션, 극한 처리량을 위한 특화 변형을 제공합니다.

129

MiniCPM-V 4.6 릴리즈 노트 / 새로운 소식

MiniCPM-V 4.6은 엣지 배포와 에이전트 워크플로를 위해 설계된 13억 파라미터 비전 모델로, 높은 토큰 효율성과 유연한 시각 토큰 압축을 특징으로 합니다.

130

OpenShell: 안전한 LLM 에이전트를 위한 프로세스 외 집행

OpenShell은 슈퍼바이저를 사용해 에이전트 프로세스 외부에서 네트워크, 파일, 자격 증명 정책을 집행함으로써 LLM 에이전트에 안전한 런타임을 제공하고, 프롬프트 인젝션 및 탈옥 공격을 방지합니다.

131

AMD 하드웨어에서 로컬 AI 실행하기

AMD의 ROCm 플랫폼과 Radeon AI Pro GPU는 LLM, 이미지 및 비디오 생성 모델의 고성능 로컬 실행을 가능하게 하며, 프라이버시와 비용 효율성을 위해 CUDA 기반 시스템에 대한 실용적인 대안을 제공합니다.

132

NVIDIA Nemotron 3 Ultra Release

NVIDIA는 에이전시 워크플로에 최적화된 550B 파라미터 Mixture-of-Experts 모델인 Nemotron 3 Ultra를 출시했으며, 다중 교사 증류와 공개 학습 레시피를 특징으로 합니다.

133

NVIDIA Nemotron 3.5 ASR 릴리스 노트

NVIDIA는 40개 언어를 지원하며 캐시 인식 스트리밍을 통해 지연 시간을 크게 줄인 6억 개의 파라미터를 가진 스트리밍 speech-to-text 모델인 Nemotron 3.5 ASR을 출시했습니다.

134

Anthropic Claude Fable 5 및 Mythos 5 출시

Anthropic은 코딩 및 법률 벤치마크에서 GPT-5.5와 Opus 4.8을 능가하는 안전 조정된 Mythos 클래스 모델인 Claude Fable 5를 출시했지만, 엄격한 안전 트리거와 의무적인 30일 데이터 보존 정책을 도입했습니다.

135

GLM 5.2 릴리스 노트 및 성능 분석

Z.AI는 에이전트 코딩 및 디자인 분야에서 프론티어 독점 모델과 경쟁하면서도 훨씬 더 저렴한 비용을 제공하는 오픈 웨이트 모델인 GLM 5.2를 출시했습니다.

136

VibeThinker 3B: 소형 언어 모델에서 추론 확장

VibeThinker 3B는 Weibo AI Lab에서 만든 연구 모델로, 검증 가능한 보상 기반 강화 학습을 활용해 수학·코딩 등 특정 추론 작업에서 300배 규모 모델과 맞먹거나 능가합니다.