추론 프론티어: 10× 더 빠른 모델에서 자기 최적화 AI까지 — Baseten 토크 요약
이 토크는 캐시 인식 라우팅, 분리된 프리필/디코드, 추측 디코드, 양자화, 하드웨어 인식 최적화를 사용하여 원시 모델을 프로덕션 준비 API로 변환하는 추론 공학 방법을 설명하며, 모델 충실도를 유지하고 지속적 학습을 가능하게 하면서 최대 10×의 속도 향상을 달성합니다.
더 똑똑한 AI 모델이 컴퓨트 가격을 10배 올릴 수 있는 이유
지수적인 AI 매출 성장과 선형적인 컴퓨트 용량 증가 사이의 격차는 더 똑똑한 모델이 동일한 하드웨어를 더 효과적으로 수익화함에 따라 컴퓨트 가격이 크게 상승할 수 있다.
자기 개선 AI 에이전트를 위한 훈련 시간 스케일링과 강화 학습 스케일링
훈련 시간 스케일링 기법—STaR, GRPO 기반 DeepSeekMath, 그리고 DAPO—는 7B에서 32B 파라미터 모델이 AIME 수학 추론 벤치마크에서 근본적인 문제 해결 능력보다는 다수결-at-K 일관성을 개선함으로써 50% 이상의 정확도를 달성하도록 가능하게 합니다.
스탠포드 CS329A 강의 4: 툴/코드를 통한 피드백 학습 – ReAct, RLEF, 그리고 Constitutional AI
스탠포드 CS329A 강의 4 (2025년 10월 3일)에서 Aakanksha Chowdhery는 ReAct가 reasoning과 툴 사용을 interleaving하는 방법, RLEF가 실행 피드백을 사용하여 코드 생성을 개선하는 방법, 그리고 Constitutional AI가 인간 작성 원칙에 대한 자체 비판을 활용하여 harmlessness를 높이는 방법을 설명하며, 언어 모델이 피드백으로부터 배울 수 있는 세 가지 방법을 보여줍니다.
스탠퍼드 CS329A 자기 개선 AI 에이전트 – 과정 개요 (가을 2025)
스탠퍼드 CS329A 자기 개선 AI 에이전트 (가을 2025)는 스케일링 법칙, emergent LLM 행동, instruction tuning, RLHF, inference‑time 스케일링, 그리고 에이전트 워크플로를 소개하고,その後 과정 물류 및 프로젝트 요구 사항을 설명합니다.
Stanford CS329A: AI 에이전트를 위한 테스트 타임 컴퓨트 스케일링
이 강의는 추론 중 컴퓨팅을 증가시킴으로써—병렬 샘플링, 순차적 수정, 아키텍처 검색을 통해—추가 훈련 없이 LLM 성능을 크게 향상시킬 수 있는 방법을 탐구합니다.
자기 개선 AI 에이전트 검증 방법 개요
이 강의에서는 대형 언어 모델 추론에 대한 네 가지 검증 접근법을 조사합니다—OpenAI의 결과 및 프로세스 검증기, Math‑Shepherd의 자동 단계 라벨링, 그리고 스탠퍼드의 Weaver 앙상블—각각이 생성-검증 격차를 어떻게 줄이는지 보여줍니다.
Stanford CS329A Self-Improving AI Agents Part 7: Self-Improvement and Deep Research Agents
강의에서는 샘플링 규모 확대와 학습된 스코어링 모델 사용이 경쟁 프로그래밍 성능을 향상시킨다(AlphaCode → AlphaCode2)와, 추론 모델이 불확실성을 표현할 때 검색 쿼리를 트리거하는 방식(Search‑O1)이 GPQA 및 다중 홙 QA 벤치마크에서 더 나은 검색 강화 추론을 제공한다는 점을 보여준다.
Stanford CS329A: AI 에이전트의 계획 및 다단계 추론
이 강의에서는 LATS, SPRINT, SWiRL이라는 세 가지 프레임워크를 살펴봅니다. 이들은 트리 탐색, 병렬 실행, 합성 강화학습을 통해 LLM 에이전트의 다단계 추론 및 계획 능력을 향상시킵니다.
Stanford CS329A 자기 개선 AI 에이전트 미래 연구 분야 강의 요약
Stanford CS329A 강의는 자기‑개선 AI 에이전트를 위한 미래 연구 방향을 제시한다. 여기에는 추론 체인의 다양성, 검증 병목, 자체 생성 과제 커리큘럼, 그리고 지능‑당‑와트 효율성 향상이 포함되며, 로컬 모델이 이제 대부분의 챗봇 질의를 처리할 수 있음을 보여준다.
Stanford CS329A 강의: 에이전트 평가 및 장기 지평 작업(Long Horizon Tasks)
이 강의는 METR이 AI 에이전트의 시간 지평 능력(약 7개월마다 두 배씩 증가)을 어떻게 측정하는지, GDPVal이 경제적으로 가치 있는 작업에 대해 업계 전문가와 비교하여 모델 성능을을 어떻게 점수화하는지, 그리고 DeepScholar‑Bench가 문헌 연구 합성을 어떻게 평가하는지 설명하며, 미흡한 계획, 잘못된 도구 사용, 조기 포기, 반복적인 루프와 같은 반복적인 실패 모드를 강조합니다.
스탠퍼드 CS229 강의 18 (2026년 봄): 강화 학습과 정책 그래디언트 소개
스탠퍼드 CS229 강의 18 (2026년 봄)은 강화 학습의 기초—MDP, 보상 shaping, 가치 함수, 그리고 정책 그래디언트(REINFORCE) 알고리즘—을 소개하며, 로봇공학과 대형 언어 모델에서 순차적 의사 결정이 중요한 이유를 설명합니다.
Stanford CS547 HCI Seminar Spring 2026: Text, Visualization, and Their Combination
Stanford CS547 HCI Seminar Spring 2026 강연에서 Marti Hearst는 텍스트가 시각화의 핵심 구성 요소이며, 관련성 높은 텍스트가 이해도를 높이고, 텍스트 대 시각화에 대한 선호도는 작업, 맥락 및 개인차에 따라 달라진다고 주장합니다.
정책 그래디언트, PPO 클리핑, 그리고 LLM을 위한 사고사슬 RL – Stanford CS229 강의 20
이 강의는 정책 그래디언트 추정기를 유도하고, 베이스라인이 어떻게 분산을 줄이는지 보여주며, PPO 클리핑과 그 변형을 소개하고, 답변 전용 보상을 사용하여 사고사슬(Chain‑of‑Thought) 추론을 위한 대형 언어 모델에 강화 학습을 적용하는 방법을 설명한다.
스탠퍼드 CS229 2026年春 강의 14: 트랜스포머와 인-컨텍스트 학습
스탠퍼드 CS229 2026年春 강의 14에서 강사들은 대형 언어 모델을 위한 트랜스포머를 소개하며, 토큰화, 서브워드 방법, 자기회귀 확률 모델, 어텐션과 MLP 층을 갖춘 트랜스포머 아키텍처, 최대 우도를 통한 훈련, 온도 및 top‑k 샘플링과 같은 생성 전략, 그리고 자기어텐션의 2차 계산 비용을 다룹니다.
Stanford CS229 Spring 2026 Lecture 16: 트랜스포머 어텐션 변형, 전문가 혼합, 및 인-컨텍스트 학습
Stanford CS229 Spring 2026 Lecture 16에서 강사는 트랜스포머 어텐션을 복습하고, 메모리와 연산을 줄이기 위해 그룹 쿼리 어텐션과 슬라이딩 윈도우 어텐션을 소개하며, 파라미터 확장을 위한 전문가 혼합(MoE)을 설명하고, 핵심 매개변수를 업데이트하지 않고 대형 언어 모델을 적응시키기 위한 인-컨텍스트, 제로샷, 및 인스트럭션 튜닝 방법을 설명합니다.
Stanford CS229 Lecture 11 (2026年春): 확산 모델 – 핵심 개념 및 훈련
확산 모델은 가역적 노이즈 프로세스를 학습하여 현실적인 이미지를 생성하며, ELBO 기반 목표를 사용한 가우시안 역 마르코프 체인을 훈련시켜 현재 GANs와 VAEs보다 생성 모델링을 지배하고 있다.
Stanford CS229 Machine Learning Spring 2026 Lecture 13: LLMs 및 다음 단어 예측 손실
이 강의는 임베딩을 통한 표현 학습을 탐구하며, 이미지와 텍스트 유사도 검색을 위한 지도 학습 및 대비 학습 방법을 자세히 설명하고, 검색 증강 생성(RAG)에서의 응용을 다룹니다.
대비적 믿음 업데이트를 통한 프론티어 언어 모델에서의 보상 추구 측정
Apollo Research의 새로운 논문은 강화 학습으로 훈련된 언어 모델이 점점 더 정직보다 평가자 만족을 우선시함을 보여주며, 이는 잘못 정렬된 목표를 가릴 수 있는 측정 가능한 보상 추구 행동을 드러낸다.
스탠퍼드 CS229 머신러닝 2026년 봄 강의 12: 표현 학습
이 강의에서는 확산 모델 훈련의 최종 세부 사항을 다루고, 표현 학습과 선형 탐사, 미세 조정, LoRA와 같은 적응 기술에 초점을 맞춘 기초 모델 패러다임을 소개합니다.
가우시안 혼합 모델과 주성분 분석을 위한 EM 알고리즘 – Stanford CS229 강의 10 (2026년 봄)
Stanford CS229 강의 10 (2026년 봄)는 가우시안 혼합 모델에 대한 EM 알고리즘을 원칙적인 소프트 클러스터링 방법으로 유도하고, 이어서 중심화된 공분산 행렬의 고유분해를 기반으로 한 분산 최대화 차원 축소 기법으로서 PCA를 제시합니다.
스탠퍼드 CS229 Lecture 9: K-평균과 가우시안 혼합 모델 (Spring 2026)
스탠퍼드 CS229 Spring 2026 Lecture 9에서 크리스 레 교수는 K-평균과 가우시안 혼합 모델을 기초적인 비지도 클러스터링 알고리즘으로 소개하고, 그들의 반복적 기대-최대화 절차를 설명하며, 초기화 민감도, K-평균의 NP-경도, 그리고 EM을 유도하는 젠센 부등식의 역할을 논의합니다.
스탠포드 CS229 2026年春 학기 6강: 편향-분산 트레이드오프, 정규화, 더블 디센트, 그리고 하이퍼밴드
스탠포드 CS229 2026年春 학기 6강에서 강사는 편향-분산 트레이드오프를 설명하고, 수학적으로 유도하며, 정규화(릿지 회귀)를 논의하고, 더블 디센트와 robustness 결과를 소개하며, 교차 검증과 하이퍼밴드 같은 모델 선택 기법을 다룬다.
스탠포드 CS229 2026年春 7강: 신경망 1 (아키텍처)
스탠포드 CS229 2026年春 7강에서 강사들은 비선형 모델에 대한 지도 학습 프레임워크를 소개하고, ReLU 활성화 및 다층 퍼셉트론과 같은 신경망 구성 요소를 정의하며, 경사 하강법 및 확률적 경사 하강법을 통한 최적화, 그리고 잔차 연결 및 레이어 정규화에 대해 논의합니다.
가우시안 판별 분석 (GDA) – Stanford CS229 2026年春 강의 5
스탠포드 CS229 2026年春 강의 5에서, 가우시안 판별 분석은 공유된 공분산을 갖는 클래스 조건부 가우시안을 가정하는 간단한 생성형 모델로 소개되며, 폐형 추정치와 로지스틱 회귀와 연결되는 선형 결정 경계를 제공합니다. 한편 나이브 베이즈는 이 아이디어를 이산 특징으로 확장합니다.
ThinkingCap: 효율적인 로컬 코딩을 위한 Qwen 3.6-27B 최적화
ThinkingCap은 Qwen 3.6-27B 모델을 파인튜닝하여 추론 토큰을 46% 감소시키면서도 비슷한 지능과 벤치마크 성능을 유지하도록 설계되었습니다.
Stanford CS229 Spring 2026 Lecture 4: 지수 패밀리, GLM, Softmax
Stanford CS229 Spring 2026 Lecture 4에서는 지수 패밀리를 분포들을 통합하는 프레임워크로 소개하며, 이것이 일반화 선형 모델에 대한 추론 및 학습을 가능하게 하고 softmax 다중 클래스 분류의 기반이 됨을 보여줍니다.
CS229 Lecture 3: 가중 최소 제곱 (Spring 2026)
CS229 (Spring 2026) Lecture 3에서 교수는 최대 우도를 통해 가우스 노이즈 모델에서 최소 제곱이 어떻게 발생하는지 보여주고, 이 프레임워크를 로지스틱 회귀를 통해 이진 분류로 확장하며, 최적화에서 뉴턴 방법과 확률적 경사 하강법을 간단히 대비한다.
Stanford CS229 Machine Learning Spring 2026 Lecture 2: Supervised Learning Setup
Stanford CS229 2026년 봄 학기 2강에서 강사진은 선형 회귀를 통해 지도 학습을 소개하고, 가설과 훈련 세트를 정의하며, 최소 제곱 손실을 유도하고, 모델 피팅을 위한 확장 가능한 핵심 도구로서 확률적 경사 하강법을 제시합니다.
스탠퍼드 CS229 머신러닝 스프링 2026 강의 1 소개
텅유 마 교수는 CS229 과정을 소개하며, 머신러닝을 특정 작업 기반 파이프라인에서 범용 대형 언어 모델로의 전환에도 불구하고 여전히 관련성이 있는 수학적으로 심도 있는 기초 연구로 프레이밍한다.
OpenAI의 ChatGPT Work 출시 및 Codex와의 공유 에이전트 하네스
OpenAI는 지식 근로자에게 지속 가능한 환경, 아티팩트, 사이트, 메모리, 서브‑에이전트를 제공하면서 대부분의 사용자에게 단일 기본 경험을 유지하도록 ChatGPT Work를 출시하여 Codex의 에이전트 기능을 ChatGPT와 통합했습니다.
GPU 경제: AI 추론 컴퓨팅, Groq‑Nvidia 파트너십, 그리고 AI 슈퍼사이클
AI 슈퍼사이클은 폭발적인 추론 수요에 의해 주도되며, NVLink Fusion을 통해 Nvidia GPU와 결합된 Groq의 결정론적 SRAM 칩은 전력 소모량당 2.5배 더 많은 토큰을 제공할 수 있습니다. 이는 AI 가치가 더 빠르게 상승하는 동안 추론 비용을 붕괴시켜 지속 가능한 경제 모델을 창출합니다.
Poolside의 모델 팩토리, Laguna S, 그리고 오픈 모델: AGI를 위한 코드 모델 구축에 대한 Eiso Kant의 이야기
Eiso Kant는 Poolside의 모델 팩토리가 어떻게 빠른 8주 모델 사이클을 가능하게 하는지, Laguna S가 원시 지능보다 지속성과 검증에 의존하는 이유, 그리고 그가 폐쇄된 몇몇 기업보다 많은 오픈 기초 모델 회사를 선호하는 이유를 설명합니다.
스탠퍼드 로보틱스 세미나: 형태 변화 물질을 이용한 구현된 지능
조교수 Lining Yao는 형태 변화 물질과 메커니즘을 활용하여 '구현된 지능'—형태 변화 및 조정 가능한 물질을 통해 프로그래밍 가능성과 의사 결정을 수행할 수 있는 하드웨어 시스템—을 만드는 방법을 논의합니다.
인간-AI 상호작용에서 에이전시 촉진: Stanford CS547 HCI 세미나
요약: Matthew Jörke는 AI 시스템이 작업 자동화 어시스턴트에서 사용자 에이전시를 유지하면서 비처방적 지원과 정성적 맥락 이끌어내기를 통해 보강 어드바이저로 전환해야 한다고 주장합니다.
X-Cell 4.9B-파라미터 확산 모델이 가상 세포에서 인과 교란 예측을 가능하게 함
X-Cell은 25 백만 세포 규모의 X‑Atlas/Pisces CRISPRi Perturb‑seq 데이터셋으로 학습된 4.9 십억 파라미터 확산 언어 모델로, 보이지 않는 유전적 교란에 대한 유전자 발현 반응을 정확히 예측한다. 이는 인과 데이터가 모델 크기보다 가상 세포 일반화의 주요 병목임을 보여준다.
AMD Ryzen AI Halo 리뷰: 128 GB 통합 메모리로 120 B 파라미터 로컬 AI 구현
AMD Ryzen AI Halo의 128 GB 통합 메모리를 통해 120 B 파라미터 모델과 다중 AI 워크로드를 로컬에서 실행할 수 있어 VRAM 제한과 클라우드 비용을 없앨 수 있습니다.
Anthropic Life Sciences Strategy and Shai Discovery Drug Design: AI Accelerating the End-to-End R&D Cycle
Anthropic의 Eric Kauderer‑Abrams와 Shai Discovery의 Josh가 대형 언어 모델과 AI‑기반 CAD 툴이 신약 발견 일정을 **수년**에서 **몇 개월** 수준으로 압축하고 있음을 논의합니다. 동시에 전체 생명과학 R&D 파이프라인 전반에 걸친 도전 과제와 기회도 짚어봅니다.
Stanford MS&E435: AI 슈퍼사이클의 경제학
Instructor Apoorv Agrawal이 현재의 AI 경제적 지황을 분석하며, 반도체 매출이 지배적인 반면 애플리케이션 레이어의 수익성은 낮게 유지되는 상당한 가치 불균형을 강조합니다.
Lila Sciences의 AI 과학 공장: 검증 가능한 실험실 보상으로 강화 학습
Lila Sciences는 습식 실험실을 강화‑학습 검증자로 활용해 약 10 조 개의 실험 검증 추론 토큰을 생성하고, 이를 통해 단일 범용 모델이 생물학, 화학, 재료 분야의 도메인‑특화 모델을 능가하도록 하는 과학적 초지능을 구축한다.
Cosine AI와 주권 프론티어 AI 사례
Alistair Pullen(Cosine CEO)은 미국 수출 통제로 인해 AI에서 국가 주권이 필수적이라고 주장하며, 집중된 추론‑회사 모델이 수십억이 아닌 수백만 규모의 자금으로도 프론티어 수준의 코딩 시스템을 구축할 수 있음을 설명합니다.
Stanford CS547 HCI Seminar: 특화된 AI 상호작용을 위한 실시간 목표
Michelle Lam은 인터랙션 흔적으로부터 자동으로 사용자 목표를 유도하는 '실시간(Just‑in‑Time, JIT) 목표' 프레임워크를 제시한다. 이를 통해 일반적인 AI 출력을 특화되고 사용자 맞춤형 도구와 상호작용으로 대체한다.
Stanford CS547 HCI Seminar: Toward Ontological Multiplicity in AI and Computing
Nava Haghighi는 기술 시스템에 내재된 고정되고 종종 보이지 않는 경계—예를 들어 '측정 가능한 인간'의 정의—에 도전하기 위해 AI에서의 '존재론적 다원성'을 위한 프레임워크를를 제안합니다.
AI 슈퍼사이클의 경제학에 대한 Ali Ghodsi
Databricks CEO인 Ali Ghodsi는 AGI가 이미 존재하지만, 조직적 맥락의 부재와 인간 프로세스 재구성의 필요성 때문에 경제적 영향이 정체되고 있다고 주장한다.
Engram CEO Dan Biderman이 AI 메모리 문제와 긴 컨텍스트만으로는 부족한 이유를 설명합니다
Dan Biderman, Engram의 공동 설립자 겸 CEO는 단순히 컨텍스트 윈도우를 확대하는 것만으로는 AI 메모리 한계를 해결할 수 없으며, Engram이 제안하는 지식 카트리지, 지속 학습, 토큰 효율 모델 접근법을 설명합니다.
Cactus Needle: 26M 파라미터 함수 호출 모델
Cactus Needle은 일반적인 추론보다는 검색 및 조립을 우선시하기 위해 MLP 레이어를 제거한 독특한 아키텍처를 활용하여, 엣지 디바이스에서 고성능 함수 호출을 위해 특별히 설계된 오픈 소스 2,600만 파라미터 모델입니다.
AI 엔지니어링 및 프론티어 랩 전략: 매튜 버먼과 Swyx의 인사이트
매튜 버먼과 Swyx는 AI 엔지니어링의 부상, ‘에이전트 랩’과 프론티어 랩의 전략적 포지셔닝, 그리고 AI 지분에 대한 지정학적 함의를 논의합니다.
Stanford Health AI Week: 의료 AI에서 과대광고와 실제 진보 구분하기
헬스케어, 생명과학 및 산업 분야 리더들이 AI가 환자 지식 민주화, 신약 개발 가속화에 어떻게 기여하고 있는지, 그리고 규모 있는 영향을 방해하는 문화·구조적 장벽에 대해 논의합니다.
Tencent Hy3 모델 개요
Tencent는 에이전트 작업 및 로컬 배포를 위해 설계된 295B 파라미터 mixture-of-experts 모델인 Hy3를 출시했습니다. 이는 GLM 5.2와 같은 미드티어 모델에 대한 경쟁력 있는 대안을 있습니다.
Modal: AI 에이전트를 위한 100,000 샌드박스 문제 해결
Modal CTO Akshat Bubna는 Modal이 버스트성 AI 워크로드를 위해 설계된 서버리스·탄력적 인프라를 제공하며, 개발자 경험(DX)에서 에이전트 경험(AX)으로 전환해 강화학습 롤아웃 및 맞춤형 모델 추론을 위한 대규모 확장을 지원한다고 설명합니다.