✷ 아카이브 · 연구소 11곳 · 디스패치 3,049건
연구소
매일 아침 십여 개의 공식 블로그를 돌아볼 필요가 없습니다. OpenAI, Anthropic, DeepMind 등의 일차 발표를 핵심만 뽑아서.
Anthropic 헌법 분류기: 보편적 제거 공격에 대한 방어
Anthropic는 보편적 제거 공격의 성공률을 5% 미만으로 줄이고, 계산 비용 증가와 무해한 거부율 증가를 최소화한 새로운 입력-출력 필터링 시스템인 헌법 분류기를 발표했다.
OpenAI 국가 안보 원칙 및 정부 파트너십
OpenAI는 국가 안보 및 법 집행 분야에서 정부 파트너십과 기술 사용 방식을 투명하게 공개하기 위해 **국가 안보 원칙**을 발표했습니다.
SWE-Bench Pro 코딩 평가 결함에 대한 OpenAI 분석
OpenAI는 감사 결과 벤치마크 작업의 약 30%가 과도하게 엄격한 테스트와 미지정된 프롬프트와 같은 문제로 손상된 것으로 밝혀진 후 SWE-Bench Pro에 대한 권고를 철회했습니다.
Robostral Navigate 릴리스 노트
Mistral AI는 단일 RGB 카메라만을 사용하여 로봇이 복잡한 환경을 자율적으로 탐색할 수 있게 하는 8B 모델인 Robostral Navigate를 출시했으며, 보지 못한 R2R-CE 벤치마크에서 76.6%의 성공률을 달성했습니다.
OpenAI Academy K–12 교육자를 위한 AI Skills Jam
OpenAI Academy는 Walton Family Foundation과 협력하여 AI Skills Jam을 시작합니다. 이 프로그램은 1,600명 이상의 K–12 교육자에게 AI를 교육 및 행정에 통합하는 실습 교육을 제공하는 것을 목표로 합니다.
Hugging Face 네이티브 속도 vLLM Transformers 모델링 백엔드
Hugging Face는 런타임에 추론 전용 레이어 융합을 동적으로 적용함으로써, 맞춤형 vLLM 구현의 처리량에 맞추거나 능가하도록 transformers vLLM 백엔드를 업데이트했습니다.
GPT‑Live‑1 및 GPT‑Live‑1 mini 소개: OpenAI의 새로운 전이중 음성 모델
OpenAI는 GPT‑Live‑1과 GPT‑Live‑1 mini를 발표했습니다. 전이중 음성 모델로 자연스럽고 중단 가능한 대화를 가능하게 하며 복잡한 추론은 GPT‑5.5에 위임하고, 전 세계 ChatGPT 사용자에게 순차적으로 제공됩니다.
Anthropic과 AE Studio, 이중 용도 지식 제어를 위한 GRAM 도입
Anthropic과 AE Studio는 일반 모델 성능을 희생시키지 않으면서 이중 용도 지식을 제거 가능한 구획으로 격리하여 오용을 방지하는 방법인 Gradient-Routed Auxiliary Modules (GRAM)를 개발했습니다.
Hugging Face와 Amazon SageMaker Studio 통합
Hugging Face는 Amazon SageMaker AI와의 딥링크 통합을 도입하여 개발자가 모델 탐색에서 SageMaker Studio에서의 파인튜닝 또는 배포까지 단 한 번의 클릭으로 이동할 수 있게 했습니다.
Foundry Managed Compute의 Hugging Face 모델
Microsoft Foundry는 이제 기업 수준의 운영을 위해 클릭 한 번으로 Foundry Managed Compute에 배포할 수 있는, 매주 업데이트되는 Hugging Face 오픈 웨이트 모델의 엄선된 카탈로그를 통합합니다.
지능은 무료가 되었고, 이제 무엇인가? 에이전트를 위한, 에이전트의, 에이전트에 의한 데이터 시스템
BAIR 연구원은 AI 추론 비용이 zéro에 접근함에 따라 에이전트 워크로드, 에이전트 상태 관리, 에이전트 주도 시스템 합성을 위한 데이터 시스템 재설계를 위한 새로운 프레임워크를 제안합니다.
Hugging Face와 SkyPilot 통합으로 제로 이그레스 AI 스토리지
Hugging Face와 SkyPilot이 통합되어 Hugging Face Hub에 저장된 모델과 데이터셋을 읽을 때 제로 이그레스 비용으로 어떤 클라우드 공급자에서도 AI 워크로드를 실행할 수 있게 되었습니다.
MUFG AI-네이티브 변혁과 OpenAI
MUFG는 OpenAI와 파트너십을 맺어 35,000명의 직원에게 ChatGPT Enterprise를 구현하고 AI 기반 고객 경험을 개발하여 AI-네이티브 금융 그룹으로 전환하고 있습니다.
Australian Payments Plus의 ChatGPT Enterprise 및 Codex 통합
Australian Payments Plus (AP+)는 기술 조사를 가속화하고, 복잡한 지식 업무를 효율화하며, 제품 프로토타이핑 시간을 몇 주에서 단 하루로 단축하기 위해 ChatGPT Enterprise와 Codex를 도입했습니다.
LeRobot v0.6.0 릴리스 노트 / 새로운 기능
LeRobot v0.6.0은 월드 모델 정책, 확장된 VLA 모델 주, 통합 보상 모델 API, 그리고 DAgger 방식의 인간 개입 수정을 지원하는 새로운 배포 CLI를 도입합니다.
PRX 데이터 전략: VLM 재캡셔닝 및 Mosaic Streaming을 통한 사전 학습 확장
Photoroom은 7B 파라미터 모델을 최적화하기 위해 긴 VLM 생성 캡션 사용, Lance 및 Mosaic Data Shards를 결합한 하이브리드 저장 전략, 그리고 고품질 JPEG 인코딩을 강조하며 PRX의 데이터 파이프라인을 상세히 설명합니다.
vLLM × HPC-Ops: Tencent Hunyuan의 고성능 Attention 및 MoE 백엔드
vLLM에 NVIDIA Hopper H20에 최적화된 HPC-Ops attention 및 MoE 백엔드가 포함되었습니다. 이를 통해 attention 속도는 최대 2.95배, MoE 속도는 1.59배 향상되었으며, Hy3 모델에서 TTFT는 약 24%, TPOT는 약 17% 감소했습니다.
Hugging Face Kernels 주요 업데이트
Hugging Face는 새로운 커널 저장소 유형, 신뢰할 수 있는 게시자 및 코드 서명, 개편된 CLI, 광범위한 프레임워크 지원, 에이전트 기반 커널 개발을 위한 기반을 도입하며 Kernels 프로젝트의 주요 업데이트를 발표했습니다.
Anthropic, Claude 언어 모델에서 글로벌 워크스페이스(J-space) 발견
Anthropic은 Claude 내에서 내부적이고 보고 가능한 추론을 위한 글로벌 워크스페이스 역할을 수행하며, 침묵하는 사고의 모니터링과 새로운 안전 도구를 가능하게 하는 창발적 "J-space"의 발견을 발표했습니다.
앨버타 정부, 클로드 코드로 4억 6600만 줄의 코드를 수시간 내에 스캔하고 수정
앨버타 주 정부는 앤트로픽의 클로드 코드(Opus 및 손넷)를 활용해 3,400개 저장소에 걸쳐 4억 6600만 줄의 코드를 20시간 내에 스캔하고, 자동으로 수정을 생성하며, 지속적인 AI 기반 보안 검토를 구축함으로써 수년에 걸친 작업을 획기적으로 단축했습니다.
xAI Grok Voice 업데이트: 21개의 새로운 플래그십 보이스
xAI는 기존 5개 보이스의 개선과 Grok Voice Agent Builder의 도입과 함께, Grok Voice를 위한 21개의 새로운 다국어 플래그십 보이스를 출시했습니다.
Google DeepMind과 A24 연구 파트너십
Google DeepMind과 A24는 창의적 과정에 AI 혁신을 직접 통합하여 새로운 영화 제작 워크플로와 기술을 개발하기 위한 연구 파트너십을 체결했습니다.
Leanstral 1.5 릴리스: 최첨단 형식 검증 모델
Mistral AI는 119 B 파라미터, Apache‑2.0 라이선스를 가진 Leanstral 1.5를 공개했는데, 이 모델은 miniF2F에서 완전히 커버하고 PutnamBench 문제 587개 중 672개를 해결하며, 오픈소스 코드에서 이전에 알려지지 않은 버그를 발견했습니다.
클로드 패블 5 사이버보안 안전장치 및 잠금 해제 프레임워크
애너티픽은 클로드 패블 5에서 사이버보안 오용을 방지하기 위해 사용하는 안전 분류기의 세부 사항을 공개하고, AI 잠금 해제의 평가 방식을 표준화하기 위한 새로운 사이버 잠금 해제 심각도(CJS) 프레임워크를 제안했다.
Anthropic, Claude Fable 5 및 Mythos 5에 대한 접근 복원
Anthropic는 미국 수출 통제가 해제된 후 Claude Fable 5 및 Mythos 5가 다시 온라인으로 복원되었으며, 새로운 안전 분류기, 산업 전반의 잠금 해제 심각도 프레임워크, 그리고 정부와의 확대된 협력을 발표했습니다.
Claude Fable 5 및 Claude Mythos 5 출시 – 안전 보호 기능과 계층적 접근을 갖춘 최첨단 Mythos 클래스 모델
Anthropic는 소프트웨어 공학, 시각 처리, 과학 분야에서 기록적인 성능을 보이는 일반 사용용 Mythos 클래스 1 모델인 Claude Fable 5와, 검증된 사이버 방어 전문가 및 향후 생물학 파트너를 위한 안전 보호 기능이 완화된 Claude Mythos 5를 출시했다.
BAIR 2026 졸업생 쇼케이스
Berkeley Artificial Intelligence Research (BAIR) Lab이 2026년 박사 학위 졸업생 명단을 발표하며 로봇 공학, 대규모 언어 모델, AI 안전성 및 헬스케어를 아우르는 연구 성과를 강조했습니다.
허깅 페이스와 세레브라스 실시간 음성 AI with Gemma 4
허깅 페이스와 세레브라스는 Gemma 4 31B를 사용한 오픈 캐스케이디드 음성-음성 파이프라인을 개발하여 자연스럽고 낮은 지연 시간의 음성 AI 상호작용을 가능하게 했습니다.
Qwen3-Omni-30B-A3B-Instruct 서빙을 위한 vLLM-Omni 최적화
vLLM-Omni는 Thinker, Talker, Code2Wav의 3단계 파이프라인을 통해 Qwen3-Omni-30B-A3B-Instruct를 서빙하며, 단계 분해, CUDA Graphs, async chunk handoffs, async output, stage replicas 및 hot-path cleanup을 사용하여 처리량과 지연 시간을 개선합니다.
xAI Voice Agent Builder Beta Release
xAI가 Grok Voice를 기반으로 프로덕션용 음성 에이전트를 생성할 수 있는 노코드 플랫폼인 Voice Agent Builder를 베타 버전으로 출시했습니다.
ScarfBench: 엔터프라이즈 자바 프레임워크 마이그레이션을 위한 AI 에이전트 벤치마크
IBM Research는 엔터프라이즈 자바 애플리케이션을 Spring, Jakarta EE, Quarkus 프레임워크 간에 마이그레이션하는 AI 에이전트의 능력을 평가하는 오픈 벤치마크인 ScarfBench를 소개합니다.
Nano Banana 2 Lite 및 Gemini Omni Flash 출시
Google DeepMind은 고속かつ 비용 효율적인 이미지 생성을 위한 Nano Banana 2 Lite와 고품질 비디오 생성 및 대화형 편집을 위한 Gemini Omni Flash를 출시했습니다.
왜 특화는 AI 시스템에서 불가피한가
2026년 Goldfeder 등(2026) 연구에 따르면, 한정된 자원으로 인해 집중된 용량이 넓은 일반성보다 더 효과적이기 때문에 특화는 AI 성능에 구조적인 필수조건이다.
OpenAI Signals: 글로벌 ChatGPT 채택 동향 분석
OpenAI Signals 데이터는 전 세계적으로 ChatGPT 사용이 심화되고 확대되고 있음을 보여주며, 사용자는 가입 후 6개월이 지나면 일일 메시지량을 50% 늘리고 수행 작업의 다양성을 두 배로 늘린다고 나타냅니다.
Anthropic Frontier Red Team: AI 역량 스트레스 테스트
Anthropic의 Frontier Red Team은 미래의 위험을 예측하기 위해 사이버 보안, 국가 안보 및 자율 시스템에 대한 AI의 영향에 관한 증거 기반 분석을을 수행합니다.
허깅 페이스 커뮤니티 Evals과 Every Eval Ever (EEE) 통합
허깅 페이스는 표준화된 평가 결과를 교차 게시하고 모델 페이지와 상세 기술 기록 간의 직접 연결을 가능하게 하기 위해 커뮤니티 Evals과 Every Eval Ever (EEE) 프로젝트를 통합했습니다.
OpenAI 코어 덤프 역학: 18년 된 libunwind 버그 수정
OpenAI는 자신의 Rockset 데이터 인프라에서 두 개의 서로 다른 충돌 인구를 식별하고 해결했으며, 이는 silenz한 하드웨어 실패와 GNU libunwind에서의 드문 18년 된 경합 조건을 포함합니다.
OpenAI가 계산 생물학 추론을 위한 GeneBench-Pro를 소개합니다
OpenAI가 계산 생물학에서 AI 에이전트의 고수준 과학적 판단 및 반복 분석 능력을 평가하기 위해 설계된 연구 수준 벤치마크인 GeneBench-Pro를 출시했습니다.
Genebench-Pro 내부: 유전체 AI 벤치마킹의 사례 연구
OpenAI의 Genebench-Pro는 somatic oncology, 기능 유전체학, 집단 유전학 전반에 걸친 열 개의 상세한 사례 연구를 특징으로 하는 복잡한 유전체 작업에서 AI 모델을 평가하기 위한 특화된 벤치마크를 제공합니다.
클로드 사이언스 AI 워크벤치 출시
애너트로픽은 과학 도구를 통합하고 확장 가능한 컴퓨팅을 관리하며, 검증 가능한 연구 자산을 제공하는 AI 워크벤치인 클로드 사이언스를 출시했습니다.
DiScoFormer: 밀도와 점수를 위한 하나의 트랜스포머, 분포 전반에 걸쳐
DiScoFormer는 주어진 데이터 포인트 집합으로부터 분포의 밀도와 점수를 단일 순전파에서 추정하며, 새로운 분포에 대해 재훈련이 필요 없는 새로운 트랜스포머 기반 모델입니다.
TITLE: OpenAI 유럽 AI 인력 기회 보고서 2026 매핑
SUMMARY: OpenAI의 2026년 보고서는 AI 직업 전환 프레임워크를 EU로 확장하여, EU 고용의 약 12%가 AI와 함께 성장할 수 있고, 14%는 더 높은 단기 자동화 직면 가능성을 보이며, 27%는 재구성될 가능성이 있고, 나머지 47%는 즉시적인 변화가 적다고 밝혔습니다.
vLLM Semantic Router: 마이크로 에이전트 협업을 통한 모델 성능 향상
vLLM은 Semantic Router를 도입했는데, 이는 서빙 레이어 프리미티브로서 단일 모델 API 호출을 마이크로 에이전트의 제한된 협업으로 변환하여 복잡한 벤치마크에서 프론티어 모델보다 우수한 성능을 내게 합니다.
Ollama 0.31: Multi-Token Prediction을 통한 Gemma 4 성능 향상
Ollama 0.31은 Apple Silicon에서 Gemma 4를 위한 multi-token prediction을 도입하여, 모델 출력을 변경하지 않으면서 코딩 에이전트 벤치마크에서 토큰 생성 속도를 거의 90% 향상시켰습니다.
HP Inc.와 OpenAI의 전략적 파트너십
HP Inc.는 OpenAI Frontier 플랫폼을 사용하여 고객 지원, 보안 및 소프트웨어 개발 전반에 AI 에이전트와 워크플로우를 배치하기 위해 OpenAI와의 전략적 파트너십을 확대하고 있습니다.
GPT-5.6 Sol 미리보기: 기능, 보호 조치, 그리고 가용성
OpenAI는 자체 차세대 플래그십 모델인 GPT‑5.6 Sol을 Terra 및 Luna와 함께 미리보기했으며, 강화된 보호 조치와 신뢰할 수 있는 파트너를 위한 제한된 출시를 강조하면서 코딩, 생물학, 사이버 보안 분야에서 더 강력한 기능을 강조했습니다.
Hugging Face Jobs: 단일 명령으로 vLLM 서버 배포하기
Hugging Face는 이제 HF Jobs를 통해 단일 명령으로 자체 인프라에서 비공개 OpenAI 호환 vLLM 엔드포인트를 배포할 수 있게 하여, 테스트, 평가 및 배치 생성을 위한 초당 과금 대안을 제공합니다.
Anthropic 경제 지수 주기 보고서 – 2026년 6월
Anthropic의 2026년 6월 경제 지수 보고서는 클로드 사용이 이제 일일 및 주간 근무 주기와 일치하며, 더 높은 가치의 아티팩트를 생성하고 더 많은 컴퓨팅 자원을 소비하며, 더 많은 작업을 자동화하는 사용자들이 AI가 그들의 직업에 미치는 영향에 대해 놀랍도록 낙관적임을 밝혀냈습니다.
OpenAI Codex 에이전시 AI 도입 및 영향
OpenAI는 Codex를 통해 짧은 챗봇 상호작용에서 장기 에이전시 작업으로 지식 작업이 전환되었으며, 비개발자 채택이 2025년 8월 이후 최대 189배 성장했다고 보고했습니다.
Gemini 3.5 Flash 컴퓨터 사용 통합
Google DeepMind은 Gemini 3.5 Flash에 컴퓨터 사용을 네이티브 도구로 통합하여, 에이전트가 브라우저, 모바일, 데스크톱 환경에서 보고, 추론하고 행동을 취할 수 있도록 했습니다.