vLLM에서 NVIDIA Nemotron 3 Nano Omni 지원
vLLM은 이제 NVIDIA Nemotron 3 Nano Omni를 지원합니다. 이 모델은 30B MoE 멀티모달 모델로, 비전, 오디오, 언어 추론을 하나의 루프로 통합하여 에이전트 AI를 구동하는 고효율 모델입니다.
OpenAI GPT-5.5, Codex, 및 AWS 관리 에이전트 릴리스 노트
2026년 4월 28일, OpenAI는 GPT‑5.5를 포함한 최첨단 모델, Codex 코딩 에이전트, 그리고 OpenAI 기반 Amazon Bedrock 관리 에이전트가 AWS에서 제한된 프리뷰로 제공된다고 발표했으며, 이를 통해 기업은 기존 AWS 보안·컴플라이언스·조달 워크플로우 내에서 이러한 기능을 활용할 수 있게 되었습니다.
OpenAI, FedRAMP 중간 수준 인증 획득
OpenAI는 ChatGPT Enterprise와 API 플랫폼에 대해 FedRAMP 20x 중간 수준 인증을 획득했으며, 이를 통해 미국 정부 기관이 연방 보안 및 개인정보 보호 기준에 부합하는 GPT-5.5를 포함한 최첨단 AI 모델에 접근할 수 있게 되었습니다.
Google DeepMind과 대한민국과의 파트너십
Google DeepMind은 대한민국 과학기술정보통신부와 파트너십을 체결하여 서울에 AI 캠퍼스를 설립하고 최첨단 AI 모델을 배치하여 생명 과학, 에너지, 기후 분야의 과학 연구를 가속화할 것입니다.
Microsoft OpenAI 파트너십의 다음 단계
OpenAI와 Microsoft는 파트너십 계약을 수정하여 유연성을 높였으며, OpenAI가 Microsoft를 주요 클라우드 파트너로 유지하면서 모든 클라우드 제공업체에 제품을 제공할 수 있게 되었습니다.
Choco는 AI 에이전트로 식품 유통을 자동화합니다
Choco는 OpenAI API를 기반으로 구축된 AI 기반 OrderAgent와 VoiceAgentを発表하여 식품 유통 주문 처리를 자동화했습니다.
Symphony: Codex 오케스트레이션을 위한 오픈 소스 사양
OpenAI가 Linear와 같은 이슈 트래커를 Codex 코딩 에이전트를 위한 상시 가동 오케스트레이터로 변환하는 오픈 소스 사양인 Symphony를 출시했습니다. 이를 통해 팀은 일상적인 구현 작업을 자동화하고 PR 처리량을 높일 수 있습니다.
OpenAI Privacy Filter: 확장 가능한 PII 탐지 웹 앱 구축하기
OpenAI는 128k 컨텍스트 윈도우에서 8가지 범주의 민감한 데이터를 라벨링할 수 있는 오픈 소스 1.5B-parameter PII 탐지기인 Privacy Filter를 출시했습니다.
OpenAI AGI 개발을 위한 운영 원칙
OpenAI는 인공 일반 지능(AGI)이 인류 전체에 이익이 되도록 보장하기 위해 다섯 가지 핵심 원칙—민주화, 권한 부여, 회복력, 보편적 번영, 적응력—을 제시했습니다.
OpenAI AI 직업 전환 프레임워크
OpenAI는 921개 직업에 걸쳐 AI가 고용에 미치는 영향을 분석하기 위해 AI 직업 전환 프레임워크를 도입했으며, 자동화 위험, 재구성, 성장 잠재력, 안정성을 기반으로 직업을 네 가지 경로로 분류합니다.
DeepSeek-V4 릴리스 노트: AI 에이전트를 위한 효율적인 1M-토큰 컨텍스트
DeepSeek-V4는 하이브리드 CSA/HCA 주의 메커니즘으로 구동되는 1M-토큰 컨텍스트 윈도우를 도입하며, 장기 실행 에이전트 워크로드 및 도구 사용 궤적에 특별히 최적화되었습니다.
vLLM DeepSeek V4 지원: 효율적인 장기 컨텍스트 어텐션
vLLM은 이제 DeepSeek V4-Pro와 V4-Flash를 지원하며, 컨텍스트 길이를 최대 백만 토큰까지 확장하고 KV 캐시 메모리를 크게 절감하는 새로운 어텐션 메커니즘을 구현했습니다.
OpenAI GPT-5.5 System Card
OpenAI가 복잡한 실무 작업 및 도구 사용에 최적화되고, 향상된 작업 이해도와 더욱 강력한 안전 프레임워크를 특징으로 하는 GPT-5.5를 출시했습니다.
OpenAI GPT-5.5 릴리스 노트
OpenAI는 GPT-5.5와 GPT-5.5 Pro를 출시했으며, 에이전트 코딩, 컴퓨터 사용, 과학 연구 분야에서 큰 발전을 이루면서도 GPT-5.4와 동일한 지연 시간을 유지합니다.
일상 업무에서 ChatGPT Work 사용하기
2026년 4월 23일 OpenAI 아카데미 게시물에서는 ChatGPT Work가 캘린더, 이메일, 문서, 스프레드시트와 같은 기존 작업 자료를 팀이 검토하고 편집할 수 있는 초안 브리프, 요약, 데크, 워크북, 계획, 프로세스 문서로 변환하는 방법을 설명합니다.
크롬 확장 프로그램에서 Transformers.js 사용하기
Hugging Face는 Gemma 4 E2B로 구동되는 백그라운드 호스팅 모델 아키텍처를 특징으로 하는 Manifest V3를 사용하는 Chrome 확장 프로그램에 Transformers.js를 통합하는 기술 가이드를 제공합니다.
ChatGPT for Clinicians 출시
OpenAI는 인증된 미국 의료 제공자를 위해 문서화, 의료 연구 및 임상 워크플로를 자동화하도록 설계된 ChatGPT의 무료 버전인 ChatGPT for Clinicians를 출시했습니다.
Google DeepMind Decoupled DiLoCo
Google DeepMind는 저대역폭과 혼합된 하드웨어 세대를 사용하여 멀리 떨어진 데이터 센터 간에 회복 탄력적이고 비동기적인 LLM 학습을 가능하게 하는 분산 학습 아키텍처인 Decoupled DiLoCo를 소개했습니다.
ChatGPT에서 워크스페이스 에이전트 소개 – OpenAI 연구 미리보기
OpenAI는 ChatGPT에서 워크스페이스 에이전트를 도입하여, 팀이 조직 통제를 준수하면서 도구 간 멀티스텝 워크플로를 자동화하는 공유 클라우드 기반 AI 에이전트를 만들 수 있도록 했습니다.
ChatGPT의 워크스페이스 에이전트: 개요 및 구축 방법
OpenAI는 트리거, 프로세스 및 도구 통합을 결합하여 반복 가능하고 구조화된 워크플로를 자동화하는 워크스페이스 에이전트를 ChatGPT에 도입했으며, 이를 통해 팀이 일관된 AI 기반 작업을 공유할 수 있게 했습니다.
OpenAI Responses API WebSocket 모드 출시
OpenAI는 Responses API에 WebSocket 지원을 도입하여 중복된 API 오버헤드를 제거하고 초당 최대 4,000 토큰의 추론 속도를 가능하게 함으로써 에이전트 워크플로우 지연 시간을 최대 40%까지 감소시켰습니다.
Qwen3.6-27B 릴리스 노트 / 새로운 내용
Qwen은 27억 파라미터의 밀집형 멀티모달 모델인 Qwen3.6-27B를 출시했으며, 모든 주요 에이전트 코딩 벤치마크에서 더 큰 Qwen3.5-397B-A17B를 능가합니다.
vLLM FP8 KV-Cache 및 Attention 양자화 업데이트
vLLM은 Hopper 및 Blackwell 아키텍처 전반에서 베이스라인에 가까운 정확도를 유지하면서 디코딩 지연 시간과 메모리 사용량을 줄이기 위해 FP8 KV-cache 및 attention 양자화를 최적화했습니다.
OpenAI 프라이버시 필터 릴리스
OpenAI는 비구조화 텍스트에서 개인 식별 정보(PII)를 고속으로, 컨텍스트를 인식하여 감지하고 삭제하도록 설계된 오픈-웨이트 1.5B 파라미터 모델인 Privacy Filter를 공개했습니다.
Google DeepMind, Accenture, Bain & Company, BCG, Deloitte 및 McKinsey와 협력해 AI 전환을 가속화
Google DeepMind는 Accenture, Bain & Company, BCG, Deloitte, 그리고 McKinsey와의 파트너십을 발표했습니다. 이 파트너십은 Gemini와 같은 최첨단 모델에 대한 조기 접근을 제공하고, 산업별 AI 솔루션을 공동 개발하며, 리더십을 고객 CEO와 연결함으로써 기업 AI 전환을 가속화합니다.
ChatGPT 이미지 2.0 출시
OpenAI는 이미지 생성 기능을 크게 향상시킨 ChatGPT Images 2.0을 출시했으며, 정밀도 향상, 다국어 텍스트 렌더링, 스타일리시한 사실감이 강화되었습니다.
QIMMA: 품질 우선 아라비아어 LLM 리더보드
Hugging Face와 파트너들은 QIMMA를 도입했습니다. 이는 새로운 아라비아어 LLM 리더보드로, 벤치마크가 실제 언어 능력을 반영하도록 엄격한 품질 검증 파이프라인을 구현합니다.
전 세계 기업에 Codex 확장 – OpenAI 발표
OpenAI는 Codex 사용량이 주당 3백만 명 이상에서 4백만 명 이상으로 증가했다고 발표했으며, Codex Labs와 글로벌 시스템 통합업체 파트너 프로그램을 도입하여 기업이 소프트웨어 개발 수명 주기 전반 및 그 이상에서 Codex를 도입하도록 지원했습니다.
vLLM v0.20.0 하이브리드 SSM 모델을 위한 분산 서빙 추가
vLLM v0.20.0은 하이브리드 SSM‑FA 모델을 위한 분산 프리필/디코드 서빙을 도입하여, 이중 디스크립터 뷰와 3‑디스크립터 Conv 상태 전송을 통해 효율적인 KV 전송을 가능하게 합니다.
Hugging Face: AI와 사이버 보안의 미래
Hugging Face는 오픈소스 AI 모델과 툴링이 Mythos와 같은 자율 취약점 탐지 시스템이 초래하는 위험에 대응하기 위한 사이버 보안 방어에 필수적이라고 주장합니다.
GRASP: 장기 지평선에서 세계 모델을 위한 Gradient 기반 계획
BAIR는 GRASP를 소개합니다. 이는 학습된 세계 모델에서 궤적을 가상 상태로 올리고 행동 Gradient만을 사용해 적대적 상태‑입력 민감성을 회피함으로써 견고한 장기 지평선 계획을 가능하게 하는 Gradient 기반 플래너입니다.
Hyatt, 글로벌 운영 향상을 위해 ChatGPT Enterprise 배포
Hyatt는 ChatGPT Enterprise를 통합하여, 글로벌 기업 및 호텔 직원이 GPT 5.4와 Codex에 접근하여 수작업 작업을 자동화하고 고객 경험을 개선할 수 있도록 제공했습니다.
Qwen3.6-Max-Preview 릴리스 노트 / 새로운 내용
Qwen3.6-Max-Preview는 Qwen이 제공하는 독점 프리뷰 모델로, Qwen3.6-Plus에 비해 에이전시 코딩, 세계 지식, 그리고 지시 수행 능력을 향상시켰습니다.
OpenAI Codex 업데이트 2026년 4월
OpenAI는 Codex를 업데이트하여 백그라운드 컴퓨터 사용, 장기 작업 자동화 및 메모리를 지원하도록 하였으며, 코드 생성기에서 전체 소프트웨어 개발 라이프사이클 파트너로 활용 범위를 확대했습니다.
GPT-Rosalind: 생명과학을 위한 OpenAI의 프론티어 추론 모델
OpenAI는 생물학, 약물 발견 및 번역 의학에 최적화된 추론 모델인 GPT-Rosalind를 도입하여 초기 단계 연구 워크플로우를 가속화했습니다.
OpenAI 사이버를 위한 신뢰할 수 있는 접근 프로그램
OpenAI는 신뢰할 수 있는 사이버 접근 프로그램을 출시했습니다. 이 프로그램은 다양한 수비자 생태계에 고급 사이버 기능에 대한 확장된 접근과 API 크레딧 1,000만 달러를 제공하여 글로벌 디지털 탄력성을 강화하는 것을 목표로 합니다.
Ecom-RLVE: 전자상거래 대화형 에이전트를 위한 적응형 검증 가능한 환경
Hugging Face는 대화형 유창성과 실제 작업 완료 사이의 격차를 해소하기 위해 적응형 난이도 확장을 갖춘 여덟 개 검증 가능하고 다중 턴 환경을 사용하여 전자상거래 에이전트를 훈련하는 프레임워크인 EcomRLVE-GYM을 소개합니다.
Hugging Face transformers-to-mlx 스킬 및 테스트 하네스
Hugging Face는 transformers 라이브러리에서 mlx-lm으로 언어 모델 포팅을 간소화하면서 높은 코드 품질과 리뷰어 신호를 유지하기 위해 스킬과 비에이전트 테스트 하네스를 출시했습니다.
Sentence Transformers를 사용한 멀티모달 임베딩 & 리랭커 모델의 학습 및 파인튜닝
Hugging Face는 Sentence Transformers를 사용한 멀티모달 임베딩 및 리랭커 모델의 학습과 파인튜닝에 대한 가이드를 발표했으며, 작업 특화 파인튜닝이 Visual Document Retrieval과 같은 검색 작업에서 성능을 향상시킨다는 것을 보여주었습니다.
Gemini 3.1 Flash TTS 출시 노트 / 새로운 기능
Google DeepMind은 자연어 오디오 태그를 통해 음성 스타일, 속도, 전달을 정밀하게 제어할 수 있는 70+ 언어 지원 텍스트-음성 모델인 Gemini 3.1 Flash TTS를 출시했습니다.
VAKRA 벤치마크 분석: 에이전트 추론, 도구 사용 및 실패 모드
Hugging Face는 8,000개 이상의 API와 문서 소스에 걸쳐 구성적 추론 능력을 평가하는 실행 가능한 도구 기반 스위트인 VAKRA 벤치마크를 발표했으며, 이를 통해 도구 선택, 멀티 홉 추론 및 정책 준수에서 나타나는 광범위한 실패를 드러냈습니다.
OpenAI Agents SDK 업데이트
OpenAI는 Agents SDK의 업데이트된 기능을 출시하여 모델-네이티브 하네스와 네이티브 샌드박스 실행을 도입함으로써 프로덕션 환경에서 에이전트의 신뢰성과 성능을 향상시켰습니다.
HCompany HoloTab 출시
HCompany은 Holo3 모델을 기반으로 하는 Chrome 확장 프로그램인 HoloTab을 출시했는데, 이는 사용자가 자연어 설명이나 기록된 루틴을 통해 웹 작업을 자동화할 수 있게 합니다.
Qwen3.6-35B-A3B 릴리즈 노트
Qwen은 350억 전체 파라미터와 30억 활성 파라미터를 가진 오픈소스 혼합 전문가 모델 Qwen3.6-35B-A3B를 출시했으며, 이는 에이전시 코딩 및 멀티모달 추론에서 더 큰 밀집 모델과 경쟁합니다.
OpenAI, 사이버를 위한 Trusted Access를 확대하고 방어 사이버 보안을 위한 GPT‑5.4‑Cyber를 출시
OpenAI는 검증된 방어자를 수천 명으로 확대하고, 방어 사이버 보안을 위해 설계된 미세 조정된 보다 관용적인 모델인 GPT‑5.4‑Cyber를 출시하면서 Trusted Access for Cyber 프로그램을 확장합니다.
vLLM Korea Meetup 2026 정리
서울에서 열린 vLLM Korea Meetup 2026은 vLLM이 통합 추론 인프라로 진화한 모습을 보여주었으며, 커뮤니티 성장, 하드웨어 통합 진전, 프로덕션 스택 기능, 그리고 오픈소스 및 엔터프라이즈 트랙 전반에 걸친 실제 배포 전략을 선보였습니다.
Gemini Robotics-ER 1.6 릴리스 노트 / 새로운 내용
Google DeepMind는 Gemini Robotics-ER 1.6을 출시했습니다. 이 모델은 추론 중심 모델로, 공간 추론, 다중 시점 이해 및 자동 로봇 작업을 위한 계측기 판독을 향상시킵니다.
Cloudflare Agent Cloud와 OpenAI 통합
Cloudflare Agent Cloud는 이제 GPT-5.4와 Codex를 포함한 OpenAI 프론티어 모델을 통합하여, 기업이 에지에서 확장 가능하고 프로덕션 준비가 된 AI 에이전트를 배포할 수 있도록 합니다.
고객 성공 팀을 위한 ChatGPT
OpenAI는 고객 성공 팀이 산재된 고객 컨텍스트를 구조화된 실행 계획과 커뮤니케이션으로 합성하여 운영 오버헤드를 줄이는 ChatGPT 사용 가이드를 소개했습니다.
OpenAI에서의 AI 응용
OpenAI는 ChatGPT와 Codex와 같은 직접 접근 제품을 통해 AI 기능을 제공하며, 또한 OpenAI API를 통해 개발자 통합을 위한 조합 가능한 빌딩 블록도 제공합니다.