5801

Waypoint-1: Overworld의 실시간 인터랙티브 비디오 디퓨전

Overworld는 10,000시간 분량의 게임 영상을 학습한 실시간 인터랙티브 비디오 디퓨전 모델 Waypoint-1을 출시했으며, 텍스트, 마우스, 키보드를 통해 지연 없는 세계 상호작용을 가능하게 합니다.

5802

OpenAI 비즈니스 모델 및 컴퓨팅 확장 전략

OpenAI는 인텔리전스의 가치에 따라 확장되는 비즈니스 모델을 구현하여, 다각화된 컴퓨팅 포트폴리오와 다중 계층 수익화 방식을 통해 2023년부터 2025년까지 매출을 10배 증가시켰습니다.

5803

D4RT: 동적 4D 재구성 및 추적

Google DeepMind은 이전 방법보다 최대 300배 더 효율적인 4D 장면 재구성 및 추적을 위한 통합 AI 모델인 D4RT를 소개합니다.

5804

ChatGPT Go 글로벌 출시

OpenAI는 미국에서 월 $8에 제공되는 저비용 구독 플랜인 ChatGPT Go를 모든 이용 가능한 시장으로 확대하여 GPT-5.2 Instant에 대한 전 세계 접근성을 높였습니다.

5805

OpenAI 광고 전략 및 ChatGPT Go 확장

OpenAI는 월 $8 ChatGPT Go 등급을 미국 및 모든 이용 가능한 시장으로 확장하고, 무료 및 Go 등급에서 광고 테스트를 시작하여 AI 접근성을 높일 예정입니다.

5806

OpenAI의 Merge Labs 투자

OpenAI는 생물학적 인공지능과 인공 지능을 연결하는 고대역폭 뇌-컴퓨터 인터페이스(BCI)를 개발하는 연구소인 Merge Labs의 시드 라운드에 참여하고 있습니다.

5807

OpenAI, 국내 제조를 통해 미국 AI 공급망 강화 이니셔티브

OpenAI는 데이터 센터 하드웨어, 소비자 전자제품, 로봇을 포함한 중요한 AI 인프라 구성 요소에 대한 미국 내 제조를 식별하고 가능하게 하기 위해 제안 요청서(RFP)를 출시했습니다.

5808

Hugging Face Open Responses 추론 표준

Hugging Face는 에이전트형 AI 워크플로우를 위해 Chat Completion 형식을 대체하도록 설계된 Responses API 기반의 오픈 추론 표준인 Open Responses를 도입했습니다.

5809

OpenAI와 Cerebras의 저지연 추론을 위한 파트너십

OpenAI는 AI 모델 응답을 가속화하고 실시간 AI 상호작용을 가능하게 하기 위해 목적에 맞게 설계된 AI 시스템을 추론 스택에 통합하고자 Cerebras와 파트너십을 맺고 있습니다.

5810

Veo 3.1 릴리스 노트: 향상된 Ingredients to Video 및 4K 업스케일링

Google DeepMind가 Veo 3.1을 출시했으며, 이미지‑비디오 생성에 대한 향상된 정체성 및 객체 일관성, 네이티브 세로 비디오 지원, 그리고 1080p 및 4K 해상도로 업스케일링을 도입했습니다.

5811

Zenken 사례 연구: ChatGPT Enterprise로 영업 및 운영 확장

Zenken은 지식 작업을 자동화하기 위해 ChatGPT Enterprise를 도입했으며, 연간 아웃소싱 비용을 5천만 엔 절감하고 최종 제안 승인율을 30% 증가시켰습니다.

5812

정보 기반 설계의 영상 시스템

BAIR 연구진은 상호 정보를 활용해 영상 시스템을 평가하고 최적화하는 프레임워크를 개발했으며, 이를 통해 작업‑특정 디코더 없이도 고성능 하드웨어 설계가 가능해졌습니다.

5813

OpenAI와 SoftBank 그룹의 SB Energy 파트너십

OpenAI와 SoftBank 그룹은 각각 5억 달러를 SB Energy에 투자하여 AI 데이터 센터 캠퍼스와 에너지 인프라 개발을 가속화하고 있으며, 텍사스 주 Milam 카운티에 1.2GW 규모의 부지를 포함하고 있습니다.

5814

Datadog, 시스템 수준 코드 리뷰를 위해 OpenAI Codex 통합

Datadog은 1,000명 이상의 엔지니어에게 OpenAI Codex를 배포하여 코드 리뷰에서 시스템 수준 위험 및 서비스 간 종속성을 식별하고, 인간 리뷰어가 놓친 과거 사고의 22%를 성공적으로 감지했습니다.

5815

OpenAI for Healthcare 발표

OpenAI는 임상의 행정 부담을 줄이고 치료 일관성을 향상시키기 위해 ChatGPT for Healthcare와 OpenAI API를 포함한 HIPAA 준수 도구 모음인 OpenAI for Healthcare를 출시했습니다.

5816

Netomi가 에이전트 시스템을 기업에 확장 – OpenAI에서 얻은 교훈

Netomi는 저지연 도구 사용을 위한 GPT‑4.1과 깊은 다단계 계획을 위한 GPT‑5.2를 결합한 프로덕션‑그레이드 에이전트 플랫폼을 발표했으며, 3초 미만 응답, 98% 의도 정확도, 그리고 기업 규모의 내장 거버넌스를 제공했습니다.

5817

Qwen3-VL-Embedding 및 Qwen3-VL-Reranker 출시

Qwen은 텍스트, 이미지, 스크린샷 및 비디오 전반에 걸친 고정밀 교차 모달 검색을 위해 설계된 멀티모달 모델 시리즈인 Qwen3-VL-Embedding 및 Qwen3-VL-Reranker를 출시했습니다.

5818

How Tolan Builds Voice-First AI with GPT-5.1

Tolan은 GPT-5.1과 맞춤형 실시간 컨텍스트 관리 시스템을 활용해 낮은 지연 시간, 지속적인 메모리 및 일관된 퍼소나를 갖춘 음성‑우선 AI 동반자를 구현합니다.

5819

ChatGPT Health 출시 노트

OpenAI는 개인 의료 기록과 웰니스 앱 데이터를 통합하여 임상 치료를 대체하지 않고 사용자가 건강 정보를 탐색하도록 돕는 전용かつ 안전한 경험인 ChatGPT Health를 출시했습니다.

5820

NVIDIA Cosmos Reason 2 릴리즈 노트 / 새로운 소식

NVIDIA는 물리 AI를 위해 설계된 오픈 추론 비전‑언어 모델인 Cosmos Reason 2를 출시했으며, 이 모델은 Physical AI Bench와 Physical Reasoning 리더보드에서 1위를 차지했습니다.

5821

Falcon-H1-Arabic 릴리즈 노트

Hugging Face는 Falcon-H1-Arabic을 발표했습니다. 이 모델군은 3B, 7B, 34B 규모의 하이브리드 Mamba-Transformer 모델로, 최대 256K 토큰까지 확장된 컨텍스트 윈도우를 제공하며 아랍어 NLP에서 새로운 최첨단 벤치마크를 설정합니다.

5822

NVIDIA DGX Spark 및 Reachy Mini 통합 가이드

NVIDIA는 DGX Spark 하드웨어, Reachy Mini 로봇공학, 그리고 오픈 추론 및 비전 모델을 사용하는 NeMo Agent Toolkit을 결합하여 실제 세계 AI 에이전트를 생성하기 위한 프레임워크를 도입했습니다.

5823

OpenAI Grove Cohort 2 공지

OpenAI는 AI 기반 회사를 구축하는 사전 아이디어 기술 인재를 지원하기 위해 설계된 OpenAI Grove 프로그램의 두 번째 코호트 지원을 시작했습니다.

5824

Qwen-Image-2512 릴리스 노트 / 새로운 소식

Qwen-Image-2512는 Qwen-Image 텍스트-이미지 모델의 12월 업데이트로, 인간 사실감, 자연 디테일 렌더링, 복잡한 텍스트 레이아웃 정확성을 크게 향상시킵니다.

5825

Google DeepMind 2025 연간 리뷰: Gemini 3, Gemma, AI 제품, 과학, 그리고 안전 혁신

Google DeepMind는 Gemini 3 모델, 오픈소스 Gemma, AI 기반 제품, 생성 미디어, 과학 AI, 양자 컴퓨팅, 안전 프레임워크 및 글로벌 협업 등 2025년의 혁신을 발표했으며, AI가 도구에서 유틸리티로 전환되는 모습을 보여줍니다.

5826

AprielGuard: 현대 LLM 시스템에서 안전 및 적대적 견고성을 위한 가드레일

Hugging Face와 ServiceNow AI는 8B 파라미터의 보호 모델인 AprielGuard를 소개했습니다. 이 모델은 독립 프롬프트, 다중 턴 대화, 에이전시 워크플로우 전반에 걸쳐 16가지 안전 위험 카테고리와 다양한 적대적 공격을 탐지하도록 설계되었습니다.

5827

Qwen-Image-Edit-2511 릴리스 노트

Qwen-Image-Edit-2511은 캐릭터 일관성을 개선하고 커뮤니티 LoRA를 통합하며 기하학적 추론 및 산업 디자인 기능을 강화한 최신 이미지 편집 모델입니다.

5828

Qwen3‑TTS‑VD‑Flash 및 Qwen3‑TTS‑VC‑Flash 출시: 제어 가능한 음성 디자인과 빠른 다국어 음성 클로닝

Qwen은 자연어 기반 음성 디자인을 위한 Qwen3‑TTS‑VD‑Flash와 3초 다국어 음성 클로닝을 위한 Qwen3‑TTS‑VC‑Flash를 출시했으며, 두 모델 모두 제어성 및 정확도 면에서 기존 주요 TTS 시스템을 능가합니다.

5829

ChatGPT Atlas: 프롬프트 인젝션에 대한 브라우저 에이전트 강화

OpenAI는 RL 훈련된 자동 공격자를 활용한 사전 대응 빠른 응답 루프를 구현하여 실제 환경에서 악용되기 전에 ChatGPT Atlas의 프롬프트 인젝션 취약점을 발견하고 완화합니다.

5830

OpenAI 고객 성장 및 기업 채택

OpenAI는 100만 명이 넘는 비즈니스 고객을 돌파했으며, 사용자 75%가 이전에 불가능했던 작업을 완료할 수 있게 되었다고 보고했습니다.

5831

Qwen-Image-Layered: 고유 편집 가능성을 위한 계층적 분해

Qwen-Image-Layered는 이미지를 여러 RGBA 레이어로 분해하여, 다른 콘텐츠에 영향을 주지 않고 이미지 구성 요소를 독립적으로 조작할 수 있게 하는 새로운 모델입니다.

5832

OpenAI 체인오브생각 모니터링 가능성 평가

OpenAI는 '모니터링 가능성'을 측정하기 위한 프레임워크와 13개의 평가를 도입했으며, 이는 내부 추론을 통해 모델 행동을 예측하는 능력을 의미합니다. 연구 결과, 체인오브생각을 모니터링하는 것이 단순히 출력만 모니터링하는 것보다 훨씬 더 효과적임을 발견했습니다.

5833

OpenAI 모델 사양 업데이트: 18세 미만 (U18) 원칙

OpenAI는 모델 사양에 18세 미만 (U18) 원칙을 포함하도록 업데이트했으며, 13세에서 17세 사용자에게 청소년 안전과 현실 세계 지원을 우선시하는 연령에 맞는 행동 지침을 설정했습니다.

5834

OpenAI AI 리터러시 자료: 청소년 및 부모를 위한

OpenAI는 가족 친화적 가이드 및 부모 맞춤 팁을 포함한 AI 리터러시 자료 세트를 출시하여 가족이 ChatGPT를 안전하고 책임감 있게 사용할 수 있도록 지원합니다.

5835

OpenAI와 미국 에너지부가 AI 협력을 확대하다

OpenAI와 미국 에너지부는 과학 연구에 프론티어 AI 모델을 통합하기 위해 양해각서(MOU)를 체결했으며, 구체적으로 제네시스 미션과 국립 연구소 이니셔티브를 지원합니다.

5836

Transformers v5 토크나이제이션 업데이트

Hugging Face는 Transformers v5에서 토크나이저 아키텍처를 학습된 어휘와 분리하도록 토크나이제이션을 재설계하여, 더 쉬운 검사, 맞춤화 및 처음부터 학습이 가능하도록 했습니다.

5837

GPT-5.2-Codex 릴리스 노트

OpenAI는 복잡한 소프트웨어 엔지니어링, 장기 작업 및 고급 사이버 보안 연구에 최적화된 에이전트형 코딩 모델인 GPT-5.2-Codex를 출시했습니다.

5838

OpenAI GPT-5.2-Codex 시스템 카드 추가

OpenAI는 복잡한 소프트웨어 엔지니어링, 프로젝트 규모 리팩터링 및 사이버 보안 작업에 최적화된 에이전시 코딩 모델인 GPT-5.2-Codex를 출시했습니다.

5839

NVIDIA Nemotron 3 Nano와 NeMo Evaluator 오픈 평가 레시피

NVIDIA는 NeMo Evaluator를 기반으로 한 완전한 오픈 평가 레시피와 함께 30B Nemotron 3 Nano 모델을 출시했으며, 누구나 벤치마크 점수를 재현하고 전체 평가 파이프라인을 감사할 수 있게 했습니다.

5840

Gemini 3 Flash 릴리스 노트 / 새로운 기능

Google DeepMind은 개발자와 소비자를 위해 낮은 지연 시간과 감소된 비용으로 프론티어 수준의 추론 및 멀티모달 지능을 결합한 Gemini 3 Flash 모델을 출시했습니다.

5841

OpenAI 뉴스 기관을 위한 아카데미 출시

OpenAI는 뉴스 기관을 위한 OpenAI 아카데미를 출시하여 기자들에게 교육, 플레이북, 그리고 AI의 책임 있는 채택에 대한 지침을 제공하여 보도 및 비즈니스 운영을 향상시킵니다.

5842

OpenAI가 ChatGPT용 앱 제출 및 디렉터리를 소개합니다

OpenAI가 앱 디렉터리와 베타 Apps SDK를 출시하여 개발자가 ChatGPT 내에서 직접 채팅 네이티브 경험을 구축, 제출, 수익화할 수 있도록 했습니다.

5843

2025 기업 AI 현황 보고서

OpenAI의 2025년 보고서는 기업 AI 도입이 급속히 확대되고 있으며, ChatGPT 메시지 양이 8배 증가하고 API 추론 토큰 사용량이 연간 320배 증가하고 있음을 밝혔습니다.

5844

Gemma Scope 2 출시 – Gemma 3 언어 모델 해석을 위한 오픈 도구

Gemma Scope 2는 Gemma 3 모델(270M‑27B 매개변수)을 위한 해석 가능성 도구 오픈소스 스위트로, 연구자들이 내부 계산을 추적하고 안전‑중요한 행동을 디버그할 수 있게 합니다.

5845

OpenAI FrontierScience Benchmark Release

OpenAI는 물리학, 화학, 생물학 분야에서 복잡한 과학적 추론과 실제 연구 작업을 수행하는 AI의 능력을 측정하기 위해 설계된 새로운 전문 수준 벤치마크인 FrontierScience를 도입했습니다.

5846

OpenAI GPT-5 생물학 연구 능력

OpenAI는 GPT-5가 분자 클로닝 프로토콜을 자율적으로 최적화할 수 있음을 입증했으며, 새로운 효소 메커니즘의 발견을 통해 효율이 79배 증가했다고 밝혔다.

5847

OpenAI 가이드: AI 시대의 선두를 유지하기

OpenAI는 조직이 AI-first 기업으로 전환하고 경쟁 우위를 유지하도록 돕기 위해 Align, Activate, Amplify, Accelerate, Govern의 5단계 플레이북을 제시합니다.

5848

ChatGPT Images와 GPT Image 1.5 출시

OpenAI는 최대 4배 빠른 생성 속도를 제공하고 정밀 편집 및 텍스트 렌더링 기능을 크게 향상시킨 새로운 flagship 이미지 생성 모델인 GPT Image 1.5를 출시했습니다.

5849

Hugging Face에서의 CUGA: 구성 가능한 AI 에이전트의 민주화

IBM Research는 CUGA(구성 가능한 범용 에이전트)를 출시했는데, 이는 복잡한 API 및 웹 작업에 대한 AppWorld 및 WebArena 벤치마크에서 최첨단 성능을 달성하는 오픈소스 에이전트 프레임워크입니다.

5850

Gemini 2.5 Flash Native Audio 출시: 강화된 라이브 음성 에이전트 및 실시간 음성 번역

Google DeepMind는 기능 호출, 지시 이행 및 멀티턴 대화 품질을 개선하고 70개 이상의 언어에 대한 실시간 음성 대 음성 번역 기능을 추가한 라이브 음성 모델인 Gemini 2.5 Flash Native Audio를 발표했습니다.