✷ 아카이브 · 연구소 11곳 · 디스패치 58건
연구소
매일 아침 십여 개의 공식 블로그를 돌아볼 필요가 없습니다. OpenAI, Anthropic, DeepMind 등의 일차 발표를 핵심만 뽑아서.
Ollama, Pro, Max 및 Team 플랜을 위한 투명한 토큰당 과금 방식 도입
Ollama는 Pro, Max 및 Team 플랜에 대해 월간 사용 크레딧을 포함한 토큰당 과금 방식을 발표하여, 오픈 모델 액세스에 대한 비용 예측을성을 단순화했습니다.
Claude Desktop integration with Ollama enables local and cloud model switching
Ollama는 이제 Claude Desktop이 서드파티 게이트웨이 역할을 하도록 하여, 사용자가 데이터를 Anthropic으로 전송하지 않고도 Ollama의 모든 로컬 또는 클라우드 모델과 함께 Claude를 실행할 수 있게 합니다.
NVIDIA Nemotron 3.5 Lightning 출시
NVIDIA Nemotron 3.5 Lightning는 토큰당 30억 개의 활성 파라미터를 가진 30B 파라미터 오픈 모델로, 1M 토큰 컨텍스트 윈도우를 통해 로컬 에이전트 워크플로우 및 다단계 작업을 위해 설계되었습니다.
Muse Glimmer 출시: Meta Superintelligence Labs의 30B 에이전틱 멀티모달 모델
Meta Superintelligence Labs는 128K+ 컨텍스트 길이를 갖춘 로컬 에이전트 워크로드에 최적화된 30B 멀티모달 모델인 Muse Glimmer를 출시했으며, 현재 Ollama를 통해 사용할 수 있습니다.
Ollama 투자 유치 및 오픈 모델 플랫폼 확장
Ollama는 890만 명의 개발자와 Fortune 500대 기업의 85%를 대상으로 오픈 AI 모델을 실행하고 확장할 수 있는 플랫폼을 확장하기 위해 8,800만 달러를 유치했습니다.
Ollama 0.31: Multi-Token Prediction을 통한 Gemma 4 성능 향상
Ollama 0.31은 Apple Silicon에서 Gemma 4를 위한 multi-token prediction을 도입하여, 모델 출력을 변경하지 않으면서 코딩 에이전트 벤치마크에서 토큰 생성 속도를 거의 90% 향상시켰습니다.
Apple Silicon을 위한 Ollama MLX 엔진 업데이트
Ollama는 NVFP4 지원, 커널 융합, 그리고 에이전트 워크플로우를 위한 새로운 상태 스냅샷 시스템을 통해 Apple Silicon에서의 성능을 개선하기 위해 MLX 엔진을 업데이트했습니다.
Ollama 0.30 릴리스: GGUF 모델 지원 추가 및 NVIDIA 성능 최대 20% 향상
Ollama 0.30은 llama.cpp를 통해 GGUF 모델 호환성을 도입하고 NVIDIA GPU에서 최대 20% 더 빠른 처리량을 제공하며, 기본 Vulkan 가속을 통해 하드웨어 지원을 확장합니다.
NVIDIA Nemotron 3 Ultra 출시
NVIDIA Nemotron 3 Ultra는 5500억 파라미터 오픈 모델로, 장시간 실행되는 에이전트 워크플로우에 최적화되어 있으며, 100만 토큰 컨텍스트 창과 NVFP4 양자화를 통해 높은 효율성을 제공합니다.
OpenJarvis 1.0 출시: Ollama를 통한 로컬 우선 개인용 AI
OpenJarvis 1.0은 Ollama와 통합되어 개인용 하드웨어에서 모델을 실행할 수 있는 로컬 우선 개인용 AI 에이전트를 구축하기 위한 오픈 소스 프레임워크입니다.
Ollama 0.19 Preview: MLX Integration for Apple Silicon Acceleration
Ollama 0.19는 Apple의 MLX 프레임워크 통합을 프리뷰로 도입하여, 통합 메모리 최적화 및 NVFP4 지원을 통해 Apple Silicon 장치에서의 성능을 크게 가속화합니다.
Ollama 0.17: OpenClaw AI 어시스턴트를 위한 간소화된 설정
Ollama 0.17은 로컬 하드웨어에서 이메일, 캘린더, 메시징 앱을 관리할 수 있는 개인용 AI 어시스턴트인 OpenClaw의 단일 명령어 설치 프로세스를 도입합니다.
Ollama가 Claude Code에 Subagents 및 Web Search 기능 추가
Ollama는 이제 Claude Code 내에서 subagents 및 web search를 지원하여, MCP 서버나 API 키 없이도 모델이 병렬 작업을 수행하고 실시간 정보에 접근할 수 있도록 합니다.
Ollama가 출시한 OpenClaw 개인용 AI 코딩 보조 도구
Ollama는 WhatsApp, Telegram, Slack, Discord, iMessage 등 다양한 메시징 플랫폼을 중앙 게이트웨이를 통해 AI 코딩 에이전트와 연결하는 로컬에서 실행되는 개인용 AI 보조 도구인 OpenClaw를 발표했습니다. 이 도구는 개인 정보 보호를 우선시하며, 크로스 플랫폼 코드 보조 기능을 제공합니다.
Ollama launch 명령 출시
Ollama는 버전 0.15+에서 'ollama launch' 명령을 도입하여, 사용자가 수동 환경 변수나 구성 파일 없이 Claude Code 및 OpenCode와 같은 코딩 도구를 설정하고 실행할 수 있도록 했습니다.
Ollama가 Z-Image Turbo 및 FLUX.2 Klein을 통한 실험적 이미지 생성 기능을 추가합니다
Ollama는 6B 파라미터의 Z-Image Turbo 모델과 Black Forest Labs의 FLUX.2 Klein 모델을 사용하여 macOS에서 실험적인 이미지 생성 기능을 발표했으며, 이는 Ollama 생태계의 첫 번째 네이티브 텍스트-이미지 기능입니다.
Ollama v0.14.0: Anthropic API 호환성 및 Claude Code 지원
Ollama v0.14.0은 Anthropic Messages API와의 호환성을 도입하여, Claude Code 및 기타 Anthropic SDK 애플리케이션을 로컬 및 클라우드 오픈 소스 모델과 함께 사용할 수 있도록 합니다.
OpenAI Codex와 Ollama 통합
Ollama는 이제 OpenAI Codex CLI가 오픈 웨이트 모델을 사용할 수 있도록 지원하여, gpt-oss:20b 및 gpt-oss:120b와 같은 모델을 사용하여 로컬 코드 실행 및 수정을 가능하게 합니다.
OpenAI gpt-oss-safeguard 모델, Ollama를 통해 공개
OpenAI와 Ollama는 Apache 2.0 라이선스 하에 오픈소스 gpt-oss-safeguard 안전 추론 모델(20B 및 120B)을 공개하여, 투명한 추론을 통해 정책 기반 콘텐츠 분류를 실행할 수 있도록 함.
Ollama Cloud에서 MiniMax M2 출시
MiniMax M2는 코딩 및 에이전트 워크플로우에 최적화된 고성능 모델로, 이제 Ollama의 클라우드 플랫폼에서 사용할 수 있습니다.
Ollama를 사용한 NVIDIA DGX Spark 성능
Ollama는 펌웨어 버전 580.95.05를 사용하여 gpt-oss 및 gemma3를 포함한 다양한 모델의 처리량을 입증하며 NVIDIA DGX Spark에 대한 성능 벤치마크를 발표했습니다.
Ollama 코딩 모델 및 통합 업데이트
Ollama는 GLM-4.6 및 Qwen3-Coder-480B에 대한 클라우드 액세스를 도입했으며, Qwen3-Coder-30B 업데이트와 함께 VS Code, Zed, Droid에 대한 통합을 확장했습니다.
Qwen3-VL 릴리스 노트
Ollama는 고급 공간 인지, 32개 언어에 대한 확장된 OCR 지원, 그리고 긴 비디오 이해를 위한 네이티브 256K 컨텍스트를 특징으로 하는 강력한 vision language model인 Qwen3-VL을 출시했습니다.
NVIDIA DGX Spark와 Ollama 통합
Ollama는 GB10 Grace Blackwell Superchip을 탑재한 NVIDIA DGX Spark를 로컬 언어 모델 실행에 최적화하기 위해 NVIDIA와 협력하고 있으며, 1페타플롭의 성능과 128GB의 메모리를 제공합니다.
Ollama 웹 검색 및 웹 페치 API 출시
Ollama는 환각 현상을 줄이고 REST 및 라이브러리 통합을 통해 LLM에 실시간 웹 데이터를 제공하기 위해 새로운 웹 검색 및 웹 페치 API를 출시했습니다.
Ollama 새로운 모델 스케줄링 업데이트
Ollama는 충돌을 줄이고 GPU 활용도를 높이기 위해 메모리 추정 대신 정확한 메모리 측정을 사용하는 새로운 모델 스케줄링 시스템을 도입했습니다.
Ollama Cloud Models Preview
Ollama가 클라우드 모델 프리뷰를 출시하여, 사용자가 동일한 로컬 도구 세트와 API 통합을 유지하면서 데이터센터급 하드웨어에서 대규모 모델을 실행할 수 있게 되었습니다.
OpenAI gpt-oss Ollama 출시
Ollama는 OpenAI와 협력하여 gpt-oss 오픈 웨이트 모델을 통합하였으며, MXFP4 양자화 형식을 통해 로컬 실행에 최적화된 20B 및 120B 파라미터 버전을 제공합니다.
Ollama macOS 및 Windows용 앱 출시
Ollama는 파일 업로드 및 멀티모달 기능을 포함하여 로컬 AI 모델을 다운로드하고 채팅할 수 있는 그래픽 사용자 인터페이스를 제공하는 macOS 및 Windows용 새로운 애플리케이션을 출시했습니다.
Secure Minions 프로토콜을 통한 암호화된 Ollama‑frontier 모델 협업 가능
Ollama와 스탠포드 Hazy Research 연구실은 모든 데이터를 기밀로 유지하면서 로컬 Ollama 모델이 frontier cloud 모델과 협업할 수 있도록 하는 종단간 암호화 프로토콜인 Secure Minions를 발표했습니다.
Ollama Thinking Feature Release
Ollama는 DeepSeek R1 및 Qwen 3와 같은 모델의 내부 추론을 최종 출력과 분리할 수 있도록 모델의 thinking 프로세스를 활성화하거나 비활성화할 수 있는 기능을 도입했습니다.
Ollama가 스트리밍 도구 호출 지원 추가
Ollama는 이제 도구 호출과 함께 스트리밍 응답을 지원하여, 채팅 애플리케이션이 부분적인 모델 출력을 받고 실시간으로 함수를 호출할 수 있게 했습니다.
Ollama 멀티모달 엔진 출시
Ollama는 Llama 4, Gemma 3, Qwen 2.5 VL, Mistral Small 3.1을 지원하며, 비전 모델의 로컬 추론 신뢰성과 정확도를 향상시키기 위한 새로운 멀티모달 엔진을 도입했습니다.
Ollama Minions: Hybrid Local and Cloud LLM Collaboration
Ollama는 Stanford Hazy Research에서 개발한 Minions 프레임워크를 소개합니다. 이 프레임워크는 높은 성능을 유지하면서 Llama 3.2와 같은 로컬 모델에 워크로드를 위임함으로써 클라우드 LLM 비용을 절감합니다.
Ollama 구조화된 출력 릴리스
Ollama는 이제 구조화된 출력을 지원하여 사용자가 JSON 스키마로 정의된 특정 형식으로 모델 응답을 제한할 수 있게 되어 신뢰성과 일관성이 향상되었습니다.
Ollama Python 라이브러리 0.4 릴리스 노트
Ollama Python 라이브러리 0.4는 Python 함수를 직접 도구로 전달할 수 있게 하며, Pydantic과 docstring 파싱을 통해 JSON 스키마 생성을 자동화합니다.
Ollama에서 Llama 3.2 Vision 사용 가능
Ollama가 11B 및 90B 파라미터 크기의 Llama 3.2 Vision 지원을 출시하여, OCR 및 이미지 분석을 포함한 멀티모달 기능의 로컬 실행을 가능하게 했습니다.
Ollama에서 사용 가능한 IBM Granite 3.0 모델
Dense 및 Mixture of Experts (MoE) 변형을 포함한 IBM Granite 3.0 모델이 이제 Apache 2.0 라이선스 하에 Ollama에서 사용 가능합니다.
Ollama에서 Llama 3.2 지원
Ollama가 이제 Meta의 Llama 3.2를 지원하여, 엣지 디바이스를 위한 경량 1B 및 3B 텍스트 전용 모델과 곧 출시될 11B 및 90B 비전 기능 모델을 도입합니다.
Bespoke-Minicheck: 지문 기반 사실성 검증을 통한 LLM 환각 현상 감소
Ollama는 Bespoke Labs에서 개발한 지문 기반 사실성 검증 모델인 Bespoke-Minicheck를 통합하여, 주장이 소스 문서에 기반하는지 검증함으로써 환각 현상을 탐지합니다.
Ollama 도구 지원 출시
Ollama는 Llama 3.1과 같은 모델에 대해 도구 호출 지원을 도입하여, 로컬 LLM이 외부 API, 함수 및 코드 인터프리터와 상호작용할 수 있도록 합니다.
Ollama에서의 Google Gemma 2 출시
2B, 9B, 27B 파라미터 변체로 제공되는 Google Gemma 2가 클래스 리딩 성능과 효율성을 제공하는 새로운 아키텍처와 함께 Ollama에 출시되어, 더 큰 오픈 모델보다 뛰어난 성능을 발휘합니다.
Ollama와 Continue: 오픈 소스 AI 코드 어시스턴트 설정하기
Ollama와 Continue를 사용하면 Codestral, Llama 3, DeepSeek Coder와 같은 모델을 사용하여 VS Code 및 JetBrains 내에서 완전한 오픈 소스 로컬 AI 코딩 어시스턴트를 구축할 수 있습니다.
Ollama 지원을 포함한 Firebase Genkit
Google은 AI 기반 앱을 구축하기 위한 오픈 소스 프레임워크인 Firebase Genkit을 출시했으며, Google의 Gemma 모델을 로컬에서 실행할 수 있도록 Ollama에 대한 네이티브 지원을 특징으로 합니다.
Llama 3 거절률 및 검열 비교
Llama 3는 Llama 2보다 현저히 낮은 오거절률을 보여주며, 무해한 프롬프트에 대한 과도한 거절을 줄이면서도 기술적인 지원을 제공합니다.
Ollama에서 Llama 3 사용 가능
Ollama가 Llama 3 지원을 출시하여, Llama 2 대비 학습 데이터, 컨텍스트 길이 및 토큰 효율성 면에서 상당한 개선이 이루어진 8B 및 70B 파라미터 모델에 대한 액세스를 제공합니다.
Ollama 임베딩 모델 지원
Ollama는 이제 임베딩 모델을 지원하여, 텍스트를 벡터 임베딩으로 변환함으로써 로컬 검색 증강 생성(RAG) 애플리케이션을 생성할 수 있습니다.
Ollama AMD 그래픽 카드 지원 프리뷰
Ollama가 Windows 및 Linux에서 AMD 그래픽 카드에 대한 프리뷰 지원을 도입하여, 다양한 Radeon, Radeon PRO, 및 Instinct 시리즈 카드를 통해 모든 Ollama 기능에 대한 하드웨어 가속을 가능하게 합니다.
Ollama Windows Preview Release
Ollama가 Windows용 프리뷰 버전을 출시하여, 사용자가 네이티브 GPU 가속 및 API 액세스를 통해 대규모 언어 모델을 로컬에서 실행, pull, 그리고 create할 수 있게 되었습니다.
Ollama OpenAI 호환성 업데이트
Ollama는 OpenAI Chat Completions API와의 내장 호환성을 도입하여, 사용자가 기존의 OpenAI 호환 도구 및 라이브러리를 사용하여 로컬 모델을 실행할 수 있도록 합니다.