Experiential 오픈 소스 모델 게이트웨이는 LLM의 통합 액세스, 라우팅 및 최적화를 가능하게 합니다
Experiential이 하는 일과 그 중요성
Experiential은 호스팅된 모델, BYOK(Bring-Your-Own-Key), 또는 로컬에서 실행되는 언어 모델의 모든 조합으로 요청을 전달할 수 있는 단일 OpenAI 호환 API를 제공하며, 운영자가 사용자 액세스, 지출 한도 및 모델 선택에 대해 세밀한 제어권을 가질 수 있도록 합니다. 프로덕션 트래픽을 OpenTelemetry 트레이스로 수집함으로써, 플랫폼은 품질, 지연 시간 및 비용을 개선하기 위해 맞춤형 라우터를 자동으로 학습하거나 모델을 미세 조정(fine-tune)할 수 있습니다.
즉시 사용 가능한 핵심 기능
통합 제어 평면(Unified Control Plane)
- OpenAI, Anthropic, Gemini, Azure, Bedrock, Fireworks, OpenRouter 또는 자체 호스팅된 오픈 소스 모델 등 모든 모델은 동일한
/v1/chat/completions엔드포인트를 통해 접근할 수 있습니다. - 게이트웨이는 예산 한도(예: 기본
$50명령 예산)를 포함하여 사용자별, 에이전트별 및 사용 사례별 정책을 강제합니다.
트래픽 기반 최적화
- OpenTelemetry 트레이스는 에이전트로부터 수집되어 익명으로 저장됩니다. 프롬프트, 자격 증명 또는 원본 콘텐츠는 텔레메트리 서비스로 절대 전송되지 않습니다.
exp build마법사는 이러한 트레이스를 기반으로 시뮬레이션된 프로젝트 라우터를 생성하며,exp optimize는 관찰된 워크로드에 더 잘 대응하기 위해 오픈 소스 모델을 미세 조정(via Tinker tool)할 수 있습니다.
저지연 라우팅
- 벤치마크에 따르면 게이트웨이는 BYOK 요청에 대해 1ms 미만의 지연 시간을 추가하며, 이는 고처리량 애플리케이션에 적합합니다.
- 캐싱 전략은 저장소에 상세히 설명되어 있지 않지만, 커뮤니티 멤버들은 토큰 수준 캐싱 및 그에 따른 비용 영향에 대해 설명을 요청했습니다.
빠르게 시작하기
로컬 개발
pip install experiential
exp # runs the setup wizard and prints a one‑time API key
export EXP_GATEWAY_KEY=... # use the printed key
curl http://127.0.0.1:8000/v1/chat/completions \
-H "Authorization: Bearer $EXP_GATEWAY_KEY" \
-H 'Content-Type: application/json' \
-d '{"model":"opus-5","messages":[{"role":"user","content":"Help me"}]}'
마법사는 자동으로 공개 별칭(예: opus-5)과 기본 지출 예산을 생성합니다.
호스팅 플랫폼
- 관리형 서비스는 https://platform.experientiallabs.ai에서 제공되며,
https://api.experientiallabs.ai/v1에서 동일한 OpenAI 호환 API를 노출출합니다. - 온보딩 단계에는 LLM 트레이스 업로드, 모든 제공업체에 대한 BYOK 키 연결, 그리고 기존 코딩 에이전트(Claude Code, Cursor, Codex, Aider, etc.)를 새로운 엔드포인트로 다시 연결하는 작업이 포함됩니다.
실제 트래픽으로부터 최적화하기
- 트레이스 수집 – 에이전트로부터 OTLP JSONL 파일을 내보내거나 public terminal-tasks 데이터셋을 사용하세요:
curl -L -o traces.otel.jsonl \ https://huggingface.co/datasets/experiential-labs/wmo-terminal-tasks-traces/resolve/540883e451dc13d34fb50fdd36b143cb0f1fb0db/traces.otel.jsonl - 프로젝트 라우터 구축 – 대화형 빌더를 실행하세요:
exp build support-agent # selects providers, models, budget, and trace file - 미세 조정(Fine-Tune) 모델 – 라우터 트레이스를 수집한 후, Tinker를 호출하여 맞춤형 모델을 생성하세요:
exp optimize model support-agent
결과로 생성된 모델은 동일한 게이트웨이를 통해 서비스될 수 있으며, 관찰과 개선의 루프프를 완성합니다.
텔레메트리 정책
- Experiential은 PostHog를 통해 익명 집계 텔레메트리를 제공합니다.
- 텔레메트리는 사용자 프롬프트, 모델 이름, 자격 증명 또는 원본 콘텐츠를 절대 포함하지 않습니다.
- 사용자는 다음 명령으로 텔레메트리를 전환할 수 있습니다:
exp config telemetry status # view current state exp config telemetry disable # turn off exp config telemetry enable # turn on
설정은 .exp/settings.toml에 로컬로 저장됩니다.
커뮤니티 피드백 하이라이트
"Finally an open source tool doing this!" – ashermania
"The gateway adds under 1 ms for BYOK requests. Amazing!" – ceroxylon
"Is it similar to LiteLLM? If so, what sets it apart?" – cheema33
"Caching is definitely one of the hardest parts to get right…" – foremerge
"Curious if you initially had this in Python and then rewrote in Rust?" – 23david
이러한 코멘트는 세 가지 반복되는 주제를 강조합니다: (1) 오픈 소스, 모델 불가지론적(model-agnostic) 게이트웨이의 참신함, (2) การungan (un-agnostic) 초저지연의 중요성, (3) 캐싱 전략 및 구현 언어에 대한 열린 질문들.
유사 프로젝트와의 비교
- LiteLLM – 여러 제공업체에 대한 얇은 래퍼(wrapper)를 제공하지만, 트래픽 기반의 내장된 라우터 및 최적화 루프가 부족합니다.
- Enterpilot/GoModel, Maximhq/Bifrost, BerriAI/LiteLLM – 멀티 프로바이더 라우팅을 제공합니다; Experiential은 텔레메트리 기반의 라우터 빌더와 Tinker를 통한 통합 미세 조정 기능을 통해 차별화됩니다.
- vLLM Semantic Router – 오픈 소스 추론을 위한 시맨틱 라우팅에 집중합니다; Experiential은 BYOK, 예산 집행, 호스팅 SaaS 제공을 통해 이를 보완합니다.
개발 및 기여
uv sync --extra dev # install dev dependencies
uv run ruff format --check . # code formatting check
uv run ruff check . # linting
uv run ty check # type checking
uv run pytest -q # test suite
기여 가이드라인, 에이전트 컨벤션, API 문서는 저장소의 AGENTS.md와 SETUP.md 파일에서 관리됩니다.
전망
Experiential은 오픈 소스 게이트웨이가 이질적인 LLM 플릿(fleet)을 위한 제어 평면이자 지속적인 모델 개선을 위한 데이터 수집 지점으로 기능할 수 있음을 보여줍니다. 더 많은 조직이 멀티 프로바이더 전략을 채택함에 따라, 라우팅을 자동화하고, 지출 한도를 강제하고, 프로덕션 트래픽과 모델 학습 사이의 피드백 루프프를 완성하는 도구들이 필수적인 인프라가 될 것입니다.
Sources
관련
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트