typedef-ai/fenic
Semantic DataFrames for humans and agents
해결하는 문제
fenic은 비정형 데이터를 다룰 때 발생하는 취약성을 해결하기 위해 설계되었습니다. 전통적으로 로그, 트랜스크립트 및 문서에서 의미를 추출하려면 취약한 regex 스크립트, 일회성 프롬프트 및 수동 노트북 탐색이 혼합되어 필요했습니다. fenic은 이러한 일시적인 발견을 인간과 AI 에이전트 간에 공유할 수 있는 내구성이 있고 타입이 지정된 재사용 가능한 DataFrame 파이프라인으로 변환합니다.
작동 방식
LLM 작업을 쿼리 모델에 직접 통합하는 시맨틱 DataFrame 엔진으로 작동합니다. 사용자는 API 호출을 수동으로 오케스트레이션하는 대신 extract, classify, summarize와 같은 시맨틱 연산자와 함께 PySpark/SQL 스타일의 작업(select, filter, join)을 작성합니다.
주요 기술 메커니즘은 다음과 같습니다:
- Lazy Execution (지연 실행): 파이프라인은 지연 방식으로 구축되고 추론을 위해 컴파일되며, 자동 배치, 속도 제한 및 응답 캐싱 기능을 특징으로 합니다.
- Typed Schemas (타입 지정 스키마): 사용자는 Pydantic 모델을 사용하여 원하는 출력 형태를 정의하여 비정형 텍스트가 구조화되고 쿼리 가능한 열로 변환되도록 보장합니다.
- Semantic Joins (시맨틱 조인): 엔진은 정확한 키 일치가 아닌 자연어 술어(의미)를 기반으로 두 DataFrame을 조인할 수 있습니다.
- Lineage Tracking (리니지 추적): 출력을 소스 데이터까지 추적할 수 있는 행 수준의 리니지를 제공합니다.
- MCP Integration (MCP 통합): 파이프라인을 Model Context Protocol (MCP) 도구로 승격시켜 AI 에이전트가 관리된 도구 인터페이스로서 호출할 수 있도록 합니다.
대상 사용자
- 대량의 비정형 텍스트를 구조화된 데이터 세트로 처리해야 하는 데이터 엔지니어 및 분석가.
- 모델 실패를 분류하고 트레이스의 패턴을 식별하기 위한 평가 파이프라인을 구축하는 AI 개발자.
- 에이전트의 데이터 탐색 발견을 반복 가능하고 관리되는 도구로 변환하려는 에이전트 개발자.
주요 특징
- 내장된 시맨틱 연산자: 추출, 분류, 감성 분석 및 요약에 대한 일급 지원.
- 네이티브 비정형 지원: Markdown, 트랜스크립트 (SRT/WebVTT), JSON (
jq를 통해) 및 PDF에 대한 전문적인 처리. - 추론 최적화: LLM 오버헤드를 관리하기 위한 통합 토큰/비용 계정, 재시도 및 캐싱.
- AI 에이전트 툴링: 린팅을 위한
fenic check및 코딩 에이전트에게 API를 올바르게 사용하는 방법을 가르치는fenic skill install포함. - 멀티 프로바이더 지원: OpenAI, Anthropic, Google, Cohere 및 OpenRouter와 호환됩니다.