typedef-ai/fenic
Semantic DataFrames for humans and agents
解決する課題
fenicは、非構造化データの扱いに伴う脆弱性を解決するために設計されています。従来、ログ、トランスクリプト、ドキュメントから意味を抽出するには、壊れやすいregexスクリプト、使い捨てのプロンプト、および手動のノートブック探索を組み合わせる必要がありました。fenicは、これらの一時的な発見を、人間とAIエージェントの間で共有可能な、耐久性のある型付きの再利用可能なDataFrameパイプラインへと変換します。
仕組み
LLM操作をクエリモデルに直接統合するセマンティックDataFrameエンジンとして機能します。ユーザーは、API呼び出しを手動でオーケストレーションする代わりに、extract、classify、summarizeといったセマンティックオペレーターと共に、PySpark/SQLスタイルの操作(select、filter、join)を記述します。
主な技術的メカニズムは以下の通りです:
- Lazy Execution(遅延実行): パイプラインは遅延的に構築され、推論用にコンパイルされます。自動バッチ処理、レート制限、およびレスポンスキャッシュ機能を備えています。
- Typed Schemas(型付きスキーマ): ユーザーはPydanticモデルを使用して望ましい出力形状を定義し、非構造化テキストが構造化されクエリ可能な列に変換されることを保証します。
- Semantic Joins(セマンティック結合): エンジンは、正確なキーの一致ではなく、自然言語の述語(意味)に基づいて2つのDataFrameを結合できます。
- Lineage Tracking(リネージ追跡): 出力をソースデータまで遡って追跡するための行レベルのリネージを提供します。
- MCP Integration(MCP統合): パイプラインをModel Context Protocol (MCP) ツールに昇格させることができ、AIエージェントが管理されたツールインターフェースとしてそれらを呼び出すことを可能にします。
対象ユーザー
- 大量の非構造化テキストを構造化データセットに処理する必要があるデータエンジニアおよびアナリスト。
- モデルの失敗を分類し、トレース内のパターンを特定するための評価パイプラインを構築するAIデベロッパー。
- エージェントのデータ探索による発見を、再現可能で管理されたツールに変換したいエージェントデベロッパー。
ハイライト
- 組み込みのセマンティックオペレーター: 抽出、分類、感情分析、要約をファーストクラスでサポート。
- ネイティブな非構造化データサポート: Markdown、トランスクリプト (SRT/WebVTT)、JSON (
jq経由)、およびPDFの専門的な処理。 - 推論の最適化: LLMのオーバーヘッドを管理するための、統合されたトークン/コスト計算、リトライ、およびキャッシュ。
- AIエージェント用ツール群: リンティング用の
fenic checkや、コーディングエージェントにAPIの正しい使用方法を教えるためのfenic skill installを含む。 - マルチプロバイダー対応: OpenAI、Anthropic、Google、Cohere、およびOpenRouterと互換性があります。