nndl/llm-beginner

LLM、Agent上手教程

What it solves

このプロジェクトは、初心者が大規模言語モデル(LLM)とAIエージェントをマスターするための、構造化されたハンズオン学習パスを提供します。理論と実装のギャップを埋め、基本的なTransformerアーキテクチャから高度な自律コーディングエージェントまで、6つの段階的タスクでガイドします。

How it works

ユーザーは6つの独立したタスクを順に進めます。各タスクは数週間で完了できるよう設計されており、"まずはゼロから実装し、次にフレームワークと比較する"という学習手法で、基礎原理への深い理解を促します。各タスクには依存パッケージ、データダウンロードスクリプト、自己チェックスクリプトが含まれ、実装の正当性を検証できます。

  1. Transformer Basics:テキスト分類のための自己注意機構とTransformerブロックを実装。
  2. mini-GPT:デコーダのみのモデルをゼロから構築。BPEトークナイゼーション、RoPE、KVキャッシュを含む。
  3. SFT & DPO:LoRAを用いてベースモデル上で教師あり微調整(Supervised Fine‑Tuning)と直接好み最適化(Direct Preference Optimization)を実施。
  4. RAG:埋め込みモデル、ベクトルデータベース(FAISS)、リランカーを組み合わせた検索拡張生成パイプラインを構築。
  5. Tool Agents:ReActループを実装し、LLMが外部ツール(電卓、サンドボックス、API)を利用できるようにする。
  6. Coding Agents:MCP(Model Context Protocol)、Skills、Subagents を活用し、ローカルコードの変更とテスト実行が可能な高度なエージェントを作成。

Who it’s for

Pythonとディープラーニングの基礎があり、実践的でコード中心の演習を通じてLLMとAIエージェントの領域に踏み込みたい学習者向けです。

Highlights

  • Progressive Curriculum:基礎アーキテクチャから高度なエージェントワークフローへ段階的に進む。
  • Hands‑on Validation:各タスクに eval/run.py スクリプトを用意し、実装の正確性を即座にフィードバック。
  • Hardware Accessible:消費者向けGPU(8GB‑16GB VRAM)やMacのMシリーズチップでも動作可能。
  • Comprehensive Tech Stack:RoPE、LoRA、DPO、RAG、ReAct、MCP といった最新技術を網羅。