Lewis Tunstall インタビュー – Hugging Face 機械学習エキスパート

Lewis Tunstall インタビュー – Hugging Face 機械学習エキスパート

Hugging Face は、機械学習エンジニアの Lewis Tunstall への詳細なインタビューを発表し、Transformers ライブラリでの彼の取り組み、新しい「NLP with Transformers」書籍、そして拡大中の Hugging Face Course をハイライトしています。

Lewis Tunstall インタビュー – Hugging Face 機械学習エキスパート

TL;DR

Hugging Face は、Transformers ライブラリに貢献し、NLP with Transformers 書籍を共著した機械学習エンジニアの Lewis Tunstall へのインタビューを公開し、Hugging Face Course と大規模モデル評価ツールの構築を支援しています。


Lewis Tunstall とは?

Lewis Tunstall は Hugging Face の機械学習エンジニアです。以前はスタートアップや企業向けに NLP、トポロジカルデータ解析、時系列プロジェクトに取り組んでいました。機械学習に入る前は理論物理学者でした。仕事以外ではギター、トレイルランニング、オープンソースへの貢献を楽しんでいます。


彼が Hugging Face に入社した経緯

  • 2018 年、スイスのスタートアップで質問応答プロトタイプを作るために、初期の pytorch-pretrained-bert ライブラリを使用しました。
  • アクセスしやすいリソースが不足していることに魅了され、同僚の Leandro von Werra と共に Hugging Face の共同創業者 Thomas Wolf にコールドメールを送り、好意的な返答を受けて Transformers に関する書籍の執筆を開始しました。
  • 書籍 NLP with Transformers は 1.5 年の共同作業の後に出版され、両著者が Hugging Face に入社するきっかけとなり、Lewis は約 9 ヶ月間勤務しています。

NLP with Transformers 書籍について

  • Luca Perrozi(Accenture)によると「複雑さをシンプルにした… 今後何年も分野の標準を決定づける運命にある」と評されています。
  • 市販の事前学習モデルとスクラッチからのトレーニング、パフォーマンスチューニング、欠損ラベルの処理のすべてを網羅しています。
  • 表紙にはオウムが描かれており、コミュニティの「stochastic parrots」議論へのオマージュと、著者らが言語モデルのメタファーと考える遊び心のあるイラストです。

Transformers ライブラリへの貢献

  • ONNX 形式による本番環境向けモデルエクスポートに注力し、PyTorch から TensorFlow への変換や専用ハードウェア上での実行を可能にしました。
  • エクスポートプロセスを 1 行のコードに簡素化し、レイテンシを削減し、チャットボットなどのリアルタイムアプリケーションのスループットを向上させました。
  • ライブラリの哲学であるボイラープレートの抽象化を強調し、ユーザーが本来のタスクに集中できるようにしています。

Hugging Face Course

  • コアメンテナの Sylvain Gugger と Lysandre Jik と共同で開発し、ソフトウェアエンジニアと最新の NLP のギャップを埋めました。
  • 無料のマルチパートコースで、タスク横断的なエンドツーエンドのモデル訓練を教え、次回の第3部では音声とコンピュータビジョンのモダリティもカバーするよう拡張中です。
  • コミュニティ主導のイベントで実用的なプロジェクトが生まれました。例として、カバーレター生成ツールが参加者の Big Science チームでのインターンシップ獲得に貢献しました。

大規模モデル評価

  • ユーザーが Hugging Face Hub 上でモデルとデータセットを直接評価できるインフラを構築中で、手動ベンチマークなしにタスクごとのトップパフォーマンスモデルを提示することを目指しています。
  • 研究者が評価スイートを提出・維持しやすくするホスト型ベンチマークを検討しており、現在のアドホックスクリプトや論文単位のテストへの依存を解消します。
  • ベンチマークの過適合リスクを指摘しています。モデルは実際のタスク性能を反映しないショートカットを利用して高スコアを得ることがあります。

ML エンジニアへの実践的アドバイス

  • ベースラインから始める。 シンプルな正規表現やロジスティック回帰は、最先端の Transformers に進む前の堅実な基準を提供することが多いです。
  • 過度なエンジニアリングを避ける。 本番環境の制約と統合したエンドツーエンドのパイプラインを構築すべきです。デプロイできない高性能モデルは無意味です。
  • オープンソースに早期に貢献する。 コミュニティプロジェクトへの早期参加は学習を加速し、キャリアの機会を広げることがあります。

将来の応用に対するビジョン

  • 自然科学。 ディープラーニングと領域知識を組み合わせることで、AlphaFold のタンパク質構造予測のように発見を加速できます。
  • 創薬とロボティクス。 ML 主導の化学パイプラインや、家庭用ロボット(例:洗濯物のたたみ)の長期的な目標は、個人的な関心領域です。
  • 責任ある AI。 悪用(武器化や金融市場操作など)の可能性を認めつつ、Tunstall は直面するリスクは「ターミネーター」的シナリオではなく、システム的な脆弱性であると強調しています。

好きな論文とインスピレーション

  • Leo Breiman の 2001 年の Random Forests 論文 – その明快さと実装しやすさが称賛されています。
  • 最近の DeepMind の論文で、代数トポロジーの定理証明に ML を使用したもの – 予測タスクを超えて、根本的な科学的洞察を支援できることを示しています。

個人的な関心とアウトリーチ

  • Hannah Fry がホストする DeepMind ポッドキャストを定期的に聴いており、ディープラーニングと強化学習の分かりやすい解説として推奨しています。
  • Twitter (@_lewtun) で活動し、Hugging Face Forums と Discord コミュニティにも参加しています。

主なポイント

  • Lewis Tunstall の取り組みは、オープンソースへの貢献、実用的なツール(ONNX エクスポート)および教育リソース(Hugging Face Course)が組み合わさることで、Transformers を本番環境で活用するハードルを下げることを示しています。
  • 本インタビューは、ベースラインモデル、エンドツーエンドのシステム思考、そして持続可能な ML 開発のための責任ある評価実践の重要性を強調しています。

Sources