Intercomの持続可能なAI優位性戦略

Intercomは、事業のリプラットフォームに1億ドルを投資し、毎月数百万件の問い合わせを解決するAIエージェントFinを立ち上げることで、生成AIを顧客サービスソフトウェアに成功裏に統合しました。同社の成功は、「AIファースト」アプローチへの戦略的転換に起因しており、製品チームの再編成や非AIプロジェクトの中止を行い、AIを機能として追加するのではなく、製品のコアに組み込むことを確実にしました。

初期実験によるモデル習熟の構築

Intercomは、モデルを早期かつ頻繁にテストし、その制限や可能性を深く理解することで競争優位性を維持しています。この実践的なアプローチにより、チームがすでにGPT-3.5の能力をマッピングしていたため、GPT-4のリリースからわずか4か月でFinを立ち上げることができました。

Key technical findings from their experimentation include:

  • タスク向けモデル選択: Intercomは当初、返金などの複雑なワークフローを自動化する「Fin Tasks」のために推論モデルベースのスタックを計画していましたが、評価の結果、GPT-4.1が高い信頼性と低レイテンシでこれらのタスクを処理できることが判明しました。
  • プロンプトエンジニアリング: チームは、非推論クエリにチェーン・オブ・ソート(思考の連鎖)プロンプトを適用することで、パフォーマンスギャップを効果的に埋められることを発見しました。
  • 効率向上: Intercomの評価では、GPT-4.1がタスク完了の信頼性で最高を示し、GPT-4oと比較してコストを20%削減しました。データの完全性を確保するため、5回の独立実行でPass@kを用いて完了度を測定し、すべての実行で成功した場合のみ結果を完了とカウントしました。

厳格な評価によるデプロイの加速

Intercomは、構造化された評価プロセスを活用して新しいモデル、モダリティ、アーキテクチャを迅速に採用しています。このフレームワークは、オフラインテストとライブA/Bテストで構成され、デプロイ前に指示遵守、ツール呼び出しの正確性、そして一貫性を測定します。

評価手法

  • ベンチマーク: 実際のサポートインタラクションのトランスクリプトを用いて、モデルがマルチステップ指示を処理し、ブランドの声を維持し、機能呼び出しを実行できるかを評価します。
  • A/Bテスト: ライブテストで、GPT-4やGPT-4.1など異なるモデル間の解決率と顧客満足度を比較します。
  • 音声固有指標: Realtime APIで動作するFin Voiceについては、人格、トーン、割り込み処理、背景ノイズを評価し、人間品質の電話サポートを確保します。

この厳格なプロセスにより、IntercomはGPT-4からGPT-4.1への移行を数日で実施でき、評価結果はモデルリリースから48時間以内に完了しました。

アーキテクチャの柔軟性の維持

Intercomは、モジュラーでモデル非依存のアーキテクチャを採用しており、クエリを最適なモデルにルーティングし、システム全体を再設計せずにモデルを交換できます。この柔軟性は、チャット、メール、音声など、レイテンシや複雑性の要件が異なる複数のモダリティをサポートするために不可欠です。

アーキテクチャの進化

  • 反復的設計: Finのアーキテクチャは現在第3世代で、第四世代が開発中です。これにより、必要に応じて複雑性を追加し、モデルが向上するにつれて簡素化できます。
  • 複雑性の削減: GPT-4.1の指示遵守性能の高さにより、IntercomはFin Tasks向けのアーキテクチャを転換し、より複雑な推論ベースのスタックを不要にし、全体のレイテンシとコストを削減しました。

ビジネス全体へのAI機能拡大

モジュラーアーキテクチャと高度なモデルを組み合わせることで、IntercomはAIの活用範囲を基本的な顧客サポートからより広範なビジネスワークフローへと拡大しています。

  • サポートチーム: Fin AIエージェントを使用して、音声、メール、チャットを通じた受信問い合わせの大半を解決します。
  • オペレーションチーム: Fin Tasksを活用し、サブスクリプションの更新、アカウント変更、返金を自動化します。
  • プロダクトチーム: MCPサーバーを活用し、ChatGPTなどのAIツールがチケット、ユーザーデータ、会話にアクセスできるようにして、製品ロードマップの精緻化やバグの特定に役立てます。

Sources