Intercom 的永續 AI 優勢策略
Intercom 成功將生成式 AI 整合到其客戶服務軟體中,投入 1 億美元重新平台化其業務,並推出 Fin——一個每月解決數百萬查詢的 AI 代理。公司成功歸因於向「AI 為先」策略的戰略轉變,這包括重新組織產品團隊並取消非 AI 專案,以確保 AI 被建構於產品核心,而非作為附加功能。
透過早期實驗建立模型流暢度
Intercom 透過早期且頻繁的模型測試,深入了解其限制與機會,從而保持競爭優勢。這種實作方式使公司能在 GPT-4 發布後四個月內推出 Fin,因為團隊已經繪製出 GPT-3.5 的能力圖譜。
關鍵技術發現包括:
- Model Selection for Tasks(任務模型選擇): 雖然 Intercom 最初規劃以推理模型為基礎的「Fin Tasks」堆疊(自動化如退款等複雜工作流程),評估結果顯示 GPT-4.1 能以高可靠性與較低延遲處理這些任務。
- Prompt Engineering(提示工程): 團隊發現,對非推理查詢使用 chain-of-thought 提示能有效縮小效能差距。
- Efficiency Gains(效率提升): 在 Intercom 的評估中,GPT-4.1 在任務完成的可靠性最高,且相較於 GPT-4o 成本降低 20%。為確保資料完整性,使用 Pass@k 在五次獨立執行中測量完整度,僅在所有五次皆成功時才視為完整。
以嚴謹評估加速部署
Intercom 採用結構化的評估流程,快速採用新模型、模態與架構。此框架包括離線測試與線上 A/B 試驗,衡量指令遵循、工具呼叫準確性與一致性,於部署前完成評估。
評估方法論
- Benchmarking(基準測試): 以實際支援互動文字稿測試模型,評估其處理多步指令、維持品牌語調與執行功能呼叫的能力。
- A/B Testing(A/B 測試): 線上測試比較不同模型(如 GPT-4 與 GPT-4.1)的解決率與客戶滿意度。
- Voice-Specific Metrics(語音特定指標): 對於 Fin Voice(由 Realtime API 提供),Intercom 評估個性、語調、打斷處理與背景噪音,以確保具有人類品質的電話支援。
此嚴謹流程使 Intercom 能在數天內從 GPT-4 遷移至 GPT-4.1,且評估結果在模型發布後 48 小時內完成。
維持架構彈性
Intercom 採用模組化、模型無關的架構,使公司能將查詢導向最適合的模型,且可在不重新設計整個系統的情況下切換模型。此彈性對支援多種模態(包括聊天、電子郵件與語音)至關重要,因各模態具不同的延遲與複雜度需求。
架構演進
- Iterative Design(迭代設計): Fin 的架構目前已進入第三次重大迭代,第四次迭代正在開發中,使團隊能在必要時增加複雜度,並隨模型進步而簡化。
- Complexity Reduction(降低複雜度): GPT-4.1 在指令遵循能力上的高表現,使 Intercom 能調整 Fin Tasks 的架構,省去更複雜的推理堆疊,降低整體延遲與成本。
擴展全公司 AI 能力
透過結合模組化架構與先進模型,Intercom 正將 AI 的效用從基本客戶支援擴展至更廣泛的業務工作流程:
- Support Teams(支援團隊): 使用 Fin AI 代理解決大部分透過語音、電子郵件與聊天進入的查詢。
- Operations Teams(營運團隊): 利用 Fin Tasks 自動化訂閱更新、帳號變更與退款。
- Product Teams(產品團隊): 透過 MCP Server 讓像 ChatGPT 之類的 AI 工具存取工單、使用者資料與對話,協助完善產品路線圖與偵測錯誤。