Falcon 模型發布與 Hugging Face 生態系統整合
Falcon 模型
Falcon 是由阿布扎比的 Technology Innovation Institute 創建的最新一族最先進的語言模型家族,並以 Apache 2.0 授權發布。該家族由 Falcon‑40B 和其較小的兄弟 Falcon‑7B 組成。發布時,Falcon‑40B 在 Open LLM 排行榜上排名第一,而 Falcon‑7B 則是其重量級別的最佳模型。Falcon‑7B 在 1.5 兆個 token 上進行訓練,Falcon‑40B 在 1 兆個 token 上進行訓練,超過 80% 的數據來自 RefinedWeb 網頁語料庫。兩個模型均使用 multiquery attention,這在自回歸解碼過程中大幅減少了 key‑value 快取的大小。Falcon‑40B 進行全精度推理時需要約 90 GB 的 GPU 記憶體,而 Falcon‑7B 只需約 15 GB。此外,Falcon‑7B‑Instruct 和 Falcon‑40B‑Instruct 這兩個指令版本也可供使用,並建議用於快速實驗。
示範
Falcon‑40B 模型可以在 Hugging Face Space 中立即體驗,或透過內嵌的遊樂場進行嘗試。該 Space 使用 Hugging Face 的 Text Generation Inference 後端,這是驅動 HuggingChat 的同一項技術。Falcon‑7B‑Instruct 模型的 Core ML 版本已經構建並示範在 M1 MacBook Pro 上運行,附帶一段影片展示輕量級應用程式,並提供下載 Core ML 權重的連結以供進一步探索。
推論
Falcon 模型可以使用標準的 transformers 庫來運行,但必須使用 bfloat16 資料類型並啟用遠端程式碼執行,因為建模程式碼位於模型儲存庫中。對於 7B 指令模型,可以透過 AutoTokenizer、transformers.pipeline、torch_dtype=torch.bfloat16、trust_remote_code=True 和 `device_map=