預測語言模型在錯資訊活動中的濫用

OpenAI 與喬治城大學安全與新興技術中心以及斯坦福網路觀測站合作,發布了一份報告,調查大型語言模型(LLM)在錯資訊活動中被濫用的可能性。研究結論指出,LLM 很可能透過降低成本、擴大規模以及提升欺騙性內容的說服力,改變線上影響作業的運作方式。

LLM 對影響作業的影響

大型語言模型有可能改變影響作業的三個主要構成要素:行動者、行為與內容。

行動者

LLM 可能降低執行影響作業的財務與技術門檻。這使得新型態的行動者能夠進入此領域,並為能自動化文字產出的「受僱宣傳者」提供競爭優勢。

行為

透過 LLM 可以擴大影響作業的規模,使得昂貴的策略——例如產生高度個人化的內容——變得顯著更便宜。此外,LLM 也啟用新策略,包括使用聊天機器人進行即時內容生成。

內容

LLM 能產生比人類宣傳者更具說服力或衝擊力的訊息,尤其在宣傳者缺乏目標受眾的文化或語言知識時更是如此。此外,LLM 使這些作業更難偵測,因為它們能持續產生獨特內容,避免了手動活動中常用以節省時間的重複複製貼上模式。

AI 驅動錯資訊的關鍵未知因素

儘管已辨識出風險,仍有多項變數尚未明朗,需要進一步研究以確定威脅的實際程度:

  • Emergent Capabilities:哪些善意的商業或研究投資會無意間為影響作業創造新能力?
  • Actor Investment:哪些特定行動者會在 LLM 技術上投入最多資金?
  • Tool Availability:易於使用的文字生成工具何時會公開,且針對影響的專門模型是否會比通用模型更有效?
  • Norms and Intentions:社會或政治規範是否會發展,以抑制在影響作業中使用 AI?

四階段緩解框架

為了應對這些威脅,報告提出一個管線框架,辨識出四個階段,可在此施行緩解措施以破壞影響作業。

管線階段 示範性緩解措施
1. 模型建構 建構對事實敏感的模型;散布「放射性資料」以使模型可被偵測;政府對資料收集或 AI 硬體存取的限制。
2. 模型存取 實施更嚴格的使用限制;制定模型發布的新規範;修補安全漏洞。
3. 內容散布 平台與 AI 供應商協調以辨識 AI 內容;要求發文時提供「人格證明」;採用數位來源標準。
4. 信念形成 推動媒體素養宣導;提供以消費者為中心的 AI 工具,協助使用者辨識錯資訊。

評估緩解措施的可取性

報告強調,緩解措施的存在並不自動代表其可取。鼓勵政策制定者與開發者以四個指導問題來評估潛在介入措施:

  1. Technical Feasibility:此緩解措施是否需要對現有技術基礎設施做出重大變更?
  2. Social Feasibility:此緩解措施在現行法律與規範下是否可執行,且關鍵行動者是否有動機實施?
  3. Downside Risk:此緩解措施可能帶來的負面影響為何?
  4. Impact:所提議的緩解措施在實際降低威脅方面的效力如何?

不論先進模型是保持私有或透過 API 受限,研究人員預期宣傳者將利用開源替代方案,或是國家將自行發展內部能力。

Sources