SNEWPapers: AI 解鎖美國報紙數世紀的歷史

存取與分析歷史報紙檔案長期以來一直是研究人員面臨的巨大挑戰。傳統方法通常需要手動翻閱微縮膠卷或受關鍵字限制的數位資料庫,導致大量資訊未被發掘。SNEWPapers 作為一項突破性的解決方案出現,利用人工智慧打造它聲稱的全球首個 AI 報紙檔案與研究平台,真正「閱讀」報紙。此平台旨在解鎖 250 年的美國歷史,從 1730 年代到 1960 年代,讓數百萬篇故事以空前的方式可被存取與搜尋。

此計畫之所以重要,是因為它承諾讓歷史資料的取得更加民主化,超越傳統搜尋引擎乃至像 ChatGPT 這類通用 AI 模型的限制。透過將先進的 AI 應用於從歷史報紙中提取與組織內容的複雜任務,SNEWPapers 為歷史研究提供了全新的範式,促進更深入的洞見與發現。

SNEWPapers 的規模與範圍

SNEWPapers 擁有令人印象深刻的檔案,現已收錄超過 600 萬篇從 3,000 多個報紙標題中提取的故事,涵蓋 250 年的美國歷史。這龐大的資料集持續成長,為歷史學家、學者與愛好者提供豐富資源。平台將這些龐大內容整理為 24 個主要類別與超過 1,000 個子類別,方便細緻探索。

AI 驅動的研究能力

SNEWPapers 的核心創新在於其 AI 驅動的研究工具,旨在克服傳統關鍵字搜尋的限制:

AI 驅動搜尋

與傳統搜尋引擎不同,SNEWPapers 允許使用者「以意義搜尋,而非僅限關鍵字」。此語意搜尋功能讓研究者即使在文字中未出現精確詞彙,也能找到關於概念、事件與主題的文章。這對於術語隨時間演變或事件以間接方式描述的歷史研究尤為關鍵。使用者還可透過類別、子類別、州別與日期篩選器進一步細化搜尋。

收藏與探索

平台支援建立精選收藏,讓研究者整理其發現。它亦透過允許使用者探索他人建立的公開收藏,營造協作環境,促進跨世紀歷史敘事的發現與連結。

The Sleuth:您的 AI 研究助理

「The Sleuth」作為 AI 研究助理,旨在以檔案中直接引用的方式回答具體問題。此功能旨在大幅減少在龐大歷史資料中挖掘的人工工作,提供直接且有證據的答案。

今日歷史

為了每日互動,SNEWPapers 提供「今日歷史」功能,呈現當天發生的事件時間軸,直接取自報導該事件的報紙。此功能已由創作者公開,讓使用者無需驗證即可窺見檔案內容。

應對歷史文件處理的技術挑戰

從歷史報紙中提取結構化資訊的任務充滿技術挑戰。正如 Hacker News 評論者所指出的,一個重要障礙是報紙版面的複雜性。

「令人驚訝的是,我發現版面是最棘手的,因為報紙文章常有多層標題、跨越多欄等。你有偏好的解決方案嗎?」 — @zzleeper

SNEWPapers 宣稱自己是「唯一真正閱讀過報紙」的說法,暗示其對這些版面解析複雜性的強大解決方案,可能涉及先進的電腦視覺與自然語言處理技術,以精確辨識文章邊界、標題以及跨複雜頁面設計的內容流。此能力是其提供語意搜尋與精確文章提取的基礎。

另一相關挑戰,特別針對圖像密集的文件如雜誌,涉及文字與背景圖片混合時的 OCR 準確度。

「你認為你的 OCR 解決方案在雜誌上表現如何?我發現 OCR 在雜誌上時好時壞,尤其是文字與背景圖片混合的情況。」 — @longplay

雖然 SNEWPapers 主要聚焦於報紙,報紙因印刷品質與歷史字體的差異常帶來 OCR 挑戰,但此專案所開發的底層 AI 與 OCR 技術有可能被改編或為其他歷史文件類型(包括雜誌)提供解決方案,儘管文字覆蓋圖像的特定挑戰仍屬複雜領域。

使用者體驗與可及性

早期使用者的回饋強調了透過直接體驗展示平台實用性的重要性。

「即使我在搜尋產業已久,我仍難以具體想像如何使用這個平台。我建議先取一小段可能代表使用情境的資料集,然後將該段公開,讓人不需註冊即可立即搜尋。」 — @benwills

針對此回饋,創作者已將「今日歷史」功能公開,並積極致力於讓資料的可搜尋部分免費開放。亦提供多個直接範例供未驗證使用者探索:

未來可能性

SNEWPapers 档案的结构化特性为进阶的历史分析打开了大门。社区的建议包括进行时间序列分析,例如辨识「每月/每年最热门的新闻标题」或甚至分析「出版商的左倾/右倾波动」随时间的变化。这类宏观洞察过去往往艱難或不可能实现,但在 AI 处理并组织的历史数据集下成为可行的可能性。

SNEWPapers 代表了歷史研究的一大躍進,改變了我們與數世紀記錄歷史的互動方式。透過利用 AI 克服歷史報紙檔案的固有複雜性,它有望發掘新敘事,提供對過去更深入的理解。

Sources