llms.txt 是什麼?新手入門:定義、運作原理與常見迷思

中文名稱:llms.txt(給大型語言模型看的網站精選導覽檔)|英文:llms.txt

llms.txt 是一個放在網站根目錄的純文字檔,用 Markdown 格式整理出「網站上最重要、最值得讓 AI 讀的內容在哪裡」,目的是幫大型語言模型(LLM)在回答問題的當下,更快找到乾淨、精準的資料。它是一份 2024 年提出的社群提案,不是官方標準,目前主流搜尋引擎與 AI 也尚未正式採用。

這篇文章會用新手角度說明:llms.txt 是什麼、它和 robots.txt 差在哪、檔案長什麼樣、實際上誰用得到,以及為什麼它討論度很高,實際效果卻仍有很大的問號。


llms.txt 是什麼?

依官方提案網站 llmstxt.org 的說法,llms.txt 是「在網站上放一個 /llms.txt 檔,提供資訊幫助大型語言模型在 inference(回答的當下)使用這個網站」的標準化提案。它由 Answer.AI 的 Jeremy Howard 於 2024 年 9 月提出。

它想解決的問題很實際:LLM 的「上下文視窗」有限,塞不下整個網站;而一般網頁塞滿導覽列、廣告與 JavaScript,要轉成乾淨、AI 好讀的純文字既麻煩又容易出錯。llms.txt 的想法,就是由網站主動把精華濃縮成一份好讀的清單。

技術上有幾個重點要知道:

  • 位置固定:放在網站根目錄,網址會長這樣 https://www.example.com/llms.txt(提案也允許放在子路徑)。
  • 用 Markdown:它刻意不用 XML 這類傳統結構化格式,而是用 Markdown,因為這份檔案本來就是要給語言模型與 AI 代理讀的。
  • 主要用於 inference,不是訓練:它預期是在使用者當下提問、AI 需要查資料時才被用到,而非拿去做模型訓練。
  • 還有一個搭配提案:在重要網頁的同一網址後面加上 .md,提供一份乾淨的 Markdown 版頁面(例如 page.html 對應 page.html.md)。

用白話文怎麼說?

你可以把網站想成一間大型展館,這裡有三種「給機器看的檔案」,角色完全不同:

  • robots.txt:門口的動線告示,「哪裡可以進、哪裡請勿進入」,管的是存取。
  • sitemap.xml:完整的全館樓層平面圖,把所有房間都列出來給搜尋引擎。
  • llms.txt:館方親手挑的一張「精華導覽手冊」,只列最重要的幾個展區,還附上最乾淨的說明,方便趕時間的 AI 導覽員快速抓重點。

關鍵差別在於:llms.txt 是你「主動遞上的一張小抄」,它沒有強制力,也沒有門鎖。AI 那邊要不要拿、拿了要不要看、看不看得懂,主導權都在對方手上。

你可以這樣記:llms.txt 是「我幫你整理好重點,歡迎參考」的邀請函,不是「你只能看這些」的命令。


llms.txt 實際上要做什麼?

它的格式很簡單,依官方規格,由上而下大致是這幾段:

  • 一個 H1 標題寫網站或專案名稱——這是唯一必填的部分。
  • 一段引言(blockquote),用一兩句話講清楚這個網站在做什麼。
  • 可有可無的補充說明段落(不含標題)。
  • 數個用 H2 分區的「連結清單」,每一條是 [名稱](網址),後面可加一句說明。
  • 一個叫 Optional 的特別區塊:當 AI 需要更短的內容時,這裡的連結可以被略過。

一個精簡的例子大概長這樣:

# 你的網站名稱

> 一句話說明這個網站或專案在做什麼。

## 文件
- [快速上手](https://example.com/start.md):給新手的入門說明
- [API 參考](https://example.com/api.md):所有參數一覽

## Optional
- [完整封存說明](https://example.com/archive.md)

那「誰真的用得到」?目前最站得住腳的場景,是開發文件與技術網站:把程式庫說明、API 文件整理給編碼助手或 AI 代理即時參考,確實能省下它們亂猜的功夫。也因此,不少文件平台與 CMS(例如 Mintlify、VitePress、Docusaurus、Drupal 等)都推出了外掛,可以自動產生 llms.txt。

但如果你經營的是一般部落格或小型商家網站,先把期待放低一點:它「能不能帶來看得到的好處」,目前還沒有定論。


關於 llms.txt 的常見迷思

迷思一:llms.txt 像 robots.txt 一樣可以擋 AI 抓我的內容

不行。llms.txt 完全沒有阻擋力,它是「邀請與導覽」,不是「門鎖」。提案本身也說明,它和 robots.txt 用途不同:要管制 AI 爬蟲能不能抓你的內容,仍然得用 robots.txt,而不是 llms.txt。

迷思二:放了 llms.txt,Google 排名或 AI 摘要就會變好

目前沒有證據支持這點,方向反而相反。Google 已公開表示不支援 llms.txt、也沒有打算支援(據報導為 Gary Illyes 於 2025 年 7 月所述),John Mueller 還把這個構想類比成早已被棄用的 keywords meta 標籤。Google 針對 AI 功能的站長指南,更直接把 llms.txt 列為「沒有幫助」的做法之一(實際內容請以官方最新版本為準)。它不是排名訊號。

迷思三:主流 AI 都會自動讀 llms.txt

目前,OpenAI、Google、Anthropic、Meta、Mistral 等主要業者,都還沒有公開證實在正式產品中讀取或採用 llms.txt。第三方分析也觀察到,實際 AI 爬蟲流量真正觸及 /llms.txt 的比例極低(非官方統計,僅供參考)。

迷思四:llms.txt 就是「AI 版 sitemap」,可以取代 sitemap.xml

兩者用途不同。提案者明說 llms.txt 不是 sitemap 的替代品:sitemap.xml 是給搜尋引擎的全站索引清單,llms.txt 則是精選、可以包含外部連結、為 inference 設計的導覽。一個求「全」,一個求「精」。


總結

如果只記一句話:llms.txt 是一份「主動遞給 AI 的網站精華小抄」的社群提案,想幫大型語言模型在回答時更快找到乾淨內容;但它是邀請,不是門鎖,也不是排名工具。

新手可以記住三件事。第一,它不擋 AI,也不是 robots.txt 的替代,要管制爬取請繼續用 robots.txt。第二,Google 明說不採用,別期待靠它衝排名或 AI 引用。第三,它目前最實際的價值在開發文件與 AI 代理情境;一般網站可以先觀望,把力氣放在好內容與乾淨的技術基礎上,這才是不論搜尋引擎或 AI 都看重的根本。


參考資料