Robots.txt Generator Robots.txt 產生器
快速建立符合搜尋引擎規範的 robots.txt,支援多組 User-agent、Allow/Disallow 規則。
內建常用模板、Sitemap 設定與即時驗證。
# 在此設定您的 robots.txt 規則…
設定規則後將即時驗證…
❓ 常見問題 FAQ
關於 robots.txt 的常見疑問
robots.txt 是什麼?網站需要它嗎?
robots.txt 是放置在網站根目錄的純文字檔案,用來告知搜尋引擎爬蟲(如 Googlebot、Bingbot)哪些頁面可以抓取、哪些不應該抓取。
幾乎所有正式上線的網站都應該擁有 robots.txt,原因如下:
- 控制抓取預算(Crawl Budget)— 引導爬蟲專注於重要頁面
- 避免敏感內容被索引 — 管理後台、購物車等不該出現在搜尋結果
- 宣告 Sitemap 位置 — 幫助搜尋引擎更快發現所有頁面
- 降低伺服器負載 — 阻止爬蟲抓取無意義的頁面
💡 注意:robots.txt 是「禮貌性協定」,並非強制安全機制。真正需要保護的頁面應使用登入驗證或 noindex 標籤。
Allow 與 Disallow 有什麼不同?
Disallow 告訴爬蟲「此路徑不要抓取」;Allow 告訴爬蟲「此路徑可以抓取」。
範例:
User-agent: *
Disallow: /admin/
Disallow: /private/
Allow: /images/
上述規則表示:禁止抓取 /admin/ 與 /private/ 開頭的路徑,但允許 /images/(即使它位於被封鎖的目錄內)。
💡 Allow 常用於「先封鎖大範圍,再開放特定子目錄」的場景,例如封鎖 /wp-content/ 但開放 /wp-content/uploads/。
為什麼要設定 Sitemap?
在 robots.txt 中宣告 Sitemap: 指令有兩個主要好處:
- 加速發現 — 搜尋引擎爬取 robots.txt 時會立即得知 Sitemap 位置,更快發現新頁面
- 提升索引效率 — 特別是新網站或大型網站,Sitemap 能確保所有重要頁面都被考慮索引
Sitemap 指令格式:Sitemap: https://example.com/sitemap.xml,可重複多行宣告多個 Sitemap 檔案。
💡 建議每個網站都在 robots.txt 中宣告 Sitemap,這是低成本、高效益的 SEO 最佳實踐。本工具會在有宣告 Sitemap 時顯示通過,否則顯示提醒。
Crawl-delay 是什麼?需要設定嗎?
Crawl-delay 告訴爬蟲「每次請求之間應等待幾秒」,用於減輕伺服器負載。
- Google 不支援 Crawl-delay 指令,改用 Search Console 的「抓取頻率」設定控制
- Bing(Bingbot) 支援,但建議僅在伺服器負載過高時使用
- Yandex 與 Baidu 支援此指令
💡 一般網站(流量正常、頁面載入快速)不需要設定 Crawl-delay,因為它可能減慢頁面的被索引速度。僅在伺服器負載過高時才建議使用。
有哪些常見的 robots.txt 錯誤?
以下是網站管理者最常犯的 robots.txt 錯誤:
- 不小心封鎖整站 — 撰寫
Disallow: /且沒有 Allow 規則,導致所有頁面都無法被索引(最嚴重!) - 路徑未以斜線開頭 — 正確格式為
Disallow: /admin/,缺少前導斜線會被忽略或誤解 - 大小寫錯誤 —
user-agent、disallow為小寫;某些爬蟲對大小寫敏感 - 重複規則 — 相同路徑重複宣告,造成維護困難與潛在衝突
- 多組相同 User-agent — 搜尋引擎只會採用第一組同名規則,後面的會被忽略
- 使用 robots.txt 做安全防護 — 它只是禮貌性協定,無法阻止惡意存取
💡 本工具的驗證功能會自動檢查上述問題,並以錯誤/警告的方式提示。
robots.txt 應該放在哪裡?如何部署?
robots.txt 必須放置於網站的根目錄,且檔名必須是 robots.txt:
- 正確:
https://example.com/robots.txt - 錯誤:
https://example.com/robots/robots.txt(子目錄不會被搜尋引擎採用)
部署方式:
- 使用本工具設定規則並下載
robots.txt - 透過 FTP / 主機管理面板上傳至網站根目錄
- 使用瀏覽器開啟
https://您的網域/robots.txt確認內容正確 - 如需驗證,可使用 Google Search Console 的「robots.txt 測試工具」
這個工具安全嗎?會上傳我的規則到伺服器嗎?
完全安全!Robots.txt Generator 是一個 100% 純前端工具:
- ✅ 所有規則產生、驗證都在您的瀏覽器中完成
- ✅ 不會將任何規則或網址上傳至伺服器
- ✅ 不需要註冊、登入或安裝任何軟體
- ✅ 載入後可完全離線使用
- ✅ 不會儲存您的任何設定
💡 即使是尚未發布的網站結構或內部路徑,也可以完全放心地在此產生規則。
📖 Robots.txt 完全指南:搜尋引擎規範與 SEO 建議
深入了解 robots.txt 的運作原理與最佳實踐
功能介紹
Robots.txt Generator 是 ToolHub 推出的免費線上 robots.txt 建立工具。您可以在圖形化介面中新增多組 User-agent(Googlebot、Bingbot、Baiduspider、YandexBot 等)、設定 Allow / Disallow 規則、宣告 Sitemap、調整 Crawl-delay 與 Host,右側即時產生對應的 robots.txt 內容,並自動執行語法、封鎖範圍與重複規則的驗證。內建 WordPress、Blog、E-commerce 等 7 種常用模板,一鍵套用即可完成基礎設定。
robots.txt 是什麼?
robots.txt 是網站的「爬蟲指令檔案」,位於網站根目錄,透過標準化格式告訴搜尋引擎爬蟲哪些頁面可以抓取、哪些應避免。它遵循 Robots Exclusion Protocol(REP),是 SEO 技術優化的基礎環節。
典型的 robots.txt 由一個或多個「規則群組」組成,每個群組包含 User-agent 與對應的 Allow / Disallow 規則:
如何使用 robots.txt?
規則群組(User-agent)
每個規則群組以 User-agent: 開頭,指定規則適用的爬蟲。通用規則使用 * 表示所有爬蟲;也可以針對特定爬蟲(如 Googlebot)設定專屬規則。請注意:Google 只採用第一個相符的 User-agent 群組,因此應將最特定的爬蟲規則放在最前面。
Allow 與 Disallow
Disallow 封鎖指定路徑,Allow 開放指定路徑(Google 原生支援 Allow)。路徑必須以斜線 / 開頭,例如 Disallow: /admin/。Allow 與 Disallow 同時存在時,最長匹配的路徑規則優先——這是「先封鎖大範圍再開放子目錄」的依據。
Sitemap 宣告
Sitemap: 指令告知爬蟲 XML Sitemap 的位置。此指令與 User-agent 無關,通常放在檔案末尾,可宣告多筆。建議所有網站都在 robots.txt 中宣告 Sitemap。
Crawl-delay 與 Host
Crawl-delay 設定爬蟲請求間隔秒數(Google 不支援);Host 宣告主要網域(Yandex 支援,可避免 IP 網域重複索引問題)。
常見錯誤與避免方式
- 封鎖整站 — 單獨使用
Disallow: /會讓整站無法被索引,這是影響最大的錯誤。務必確認是否有意為之 - 路徑格式錯誤 — 缺少前導斜線(
Disallow: admin/)或使用網址而非路徑(Disallow: https://…)都是常見錯誤 - 大小寫混用 — 指令名稱必須小寫(
user-agent、disallow),值則區分大小寫 - 重複與衝突規則 — 相同路徑重複宣告會造成維護困難;同名 User-agent 群組重複時後者無效
- 誤用 robots.txt 做安全防護 — 它只是協定不是防火牆,敏感頁面應使用驗證機制
SEO 建議
- 封鎖但保持可索引 — 封鎖不應出現在搜尋結果的功能頁面(購物車、帳戶、管理後台),而非重要內容頁面
- 務必宣告 Sitemap — 讓爬蟲每次來訪都立即得知內容地圖
- 避免封鎖 CSS/JS — 現代 SEO 中,封鎖 CSS/JS 檔案會阻礙 Google 理解頁面渲染結果
- 修改後驗證 — 部署後使用 Search Console 的 robots.txt 測試工具確認無誤
- 保持簡單 — robots.txt 應簡潔明確,過度複雜的規則反而容易出錯
瀏覽器相容性
本工具基於現代 Web 標準開發,相容於所有主流瀏覽器的最新版本:Google Chrome、Mozilla Firefox、Apple Safari、Microsoft Edge 與 Opera。建議使用最新版本以獲得最佳體驗。
隱私權保護
ToolHub 高度重視您的資料隱私。Robots.txt Generator 採用 100% 純前端架構,所有規則產生與驗證均在您的瀏覽器中完成,不會將任何資料傳輸至外部伺服器。我們不會儲存、分析或分享您輸入的任何規則內容,請放心使用。