webclaw:把網頁轉成 Markdown,JSON 與 AI 可讀資料

如果你需要把網頁轉成 Markdown 或 AI 可讀資料,webclaw 可以把網址整理成乾淨的 Markdown,JSON,純文字或壓縮過的上下文。它適合把文件站整理成 RAG 資料,追蹤頁面變更,或讓 Claude Code,Codex 等 MCP client 取得比原始 HTML 更容易使用的內容。

它能替你完成什麼

輸入一個網址後,webclaw 會抓取頁面,移除導覽與廣告等雜訊,再保留主要內容與連結結構。除了單頁 scrape,它也能依深度 crawl 同一網站,批次處理網址,從 sitemap 找頁面,比較兩次內容差異,以及依 JSON schema 擷取欄位。

專案同時提供 CLI,REST API 與 MCP server。你可以在終端機把結果存成檔案,也可以讓 AI agent 直接呼叫 scrape,crawl,map,extract,diff 與 brand 等工具。核心路徑可在本機執行,遇到 JavaScript 或防機器人頁面時則可選擇付費雲端處理。

你需要準備什麼

第一次怎麼使用

先用一個允許公開存取的靜態文章測試:執行 webclaw <網址> --format markdown,再把輸出與原頁逐段比較。確認正文,標題,連結與表格沒有明顯遺漏後,才改用 --format llm 或 JSON。要抓整個文件站時,先設定低深度與少量頁數,查看 URL 範圍是否正確,再逐步放大。

如果接入 MCP,先只允許讀取型工作,並檢查 agent 實際抓了哪些網址。雲端模式會把請求與頁面內容交給 Webclaw 服務處理;包含內網,登入 cookie,客戶資料或未公開頁面時,不應在沒有安全審查的情況下使用。

哪些情況不適合

webclaw 能抓到內容,不代表你可以重新發布,訓練模型或建立商業資料庫。仍要遵守網站條款,robots,著作權,個資與合理請求速率。不要用代理或防封鎖功能繞過登入,付費牆或明確的存取限制。

本機模式無法處理所有 JavaScript 網站與機器人保護;雲端模式則有費用與隱私交換。自動清理也可能刪掉重要表格,註腳或互動內容,因此重要研究不能只看擷取結果,仍需回到原頁核對。

來源與授權

本頁介紹 0xMassi/webclaw。開源 CLI,MCP,擷取核心與自架 server 採 AGPL-3.0;查核時最新 Release 為 v0.6.16。官方雲端 API 是另外的託管服務,功能,費率與資料處理條款需另外確認。