webclaw:把網頁轉成 Markdown,JSON 與 AI 可讀資料
如果你需要把網頁轉成 Markdown 或 AI 可讀資料,webclaw 可以把網址整理成乾淨的 Markdown,JSON,純文字或壓縮過的上下文。它適合把文件站整理成 RAG 資料,追蹤頁面變更,或讓 Claude Code,Codex 等 MCP client 取得比原始 HTML 更容易使用的內容。
它能替你完成什麼
輸入一個網址後,webclaw 會抓取頁面,移除導覽與廣告等雜訊,再保留主要內容與連結結構。除了單頁 scrape,它也能依深度 crawl 同一網站,批次處理網址,從 sitemap 找頁面,比較兩次內容差異,以及依 JSON schema 擷取欄位。
專案同時提供 CLI,REST API 與 MCP server。你可以在終端機把結果存成檔案,也可以讓 AI agent 直接呼叫 scrape,crawl,map,extract,diff 與 brand 等工具。核心路徑可在本機執行,遇到 JavaScript 或防機器人頁面時則可選擇付費雲端處理。
你需要準備什麼
- 要擷取的公開網址,以及擷取與再利用內容的合法權限。
- 預編譯執行檔,Rust/Cargo,Docker,或 MCP 的安裝環境。
- 需要的輸出格式與抓取範圍,尤其是 crawl 深度和最大頁數。
- 若使用雲端,搜尋或受保護頁面功能,還需要 Webclaw API key 與相應額度。
第一次怎麼使用
先用一個允許公開存取的靜態文章測試:執行 webclaw <網址> --format markdown,再把輸出與原頁逐段比較。確認正文,標題,連結與表格沒有明顯遺漏後,才改用 --format llm 或 JSON。要抓整個文件站時,先設定低深度與少量頁數,查看 URL 範圍是否正確,再逐步放大。
如果接入 MCP,先只允許讀取型工作,並檢查 agent 實際抓了哪些網址。雲端模式會把請求與頁面內容交給 Webclaw 服務處理;包含內網,登入 cookie,客戶資料或未公開頁面時,不應在沒有安全審查的情況下使用。
哪些情況不適合
webclaw 能抓到內容,不代表你可以重新發布,訓練模型或建立商業資料庫。仍要遵守網站條款,robots,著作權,個資與合理請求速率。不要用代理或防封鎖功能繞過登入,付費牆或明確的存取限制。
本機模式無法處理所有 JavaScript 網站與機器人保護;雲端模式則有費用與隱私交換。自動清理也可能刪掉重要表格,註腳或互動內容,因此重要研究不能只看擷取結果,仍需回到原頁核對。
來源與授權
本頁介紹 0xMassi/webclaw。開源 CLI,MCP,擷取核心與自架 server 採 AGPL-3.0;查核時最新 Release 為 v0.6.16。官方雲端 API 是另外的託管服務,功能,費率與資料處理條款需另外確認。