Claude 看影片 Skill:Claude Video 的 /watch 怎麼運作
如果你想讓 Claude 看影片,Claude Video 的 /watch Skill 可以讀取線上影片網址或本機檔案,整理字幕並擷取不同場景的畫面,讓你詢問影片摘要,內容出現的時間點,或畫面與旁白是否一致。
這不是讓模型像人一樣從頭到尾播放影片,而是把影片轉成模型更容易讀取的文字與圖片集合。
Claude 看影片 Skill 可以做什麼
- 摘要 YouTube 影片或本機錄影
- 找出某個觀點出現的大概時間
- 對照講者說的內容與畫面
- 分析教學步驟,產品 demo 或簡報錄影
- 依問題調高或降低抽取影格數量
例如,你可以要求 Agent 列出影片中的五個主要觀點,也可以問「講者在哪個時間點開始示範安裝」。如果你關心的是某一小段,最好提供時間範圍,減少不必要的處理與 token。
字幕優先,Whisper 是備援
這個 Skill 會先找影片原生 captions。能直接取得字幕時,通常不需要 Whisper API key。
如果影片沒有字幕,才會使用 Groq 或 OpenAI 的 Whisper 服務。這時音訊會送往第三方 API,可能產生成本,也需要考慮敏感資料是否適合上傳。你也可以停用 Whisper,只靠抽取影格分析,但沒有 transcript 時,理解說話內容的能力會明顯下降。
安裝與第一次使用
Claude Code 可以透過上游 plugin marketplace 安裝。Codex 或其他讀取 Agent Skills 的工具,也可依官方 repository 提供的通用方式加入 watch。
系統需要 ffmpeg 與 yt-dlp。macOS 首次執行可以透過 Homebrew 自動安裝。Linux 與 Windows 會顯示對應指令,但仍需要使用者確認與執行。
建議第一次先使用有公開字幕的一到五分鐘影片:
- 確認 yt-dlp 能取得影片或字幕。
- 使用較低成本的 detail mode。
- 要求摘要並列出三個時間點。
- 人工打開影片核對時間與畫面。
- 再測試沒有字幕的影片與 Whisper fallback。
detail mode 會影響什麼
上游提供 transcript,efficient,balanced 與更高影格用量的模式。影格越多,模型看到的視覺資訊通常越完整,但 token 與處理時間也越高。
對長訪談或講座來說,transcript 或 efficient 往往已足夠。對產品 demo,操作教學或視覺設計分析,可能需要 balanced 或指定時間區段。
不能忽略的限制
影格抽樣一定會漏資料。快速閃過的介面,短暫動作,背景細節與純聲音事件都可能不在輸入裡。字幕錯誤也會直接影響摘要。
因此它適合研究,摘要與定位,不適合用於需要逐格精準的安全鑑識,醫療判讀或法律證據分析。
來源與授權
- 官方 repository:https://github.com/bradautomates/claude-video
- GitHub Releases:https://github.com/bradautomates/claude-video/releases
- 作者帳號:
bradautomates - License:MIT
- Release:v0.2.0
- Commit 快照:
83da59fa78c3 - 研究快照:2026-08-09