Claude 看影片 Skill:Claude Video 的 /watch 怎麼運作

如果你想讓 Claude 看影片,Claude Video 的 /watch Skill 可以讀取線上影片網址或本機檔案,整理字幕並擷取不同場景的畫面,讓你詢問影片摘要,內容出現的時間點,或畫面與旁白是否一致。

這不是讓模型像人一樣從頭到尾播放影片,而是把影片轉成模型更容易讀取的文字與圖片集合。

Claude 看影片 Skill 可以做什麼

例如,你可以要求 Agent 列出影片中的五個主要觀點,也可以問「講者在哪個時間點開始示範安裝」。如果你關心的是某一小段,最好提供時間範圍,減少不必要的處理與 token。

字幕優先,Whisper 是備援

這個 Skill 會先找影片原生 captions。能直接取得字幕時,通常不需要 Whisper API key。

如果影片沒有字幕,才會使用 Groq 或 OpenAI 的 Whisper 服務。這時音訊會送往第三方 API,可能產生成本,也需要考慮敏感資料是否適合上傳。你也可以停用 Whisper,只靠抽取影格分析,但沒有 transcript 時,理解說話內容的能力會明顯下降。

安裝與第一次使用

Claude Code 可以透過上游 plugin marketplace 安裝。Codex 或其他讀取 Agent Skills 的工具,也可依官方 repository 提供的通用方式加入 watch

系統需要 ffmpeg 與 yt-dlp。macOS 首次執行可以透過 Homebrew 自動安裝。Linux 與 Windows 會顯示對應指令,但仍需要使用者確認與執行。

建議第一次先使用有公開字幕的一到五分鐘影片:

  1. 確認 yt-dlp 能取得影片或字幕。
  2. 使用較低成本的 detail mode。
  3. 要求摘要並列出三個時間點。
  4. 人工打開影片核對時間與畫面。
  5. 再測試沒有字幕的影片與 Whisper fallback。

detail mode 會影響什麼

上游提供 transcript,efficient,balanced 與更高影格用量的模式。影格越多,模型看到的視覺資訊通常越完整,但 token 與處理時間也越高。

對長訪談或講座來說,transcript 或 efficient 往往已足夠。對產品 demo,操作教學或視覺設計分析,可能需要 balanced 或指定時間區段。

不能忽略的限制

影格抽樣一定會漏資料。快速閃過的介面,短暫動作,背景細節與純聲音事件都可能不在輸入裡。字幕錯誤也會直接影響摘要。

因此它適合研究,摘要與定位,不適合用於需要逐格精準的安全鑑識,醫療判讀或法律證據分析。

來源與授權