让 Claude Desktop 和 Cursor 真正“看”视频(MCP,全本地)
这周我的 AI 助手学会了看视频。下面用三行说明,告诉你怎么让你的助手也具备这个能力。
claude-real-video(MIT 协议,1.9k stars)可以从任意视频 URL 或本地文件中提取“场景感知、去重后的关键帧”,外加带时间戳的转录文本——所有处理都在你自己的机器上完成。从 0.8.0 版本开始,它自带 MCP 服务器,所以任何 MCP 客户端都可以直接请求视频。
安装:
pip install 'claude-real-video[mcp]'
Claude Code 配置:
claude mcp add crv -- crv-mcp
Claude Desktop 配置——加到 claude_desktop_config.json 里:
{
"mcpServers": {
"crv": {
"command": "crv-mcp"
}
}
}
Cursor 以及其他 MCP 客户端:用同样的 stdio 命令 crv-mcp 即可。
你能得到什么
两个工具会出现在对话中:
watch_video(source, max_frames, language, transcribe)—— 下载(URL)或读取(本地文件)视频,在场景切换处提取关键帧,去掉近乎重复的帧,用 Whisper 做转录,然后把转录文本和第一批帧作为图片直接返回对话中。get_frames(source, start_index, count)—— 翻页查看剩余帧。
每个视频的分析结果会缓存在 ~/.cache/crv-mcp 下,所以针对同一视频的追问可以即时响应。
为什么用“场景感知”而不是每秒一帧
固定间隔采样会把大量近乎相同的帧浪费在上下文里,同时还容易漏掉快速切换的镜头。场景检测能保留真正有差异的帧:一个 58 秒的测试片段,从 58 个采样帧减少到 26 个关键帧。更少的 token,不遗漏内容。仓库里的 benchmark 文件夹有完整对比,可以自行复现。