当前位置: 首页 > news >正文

让Claude看懂视频:claude-video给AI装上了眼睛

你在YouTube上看过一个很棒的教程,但想问Claude"他在第30秒做了什么"——Claude只能猜,因为它从来没法真正"看"视频。直到claude-video出现。

这个项目解决什么问题?

AI能读网页、能跑代码、能浏览仓库,但唯独看不了视频
你把一个YouTube链接丢给Claude,它只能根据标题猜内容,或者抓一个不完整的文字摘要——屏幕上发生的事,它一无所知。
claude-video用一行命令解决这个问题:

/watch https://youtu.be/<url> 他在30秒时做了什么?

Claude会下载、提取帧、抓取字幕,然后真正看到并听到这个视频,再回答你的问题。
日涨 988 stars,GitHub Trending 热度第一,MIT开源,零配置开箱即用。

核心亮点

1. 场景感知帧提取
不是每隔1秒截一帧,而是用ffmpeg场景变化检测,只在内容真正变化的时候提取帧。一个49分钟的屏幕录屏,它只需要100张帧就覆盖全程。
四种模式适应不同需求:

  • transcript:只抓字幕,0帧,4.5秒搞定
  • efficient:关键帧,50张,0.5秒提取
  • balanced:场景变化帧,100张,21秒
  • token-burner:不限量,全场景帧
    2. 智能字幕 + Whisper 兜底
    优先用yt-dlp抓原生字幕(免费、快速),没字幕时用 Whisper API 兜底。Groq 的whisper-large-v3被作为首选——更快更便宜。
    3. 帧去重机制
    屏幕录屏经常一帧停留90秒。claude-video 会自动检测近重复帧并跳过,避免同一个画面浪费 token。默认关闭可手动保留。
    4. 零配置安装
    macOS 首次运行时自动brew install ffmpeg yt-dlp,Linux/Windows 打印对应命令。Whisper API key 可选——有字幕的视频完全免费。

快速上手

# Claude Code(推荐)/plugin marketplaceaddbradautomates/claude-video /plugininstallwatch@claude-video# Codex / Cursor / Copilot / Gemini CLInpx skillsaddbradautomates/claude-video-g

安装后直接/watch <url> <问题>即可使用。

典型使用场景

  • 分析竞品内容:看别人怎么开场、怎么包装产品
  • 从视频里修bug:有人发屏幕录屏给你,你直接让Claude看
  • 加速学习:把一整个YouTube频道变成可搜索的笔记
  • 去hyping:发布视频里到底加了什么,去掉10分钟开场白

我的评价

claude-video 做对了一件事:它补上了AI能力拼图里最显眼的一块——视觉。
大多数AI编程工具都能处理文本和代码,但视频是一个巨大的盲区。这个项目用yt-dlp+ffmpeg+ Claude的Read工具,把视频变成了AI能消化的输入。
它的框架设计也很克制:不试图用AI识别画面内容(那是另外的模型),而是把每一帧当作图片让Claude自己看——这才是正确的抽象层级。
竞品对比:目前同类方案几乎都是基于专门的视觉模型(如 Video-LLaMA 等),但 claude-video 选择了一条更轻量的路——让已有的多模态大模型直接看截图。优势是无需额外部署模型,劣势是对画面内容的理解深度不如专门的视觉模型。
适用人群:经常需要和AI讨论视频内容的人、想要加速视频学习的人、做竞品分析的内容创作者。个人轻度使用也完全够。
一句话:如果你在用Claude Code或任何AI编程工具,/watch 应该在你的工具包里。

http://www.jsqmd.com/news/1292503/

相关文章:

  • Vue 事件机制深度剖析:$event、e.target 与 e.currentTarget 的本质区别
  • Python 3.12.1 Windows环境配置全攻略:从安装到虚拟环境与工具链优化
  • 如何3分钟实现专业级AI视频抠像:MatAnyone完整指南
  • ESP32+LVGL嵌入式GUI开发:从环境搭建到驱动移植全流程详解
  • 服务达标好评占比双优:2026年西藏旅行社推荐名单实测对比,我们实测了28家,这份“闭眼入”清单请收好| 附:旅行社电话 - 西藏康泰旅行社
  • 短剧出海北美、拉美、东南亚怎么选?短剧视频翻译配音对比
  • SSM框架选课系统开发实战与优化策略
  • 让Agent学会工程化:ECC——一个开源的Agent编排操作系统
  • FreeRTOS嵌入式实时操作系统:从核心原理到STM32/ESP32项目实战
  • OpenGL三维造型核心原理与实训指南:从管线到B样条曲面
  • 私有化协作底座:信创后业务优化的核心引擎
  • AI系统模块化架构:LLM、Agent与链路神经的协同设计
  • WLCSP晶圆级芯片封装技术:原理、优势与工程实践详解
  • 数学建模国赛C题:基于Holt-Winters与库存策略的原材料订购计划实战
  • 从文氏桥到PCB:低频信号发生器设计实战与调试指南
  • PyTorch升级避坑指南:从环境诊断到兼容性测试的完整流程
  • Ryujinx模拟器:如何在PC上流畅运行4000多款Switch游戏?
  • AI编程成本优化:Codex规划+DeepSeek执行的混合模型实践
  • GHelper:告别臃肿!华硕笔记本轻量化控制工具终极指南
  • LLM路由技术:智能分发与优化实践
  • FPGA彩灯控制器设计:Verilog状态机实现与Quartus仿真全流程
  • C++编译器默认生成的六大成员函数:规则、陷阱与最佳实践
  • GEO生成式引擎优化:基于Python的关键词意图匹配代码实现|API交互实践 - 汇聚至此
  • Allegro PCB设计:掌握图形层快速切换技巧,提升批量操作效率
  • 黏膜糖蛋白亲和钓靶探针|生物素-粘蛋白 Biotin-Mucin
  • STM32 I2C OLED驱动全解析:从硬件连接到图形显示实战
  • 显卡驱动彻底清理终极指南:Display Driver Uninstaller (DDU) 完整教程
  • 基于Multisim与74LS系列芯片的红绿灯时序电路设计与仿真
  • 2026年比较好的大型集团资产管理系统,解决账实不符真痛点
  • AI骨骼绑定革命:UniRig如何让3D角色动画制作效率提升10倍