https://t.co/PRmBDb4HqI

TL;DR · AI 摘要
ChatCut通过整合AI与专业工具,成为视频领域的通用Agent,实现从素材重组到生成新画面的跨越。
核心要点
- ChatCut 1.0采用Bin Viewer+PaperCut界面,专注采访粗剪并支持导出专业软件工程文件
- 2026年2月正式定位为通用剪辑Agent,可自主拆解任务、处理失败并生成可编辑工程
- 与Codex/GPT整合后,用户可直接在对话中完成视频内容生成与时间线编辑
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- ChatCut技术演进
- 产品阶段
- 1.0阶段:Bin Viewer+PaperCut界面
- Agent阶段:任务规划与自主执行
- 生成阶段:AI内容创作整合
- 核心能力
- 专业工具兼容性
- 自然语言交互
- 多步骤任务处理
金句 / Highlights
值得收藏与分享的关键句。
早期的文字只是素材的可编辑视图,现在语言开始承担规划、搜索和调用职责
Agent要围绕目标拆步骤、选工具、处理失败,再交付一个可继续编辑的工程
除非剪映也出了Agent
最近ChatCut很火,黄叔试了一下效果非常惊艳,因为后面也会做很多视频,对于视频剪辑有很强的痛点,于是赶紧研究了一下ChatCut的历史,发现它的演进和黄叔之前的一个思考有点重叠但又有所不同:
**通用Agent正在吃掉更多的AI应用,但ChatCut尝试做通用Agent背后的专业执行层。**
回看ChatCut的演进,让我意外的是,ChatCut越做越强的背后,任务的第一入口却越来越不只在自己的界面里。

真正能确认的产品起点,在 2025 年 2 月。
产品灵感更早。李凯文在 1 月 26 日发布的「十字路口」访谈(06:42)里回忆,ChatGPT 刚出现时,他用完这个“未来工具”,又回到 Premiere 剪片,强烈感到两个时代正在交接,于是萌生了“用聊天剪视频”的想法。但这是创始人对构思起点的回忆;公开画面能够验证的产品起点,仍是 2025 年 2 月的内测界面。
Kaiwen的过往职业:VICE、Discovery广告纪录片导演,短片《猎种》入围金马奖,下意识的判断也是ChatCut的起点!
Kaiwen 当时讲的不是“人人都能生成大片”,而是一个非常苦的工作:
纪录片、真人秀和播客有大量采访,导演要先扒文字稿,再找金句、调整顺序,最后组织成故事。
所以ChatCut 1.0 的界面很克制。左边是 **Bin Viewer,右边是 PaperCut**。用户在源文稿里选句、标记、划除、排序,视频跟着文字变化。做完以后,还可以导出 Premiere 和 DaVinci Resolve XML,回到专业软件继续精修。

这一步很聪明:只拿下导演最熟悉、最费脑、最重复的采访粗剪。
到 2025 年 9 月,ChatCut 从“用文字剪视频”变成了“让剪辑像聊天”。
演示里,用户一次导入三段长视频,直接描述故事结构:
先让三个人报名字,再介绍背景,最后分别进入人物故事。AI 返回计划,把 9 个片段写入时间线。用户再说“找到 Fares 谈母亲的部分,放到结尾”,系统继续搜索、插入,并播放验证。

变化在于:**早期的文字只是素材的可编辑视图,现在语言开始承担规划、搜索和调用职责。**
但聊天框没有替代编辑器。文字稿、时间线、拖拽、字幕、音频和 XML 仍在。
对话负责表达意图,编辑器负责暴露状态,人负责验证和精修。
李凯文的解释很朴素:视频过去本来就是“通过聊天剪出来的”。客户提出这段前置、那段删除、这里加音乐,剪辑师再翻译成时间线操作。
**ChatCut 只是把散落在微信、会议和脑子里的协作关系,变成软件能力。**
他也明确说,Premiere、Final Cut、DaVinci 和剪映的编辑器形态已经被长期打磨,重复造一个表面不同的轮子价值不大。**AI 更该解决的,是编辑器上方那个理解意图、组织工作流的思维层**。
从剪辑“减法”跨到生成“加法”
2025 年 11 月,ChatCut 发布 AI 生成 MG 的 First Look,宣称用户可以用自然语言或数据生成标题卡、动态图表等新视觉。产品方向由此从重组已有素材,跨到生成新画面;
前段时间很火的HyperFrame,其实就是这个路数,这个整合在Codex里的插件,也火了一阵!

从聊天式工具升级成会自己找路的 Agent
真正的分水岭出现在 2026 年 2 月。ChatCut 正式使用“**通用剪辑 Agent**”这个定位。
录屏里,它直接抓取 YouTube 失败后改用 media downloader,再抽帧、读逐字稿、抓网页、分析风格、制定分镜、生成素材,最后写回时间线。

这个失败细节比顺滑的宣传片更有价值:软件不再等用户点按钮,**Agent 要围绕目标拆步骤、选工具、处理失败,再交付一个可继续编辑的工程**。
1 月访谈里,李凯文说下一步要把剪辑师的工作拆成 Agent 流程,用 checklist 和 common sense 约束过程。2 月演示与此一致,也是本次样本中第一次出现**可见的任务规划**。
这也是模型能力/Agent进化给大家带来的启示,Agent似乎可以开始完成一个多步骤任务了。
2026 年 7 月,在 Codex × ChatCut 的演示里,用户先在 Codex 输入目标;Codex 展示内容和剪辑判断,并通过 ChatCut workflow 把切点、MG、音乐和音效写进时间线。
在 ChatGPT × ChatCut 的演示里,用户直接附上视频并 @ChatCut,右边仍是 ChatCut 的素材库、预览器和完整多轨时间线。
专业界面没有消失。通用 Agent 接过“我要做什么”的入口,ChatCut 负责把它变成可检查、可修改的视频工程。


从产品动作看,黄叔的判断是:
ChatCut 正在放下“用户必须先来到我的产品里”这个前提。
**它不一定非要成为视频领域的 ChatGPT,也可以成为 ChatGPT、Codex 背后的视频操作系统。**
这件事情非常有意思,甚至一度让我想起了Monica,也是植入到巨大的浏览器场景里,如果未来是Agent时代,ChatCut有没有可能也进入到Agent场景里呢?
不过这个入口的变化,不一定能打开专业剪辑师的迁移,但从最近看到的大量用户自传播里,包括黄叔自己的体验里,通过Agent完成视频剪辑包装,普通人是非常有需求的。
甚至说,我连剪映都不想打开!**除非剪映也出了Agent**。
在 PaperCut、对话剪辑、通用 Agent 和 Codex/GPT 演示中,**结果都回到了可见的文稿或时间线状态**。
这件事情很有意思,因为剪辑是一个创作者需要对结果验证的任务,需要系统给一个可后续编辑的状态。
语言负责控制,专业系统负责保存状态。
用户敢让 Agent 先跑,是因为需要时仍能看见时间线、修改字幕、替换音乐,或者把工程交回专业后期。

李凯文在访谈里给过一个很准确的取舍:如果 AI 能做到 80%,但给人留下修改空间,和做到 90%、却不让人改相比,他宁愿选择前者。
专业软件的第一入口被通用 Agent 分流,不等于专业能力正在失去价值。Agent 承接的任务越复杂,背后越需要一个可靠、透明、可编辑、可交接的执行层。完整的失败恢复能力,则还需要单独验证。
除非,Agent能实现接近100%的成功率,让用户多次信任后可以放弃打开时间线去亲自验证。
当然,让出入口也有代价。如果用户只记得“我在 ChatGPT 里剪了视频”,不记得背后的 ChatCut,用户关系、品牌心智和议价权都可能被通用 Agent 拿走。
所以 ChatCut 接下来真正要证明的,不是还能接入多少热门模型,而是它能不能比其他执行层更可靠、更可控、更懂工程。

绝大部分的工作,通过在Codex里对话就完成了,包括剪辑/字幕/音效/BGM,这些是我这种此前需要在剪映里花40分钟才能完成的工作,很简单在Codex里Chat几次就完成了,特别惊喜。
当然,剪辑出来的气口还是会有一点瑕疵,以及部分转写文字比如Agent识别成A卷,还是需要我手动过一遍。
不过,根据我看其他博主的教程,这是有办法进一步优化的。
整体也免费,因为我没有使用更多ChatCut本身的生成能力,ChatCut估计也自己承担了语音转写的成本,总之是让我兴奋的一次尝试。
一个 ChatCut,当然还不能代表所有专业软件。但它用一年半走出了一条很完整的路径:文字先成为素材的新视图,语言再成为任务的控制面,最后又成为通用 Agent 调用专业能力的Skill。
所以真正会消失的,可能不是 Premiere、After Effects 或 ChatCut。会消失的,是那个必须先找到软件图标、理解界面、学会菜单,才能开始工作的旧入口。
下一代专业软件,未必每天被人打开。但每一次复杂任务真正落地,都可能在背后经过它。
Agent时代挺有意思的一个范本,大家怎么看?
**访谈来源:**视频剪辑的「Cursor 时刻」来了?|对谈 ChatCut 创始人李凯文,十字路口Crossing,2026 年 1 月 26 日发布。
访谈关键时间码:06:42(产品灵感)、30:03(编辑器上层)、38:55(目标用户转向)、51:46(80% 可修改)。
**产品演示:**2025-02 口述剪辑起点;2025-09 对话剪辑;2025-11 MG First Look;2026-02 通用剪辑 Agent;2026-07 Codex × ChatCut;2026-07 ChatGPT × ChatCut。
<br>
图片口径:六张界面图均截自 Kaiwen Li 的公开产品演示视频,保留原始平台和作者水印。它们用于说明当时公开展示的产品界面,不等同于对性能、成功率或商业采用的独立复现。
- * *
本文由 YouMind 自动从 Markdown 转换排版。