
vivo AI Lab 团队 投稿 量子位 | 公众号 QbitAI南昌家具封边胶厂
近年来,生成模型在"从到有"成像素上进展飞速,但真实的创作还有另半问题:素材已经拍好了,怎么剪成条能交付的片子。
选哪几段、留多长、怎么排、怎么卡点,成片得卡在目标时长内,指定的镜头不能丢,画面还要踩上音乐的节奏。在动手渲染之前,先得解决的其实是这道约束规划题。
目前的主流做法,是把闭源前沿大模型套上提示词、包进手工搭建的流程里充当剪辑大脑——个不可训练的 workflow 式智能体。
它的短板很直接:决策策略被冻结在提示词里;成本、延迟和隐私都拴在闭源 API 上;同份诉求每次剪出来都不样。而手机厂商需要的,是个能在手机上本地运行、还能持续学习的小型剪辑智能体。
针对这问题,vivo AI Lab 和香港中文大学(圳)的研究团队提出了 RefineCut 框架:把剪辑做成个闭环——模型步步修改剪辑案,个确定验证器(verifier)当场逐条分,训练所需的全部信号都来自这个验证器。经过多教师蒸馏与偏好优化两阶段训练,8B 规模的开源模型在相同的闭环协议下反了其中两位教师,追平强的 DeepSeek-V4-Pro。该工作已被 EMNLP 2026 主会(Main Conference)接收。
△隐式的提示词决策,变成份可以逐条检查的显式剪辑计划。
核心思路:让剪辑计划成为"可以被检查"的对象
RefineCut 的出发点,是剪辑这件事的个特殊质:虽然没有唯正确答案,但个剪辑计划不格,是可以被客观检查的。
围绕这点,系统把剪辑改写成个标准的智能体问题——任务规范、动作、反馈,各有明确定义:
约束账本(constraint ledger):任务的显式规范——把每份自然语言诉求翻译成组机器可逐条核对的约束:目标时长、保镜头、禁用素材、音乐对齐要求;
RefinePatch:智能体的结构化动作空间——规划器不整段重写案,而是在类型化时间线上做小步修改,每步改了什么都有迹可查;
确定验证器:环境反馈的来源——把每个修改应用到时间线上、对照账本逐条判定,并汇总为量化总分 VES(论文中为 0 – 1 分值,本文统换成百分制)。
这套设定的关键在于:验证器输出的是确定、可复核的信号,相当于给剪辑这个创作任务配上了大模型后训练中广受关注的"可验证励"。接下来的训练分两步。
法:个验证器,串起数据、训练与部署
△ RefineCut 整体框架:(A)任务与多教师轨迹,(B)验证器回放蒸馏与自我进化训练,(C)闭环剪辑智能体。
起点:批昂贵但含噪的教师轨迹
团队先让 GPT-5.4、Qwen3-Max、DeepSeek-V4-Pro 三个前沿模型在数千个任务上闭环作业——读状态、出补丁、收反馈南昌家具封边胶厂,积累了近 5900 段教师轨迹、13800 余次前沿模型修复调用。但这批数据没法直接学:三教师模型的输出格式与分支结构互不致,各自好的分支也大多只是局部修复而非完整案。论文实测,直接模仿这批轨迹只能把模型从 59.4 分带到 62.0 分,与不训练相比几乎没有变化。
验证器回放蒸馏:老师的答案,先验过再学
阶段训练因此不模仿教师,而是把全部候选分支逐放回验证器"重放":规范化、应用到真实剪辑状态、逐条对照账本分——这步做的其实就是拒采样,以验证器为准绳,只留优修复作为训练数据。提纯后的训练集只剩原来的三分之(3317 条对 9690 条),同个模型却直接升到 85.8 分。
RefineCut-Evo:不再需要老师的自我进化
二阶段离开教师:模型自己生成候选修复,由验证器分,再用套任务准则(rubric)细化分差,只保留分差足够大的置信偏好对(终 779 对)做 DPO 偏好优化,把成绩到 92.4 分。训练完成后,它在理时就是个纯本地的剪辑智能体——读取当前时间线和尚未满足的账本条目,输出个 RefinePatch,验证器当场应用并重,至多迭代三步,平均每个任务 11.7 秒,全程没有次外部大模型调用。
RefineCut-Bench:给剪辑决策层个公开基准
由于此前不存在面向剪辑决策层的公开基准,团队把任务、素材与验证协议并整理成 RefineCut-Bench:3578 个剪辑任务、7971 个带结构化描述的素材片段、499 条音乐轨道,每个任务附显式约束账本,训练 / 开发 / 测试按任务记录切分,所有法在同套规则下对比。
△ RefineCut-Bench 览:素材库、任务分类、约束分布、多教师轨迹与评测协议。
实验结果
同闭环下与前沿模型直接对比
能说明问题的对比,是让三位教师在与学生相同的状态、账本、接口和停止规则下亲自下场。RefineCut-Evo 拿到 92.4 分,万能胶厂家于 GPT-5.4 的 89.3 分和 Qwen3-Max 的 77.3 分,与强的 DeepSeek-V4-Pro(93.6 分)几乎不相上下,而它是其中唯跑在本地的 8B 模型。
△同闭环协议下的对比:教师模型、未训练 8B 与 RefineCut-Evo(VES 为百分制,满分 100)
研究团队还门检验了"只靠提示技巧行不行":同个不训练的 8B 基座,直接提示只有 50.2 分,加上验证器反馈迭代到 59.2 分,让验证器在 4 个候选里挑好的也只到 70.0 分;哪怕把这些法每个任务碰到过的好结果单挑出来分,也只有 71.2 分,离训练后的 92.4 分还差大截。
训练各阶段的贡献
拆开训练过程看,大的步来自验证器回放蒸馏:62.0 分到 85.8 分,步涨了 23.8 分;偏好训练在此之上进到 86.4 分,Evo 自进化收在 92.4 分。
△训练各阶段在 Common-100 上的成绩(VES 百分制)
△训练阶段进:验证器回放蒸馏贡献大单步提升(62.0 → 85.8 分),Evo 将成绩至 92.4 分。
消融实验进步定位了 Evo 的增益来源:仅用验证器给偏好对分已经能到 90.9 分,任务准则的细化分差在此之上还能再涨点;反过来,不做分差过滤、什么样的偏好对都往里放,成绩明显回落。进哪些样本,比分数怎么影响大,这与蒸馏阶段"三分之的数据反而好"的现象是致的。
跨模型族的迁移
同套流程在 Llama-3.1-8B 和 GLM-4-9B 上原样重复:原始模仿在两个族上持平甚至倒退(− 7.0 分、− 3.6 分),回放蒸馏则把每个族都稳定拉起(+15.3 分、+7.9 分),三个族的保镜头召回分别到 98、92 与 99,此前低只有 39。验证器带来的收益并不绑定某个基座。
△跨基座迁移:验证器回放蒸馏在三个模型族上的结果(VES 百分制)
渲染盲测与剪辑行为
自动指标之外,团队把成片渲染出来请人盲选:三位标注者对随机乱左右顺序的 150 组 A/B 预览逐比较,Evo 对上阶段的偏好训练模型(Mixed-Pref)拿下 100 胜、34 平、16 负,偏好率 78,标注者之间的判断也相当致,与自动指标的排序相符。剪辑行为上,它平均每个任务只动 1.76 次修改(提示基线为 2.72 次),操作少(3.77 对 5.95),从不引用不存在的素材;100 个任务里次格的案从上阶段的 74 个增加到 91 个,此前常见的失败——时长不达标——从 16 例降到 1 例。
△失败构成变化:次格的计划从 74 个增至 91 个,时长不达标从 16 例降至 1 例。
局限与未来向
论文也把边界写得很清楚:VES 由训练所用的同验证器定义,是协议内的分数,渲染后的观感好不好还得靠立评测,所以才有上面的盲测;规划器读到的是素材描述与元数据而不是原始像素,上游描述的质量会给成片设上限;偏好训练阶段目前只在 Qwen 基座上完成。下步计划包括:面向真实用户的自由格式需求、长篇幅的成片、多素材域,以及把感知端并纳入训练闭环。
总结与展望
回头看,RefineCut 依赖的其实是件事:当任务的结果存在可执行的规范时,确定验证器就能接过人工标注和学习型评委的工作——先筛掉教师数据里的噪声,再给模型自己的输出分,不依赖任何人工标签。它也把"可验证励"这条在数学、代码任务上得到验证的训练路线,延伸到了剪辑这样的创作型智能体任务上。
放回真实场景,移动影像已经是大众创作的主要式,"相册键成片""智能 vlog 剪辑"这类体验的瓶颈,就在 RefineCut 所处的决策层:在用户的时长、内容与配乐约束下,给出份可以执行、也经得起检查的剪辑计划,相当于手机创作智能体的"大脑"。这些场景没法依赖云端 API:模型要能在手机上跑,同样的输入要给出同样的结果——这也是 vivo 蓝心大模型直在进的端侧路线。
论文标题:Plans You Can Check: Verifier-Grounded Learning of an Open-Weight Planner for Executable Video-Editing 收录信息:EMNLP 2026 主会(Main Conference) 论文地址:https://arxiv.org/abs/2608.25622
键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!相关词条:不锈钢保温施工 塑料管材生产线 钢绞线厂家 玻璃棉板 泡沫板橡塑板专用胶
奥力斯 泡沫板橡塑板专用胶报价 联系人:王经理 手机:18232851235(微信同号) 地址:河北省任丘市北辛庄乡南代河工业区
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定南昌家具封边胶厂,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。
