标签:# 音视频工程

将 4500 万 Token 压缩至 12KB:video-use 如何用“读文本 + 按需波形”终结多模态视频剪辑的算力黑洞

在多模态大模型席卷视频领域的浪潮中,绝大多数开发者试图将整段 1080p 原始素材以每秒数帧的密度切碎,暴力灌入超长上下文大模型进行剪辑分析。一段短短 10 分钟的多机位素材,动辄包含 18,000 帧画面,哪怕按极低分辨率压缩,也会消耗超过 2,700 万到 4,500 万的 Token 吞吐;随之而来的不仅是高昂的推理账单和漫长的网络等待,更有大模型在毫秒级时序定位上的幻觉与灾难性误差。

开源项目 browser-use/video-use 给出了颠覆性的架构解法:“大模型根本不应该‘看’视频,而应该‘读’视频。” 借鉴了 browser-use 用轻量 DOM 树替代高昂屏幕截图的降维思想,video-use 通过高精度语音转录与按需视觉合成,将 1 小时的多机位素材压缩为仅 12KB 的紧凑 Markdown,配合确定性 EDL 状态机、多引擎动画并行编排以及严格的音视频自检闭环,让 Claude Code、Codex 等通用代码 Agent 拥有了专业级视频剪辑与工业级交付能力。