标签:# Claude Code

将 4500 万 Token 压缩至 12KB:video-use 如何用“读文本 + 按需波形”终结多模态视频剪辑的算力黑洞

在多模态大模型席卷视频领域的浪潮中,绝大多数开发者试图将整段 1080p 原始素材以每秒数帧的密度切碎,暴力灌入超长上下文大模型进行剪辑分析。一段短短 10 分钟的多机位素材,动辄包含 18,000 帧画面,哪怕按极低分辨率压缩,也会消耗超过 2,700 万到 4,500 万的 Token 吞吐;随之而来的不仅是高昂的推理账单和漫长的网络等待,更有大模型在毫秒级时序定位上的幻觉与灾难性误差。

开源项目 browser-use/video-use 给出了颠覆性的架构解法:“大模型根本不应该‘看’视频,而应该‘读’视频。” 借鉴了 browser-use 用轻量 DOM 树替代高昂屏幕截图的降维思想,video-use 通过高精度语音转录与按需视觉合成,将 1 小时的多机位素材压缩为仅 12KB 的紧凑 Markdown,配合确定性 EDL 状态机、多引擎动画并行编排以及严格的音视频自检闭环,让 Claude Code、Codex 等通用代码 Agent 拥有了专业级视频剪辑与工业级交付能力。

69 场实战淬炼的 AI 求职兵工厂:ai-job-search 的双 Agent 互审、ATS 文本穿透与版面度量架构

在大模型技术重塑日常生产力的浪潮中,求职招聘领域正在经历一场隐秘而激烈的对抗博弈。一边是各大企业用 ATS(Applicant Tracking System,申请人追踪系统)与 AI 筛选器筑起的高耸自动化过滤网;另一边则是市面上形形色色的商业 SaaS,用雷同空洞的模板批量生成千篇一律的 AI 简历,沦为招聘方垃圾邮箱里的流水线废纸。

开源项目 MadsLorentzen/ai-job-search 走出了一条截然相反的硬核极客路线。它并非又一个在线 Web 封装,而是一套在本地机器上由 Claude Code(亦支持 Codex、Antigravity、Gemini CLI 等)原生编排的全栈端到端 AI 求职工程体系。

让 AI 彻底丢掉 Matplotlib 默认蓝:vivid-figures-skill 的 108 个科研配方与 Agent 闭环审图管线

如果你曾尝试让大语言模型(无论是 GPT-4o 还是 Claude 3.5 Sonnet)根据实验数据绘制科研图表,大概率体验过那种熟悉的“塑料感”与挫败感:

一敲回车,AI 熟练地掏出 Matplotlib 祖传的 tab10 默认配色(刺眼的亮蓝 #1f77b4 与土橙 #ff7f0e),画出粗糙的 72 DPI 位图;更致命的是,面对缺失的数据它会自作主张地凭空脑补置信带,或者在 10 英寸的大画布上随手设一个 9pt 字体——一旦插进 LaTeX 双栏论文,整个图表同比腰斩缩放,坐标轴上的数字瞬间缩小成辨认不清的“蚂蚁字”。

开源项目 vivid-figures-skill(生动数据图) 正是为此而生。它将原本在数学建模国赛与美赛(MCM/ICM)高强度实战中锤炼出的绘图体系,封装成了面向 Claude Code 等环境的原生 Agent Skill。它没有停留在简单的 Prompt 调教层面,而是构建了一整套包含 108 个生产级图表配方、双风格去指纹色彩体系、物理尺寸前置预计算与多模态闭环审图的严密工业级管线。

从 Git Worktree 隔离到多模型辩论:Paseo 如何用本地 Daemon 统一多 Agent 协同与跨端调度

随着 Claude Code、OpenAI Codex、GitHub Copilot CLI 以及各类基于 ACP(Agent Client Protocol)协议的自主编码代理相继进入开发者的日常流水线,一个极其尖锐的工程矛盾浮出水面:我们拥有了多个推理能力拔尖的“代码外脑”,但它们各自为政、互不相通,工作空间互相争抢,更无法在离开电脑时安全掌控。

开源编排框架 Paseo(getpaseo/paseo)以“本地常驻 Daemon 控制面”为核心,通过 Git Worktree 物理隔离、TweetNaCl 端到端加密中继,以及三大高阶协作技能(Handoff、Advisor 与 Committee),成功构建起跨桌面、手机端与 CLI 的统一多 Agent 协同体系。

让 AI 拥有原生品味:iOS & SwiftUI 开发的三大“神级” Agent Skills 深度实测与全景拆解

随着 Claude Code、Cursor、AGY 等 AI Coding Agent 成为移动端开发者的主力副驾驶,许多使用 SwiftUI 的独立开发者和 iOS 工程师都有一个共同的痛点:AI 写出的 Swift 代码,往往“充满了廉价的 AI 味”。

它可能会用早该扫进历史垃圾堆的过时 API、滥用庞大的计算属性将视图塞成千行单文件、在进入动画上机械地套用 ease-in 导致生硬顿挫、或者凭空捏造出一套充满网页套壳质感的粗糙 UI。

日前,推特博主 @limbopeng 分享了当前 iOS & SwiftUI 领域最值得关注的三个开源 Agent Skill 组合:

  1. Appllama/appllama-skills —— 让 AI 告别凭空想象,基于头部畅销 App 真实数据与原型展开设计;
  2. emilkowalski/skills —— 前 Vercel / Linear 设计工程师打造的动画与交互“审美天花板”;
  3. twostraws/SwiftUI-Agent-Skill —— 全球顶流 Swift 导师 Paul Hudson 沉淀数千小时实战经验的原生纠错引擎。

本文将为你深度拆解这三大核心技能背后的技术思想、避坑细则以及如何在终端中一键装配这套最强 iOS Agent 组合拳。

告别 PPT 式口播解说:开源神器 video-talkcraft 深度拆解 —— 字级人声对齐、七层反 PPT 镜头与 Remotion 工业级流水线

在当今的信息流与短视频生态中,“口播解说”与“知识科普” 是最受创作者欢迎的内容体裁。无论是技术博主复盘前沿架构、独立开发者讲解产品逻辑,还是出海团队制作本地化产品介绍,一段富有感染力的配音加上清晰的视觉演示,传播力远超纯文本。

然而,几乎所有尝试自制口播视频的朋友,都陷入过这三大“翻车陷阱”:

  1. 纯 AI 自动剪辑工具:丢入一段音频,AI 自动从免费素材库抓取风马牛不相及的空镜(说到“开源数据库”,画面出现一个外国人对着笔记本傻笑),文不对题,廉价感扑面而来;
  2. 纯数字人播报:一个仿真面孔木讷地对着镜头念稿,背景干瘪死板,观众看 5 秒就会产生严重的视觉疲劳并划走;
  3. PPT / 剪映手工堆砌:做一页 PPT 念一句,或者机械地“一句话弹一个图标”,满屏元素乱飞堆积,整条视频充斥着僵硬的“PPT 播放感”。

继专注于产品宣传片的 video-shotcraft 之后,作者再次开源了姊妹篇神作 —— video-talkcraft(Vincentwei1021/video-talkcraft)。它专攻人声驱动的解说与口播视频:给它一份口播稿和一条配音,它能在本地 CPU 逐字对齐时间戳(中位误差仅 20~40ms),利用 79 张动效配方卡 与 七层反 PPT 镜头系统,在 Remotion 中渲染出电影级的解说大片——所有画面重音、运镜、视差与音效,全部分毫不差地钉在人声节拍上!

把 Claude Code 变成动效工作室:开源神器 video-shotcraft 深度解析与 Remotion 电影级视频生产实战

对于独立开发者、开源作者和产品团队而言,“产品做得惊艳”与“产品展示得惊艳”同样至关重要。当你历经数月打磨出一款卓越的 Web 或桌面应用,准备在 Product Hunt、X (Twitter)、GitHub 或官网上线发布时,最令人头疼的一幕往往发生了:如何做出一支具备“顶级大厂质感”的宣传片?

现实中,绝大多数团队都会撞上三堵高墙:

  1. 纯手工录屏 + 剪辑:画面枯燥干瘪,平铺直叙,缺乏视觉层次与电影级运镜,无法抓住受众前 3 秒的注意力;
  2. 外包专业动效团队:在 After Effects / Cinema 4D 体系下制作一条 30 秒高品质宣传片,动辄耗费数周且报价几千到数万元,一旦产品界面微调,改版成本极高;
  3. 纯生成式 AI 视频模型(Sora、Runway、Kling):虽然能生成震撼的奇幻画面,但在面对 真实软件界面(UI) 时全线溃败——文字变形乱码、按钮扭曲走样、交互逻辑混乱、无法保证精准像素级呈现。

今天为大家深度解析一款近期在开发者与 AI Agent 圈掀起轰动的开源神作 —— video-shotcraft(Vincentwei1021/video-shotcraft)。它将 Claude Code / Codex 等编码 Agent 转化为全功能的动效电影工作室:只需将你的产品交给它,它便能基于 Remotion 自动化完成分镜、2.5D 运镜、素材切片、代码化动效编排与电影级音效(SFX)卡点,甚至一键导出为剪映(CapCut)原生分轨工程草稿!

解密 ego lite:人机协同的下一代 AI 浏览器与 Task Space 架构深度剖析

随着 Claude Code、Cursor、Codex 等 AI 智能体(Agent)深度介入日常开发,网页自动化(Browser Automation) 正在成为 AI 替人类完成信息检索、环境调试、表单填报与灰度验证的核心通道。

然而,现存的浏览器自动化方案几乎都让开发者感到痛苦不堪:

  • 抢夺焦点的“物理冲突”:传统的 Playwright、Puppeteer 或 Browser-Use 一旦启动,要么弹出一个狂闪的 Chromium 窗口强行抢占鼠标焦点,要么与开发者争抢同一个浏览器的活动标签页,导致人机根本无法协同;
  • 永远跨不过去的“登录态鸿沟”:无头模式下的浏览器永远是一张白纸,面对 GitHub、Google、Twitter 等现代网站的复杂 2FA 验证码,AI 智能体常常在第一道登录门禁前直接崩溃;
  • 单步 CLI Ping-Pong 的 Token 吞噬:传统工具往往强迫模型遵循“点一步 → 截一张图 → 读一次 DOM → 再点一步”的单步往返循环。一个稍微复杂的网页任务就要消耗上万 Token,耗时长达数分钟。

近期在开源社区备受瞩目的 citrolabs/ego-lite,给出了令人耳目一新的答案。

它并非简单的脚本包装库,而是一款从内核底层专为“人类与 AI 智能体并行协同(Work in Parallel)”设计的全新 Chromium 浏览器。

兄弟们一定要拥抱 AI

最近在新加坡体验特斯拉 Model Y 的自动驾驶功能——那种可以让车辆自行完成大部分行驶任务的技术。它给我的直觉印象是,AI 在各个行业里都扮演着类似的角色:为人类提供“辅助”,从而显著提升整体效率。

然而,人类社会的根基始终在于个人——没有任何系统或实体能够完全摆脱人的干预。真正决定人与人差距的,是谁能更快、更精准地完成同样的任务。早期有人担忧 AI 会“替代”程序员,甚至取代所有工作;但现实告诉我们:AI 目前并不能彻底消除人类的角色,它只是把曾经需要十个人协作完成的工作压缩到两三个人就能搞定。