标签:# DocJev

秒级切分混合文档流:Jerry Liu 开源 DocJev 的离散裁决架构与边界评测实录

在当下的企业级知识库、智能问答(RAG)、财务票据审核与合同生命周期管理流水线中,非结构化文档的摄取(Ingestion)往往是整个系统最脆弱的阿喀琉斯之踵。现实世界中的文档流绝少以“一份文件一页 PDF”的理想形态出现,企业日常接收到的通常是一个数十甚至上百页的 “混合数据包”(Packet)——例如一次性扫描交付的文件袋中,前两页是 IRS Form 1040 税表,紧接着是两份属于不同交易的财政部拍卖结果,其后又附带一份长达十页且充斥密集统计图表的经济分析公报,最后以两页公共安全指南收尾。

面对这种高度杂糅的文档流,传统的工程方案往往直接调用大型自回归语言模型(如 GPT-4o 或 Claude 3.5 Sonnet)进行长上下文抽取与切分。然而,这种“大模型一把抓”的范式不仅带来了动辄 1.5 到 2 秒的漫长等待与高昂的 Token 账单,更深陷“同类相邻单据粘连”与“公文附件过度切割”的逻辑死角。近日,知名开源数据框架 LlamaIndex 创始人 Jerry Liu 正式开源了全新项目 DocJev(jerryjliu/docjev)。该项目依托 TypeSafe Jev 毫秒级非自回归决策引擎,结合本地零成本解析 LiteParse 与自适应云端 LlamaParse,在 40 份真实美国政府公文的严苛基准下,以 138ms 分类、209ms 切分 的惊艳速度打破了传统 LLM 的性能天花板。