让两千年的文字活过来:深度拆解《史记》知识库 —— 从 57 万字古籍到 Agentic Ontology 知识图谱新范式(附 103 个 SKILL 与智能体演化实践)

让两千年的文字活过来:深度拆解《史记》知识库 —— 从 57 万字古籍到 Agentic Ontology 知识图谱新范式(附 103 个 SKILL 与智能体演化实践)

两千年来,历代学者读《史记》,靠的是案头批注、朱砂圈点与皓首穷经的线索考据;然而面对五十七万字、跨越三千年的皇皇巨著,人脑在处理上万名历史人物、数千场战争会盟与盘根错节的世系传承时,天然存在着记忆碎片化与线性阅读的认知天花板。

近期,由知名知识工程学者鲍捷博士(W3C OWL 2 工作组成员、原文因互联 CEO)主导的开源数字人文里程碑项目 baojie/shiji-kb(史记知识库)引发了学术界与开源社区的巨大轰动:它通过 LLM Agent 与可复用的领域技能(Skills),将《史记》全本 130 篇、57.7 万字完整转化为包含 14,065 个实体、126,441 次标注、3,198 个历史事件与 20,830+ 维基页面的高精度交互式知识图谱。

更具范式革命意义的是,该项目提出了颠覆传统知识工程的 Agentic Ontology(智能体本体论) 新范式,并通过完全由自主 AI Agent(Butler)自驱进化的“三层反思机制”,彻底打破了从 2001 年语义网诞生以来本体构建高成本、不可扩展的“专家手工地狱”。


一、 范式跃迁:2001 传统本体 vs 2026 Agentic Ontology

在计算机科学与人工智能领域,本体(Ontology) 是对特定领域概念及关系的结构化、形式化表达。

回顾过去四分之一个世纪,知识工程经历了从“专家自上而下设计”到“大模型自下而上涌现”的彻底范式转移:

flowchart LR
    subgraph Traditional2001["传统本体工程 (2001 Protégé 范式)"]
        direction TB
        E1["领域专家 + 知识工程师"] --> E2["手工草拟概念层级 (Top-Down)"]
        E2 --> E3["Protégé 手动输入 OWL/RDF"]
        E3 --> E4["人工校验与极慢迭代 (数月一轮)"]
        E4 --> E5["❌ 瓶颈:设计本体极其昂贵且规模受限"]
    end

    subgraph Agentic2026["Agentic Ontology (2026 智能体范式)"]
        direction TB
        A1["原始多源语料 (57 万字古籍)"] --> A2["AI Agent 抽取并构建初步概念 (Bottom-Up)"]
        A2 --> A3["图式涌现 + 自动化五级质量评估"]
        A3 --> A4["多层反思自愈环 (Agent Reflection Loop)"]
        A4 --> A5["✅ 瓶颈转移:设计已自动化,核心在进化与校准"]
    end

核心代际差异对照

维度 传统本体构建(2001 年经典) Agentic Ontology(2026 年新范式)
理论基石 Noy & McGuinness 经典本体设计手册 Agent 结构化交互与动态反思自举
起点与路径 专家在空白的 Protégé 编辑器中自上而下设计 AI Agent 从原始语料中自下而上提取涌现
构建主体 极度依赖昂贵的领域资深专家与知识工程师 LLM 驱动的多专门化 Agent 集群(Butler)
规模量级 数十个类、数百个实例(难以逾越千级门槛) 数千个类、数万个实体、百万级知识单元
迭代周期 数周甚至数月完成一轮小范围 Schema 修正 数小时一轮全量重构,12,000+ 轮自动化演进
工程核心瓶颈 如何设计(Design)合理的顶层本体 如何反思与进化(Reflect & Evolve)涌现出的本体

[!IMPORTANT]
Agentic Ontology 的本质转变:本体不再是专家预先规划好的“僵死建筑蓝图”,而是从海量真实语料中自然萌发、再由自主智能体与人类校验规则共同持续修剪、校准的有机生命体


二、 四层语义递进模型与九步 AI 管线

处理古代汉语典籍,最忌讳的是“拿着 Prompt 盲目直接扔给大模型做端到端问答”——古籍中存在大量的词类活用、假借通假、隐性指代、同名异人、在位纪年折算,端到端直接生成的幻觉率通常高达 40% 以上。

鲍捷团队在项目中确立了极其严密的四层语义递进模型(Four-Layer Semantic Progression)

flowchart TD
    L1["<b>第一层:结构语义 (Structural Semantics)</b><br/>解决文本物理组织与段落引证<br/>校勘定本 · 切分段落 · Purple Numbers 编址 · 句间关系识别 · 三家注对齐"]
    --> L2["<b>第二层:图谱语义 (Graph Semantics)</b><br/>解决主体、时空与事件链路<br/>22 类实体识别 · 别名消歧 · 3,198 历史事件 · 98.7% 公元纪年映射 · 9 种关系提取"]
    --> L3["<b>第三层:知识语义 (Knowledge Semantics)</b><br/>解决概念抽象与知识单元化<br/>概念分类树 · OWL/RDF 本体构建 · 规则推理 · 知识单元化 (Factual / Procedural / Relational SKU)"]
    --> L4["<b>第四层:应用语义 (Application Semantics)</b><br/>解决历史规律归纳与终极洞见<br/>跨 130 篇矛盾检测 · 史源溯源推演 · 经济学/社会网络分析 · 史记地铁图"]

九步 Agent 并行流水线

在实际执行层,整个知识库的构建被拆解为严格依赖且支持并行分发的九步管线:

01 校勘 ──→ 02 结构分析 ──→ 03 实体构建
                              │
             ┌────────────────┼────────────────┐
             ▼                ▼                ▼
         04 事件构建      05 关系构建      06 本体构建
             │                │                │
             └────────────────┼────────────────┘
                              ▼
                         07 逻辑推理 ──→ 08 SKU 构造 ──→ 09 应用构造
  1. 古籍校勘(Collation):跨中华书局、武英殿本等多版本比对,生成基准机器定本;
  2. 结构分析(Structural Analysis):段落粒度精确切分,引入道格·恩格尔巴特(Doug Engelbart)的 Purple Numbers 永久段落寻址锚点;
  3. 实体构建(Entity Construction):覆盖 18 类名词(人名、地名、官职、邦国、天文等)与 4 类动词(军事、刑罚、政治、经济)的 22 类细粒度 NER 标注;
  4. 事件构建(Event Construction):将史书流水账抽取为标准五元组 (时间, 地点, 主体, 动作, 客体),并将古籍年号/王纪年通过多轮反思严密对齐为公元绝对年;
  5. 关系构建(Relationship Extraction):因果、从属、亲属、对抗等 9 种确定性关系三元组沉淀;
  6. 本体构建(Ontology Induction):实体词表归一化,自底向上提炼概念树;
  7. 逻辑推理(Logical Reasoning):通过跨篇交叉验证检测年代逻辑矛盾、血缘代际矛盾与战损矛盾;
  8. 知识单元(SKU Construction):将零散图谱打包为高聚合的知识资产(事实型、过程型、关系型);
  9. 应用呈现(Application Delivery):驱动语义高亮阅读器、130 条史记地铁图(Metro Map)与自主维基。

三、 为什么是“SKILL 文档”而非“写死代码”?

在整个工程中,团队没有为核心抽取流程写过一行死板的传统 if-else 或正则表达式代码,而是将其全部沉淀为 103 个高度工程化的 SKILL 文档(包括 14 个元技能 Meta-skills 与 89 个管线技能 Pipeline-skills,整理成了厚达 863 页的开源著作)。

这背后包含着深刻的软件工程与认知科学考量:

flowchart TD
    subgraph WhySkills["为什么选用 SKILL 规范取代硬编码?"]
        direction TB
        K1["<b>1. 柔性与即时适应 (Flexibility)</b><br/>发现『单锚点塌缩』等新错误模式,只需在 Markdown 中增补一条规约,后续章节自动免疫,零重构代价"]
        K2["<b>2. 跨学科可读性 (Readability)</b><br/>历史学家无需学 Python/C++ 即可阅读 26 条年代反思逻辑,直接在 GitHub PR 中挑战和修正史学规则"]
        K3["<b>3. 跨古籍无缝迁移 (Generalizability)</b><br/>一套成熟的《史记》NER 与消歧技能,只需微调制度映射,即可零摩擦复用到《汉书》《后汉书》《资治通鉴》"]
        K4["<b>4. 自举演化闭环 (Self-Bootstrapping)</b><br/>从名家考据著作学习溯源方法 → 提炼成 SKILL → 分析新案例发现新范式 → 回写升级 SKILL"]
    end

[!TIP]
真实案例:处理战国年代,秦国使用“昭襄王某年”、赵国使用“赵惠文王某年”。用传统代码处理多国纪年换算需要编写极其庞大脆弱的表查找;而通过年代推断 SKILL,AI 可以结合上下文中的“秦赵会于渑池”等全书同步事件锚点,实现模糊约束求解与自动双向纠偏。


四、 Butler 智能体:12,000+ 轮三层反思演进机制

数据规模庞大时,单纯依靠人工修正无异于杯水车薪。shiji-kb 的 20,830 个维基页面完全由名为 Butler 的后台自主 AI Agent 进行自动化轮巡维护。

Butler 具备标准的操作原子(新建 Stub、扩写 Premium 精品页、引文溯源核验、死链修复、地名地图裁剪),并内嵌了三层递进反思机制

sequenceDiagram
    autonumber
    participant B as Butler 智能体
    participant W as 知识库维基
    participant R as 三层反思引擎

    loop 持续自治运维
        B->>W: 执行原子操作 (新建词条 / 引文核验 / 地名配图)
        Note over B,R: 每 20 步 Action 触发
        B->>R: W5 流程反思 (识别系统性操作卡点与重复劳动)
        R-->>B: 修订操作指令规则
        Note over B,R: 每完成 6 个页面 (3精品+3存根)
        B->>R: W9 图式反思 (归纳页面布局共性模式)
        R-->>B: 固化为全新类型页面模板 (Schema Template)
        Note over B,R: 每 10 轮迭代
        B->>R: W11 类型审计 (全库扫描错误分类与知识分布倾斜)
        R-->>B: 输出审计报告,自动下发批量修正任务
    end

反思闭环的质量收敛实证

以极其硬核的**事件年代反思(Event Chronology Reflection)**为例,多轮 Agent 迭代带来了惊人的确定性收敛曲线:

第 1 轮反思:修正 1,010 处 (解决系统性纪年偏差,沉淀 26 种错误模式)
    ↓ (-57%)
第 2 轮反思:修正 431 处  (精细化上下文年数调校)
    ↓ (-8%)
第 3 轮反思:修正 465 处  (发现新类型错误模式:改元与跨年逾期)
    ↓ (-64%)
第 4 轮反思:修正 167 处  (终态验证,仅 9% 为实质年份修正)
    ↓ (-72%)
第 5 轮反思:修正 21 处   (跨 130 篇强收敛,全书年代逻辑闭环)

成本效益对比

  • 传统专家人工标注:57.7 万字全本精细考据,至少需要 3~5 位历史学文献博士耗时 6~12 个月,人力成本数十万元;
  • Agentic 反思流水线:90% 准确率初始标注 + 5 轮深度反思迭代,总耗时 5 天,Token 计算成本仅约 200 元

五、 机器看见的隐秘真相:史源推理与跨章矛盾洞见

当知识被充分图谱化后,计算机不再只是检索器,而化身为具备跨时空穿透力的**“数字考据侦探”**。项目在 labs/ 实验室中产出了一系列令人拍案叫绝的实证推演:

1. 长平之战的财政极限计算:为什么赵孝成王必须换下廉颇?

  • 传统历史叙事:通常归咎于赵王昏庸、听信秦国反间计、“纸上谈兵”换上赵括;
  • 知识库量化推演:图谱提取长平前线赵军 45 万人、民夫 20 万人的日粮消耗,对齐战国晚期邯郸至长平(上党)250 公里太行山道崎岖运粮损耗(运 1 斛粮到前线需沿途吃掉 3~4 斛);
  • 结论:对峙三年,赵国国库与民间存粮已彻底见底,廉颇“固守待变”在战术上正确,但在国家财政上已是必死僵局。赵王换赵括孤注一掷寻求决战,是濒临经济崩溃边缘的唯一赌博选择。

2. 冯谖“烧券买义”的战国微观经济学

  • 首次从现代资产负债表与风险投资角度解构孟尝君的“薛地放贷”:
    • 封君贷款给领地农民的实际年化利率估算(高达 20%~30%);
    • 3000 金的坏账资产证券化分析;
    • 冯谖通过公开焚烧无法收回的死账债券,实际上是以极小的沉没成本(Sunk Cost),为孟尝君买下了日后失势避难不可动摇的政治期权与领地忠诚(Call Option)。

3. 沙丘之谋的四层传播链溯源

  • 司马迁如何得知前 210 年沙丘行宫中赵高、李斯、胡亥三人极度私密的密谋对话?
  • 实验室通过 NLP 文本风格与史料互参,拆解出百年来官方秦廷档案、楚汉之际儒生加工、西汉民间野史叙事的层叠沉积,还原了太史公“采风存疑”的叙事重构技术。

六、 本地部署与极速体验

你可以直接通过全球 CDN 访问官方阅读器,或在本地极速启动全功能维基:

1. 在线直接体验

2. 本地部署全量知识库与 Wiki

# 1. 克隆知识库源码仓库
git clone https://github.com/baojie/shiji-kb.git
cd shiji-kb

# 2. 安装 Python 基础依赖
pip3 install -r requirements.txt

# 3. 启动本地高性能 Wiki 服务
python3 wiki/server/serve.py wiki/public 8000

启动完成后,在浏览器访问 http://localhost:8000 即可浏览 20,000+ 篇互联维基与地铁图谱。


七、 总结与启示:古籍数字化通往 30 亿字星辰大海

鲍捷博士的 shiji-kb 不仅是《史记》研究的瑰宝,更是整个数字人文(Digital Humanities)领域的标杆灯塔。

它向我们证明了:

  1. 大语言模型最深层的价值,不仅在于即兴聊天,更在于充当严肃知识工程中廉价而不知疲倦的微观标注者与宏观推演者
  2. “提示词/SKILL 工程化”构成了全新时代的人机协作协议,让领域专家与人工智能在透明、可读、可进化的框架下协同自举;
  3. 从 60 万字的《史记》,到 4000 万字的《二十六史》,再到 30 亿字规模的《四库全书》与佛道典籍,一条由 AI Agent 驱动、成本呈指数级降低的古典文明知识数字化基础设施之路,已经清晰地展现在我们眼前。