O

Ontology Platform

Demo
8 Objects · 7 Links · 6 Actions
案例库/大规模文档知识图谱

大规模文档知识图谱

非结构化数据 / AI非结构化文档结构化为可问答的语义资产

官方声称官方事实模拟数据

Palantir 在 2026 年官方博客中演示了把 4000 万份文档结构化为代理式知识图谱:9.29 亿条边、10.8 分钟完成,600 道保留问题答对率 83.2%。该演示未指明客户,属于产品能力证明。本模拟复现这条流水线:从文档接入到实体消歧、图谱构建与保留问题验证。官方指标为产品演示数据;其余对象与计算结果为模拟数据。

来源与可信度

来源:Palantir 官方博客《Connecting Agents to Decisions》(2026) 产品能力演示(2026)

  • 官方声称「4000 万份文档、9.29 亿条边、10.8 分钟完成、600 道保留问题答对率 83.2%」为官方产品演示指标
  • 官方事实该演示未指明具体客户名称,属于产品能力证明而非客户案例
  • 模拟数据小批量下的实体数、消歧比例、耗时与准确率为按官方指标趋势外推的模拟数据
  1. 01

    文档接入

    非结构化数据进入本体

  2. 02

    解析抽取

    文档里挖出实体指称

  3. 03

    实体消歧

    把同一个实体合并到一处

  4. 04

    图谱构建

    实体簇之间连边

  5. 05

    索引

    让图谱可查询

  6. 06

    保留问题验证

    把 AI 输出钉在锚点上

    需人工审批

1. 文档接入非结构化数据进入本体

可单步查看

输入 / 上游数据

{
  "batchId": "BATCH-DEMO-001",
  "docs": "4000 万份",
  "source": "企业文档库(模拟)"
}

输出 / 本步产物

{
  "ingestedDocs": 40000000,
  "dedupSkipped": "已按内容哈希去重",
  "status": "已接入(模拟)"
}
本案例本体关系图
partOfmentionsresolvesToedgeFromedgeToquestionAboutansweredBy📄Document40,000,000 records📥IngestionBatch1,280 records🏷️ExtractedEntit…512,000,000 records🧬EntityCluster168,000,000 records🔗GraphEdge929,000,000 recordsRetentionQuest…600 records💬AnswerAttempt600 records
路径查找:选起点选终点
当前环节Object数据流

实现这一环需要什么能力?

数据工程师

批量接入 · 文档解析 · 去重与溯源

生产落地还需实现

配置批次水位、失败重跑与来源标记。

本环节可用操作

审计足迹

0

执行操作、审批或追踪路径后会在此留痕。