EO里的 Entity ID 归并,本质是把”官网/公众号/企查查/百科/抖音号”里长得不一样的同一家公司,在数学上合并成知识图谱里的一个节点,否则AI会把你拆成……
EO里的 Entity ID 归并,本质是把”官网/公众号/企查查/百科/抖音号”里长得不一样的同一家公司,在数学上合并成知识图谱里的一个节点,否则AI会把你拆成3个弱实体,权重互相稀释、事实各信各的。
一、归并的”双锚点”判定(确定性匹配优先)
大模型/知识图谱做 Entity Resolution 时,先走确定性锚点,命中即合并,不走概率:
- 第一锚点:统一社会信用代码(USCC)
企查查/天眼查/工商公示库里的 18 位代码是唯一主键。凡是同一 USCC 对应的”XX科技有限公司””XX科技””XX成都分公司”,一律判同一实体。这是最高权锚点,官网若没挂代码,靠名称相似度也归并不回来。
- 第二锚点:持久化 URI(JSON-LD
@id)官网首页 Organization 标记里的
"@id": "https://你的官网.com/#organization"就是你的 Entity ID。所有 Product/Person/FAQ 页用brand.@id回链它,AI 爬虫直接认领。 - 第三锚点(本地生活):地理坐标 + POI ID
高德/百度 POI 经纬度偏差<50m + 名称语义相似 → 归并门店实体。
锚点之间关系:USCC 管”法律主体同一”,
@id管”官网内节点同一”,POI 管”物理门店同一”。三者任一命中即合并,不要求全中。
二、非锚点字段的归并:别名词库 + 相似度阈值
没有 USCC 和 @id 的信源(未认证公众号、小红书、新闻稿),走概率匹配:
- 别名收敛(Canonicalization)
建一张”品牌同义词表”:全称 / 简称 / 英文名 / 常见错写 / 子品牌,全部
sameAs指向主 Entity ID。公众号叫”XX说”,官网叫”XX科技”,百科叫”XX科技有限公司”——在 JSON-LD 的sameAs和百科正文里互链,AI 才认得是同一家。 - 字段级相似度打分
名称用 Jaro-Winkler / 编辑距离,描述用 Embedding 余弦相似度,地址做行政区标准化。综合分 >0.85 合并,<0.6 拆开,中间地带进”待核验队列” 不收录(豆包工业实体逻辑就是这样)。
- 共现/共引消解
两处都提到”创始人张三+产品A+官网域名” → 上下文向量重合,辅助归并;只名字一样但旁边是”钢琴/朱利亚德” → 判不同实体,不合并。
三、跨信源归并时的冲突处理(归并不是覆盖)
归并到同一节点后,字段值打架按前面讲的优先级仲裁,但节点先合并、值后仲裁:
- USCC 相同 → 节点必并,成立时间以工商库为准,公众号写的作废
@id相同 → 官网内节点必并,FAQ 里写的价覆盖首页旧价(带时间戳者胜)- 同节点下多源给不同值 → 写进节点属性时带
provenance(出处)和confidence(置信度),不静默覆盖,RAG 生成时按置信度挑
四、你这种场景的具体归并链
未认证企业公众号 + 备案官网 + 企查查条目,正确归并姿势:
- 官网首页挂 Organization JSON-LD:
@id: [](@replace=10001),里面填 USCC、foundingDate、address、sameAs:[企查查URL, 公众号主页URL, 百度百科URL] - 企查查条目本身已有 USCC 节点,AI 把官网
@id和企查查 USCC 通过 USCC 字段对齐 → 两节点合并 - 未认证公众号:在公众号简介/菜单里放官网网址,且在官网
sameAs里反向列入公众号主页 → 靠sameAs边归并进主节点;公众号自身没 USCC 也没@id,不参与锚点判定,只做叶子信源 - 百度百科词条:正文写”XX公司(统一社会信用代码:91xxxx)”,参考资料链官网 → 百科节点并进来
归并成功后,AI 知识图谱里你只有一个节点,官网/公众号/百科/企查查是它的不同”发言通道”,不会再出现”公众号说2018、官网说2016″被当成两家公司的情况。
五、归并失败的典型信号(自查)
- 问豆包”XX公司成立时间”,它答完补一句”不同平台信息不一致” → 节点没并上或并上了但值冲突未仲裁
- 搜品牌名,AI 把”XX科技”和”XX网络科技”当成两个主体分别介绍 → USCC 或
@id没打通 - 公众号内容从未被 AI 引用过 → 没进
sameAs边,孤魂野鬼
要不要我给你一份官网 Organization JSON-LD 的字段模板(含 USCC、sameAs、公众号/百科/企查查回链写法),你直接填代码就能把多平台并成一个 Entity ID?
微信扫一扫
还没有评论呢,快来抢沙发~