07 AI SourceLink 指标体系与评估框架

AI SourceLink 通过可观测指标、回复样本、来源引用、版本对照、站内行为与必要的人工评估,将“AI 是否正确使用企业官方信息”转化为可持续测量和治理的问题。

本词条描述指标设计原则、主要指标类别、自动观测与人工评估边界,以及如何通过指标形成治理反馈闭环。


指标体系与评估框架

指标设计原则

AI SourceLink 的指标体系遵循以下原则:

  1. 可观测优先:优先建设可合法采集、可技术实现、可持续维护的指标。
  2. 边界清晰:区分自动观测指标、样本评估指标和不可直接观测对象。
  3. 非穷尽式扩展:指标类别可随客户行业、AI 平台规则和产品阶段扩展。
  4. 业务相关:指标服务客户目标,而非为了指标而指标。
  5. 可解释:指标清楚说明含义、适用范围和局限。
  6. 可行动:指标直接指向治理动作或产品优化动作。
  7. 避免伪精确:不能用不可验证数据构造看似精确的结论。

可访问指标类别

可访问指标用于评估 AI 是否能够访问企业官方信息及访问路径是否合理。类别包括但不限于:

  • AI 访问来源;
  • AI 访问频率;
  • 访问路径分布;
  • 访问状态;
  • 访问策略命中;
  • 回源与缓存;
  • 异常访问;
  • 其他可能有效的可访问指标。

可理解指标类别

可理解指标用于评估 AI 是否正确理解官方信息。类别包括但不限于:

  • 重点信息覆盖;
  • 标准口径命中;
  • 问答准确性;
  • 参数准确性;
  • 品牌定位准确性;
  • 第三方替代表述比例;
  • 语义冲突;
  • 其他可能有效的可理解指标。

可更新指标类别

可更新指标用于评估 AI 是否感知和反映最新官方信息。类别包括但不限于:

  • 更新触发;
  • 更新采样;
  • 最新信息命中;
  • 旧信息残留;
  • 平台间更新差异;
  • 更新后再访问;
  • 更新后回答修正;
  • 其他可能有效的可更新指标。

可引用指标类别

可引用指标用于评估 AI 是否引用、链接或优先展示官方来源。类别包括但不限于:

  • 官方来源提及;
  • 官方链接出现;
  • 引用位置;
  • 引用准确性;
  • 第三方来源替代;
  • 错误引用;
  • 无来源回答;
  • 其他可能有效的可引用指标。

可转化指标类别

可转化指标用于评估 AI 来源访问是否产生业务结果。类别包括但不限于:

  • AI 来源访问;
  • AI 来源着陆页;
  • 页面参与度;
  • 表单提交;
  • 注册;
  • 下载;
  • 咨询;
  • 下单;
  • 预约;
  • 线索质量;
  • 其他客户定义的关键行为。

风险与合规指标类别

风险与合规指标用于评估 AI 回答和机器可读出口是否存在潜在风险。类别包括但不限于:

  • 幻觉回答;
  • 错误参数;
  • 旧价格;
  • 旧库存;
  • 误导性承诺;
  • 合规表述缺失;
  • 敏感信息误暴露;
  • 竞品混淆;
  • 不当归因;
  • 其他可能有效的风险指标。

自动观测与人工评估边界

自动观测适合处理访问日志、来源流量、状态码、路径、样本记录、引用链接、站内行为等结构化或半结构化数据。

人工评估适合处理理解准确性、回答合理性、合规表述、品牌语义偏差、政策解释是否充分等依赖判断的问题。

AI SourceLink 的指标体系同时容纳自动观测和人工评估,不把人工判断伪装成完全自动化结果。

指标扩展机制

指标扩展覆盖:

  • 客户行业差异;
  • 客户业务目标;
  • 数据可得性;
  • AI 平台变化;
  • 法规变化;
  • 产品阶段;
  • 技术成本;
  • 其他可能影响指标建设的因素。

反馈闭环

指标不是最终目的,而是服务治理闭环的观测工具。

指标发现问题
  → 定位对应知识点、页面、出口、访问策略或 Prompt
  → 执行修正
  → 重新采样
  → 验证效果
  → 形成趋势报告

可观测治理的指标边界

可观测边界

AI SourceLink 可直接或间接观测的对象包括但不限于:

  • AI 访问日志;
  • AI 来源流量;
  • AI 回复样本;
  • AI 引用来源;
  • 更新后访问行为;
  • 更新后回答变化;
  • 站内关键行为;
  • 风险回答;
  • 人工评估结果;
  • 其他外部可采集信号。

AI SourceLink 不把以下对象包装成确定性可观测指标:

  • 第三方 AI 模型内部权重;
  • 第三方 AI 私有索引策略;
  • 未公开排序逻辑;
  • 未公开训练数据使用细节;
  • 无法采集的用户私域行为;
  • 无法验证的归因结论。

自动化观测指标类别

自动化观测指标类别包括但不限于:

  • 访问观测;
  • 平台来源观测;
  • 路径观测;
  • 响应状态观测;
  • 策略命中观测;
  • AI 来源流量观测;
  • 着陆页观测;
  • 站内行为观测;
  • 更新反馈观测;
  • 异常访问观测;
  • 其他可能有效的自动化观测指标。

人工评估指标类别

人工评估用于处理无法完全自动判断的问题。类别包括但不限于:

  • 品牌理解准确性;
  • 产品参数准确性;
  • 服务政策准确性;
  • 最新信息反映程度;
  • 官方来源优先程度;
  • 是否存在幻觉;
  • 是否存在误导性回答;
  • 是否存在合规风险;
  • 是否错误引用第三方来源;
  • 其他依赖人工判断的指标。

指标分层原则

指标分为以下层级:

  1. 基础观测层:记录访问、来源、路径、状态、样本等基础事实。
  2. 质量评估层:评估 AI 回答的准确性、时效性、引用表现和风险表现。
  3. 业务结果层:评估 AI 来源流量、站内行为、线索、注册、下单或其他业务结果。
  4. 治理动作层:记录优化动作、修复动作、策略调整和治理效果。

相关词条

  • AI SourceLink 产品架构与核心功能体系
  • 可信治理高级机制
  • 典型应用场景与商业价值
  • 安全、合规与 Human-in-the-loop 治理