AI SourceLink 通过可观测指标、回复样本、来源引用、版本对照、站内行为与必要的人工评估,将“AI 是否正确使用企业官方信息”转化为可持续测量和治理的问题。
本词条描述指标设计原则、主要指标类别、自动观测与人工评估边界,以及如何通过指标形成治理反馈闭环。
指标体系与评估框架
指标设计原则
AI SourceLink 的指标体系遵循以下原则:
- 可观测优先:优先建设可合法采集、可技术实现、可持续维护的指标。
- 边界清晰:区分自动观测指标、样本评估指标和不可直接观测对象。
- 非穷尽式扩展:指标类别可随客户行业、AI 平台规则和产品阶段扩展。
- 业务相关:指标服务客户目标,而非为了指标而指标。
- 可解释:指标清楚说明含义、适用范围和局限。
- 可行动:指标直接指向治理动作或产品优化动作。
- 避免伪精确:不能用不可验证数据构造看似精确的结论。
可访问指标类别
可访问指标用于评估 AI 是否能够访问企业官方信息及访问路径是否合理。类别包括但不限于:
- AI 访问来源;
- AI 访问频率;
- 访问路径分布;
- 访问状态;
- 访问策略命中;
- 回源与缓存;
- 异常访问;
- 其他可能有效的可访问指标。
可理解指标类别
可理解指标用于评估 AI 是否正确理解官方信息。类别包括但不限于:
- 重点信息覆盖;
- 标准口径命中;
- 问答准确性;
- 参数准确性;
- 品牌定位准确性;
- 第三方替代表述比例;
- 语义冲突;
- 其他可能有效的可理解指标。
可更新指标类别
可更新指标用于评估 AI 是否感知和反映最新官方信息。类别包括但不限于:
- 更新触发;
- 更新采样;
- 最新信息命中;
- 旧信息残留;
- 平台间更新差异;
- 更新后再访问;
- 更新后回答修正;
- 其他可能有效的可更新指标。
可引用指标类别
可引用指标用于评估 AI 是否引用、链接或优先展示官方来源。类别包括但不限于:
- 官方来源提及;
- 官方链接出现;
- 引用位置;
- 引用准确性;
- 第三方来源替代;
- 错误引用;
- 无来源回答;
- 其他可能有效的可引用指标。
可转化指标类别
可转化指标用于评估 AI 来源访问是否产生业务结果。类别包括但不限于:
- AI 来源访问;
- AI 来源着陆页;
- 页面参与度;
- 表单提交;
- 注册;
- 下载;
- 咨询;
- 下单;
- 预约;
- 线索质量;
- 其他客户定义的关键行为。
风险与合规指标类别
风险与合规指标用于评估 AI 回答和机器可读出口是否存在潜在风险。类别包括但不限于:
- 幻觉回答;
- 错误参数;
- 旧价格;
- 旧库存;
- 误导性承诺;
- 合规表述缺失;
- 敏感信息误暴露;
- 竞品混淆;
- 不当归因;
- 其他可能有效的风险指标。
自动观测与人工评估边界
自动观测适合处理访问日志、来源流量、状态码、路径、样本记录、引用链接、站内行为等结构化或半结构化数据。
人工评估适合处理理解准确性、回答合理性、合规表述、品牌语义偏差、政策解释是否充分等依赖判断的问题。
AI SourceLink 的指标体系同时容纳自动观测和人工评估,不把人工判断伪装成完全自动化结果。
指标扩展机制
指标扩展覆盖:
- 客户行业差异;
- 客户业务目标;
- 数据可得性;
- AI 平台变化;
- 法规变化;
- 产品阶段;
- 技术成本;
- 其他可能影响指标建设的因素。
反馈闭环
指标不是最终目的,而是服务治理闭环的观测工具。
指标发现问题
→ 定位对应知识点、页面、出口、访问策略或 Prompt
→ 执行修正
→ 重新采样
→ 验证效果
→ 形成趋势报告
可观测治理的指标边界
可观测边界
AI SourceLink 可直接或间接观测的对象包括但不限于:
- AI 访问日志;
- AI 来源流量;
- AI 回复样本;
- AI 引用来源;
- 更新后访问行为;
- 更新后回答变化;
- 站内关键行为;
- 风险回答;
- 人工评估结果;
- 其他外部可采集信号。
AI SourceLink 不把以下对象包装成确定性可观测指标:
- 第三方 AI 模型内部权重;
- 第三方 AI 私有索引策略;
- 未公开排序逻辑;
- 未公开训练数据使用细节;
- 无法采集的用户私域行为;
- 无法验证的归因结论。
自动化观测指标类别
自动化观测指标类别包括但不限于:
- 访问观测;
- 平台来源观测;
- 路径观测;
- 响应状态观测;
- 策略命中观测;
- AI 来源流量观测;
- 着陆页观测;
- 站内行为观测;
- 更新反馈观测;
- 异常访问观测;
- 其他可能有效的自动化观测指标。
人工评估指标类别
人工评估用于处理无法完全自动判断的问题。类别包括但不限于:
- 品牌理解准确性;
- 产品参数准确性;
- 服务政策准确性;
- 最新信息反映程度;
- 官方来源优先程度;
- 是否存在幻觉;
- 是否存在误导性回答;
- 是否存在合规风险;
- 是否错误引用第三方来源;
- 其他依赖人工判断的指标。
指标分层原则
指标分为以下层级:
- 基础观测层:记录访问、来源、路径、状态、样本等基础事实。
- 质量评估层:评估 AI 回答的准确性、时效性、引用表现和风险表现。
- 业务结果层:评估 AI 来源流量、站内行为、线索、注册、下单或其他业务结果。
- 治理动作层:记录优化动作、修复动作、策略调整和治理效果。
相关词条
- AI SourceLink 产品架构与核心功能体系
- 可信治理高级机制
- 典型应用场景与商业价值
- 安全、合规与 Human-in-the-loop 治理