没有记录,就没有确定的回答
当项目中没有任何记录匹配该问题时,响应会被标记为 provisional,置信度封顶 0.4,并在答案正文中写明它不得作为合同决策的依据。
我们还没有可公开引用的标杆客户,所以这个页面上暂时没有案例研究。我们能给你看的,是将来产出案例的那套机制 —— 它已经在对平台做出的每一个预测运行了。
预测在做出时就被写下,并带一个到期日。到期时,平台把它与实测结果对比,记录绝对误差和是否命中。容差固定在代码里并有单元测试覆盖 —— 我们无法为了让结果好看而悄悄放宽标准。
| 预测类型 | 命中判定容差 | 对照对象 |
|---|---|---|
| 工期延误 | ±7 天 | 到期日的预测延误天数 |
| 成本预测 | ±10% | 到期日的预测金额 |
| 风险等级 | ±20 分 | 到期日的项目风险分值 |
命中率与平均绝对误差按组织维度,通过平台自身的分析功能对每一位客户开放。当我们在真实项目上积累到统计意义上足够多的已评分预测时,汇总数字就会出现在这个页面上 —— 无论好看还是难看。
下面四种行为实现在推理服务中,并被发布测试套件覆盖。它们不是提示词里的叮嘱 —— 那种东西模型可以随意忽略。
当项目中没有任何记录匹配该问题时,响应会被标记为 provisional,置信度封顶 0.4,并在答案正文中写明它不得作为合同决策的依据。
答案中的每一条引用都会与实际检索到的记录比对。如果模型引用了并未检索到的内容,置信度封顶 0.45,并在答案中点名那条不可核实的引用。
每个答案都会报告它是否由模型生成、来自哪个供应商和模型、使用了什么检索方式,以及它所依据的进度样本量。
当实测活动少于三条时,预测会返回已记录的基线延误加一条警告,而不是给出一个看起来权威、实则无意义的分布。
这些数字来自产品自身的验证报告,而不是对它的营销转述。