证明

我们公开自己错在哪里。

我们还没有可公开引用的标杆客户,所以这个页面上暂时没有案例研究。我们能给你看的,是将来产出案例的那套机制 —— 它已经在对平台做出的每一个预测运行了。

实测,而非宣称

每个预测都会与实际发生的结果对照评分。

预测在做出时就被写下,并带一个到期日。到期时,平台把它与实测结果对比,记录绝对误差和是否命中。容差固定在代码里并有单元测试覆盖 —— 我们无法为了让结果好看而悄悄放宽标准。

每个预测都会与实际发生的结果对照评分。
预测类型命中判定容差对照对象
工期延误±7 天到期日的预测延误天数
成本预测±10%到期日的预测金额
风险等级±20 分到期日的项目风险分值

命中率与平均绝对误差按组织维度,通过平台自身的分析功能对每一位客户开放。当我们在真实项目上积累到统计意义上足够多的已评分预测时,汇总数字就会出现在这个页面上 —— 无论好看还是难看。

写进代码

证据策略是一条硬约束,不是一句口号。

下面四种行为实现在推理服务中,并被发布测试套件覆盖。它们不是提示词里的叮嘱 —— 那种东西模型可以随意忽略。

01

没有记录,就没有确定的回答

当项目中没有任何记录匹配该问题时,响应会被标记为 provisional,置信度封顶 0.4,并在答案正文中写明它不得作为合同决策的依据。

02

AI 自己的引用会被核验

答案中的每一条引用都会与实际检索到的记录比对。如果模型引用了并未检索到的内容,置信度封顶 0.45,并在答案中点名那条不可核实的引用。

03

每个响应都带来源标注

每个答案都会报告它是否由模型生成、来自哪个供应商和模型、使用了什么检索方式,以及它所依据的进度样本量。

04

样本不足时拒绝伪装确定性

当实测活动少于三条时,预测会返回已记录的基线延误加一条警告,而不是给出一个看起来权威、实则无意义的分布。

发布验证

上一个版本实际测了什么。

这些数字来自产品自身的验证报告,而不是对它的营销转述。

31每次运行在隔离数据库上通过的自动化测试
29针对运行中的 API 与资产 worker 的实时端到端检查
100端到端验证链给出的试点就绪度评分
143Construction OS 服务面上的 API 端点数
能力边界

我们公开自己的局限。

产品附带一份编号的明确边界清单 —— 未校准的风险启发式、词法而非语义的检索、不遍历依赖网络的预测。在评估阶段向我们索取,我们不会让你问第二次。

你的项目

成为第一个标杆。

选一个项目和一个当下难以做出的决策。我们在开始前就把成功标准写成书面,然后如实对照汇报 —— 包括它没通过的时候。

启动企业试点预约演示
证明与准确度 | OneAI Construction