MODEL VALIDATION / EVIDENCE FIRST

模型验证驾驶舱

每个材料族 × 工艺族 × 性能目标单独评估。外层按 DOI 整篇留出;候选模型选择只在训练 DOI 的内层留出中完成,避免模型选择偷看测试论文。

当前结论尚无可开放数值预测的分组
按 DOI 留一预测上一版
可校准分组最低 5 次预测 / 3 个 DOI
全部指标门槛通过尚不含外部验证要求
探索 / 工程部署工程部署必须有独立实验
正式门槛探索部署至少要求 8 个独立 DOI、20 条留出预测、R² 与其论文簇自助法 95% 下界均不低于 0、MAE 比均值基线改善至少 10%,同时满足区间覆盖/宽度、远距离样本比例和前瞻冻结公开批次验证。工程部署还必须通过独立炉批或部件实验。
01 / 按分组检查

每一项结果都保留样本与来源分母

正在读取验证文件…

02 / 拒答审计

哪些请求被拦下,哪些可能误放行?

同一套页面门控函数接受 19 个人工设计的规则探针:18 个按当前规则必须拒答,1 个有效域内的密度公式请求应允许。标签来自已声明的输入规则与当前模型放行门槛,并非独立实验真值。

正在读取拒答审计…

这是受控规则回归测试,不是对真实用户输入或新材料体系的误放行率估计。当前没有可正向放行的力学性能分组,因此无法评估力学预测的错误拒答率;“0 次误放行”仅指这 19 个探针。

下载逐例审计 JSON →
03 / 数据泄漏防护

外层评估,内层选模

同一篇论文的全部状态在外层一起留出;来源平衡 kNN、岭回归、带物理上下界的岭回归和浅层树,只能使用外层训练 DOI 做内层选择。留出论文既不参与填补/标准化,也不参与选择模型。

论文簇自助法同样以 DOI 为重采样单位,不把同一论文的多行当成独立样本。

04 / 两级部署状态

探索部署不等于工程部署

当前所有分组仍停留在诊断阶段。即使跨 DOI 指标全部合格,也必须先通过冻结模型后的新公开论文批次,才能进入科研筛选用的探索部署;工程部署还需要独立炉批或部件实验。

下载完整验证 JSON →
下载同折逐条预测 CSV →