Ingot
目录

项目入门

Ingot 文档快速开始当前状态

集成与运维

配方优化试点指南数据接入部署运维常见问题

系统与算法

系统设计分析与优化机理知识设计

验证与生产

场景验证生产架构

项目治理

发展规划品牌规范开源依赖

场景验证

文档状态:滚动验证方案。本文定义真实项目收益的验证方法与证据边界;算法复杂度不作为验收依据。

可运行的演示仅证明软件流程存在,不能证明实验效率收益。收益验证分为三个阶段:对历史项目执行无信息泄漏回放,在旁路模式下评估新建议的持续合理性,最后通过受控在线实验测量实际收益。

发展规划定义建设目标、长期定位和晋级条件;本文定义历史回放、影子验证和受控在线实验的预注册、执行、否证、内部审核及对外结论边界。三条验证线分别回答不同问题,不能互相替代。

验证问题

真实项目依次回答四个问题:

  1. 数据是否更可信? 工程师能否找到一次运行的实际条件、轨迹、上下文和质量结果?
  2. 判断是否更高效? 从发现异常到形成可执行假设,是否更快、更完整、更少依赖手工找数?
  3. 原因是否可验证? 候选原因是否带证据、反证和混杂边界,并能转成有效实验?
  4. 实验是否更有效? 在相同安全边界和候选范围内,是否用更少的有效实验达到并确认目标?

前一个问题未通过时,不使用后一个问题掩盖它。模型推荐成功不能补偿错误的运行—质量关联。

选择首个项目

首个验证项目应满足:

  • 问题、产品和设备范围清楚;
  • 可控变量和质量目标可量化;
  • 运行身份、实际参数、过程数据和检验能够关联;
  • 主要材料、工装、批次和设备上下文可以追溯;
  • 安全边界和工程师当前决策流程已记录;
  • 存在可比较的历史顺序或允许前瞻实验。

首个场景的历史回放与影子验证仍在推进,即使全部通过也不自动证明其他行业适用;具体行业与设备信息不进入公开仓库。第二个明显不同的工艺负责验证稳定契约的通用性。

阶段 0:预注册与数据基线

Platform 将阶段 0 保存为项目级不可变预注册版本。每个版本绑定当前项目定义哈希,并按冻结的数据时间、Edge 和设备范围同步固化数据可靠性基线,记录工程师原流程的时间与步骤;冻结后只能由另一名项目成员复核。项目定义变化会使旧版本失去准入效力。新项目没有当前且已复核的预注册时不能从草稿进入研发;没有可分析运行会产生明确警告,而不伪造一个通用百分比门槛。

在查看结果前记录:

  • 数据范围、时间范围和纳入项目方式;
  • 主要问题、变量、目标、约束和上下文字段;
  • 比较基线和匹配规则;
  • 数据排除规则;
  • 主要指标、守门指标和停止条件;
  • 要比较的工程师流程、传统方法和计算方法;
  • 什么结果会否定“系统帮助了工程师”的假设。

先计算:

  • 运行完整率;
  • 实际参数和过程特征覆盖率;
  • 运行—检验唯一关联率;
  • 分析必需上下文覆盖率;
  • 单位、时钟、配置版本和来源异常;
  • 工程师当前找数、分析和试验所用的时间与步骤。

达不到分析条件时,验证结果应是“先修复数据链”,不是继续训练模型。

阶段 1:历史工程问题回放

选择过去真实发生的问题,按当时能够看到的信息重建工程判断过程。系统不能提前读取后来才产生的检验、结论或最终成功工艺规范。

对每个问题比较:

  • 工程师当时查找数据和建立比较基线的步骤;
  • Ingot 能否自动聚合同一运行的事实;
  • 系统候选是否覆盖后来被支持的重要因素;
  • 候选是否引用正确记录并说明反证、混杂和缺失;
  • 系统是否在证据不足时正确拒绝;
  • 从问题开始到形成首个可执行验证实验的时间。

黄金问题集由工程师审核,不能只由开发者编写标准答案。

阶段 2:生产等价逐次回放

对适合序贯优化的历史项目,在第 t 轮只允许算法看到前 t 轮的事实。算法从预先声明的候选池或批准范围提出下一点,再揭示相应结果。

至少比较:

  • 历史工程师顺序;
  • 适用的传统 DOE 或响应面;
  • 简单随机或空间填充基线;
  • Ingot 当前策略。

记录:

  • 首次达到规格的有效实验数;
  • 达到并重复确认规格的实验数;
  • 安全边界违规和失败实验;
  • 预测区间覆盖率与可行概率校准;
  • 推荐与候选池最近真实运行的距离;
  • 材料、设备、检验和日历时间成本。

历史数据只覆盖狭窄区域时,结果只说明候选池排序能力,不能证明连续空间寻优。

阶段 1 和阶段 2 共同证明的是历史证据装置是否可信、可复现且无未来数据泄漏,不单独证明建议能够改善真实工艺。回放证据工件至少冻结数据范围、逐轮可见信息、纳入与排除、基线、策略和模型版本、随机种子、逐次输出、失败项、审核记录和内容哈希。

阶段 3:新项目影子建议

Platform 对此前的逐次回放轨迹执行失败关闭审计:轨迹数必须与随机种子数一致,每一步的可见集合必须恰好等于此前已揭示集合,候选索引必须有效且未使用,并与最终选择序列一致。空轨迹、缺步、重复、越界或自报序列不一致均不能通过门禁。

在新项目中生成建议,但不改变工程师原有实验顺序。每轮在结果产生前冻结:

  • 系统看到的数据和上下文快照;
  • 系统建议、预测、风险和理由;
  • 工程师独立选择及其理由;
  • 工程师拒绝建议的现场约束;
  • 双方选择对应的后续结果。

影子阶段重点发现未建模约束、错误映射、不可执行参数和工程师实际需要的解释。不能事后修改建议使其看起来更接近结果。

阶段 4:受控在线实验

只有满足以下条件才进入:

  • 数据链和分析准入经过现场验收;
  • 历史回放无未来数据泄漏;
  • 硬边界、安全基线和回退流程已演练;
  • 推荐值能够被准确设置并回采实际值;
  • 预测区间和可行概率完成基本校准检查;
  • 主要上下文因素具有区组、随机化或重复计划;
  • 工程师可以审核、修改或拒绝每项建议。

在线阶段从一次只执行一项建议开始。每轮完成质量结果后再更新模型。任何安全异常、数据漂移或运行关联失败都暂停建议。

工艺操作域不能凭实验室验证直接发布生产。发布前至少需要三条来自已完成受控在线实验的有效源数据运行,全部位于候选操作域内并满足目标与安全约束;受控在线决策人与生产发布审核人必须分离。

指标

数据可信度

  • 完整运行可追溯率;
  • 实际参数、轨迹、上下文和检验覆盖率;
  • 自动关联成功率和人工修复时间;
  • 排除原因得到修复的比例。

工程决策价值

  • 从异常到首个可执行假设的时间;
  • 工程师认为候选有用、部分有用或无用的比例;
  • 重要结论来源引用覆盖率;
  • 无依据因果断言率和正确拒绝率;
  • 重复分析能够得到相同事实和结果的比例。

实验与优化价值

  • 达到并重复确认规格的有效实验次数;
  • 被实验支持、否决或保持不确定的候选分布;
  • 建议采用率和拒绝原因;
  • 预测校准、失败实验和零安全违规守门;
  • 相对基线的材料、设备时间、检验和日历时间。

不预设通用百分比目标。阶段 0 先记录基线,再批准场景目标。

失败与否证条件

出现以下结果时,不得继续用功能数量证明产品成功:

  • 运行、上下文和检验无法稳定关联;
  • 系统候选经常缺少关键现场因素或引用错误证据;
  • 系统无法在数据不足时拒绝;
  • 工程师无法将输出转成可执行实验;
  • 序贯建议不优于适用的简单基线或传统 DOE;
  • 预测不确定性长期失准;
  • 推荐不能在确认运行中复现;
  • 发生已知安全边界违规。

这些结果分别触发数据修复、产品工作流调整、方法降级或暂停优化,而不是默认进入更复杂阶段。

其中“序贯建议不优于适用基线”已经落实为可执行门禁:当前策略与机理快照下最新的一份历史回放必须已经独立复核并通过,当前优化器模型版本也必须实际出现在回放轨迹中。最新回放缺失、未复核、失败或版本不一致时请求直接停止,并返回响应面或传统 DOE 的降级路径;更早的通过报告不能覆盖较新的失败,也不能只在报告中记录失败后继续发建议。

证据保密与对外表述

真实项目的完整报告是受控内部证据工件,至少保存数据范围、纳入规则、变量、目标、约束、上下文覆盖、排除原因、比较基线、随机种子、全部失败、安全事件、工程师拒绝原因、不可推广部分和内容哈希。它只向获授权的项目成员和审核人开放,并遵守部署方的数据保留、导出、备份和删除规则。

真实生产数据、项目与设备标识、工艺参数、质量分布、逐次轨迹和派生结果不进入公开仓库。仓库也不附带公开验证数据、历史协议或结果;只保留通用契约、合成测试和本验证方法。部署者在自己的受控环境中管理评估数据、基线、预算、判定规则和结果。

部署者是否发布评估结论由其数据治理和业务要求决定;Ingot 仓库不汇总或背书特定场景的量化收益。