OracleMind · Open Self-Audit
Four-rubric self-evaluation, signals from production
A living, machine-readable assessment of OracleMind against four commonly-cited evaluation rubrics (frontier exploration infrastructure, industry application, algorithm track, open exploration track). Each item links its score to a real, public signal from the running system — no assertions detached from measurement. Update cadence is nightly by default; this page is regenerated on every request.
Evaluated at 2026-09-15T09:35:51.807Z · commit 646aede · engine-audit all gates: PASS · GEO cluster score: 76.5
Borrowed from open source
Every mechanism below was studied in publicly-listed projects, then re-derived against the OracleMind substrate. The mapping is approach-level, not code-level — no vendored dependencies. Full lineage →
- CodeNotary (可信交付流水线) → 已落地 fusionChain / 计划加 HMAC 签名
- 智能体线群 ChangV (Agent 质量进化) → 计划建 /quality-evolution
- ContextLadder (Hierarchical Context Fallback) → 已落地 fusionChain
- AsoulAI ChronosFix (A-CFX) (故障时间机器) → 已对接 pending-rollback
- LabOps Guard (可信多智能体实验守护) → 已对接 engine-audit
- 2origin / RepoMesh / MergePilot (多 Agent 串修闭环) → 计划自动开 PR
- RevGuard (异常派单闭环) → 已部分落地 (correctionGates)
- FinFlux (语义注入受控演化) → 已落地 (tendency-field)
- EgoAgentOS ResearchOps (Ops 报告外部化) → 当前为 command-center JSON
- doy0 (onboarded, not engineered) → 计划 30 秒预览路径
赛道一·前沿探索(基础设施层)
5.9 / 10权重仅参考:场景 25% / 多 Agent 25% / Skill 25% / 工程落地 20% — 定性阅读
| % | Criterion | Score | Signal (from production) | Honest gap |
|---|---|---|---|---|
| 25% | 场景价值与行业可复制性 市场需求与跨场景迁移 | 5 | 已落地海外 GEO 站点(13 篇) + 命令中心报告公开 / 评分器自评基线 76.5;同 substrate 可复制到子平/紫微/六壬等场景。 | 缺英文长尾场景 demo(life-coaching/career-pivot);目标用户从传统推演受众外溢不够。 |
| 25% | 多 Agent 协同与自主闭环能力 预测引擎 + 审计 + 校准 + 报告 | 7 | 10-Agent MultiAgentLayer + StatisticalLayer + engine-audit 6 gate。当前全过。 | Agent 角色公开化(roster 端点)、A/B 权重切换、跨 fixture 串修自动化是当前空白。 |
| 25% | Skill 工程体系与生态复用 可被复用的小型能力单元 | 4 | 已发布 233 rules + 6 tools(MCP);OracleMind 内部有 tendency-field/calibration/event-corpus 模块但无显式 Skill 抽象层。 | 把 tendency-field/calibration/event-corpus/Manifold adapter 重构为标准 Skill(输入 schema/输出 schema/指标三段),可被外部 Agent 直接引用。 |
| 20% | 工程落地 / 运行验证 / 安全审计 工程深度 + 自动审计 | 8 | 每日 02:00 UTC engine-audit 自动跑(含 pending-rollback 人工闸门回滚);Brier=0.14;sensitivity std=0.148。 | 缺 SOC2 维度;HMAC 签名未默认开启(CodeNotary 借鉴空间);路由级 RBAC 不够。 |
赛道二·无界应用(产品层)
6.8 / 10权重仅参考:场景 25% / Agent 25% / Demo 20% / 技术实现 15% / 安全合规 10% — 定性阅读
| % | Criterion | Score | Signal (from production) | Honest gap |
|---|---|---|---|---|
| 25% | 行业场景价值 海外 C 端概率推演 | 6 | PayPal + USD 唯支付;面向英语海外用户;Pricing 5/5 PASS;6 个推演 target 枚举(career/wealth/...)。 | 行业纵深不足——目前定位是"个人推演",未切入企业/团队/教练场景。 |
| 25% | Agent 能力与任务闭环 推理→反馈→校准的全闭环 | 8 | feedback 漏斗(Accurate/Partly/Off)+ PredictionFeedback 表 + EventOutcomeLedger + nightly calibration,写入路径已通。 | feedback 实际收集率<1%(生产实测),需登录体验改造或产品钩子。 |
| 20% | 产品体验与 Demo 完成度 可体验密度 | 6 | 9:16 能量卡分享、daily insight、好友对比页面已就绪;/widget 嵌入可用。 | Onboarding 长度偏长;缺少 30 秒预览路径(参考 doy0 模式);动画密度不足。 |
| 15% | 技术实现深度与工程可复现性 fusionChain 显式 + 复现性 | 7 | 三层融合(base + L2 + L3)+ Manifold 市场共识 + Calibration 收缩 — 公式全部回写。 | 每层贡献对用户不可见(fusionChain 隐藏);确定性边界宣传不充分。 |
| 10% | 安全 / 合规 关键词 + 审计 + Auth | 7 | 命令中心全公开可读 + 227 rules aishield + IPN 鉴权 + 6 路审计(昨天补)。 | 生产 HMAC 签名未默认(CodeNotary 借鉴空间大);SOC 维度差距。 |
赛道三·算法(概率/校准层)
7.2 / 10权重仅参考:技术性能 45% / 科学意义 30% / 方法创新性 20% — 定性阅读
| % | Criterion | Score | Signal (from production) | Honest gap |
|---|---|---|---|---|
| 45% | 技术性能 Brier + 方向性 + 收敛速度 | 8 | 事件层 Brier=0.14(阈值 ≤0.30,余量大);方向性已发生均值 0.701 > 未发生 0.275;sensitivity std=0.148。 | 稀有事件(<5% / >95%)的分辨率未独立报告;CRPS 暂未报告。 |
| 30% | 科学意义 古典 substrate 解释 + 现代方法隔离 | 6 | 古典框架(子平/五行)作为给定 substrate 不证;现代方法 (calibration / bayesian / multi-agent) 独立审计 — 闭环已就绪。 | 亟需 case study 在公开期刊/会议呈现(AAAI/AIES/NeurIPS workshop);目前是工程论文未发表。 |
| 20% | 方法创新性 substrate-aware fusion 模式 | 7 | substrate + modern fusion 0.7/0.3 + Manifold 共识 0.30~0.55 动态权重 + 经验贝叶斯校准 — 与"端到端学习"路径不同。 | 创新性宣传缺位;benchmark 与现有 forecasting 平台(Metaculus/Polymarket/Good Judgment Open)横向未做。 |
赛道四·开放探索(推演验证场)
7.9 / 10权重仅参考:问题定义 45% / 探索过程 35% / 可检查性 15% — 定性阅读
| % | Criterion | Score | Signal (from production) | Honest gap |
|---|---|---|---|---|
| 45% | 问题定义与环境设计质量 问题清晰 + 边界明确 | 9 | 问题定义清晰:给定历史 baseline + 古典 substrate,给出未来事件概率。boundary 明确:不验证古典对错、只验证现代方法工程正确性。 | 问题定义文档形式化(formalize 到 RFC 形式)尚未公开——可作为论文章节发布。 |
| 35% | 探索过程与科学/研究信号 闭环 + 修正能力 | 7 | engine-audit 6 gate + pending-rollback + correctionGates(写 agentExperience 提案)— 形成完整"探索→告警→修正"信号链。 | 连续 3 天 DEGRADED 时自动开 PR 的能力未自动化(MergePilot 借鉴空间)。 |
| 15% | 可检查性与可延续性 每条预测都可追溯 | 7 | EventOutcomeLedger 回写 calibration;feedback funnel 已就绪;engine-audit 历史 6 关日志可查;command-center JSON 公开。 | 每条 prediction 的 fusionChain 当前不返回(融合不可见);预测分位(percentile/recommendation range)未透出。 |