Loading OracleMind...

OracleMind · Open Self-Audit

Four-rubric self-evaluation, signals from production

A living, machine-readable assessment of OracleMind against four commonly-cited evaluation rubrics (frontier exploration infrastructure, industry application, algorithm track, open exploration track). Each item links its score to a real, public signal from the running system — no assertions detached from measurement. Update cadence is nightly by default; this page is regenerated on every request.

Evaluated at 2026-09-15T09:35:51.807Z · commit 646aede · engine-audit all gates: PASS · GEO cluster score: 76.5

Borrowed from open source

Every mechanism below was studied in publicly-listed projects, then re-derived against the OracleMind substrate. The mapping is approach-level, not code-level — no vendored dependencies. Full lineage →

赛道一·前沿探索(基础设施层)

5.9 / 10

权重仅参考:场景 25% / 多 Agent 25% / Skill 25% / 工程落地 20% — 定性阅读

%CriterionScoreSignal (from production)Honest gap
25%
场景价值与行业可复制性
市场需求与跨场景迁移
5已落地海外 GEO 站点(13 篇) + 命令中心报告公开 / 评分器自评基线 76.5;同 substrate 可复制到子平/紫微/六壬等场景。缺英文长尾场景 demo(life-coaching/career-pivot);目标用户从传统推演受众外溢不够。
25%
多 Agent 协同与自主闭环能力
预测引擎 + 审计 + 校准 + 报告
710-Agent MultiAgentLayer + StatisticalLayer + engine-audit 6 gate。当前全过。Agent 角色公开化(roster 端点)、A/B 权重切换、跨 fixture 串修自动化是当前空白。
25%
Skill 工程体系与生态复用
可被复用的小型能力单元
4已发布 233 rules + 6 tools(MCP);OracleMind 内部有 tendency-field/calibration/event-corpus 模块但无显式 Skill 抽象层。把 tendency-field/calibration/event-corpus/Manifold adapter 重构为标准 Skill(输入 schema/输出 schema/指标三段),可被外部 Agent 直接引用。
20%
工程落地 / 运行验证 / 安全审计
工程深度 + 自动审计
8每日 02:00 UTC engine-audit 自动跑(含 pending-rollback 人工闸门回滚);Brier=0.14;sensitivity std=0.148。缺 SOC2 维度;HMAC 签名未默认开启(CodeNotary 借鉴空间);路由级 RBAC 不够。

赛道二·无界应用(产品层)

6.8 / 10

权重仅参考:场景 25% / Agent 25% / Demo 20% / 技术实现 15% / 安全合规 10% — 定性阅读

%CriterionScoreSignal (from production)Honest gap
25%
行业场景价值
海外 C 端概率推演
6PayPal + USD 唯支付;面向英语海外用户;Pricing 5/5 PASS;6 个推演 target 枚举(career/wealth/...)。行业纵深不足——目前定位是"个人推演",未切入企业/团队/教练场景。
25%
Agent 能力与任务闭环
推理→反馈→校准的全闭环
8feedback 漏斗(Accurate/Partly/Off)+ PredictionFeedback 表 + EventOutcomeLedger + nightly calibration,写入路径已通。feedback 实际收集率<1%(生产实测),需登录体验改造或产品钩子。
20%
产品体验与 Demo 完成度
可体验密度
69:16 能量卡分享、daily insight、好友对比页面已就绪;/widget 嵌入可用。Onboarding 长度偏长;缺少 30 秒预览路径(参考 doy0 模式);动画密度不足。
15%
技术实现深度与工程可复现性
fusionChain 显式 + 复现性
7三层融合(base + L2 + L3)+ Manifold 市场共识 + Calibration 收缩 — 公式全部回写。每层贡献对用户不可见(fusionChain 隐藏);确定性边界宣传不充分。
10%
安全 / 合规
关键词 + 审计 + Auth
7命令中心全公开可读 + 227 rules aishield + IPN 鉴权 + 6 路审计(昨天补)。生产 HMAC 签名未默认(CodeNotary 借鉴空间大);SOC 维度差距。

赛道三·算法(概率/校准层)

7.2 / 10

权重仅参考:技术性能 45% / 科学意义 30% / 方法创新性 20% — 定性阅读

%CriterionScoreSignal (from production)Honest gap
45%
技术性能
Brier + 方向性 + 收敛速度
8事件层 Brier=0.14(阈值 ≤0.30,余量大);方向性已发生均值 0.701 > 未发生 0.275;sensitivity std=0.148。稀有事件(<5% / >95%)的分辨率未独立报告;CRPS 暂未报告。
30%
科学意义
古典 substrate 解释 + 现代方法隔离
6古典框架(子平/五行)作为给定 substrate 不证;现代方法 (calibration / bayesian / multi-agent) 独立审计 — 闭环已就绪。亟需 case study 在公开期刊/会议呈现(AAAI/AIES/NeurIPS workshop);目前是工程论文未发表。
20%
方法创新性
substrate-aware fusion 模式
7substrate + modern fusion 0.7/0.3 + Manifold 共识 0.30~0.55 动态权重 + 经验贝叶斯校准 — 与"端到端学习"路径不同。创新性宣传缺位;benchmark 与现有 forecasting 平台(Metaculus/Polymarket/Good Judgment Open)横向未做。

赛道四·开放探索(推演验证场)

7.9 / 10

权重仅参考:问题定义 45% / 探索过程 35% / 可检查性 15% — 定性阅读

%CriterionScoreSignal (from production)Honest gap
45%
问题定义与环境设计质量
问题清晰 + 边界明确
9问题定义清晰:给定历史 baseline + 古典 substrate,给出未来事件概率。boundary 明确:不验证古典对错、只验证现代方法工程正确性。问题定义文档形式化(formalize 到 RFC 形式)尚未公开——可作为论文章节发布。
35%
探索过程与科学/研究信号
闭环 + 修正能力
7engine-audit 6 gate + pending-rollback + correctionGates(写 agentExperience 提案)— 形成完整"探索→告警→修正"信号链。连续 3 天 DEGRADED 时自动开 PR 的能力未自动化(MergePilot 借鉴空间)。
15%
可检查性与可延续性
每条预测都可追溯
7EventOutcomeLedger 回写 calibration;feedback funnel 已就绪;engine-audit 历史 6 关日志可查;command-center JSON 公开。每条 prediction 的 fusionChain 当前不返回(融合不可见);预测分位(percentile/recommendation range)未透出。