BabyV 干净数据双臂 · v3 看图 ×2 vs ×3 text-plan(p10 · 1000 步 · 三榜)
独立曲线页(5min 自刷):qi-zhangyang.github.io/babyv-2arm-eval-curves 拒收案卷审计站(内网):10.102.16.99:8901
BabyVPerceptionCircularV1(目标榜)
NaturalPerceptionCircularV3(同源泛化)
Perception-geometry-mc-circular-v1(跨域迁移)
Geo3D B1000 · 四个单变量对比 vs lijia-line 基线
早期实验数据咋来的(lijia-line 时代 · 0-LLM 规则造题)
图源 → specsoutu 792w 题图 · 一圈一圈筛 · 面积 ∝ 数量
R5r4 收敛 · 视觉公平 12 门控
绿 = 过不了的题拒造;灰划线 = 整类停造的 5 个不公平格
R13Class-17 · 收紧关系门控压残差
线线关系答案分布塌缩 → 平行 / 相交 ≈ 0(模型可盲猜)
训练后「平行」方向 −18.8pp
见过渡轮 tab
数据预览(m3):R5 单轮 · R5 同图多QA · R13 单轮 · R13 pair2 双图
Geo-KG Solid3D 137K:V1 旧轮(虚线)+ V2 修复(实线)· 三 setting vs Baseline
数据预览(m3 · V1 旧轮):MC · Fill · Half
数据预览(m3 · V2 修复轮):MC v2 · Fill v2 · Half v2
三张图 = V2 修复(实线)+ V1 旧轮(虚线)+ SN6V0710 Baseline;同臂同色。
SolidGeoPerceptionCircularV2
Perception-geometry-mc-circular-v1
NaturalPerceptionCircularV3
Geo3D R3 P10 四臂 · SolidGeo V2
R3 数据咋来的(0710 · 策略转变:不磨造题,改修 spec)
图源 → spec(R3 版)同一 soutu 池 · 面积 ∝ 数量
spec-fidelity r3策略转变:不磨造题,改修 spec
K8s 全量保真修复(engine2)· 全量 715,687 逐条修,终态 passed = 79,331(11%)
· final_spec 与造题世界同构,直插路 A
R3 规则造题builders_tuned · 0-LLM
101,845 题 / 18 cell· 63,129 选择 + 38,716 填空(gold_source=code)
· 真实 spec 42 格体系,实际覆盖 16/42
· 答案格式演进:v1 → v2 → v3 → v4(canonical)
数据预览(m3 · v1 格式):SE0 · SE1 · SE2–5 · 全量 101,845
SE 分组对比(SE0 / SE1 / SE2–5 + baseline)
全量数据(Full + baseline)
Geo3D R3 Full 答案格式消融 · SolidGeo V2
数据预览(m3):v1 旧双字段 · v4 新点号格式
答案格式消融(v4fmt / v1full + baseline)
PerceptionGeo V1V2 NoOrig P10 · 三榜
数据预览(m3):NoOrig 223 万
SolidGeoPerceptionCircularV1
Perception-geometry-mc-circular-v1
NaturalPerceptionCircularV3
Solidgeo 20K P10 · 三榜
数据预览(m3):solidgeo 20K
一道题是怎么诞生的(实拍:拿一道真实数方块题全程跟踪)
① 定“配方”——题还没造,身份先定
内容指纹(blake2b)= 7cf23412db6bf5a498cd440f
改一个数,整道题全变;同一个配方,谁跑、什么时候跑,产出一字不差。
② 搭模型——答案这一刻已经算好
配方驱动随机数,搭出 3×2 底盘的方块堆。每列高度(俯视)就是全部真相:
| 3 | 3 | 3 |
| 2 | 1 | 1 |
③ 画成图——课本风三步成图
相机摆到配方指定的角度(方位角 38.31°、仰角 26.93°),然后:
哪条虚哪条实不硬编码:沿棱逐点试“被不被面挡住”,挡则虚——所以转任何角度都对。
④ 出题——错项不是乱编的,全是“算错一步”
| A. 11 | ✘ 数错 2 块 |
| B. 13 | ✔ 正确(=13) |
| C. 6 | ✘ 漏数一半(÷2) |
| D. 10 | ✘ 多数/漏数 3 块 |
| E. 17 | ✘ 多数/漏数 4 块 |
| F. 26 | ✘ 当成两层算(×2) |
| G. 14 | ✘ 数错 1 块 |
| H. 12 | ✘ 数错 1 块 |
打乱顺序后,正确答案落在 B。
⑤ 双人复核——不信出题人
独立的 verify_check 程序不看上面的答案,拿第②步的列高表重新算:
这次量产的 20,910 道题全部过了这道复核才出厂。
⑥ 落盘进数据集
PNG + jsonl → 打包成训练格式 → 按 10% 混进基线训练 —— 就是本页下面那条蓝线。
SolidGeoPerceptionCircularV2
Perception-geometry-mc-circular-v1
NaturalPerceptionCircularV3
Solidgeo × Geo-KG 熵源对拍 · 五臂(plain / 混款 / spec79k / 137k / 197k)
结论(主榜 SolidGeoV2 终值,同步对照 control@1000 = 0.355):混款 / plain 并列最强(0.394,+4.0pt)> spec79k(0.368,+1.3pt;题型偏斜拖累)> 137k MC(0.333,−2.2pt,比不掺还差——LLM 出题 MC 格式是负资产,与 PercGeo ×5「全 MC 负资产」结论互证;137k 的正确打开方式是 Fill 格式 0.357)。197k MC 表面最高(0.430)但属定向拟合/泄漏口径(对着 benchmark 母题造题),只能当泄漏标尺、不能当泛化证据。干净熵源里:0-LLM 合成管线(plain/混款)显著最强。
SolidGeoPerceptionCircularV2
Perception-geometry-mc-circular-v1
NaturalPerceptionCircularV3
Geo3D R14/R15 过渡轮 · 0710 首轮
R14/R15 数据咋来的(0710 首轮 · 同 32.7w spec 池 · 0-LLM 规则造题)
图源 → specsoutu 792w 题图 · 一圈一圈筛 · 面积 ∝ 数量
R13Class-17 · 收紧关系门控压残差
线线关系答案分布塌缩 → 平行 / 相交 ≈ 0(模型可盲猜)
训练后「平行」方向 −18.8pp
R14
按 SolidGeo V2 真实分布重建· 恢复端点相交 / 普通平行
· 配额对齐 V2 70/22/9
· 新增 select 选线题 + 三类共面题
· 线线 3,008 题全量校验 0 错
R15Class-18
全图命名点清晰度门控· 被问端点投影落无关棱即拒题
· 关系题 6,541 道全量重算 0 错
· engine_wrong 残差 27→13
数据预览(m3):R15 V2 单轮 23,910
SolidGeo V2(R15 vs R13 vs control)
NaturalPerceptionCircularV3
SolidGeoPerceptionCircularV1
Perception-geometry-mc-circular-v1
Geo3D 真实 spec 42格 · 对着 BMK 补齐题型面
真实 spec 42格数据咋来的(对着 BMK 造题 · 两代生产)
图源 → spec(R3 版)同一 soutu 池 · 面积 ∝ 数量
ABSORB 吸收对着 BMK 造法
从 BMK 标注提炼造法· SolidGeo V2 的 2,102 条标注 → 28 内容题型卡片
· 落成 42 cell registry + builders(0-LLM)
一代 synthetic被否决
凭空几何 25,200(42格×600)· p10 job Failed
· 铁口径:基础几何必须可溯源 → 不复活
二代 real-spec收官
5,536 源 spec → 25,200 题· 42格×600 · 全 MC · gold 各 6,300 均衡
· p10 Succeeded · 同域 +1.1pp
数据预览(m3):真实 spec 42格 25,200
SolidGeoPerceptionCircularV2(同域)
Perception-geometry-mc-circular-v1
NaturalPerceptionCircularV3
v7 QA 全量(第一代规则造法)vs cells42 vs Baseline
v7 QA 数据咋来的(第一代规则造法 · 封存 26 天后启用)
图源 → spec(v7 版)旧 spec 波 · 面积 ∝ 数量
v6/v7 第一代规则造法无视觉公平门控
349,428 spec → 2,496,507 valid QA· 2,239,722 MC · 42 格覆盖 40/42
· qa3d_rule_from_spec(第一代造法,量大但未做公平迭代)
HOLD 封存07-05 → 07-31 · 26 天
造完即归档 m2,从没进过训练· 当时下令「现在不需要」
· 2.5M 池最大闲置资产
07-31 启用v7-sample p10
抽样 124K kimiv → p10 训练· geo3d-v7-sample-p10(m3h20 · 4n · 1000 步)
· 边训边测:step400 追平 cells42 并压过 control
数据预览(m3):v7 抽样 124K kimiv · v7 全量 QA 归档(jsonl.gz)
SolidGeoPerceptionCircularV2
Perception-geometry-mc-circular-v1
NaturalPerceptionCircularV3
spec→中文 caption · 图注验证
caption 数据咋来的(spec 的另一用法:图注)
R3 渲染图同批 spec 的图
29,852 张· 79,331 pass spec 的确定性渲染(R3 同批图,caption 拿它当训练图)
kimi-k2 BatchJobspec → 中文图注
29,852 条 · 0 失败· 输入 = spec 完整 JSON(不传图,spec 即图片真值)
· 输出 60–150 字中文图注(中位 95 字)
caption p100710 图注验证
90% baseline + 10% caption· reboot 链 3 折后续训 Succeeded 1000/1000
· 3bench × 10 步全验收
数据预览(m3):caption 29,852
SolidGeoPerceptionCircularV2
Perception-geometry-mc-circular-v1
NaturalPerceptionCircularV3
Geo-KG 197k 母题派生 · 73K 快照(虚线)+ 184K 全量(实线)vs Baseline
197k 数据咋来的(直接对 BMK 造题 · 两次验证)
1970 母题 ×100直接对 BMK 造题
SolidGeo V2 真题当母题· 每道派生 100 道相似题 = 197,000
· ⚠️ 逐题带污染标记:BMK 测分只读作定向拟合,不是泛化
197k 生产native engine2 单 pod
07-20 启动 · 07-27 完结· 184,509 / 197,000 落盘导出
· 并发 4096→20000 热调,边跑边修
73K 快照验证中间验一次
07-22 快照 73,307 题· answerfmtv2-r1 格式三臂 p10
· SolidGeoV2@1000:MC 40.2 / Half 38.1 / Fill 36.8
184K 全量验证最终版
07-26 三臂(184,512 题)· SolidGeoV2@1000:MC 43.0 / Half 41.9 / Fill 38.7
· MC 最优臂;三榜 30/30 全验收
数据预览(m3):73K 快照 MC 73,307 · 184K 全量 MC 184,512





























































