TLDR
GPT-5.5 在补测项里整体最强;CAD-Bench 补入 GPT-5.5 与 X3-High-288-Z 后,Kimi K2.6 仍以 76.996% 小幅第一,GPT-5.5 75.678% 紧随,X3-High-288-Z 为 73.122%。
Benchmark6 项 CAD/3D 任务
样本口径累计1172 条
更新时间2026-07-02
注意:不同 benchmark 的 metric 不同,不能跨 benchmark 直接平均。CadGenBench、FloorPlanQA、BlenderAlchemy 和 3DCodeBench image_to_3d 均有各自 caveat。
| Benchmark | 样本 / 指标 | 模型结果 | 结论 | Caveat |
|---|