CAD/3D 六项 Benchmark 结果简报

公开版:只保留模型分数、评测口径和 caveat;不包含内部 endpoint、日志路径或样例图。

TLDR

GPT-5.5 在补测项里整体最强;CAD-Bench 补入 GPT-5.5 与 X3-High-288-Z 后,Kimi K2.6 仍以 76.996% 小幅第一,GPT-5.5 75.678% 紧随,X3-High-288-Z 为 73.122%。

Benchmark6 项 CAD/3D 任务
样本口径累计1172 条
更新时间2026-07-02

注意:不同 benchmark 的 metric 不同,不能跨 benchmark 直接平均。CadGenBench、FloorPlanQA、BlenderAlchemy 和 3DCodeBench image_to_3d 均有各自 caveat。

Benchmark 样本 / 指标 模型结果 结论 Caveat