当前冲刺 · 2D Referring Polygon

让模型听懂描述,
并稳定圈准目标。

给模型一张图和一句自然语言描述,由多模态模型识别指代对象, 输出可解析的多边形轮廓,再用统一基准验证定位精度与稳定性。

One picture

一张图看懂当前项目

语言负责说明“找谁”,视觉模型负责理解“在哪”,多边形负责表达“边界是什么”。

3D Grounding 项目流程:图像和目标描述经过多模态模型,生成 16 点轮廓定位,并进行可靠评测。
当前已验证的是 2D 指代表达多边形评测阶段;它为更复杂的空间 Grounding 能力提供可量化的实验入口。

How it works

从一句话到一个轮廓

每一步都能单独检查,让失败不再只是一个模糊的最终分数。

  1. 01

    理解指代

    读取图片与自然语言描述,判断用户指的是哪个具体对象。

  2. 02

    视觉推理

    结合类别、属性、相对位置和场景关系定位目标区域。

  3. 03

    输出轮廓

    按顺序生成多边形坐标,用结构化结果表达目标边界。

  4. 04

    可靠评测

    同时计算定位精度、格式有效率与重复运行稳定性。

Verified benchmark

点数不是越多越好

Seed 2.0 Pro 在 1,500 个均衡样本上的正式结果,格式错误按零 IoU 计入。

Mean IoU

轮廓点数对定位质量的影响

mIoU
8 点
0.4116
16 点
0.4684
24 点
0.4336
32 点
0.4269
64 点
0.2593

Project direction

把“能回答”推进到“能可靠定位”

现在

建立可信的 2D 基线

统一数据、输出格式、评测指标与稳定性复测协议。

扩展

比较更多多模态模型

验证不同模型在精度、格式遵循和推理成本上的差异。

未来

走向真实空间理解

将语言指代与深度、三维场景和可交互空间表示进一步结合。