我是戚张扬(英文名 Zhangyang Qi,昵称 Alex Chi)。我于 2026 年 6 月香港大学计算机科学系获得博士学位,导师为 Hengshuang Zhao 教授与 Yizhou Yu 教授;此前于 2022 年 7 月哈尔滨工业大学获得学士学位。

我目前在 Kimi(月之暗面)担任研究实习生,从事多模态大语言模型研究,参与了 Kimi K3PerceptionBench。在此之前,我在上海人工智能实验室担任研究实习生,由 Jiaqi WangTong Wu 指导。

我的研究方向是面向三维场景理解与交互的多模态语言模型

  • 多模态大语言模型
  • 视觉感知与评测
  • 三维场景理解
  • 视频语言模型
  • 三维点云语言模型

欢迎通过 微信:qi-zhangyangLinkedIn 与我联系。这里是我的英文简历中文简历

🔥 近况

  • 2026.07: 🎉🎉 PerceptionBench 发布,一个面向多模态大模型原子级视觉感知能力的评测基准。
  • 2026.07: 🎉🎉 Kimi K3 发布并开放权重下载。
  • 2026.07: 🎉🎉 VLMEvalKit 技术报告更新,现已覆盖 450+ 模型与 330+ 评测基准。
  • 2026.06: 🎉🎉 于香港大学获得计算机科学博士学位。
  • 2026.02: 🎉🎉 加入 Kimi(月之暗面),任研究实习生。
  • 2026.01: 🎉🎉 GPT4Scene 被 ICLR 2026 接收。
  • 2025.12: 🎉🎉 GGBench 被 AAAI 2026 接收。
  • 2025: 🎉🎉 GPT4Point++ 被 IEEE TPAMI 接收。
  • 2025.06: 🎉🎉 VLN-R1 在 arXiv 发布。
  • 2024.03: 🎉🎉 GPT4Point 被 CVPR 2024 接收。
  • 2023.10: 🎉🎉 OCBEV 被 3DV 2024 接收。
  • 2022.09: 🎉🎉 入学香港大学,开始博士研究。
  • 2022.07: 🎉🎉 于哈尔滨工业大学获得学士学位,获十佳大学生优秀毕业生称号。

🌐 工作经历

Kimi

Kimi(月之暗面),中国北京  ·  2026.02 – 至今

  • 研究实习生
  • 从事多模态大语言模型研究,参与 Kimi K3 与 PerceptionBench。
上海人工智能实验室

上海人工智能实验室,中国上海  ·  2022.07 – 2026.01

  • 研究实习生,导师Jiaqi WangTong Wu
  • 从事三维与视频语言模型研究,主导 GPT4Point、GPT4Point++ 与 GPT4Scene。
  • 参与构建 InternLM-XComposer 系列与 V3Det 数据集的训练数据。
腾讯 PCG

腾讯 PCG,中国深圳  ·  2021.12 – 2022.05

  • 研究实习生
  • 基于 CLIP 与对比学习构建跨模态对齐方法,用于图文匹配。
  • 设计联合训练范式,提升多模态检索中的嵌入对齐效果。

📖 教育经历

  • 2022.09 - 2026.06,香港大学(HKU),计算机科学,博士。
  • 2018.08 - 2022.07,哈尔滨工业大学(HIT),信息工程,学士。

📄 技术报告

Moonshot AI 2026
sym

Kimi K3: Open Frontier Intelligence

Kimi Team  (戚张扬,贡献者)

  • 开放权重的原生多模态智能体模型:2.8T 总参数(激活 104B)的混合专家架构,100 万 token 上下文窗口,并通过 MoonViT-V2 实现原生视觉能力。
  • 于 2026 年 7 月发布并完整开源权重,是迄今参数量最大的开放权重模型。

[博客]  [技术报告]  [代码]  [模型] 

Moonshot AI 2026
sym

PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models

Kimi Team  (戚张扬,贡献者)

  • 将感知与推理解耦的评测基准:3,000 道经过验证的题目,覆盖十项原子感知能力,题目源自 42 个既有基准中模型的真实失败案例。
  • 十项能力为:视觉关系、计数、属性、深度与三维、定位、比较、细粒度识别、上下文整合、OCR 与幻觉。
  • 在各前沿多模态大模型上均未突破 60% 准确率,其中感知类幻觉平均表现最弱。

[博客]  [技术报告]  [代码]  [数据] 

Arxiv 2026
sym

VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models

Haodong Duan, Xinyu Fang, Junming Yang, Xiangyu Zhao, Zerun Ma, Yuxuan Qiao, Mo Li, Tianhao Liang, Lin Zhu, Amit Agarwal, Xiaozhe Li, Shengyuan Ding, Jiazi Bu, Ziyu Liu, 戚张扬, et al., Pan Zhang, Jiaqi Wang, Dahua Lin, Kai Chen

  • OpenCompass 背后的开源评测工具包,以统一接口支持 450+ 多模态模型与 330+ 评测基准。
  • 我贡献了空间定位相关的评测支持,包括 DA-2K、ERQA 与 RefSpatialBench。

[论文]  [代码] 

📝 学术论文

ICLR 2026
sym

GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models

戚张扬, Zhixiong Zhang, Ye Fang, Jiaqi Wang, Hengshuang Zhao

  • 首个将基于视频的大语言模型用于室内场景理解的工作。

[项目主页]  [论文]  [代码] 

AAAI 2026
sym

Game Ground Bench: Probing the Limits of LVLMs in Complex Semantic Grounding Across Game Universes

戚张扬, Jinsong Li, Hongjian Wu, Jiaqi Wang, Hengshuang Zhao

  • GGBench,面向交互式游戏环境视觉定位的大规模跨品类评测基准:涵盖卡牌、第一人称射击、角色扮演等 10 类游戏共 1,335 张测试图像,要求模型理解游戏机制与界面元素,而非简单的名词—物体匹配。
  • 进一步提出 Game-R1,基于 Grounded Reinforcement Policy Optimization (GRPO) 的训练方法,以少样本实现强泛化,在 GGBench 上超越开源与闭源视觉语言模型。

[论文] 

CVPR 2024 Highlight
sym

GPT4Point: A Unified Framework for Point-Language Understanding and Generation

戚张扬, Ye Fang, Zeyi Sun, Xiaoyang Wu, Tong Wu, Jiaqi Wang, Dahua Lin, Hengshuang Zhao

  • 首个物体级三维点云多模态大语言模型,统一了点云理解与生成任务。
  • 期刊扩展版 GPT4Point++ 发表于 IEEE TPAMI 2025

[项目主页]  [论文]  [代码]  [TPAMI 扩展版] 

Arxiv 2025
sym
3DV 2024
sym

OCBEV: Object-Centric BEV Transformer for Multi-View 3D Object Detection

戚张扬, Jiaqi Wang, Xiaoyang Wu, Hengshuang Zhao

  • 以物体为中心的鸟瞰图(BEV)自动驾驶三维目标检测框架,在 nuScenes 数据集上以一半训练数据取得性能提升。

[论文] 

其他论文

🎖 荣誉与奖励

  • 香港博士研究生奖学金计划(HKPFS),2022。
  • 香港大学校长奖学金(HKUPS),2022。
  • 哈尔滨工业大学十佳大学生,2021。
  • 国家奖学金,2020。

💻 学术服务

  • 会议审稿人:CVPR’24、’25,ICCV’25。
  • 助教DASC7606: Deep Learning(香港大学研究生课程),2023 春、2024 春、2024 秋。