我是戚张扬(英文名 Zhangyang Qi,昵称 Alex Chi)。我于 2026 年 6 月在香港大学计算机科学系获得博士学位,导师为 Hengshuang Zhao 教授与 Yizhou Yu 教授;此前于 2022 年 7 月在哈尔滨工业大学获得学士学位。
我目前在 Kimi(月之暗面)担任研究实习生,从事多模态大语言模型研究,参与了 Kimi K3 与 PerceptionBench。在此之前,我在上海人工智能实验室担任研究实习生,由 Jiaqi Wang 与 Tong Wu 指导。
我的研究方向是面向三维场景理解与交互的多模态语言模型。
- 多模态大语言模型
- 视觉感知与评测
- 三维场景理解
- 视频语言模型
- 三维点云语言模型
欢迎通过 微信:qi-zhangyang 或 LinkedIn 与我联系。这里是我的英文简历与中文简历。
🔥 近况
- 2026.07: 🎉🎉 PerceptionBench 发布,一个面向多模态大模型原子级视觉感知能力的评测基准。
- 2026.07: 🎉🎉 Kimi K3 发布并开放权重下载。
- 2026.07: 🎉🎉 VLMEvalKit 技术报告更新,现已覆盖 450+ 模型与 330+ 评测基准。
- 2026.06: 🎉🎉 于香港大学获得计算机科学博士学位。
- 2026.02: 🎉🎉 加入 Kimi(月之暗面),任研究实习生。
- 2026.01: 🎉🎉 GPT4Scene 被 ICLR 2026 接收。
- 2025.12: 🎉🎉 GGBench 被 AAAI 2026 接收。
- 2025: 🎉🎉 GPT4Point++ 被 IEEE TPAMI 接收。
- 2025.06: 🎉🎉 VLN-R1 在 arXiv 发布。
- 2024.03: 🎉🎉 GPT4Point 被 CVPR 2024 接收。
- 2023.10: 🎉🎉 OCBEV 被 3DV 2024 接收。
- 2022.09: 🎉🎉 入学香港大学,开始博士研究。
- 2022.07: 🎉🎉 于哈尔滨工业大学获得学士学位,获十佳大学生与优秀毕业生称号。
🌐 工作经历

Kimi(月之暗面),中国北京 · 2026.02 – 至今
- 研究实习生
- 从事多模态大语言模型研究,参与 Kimi K3 与 PerceptionBench。

上海人工智能实验室,中国上海 · 2022.07 – 2026.01
- 研究实习生,导师:Jiaqi Wang、Tong Wu
- 从事三维与视频语言模型研究,主导 GPT4Point、GPT4Point++ 与 GPT4Scene。
- 参与构建 InternLM-XComposer 系列与 V3Det 数据集的训练数据。

腾讯 PCG,中国深圳 · 2021.12 – 2022.05
- 研究实习生
- 基于 CLIP 与对比学习构建跨模态对齐方法,用于图文匹配。
- 设计联合训练范式,提升多模态检索中的嵌入对齐效果。
📖 教育经历
- 2022.09 - 2026.06,香港大学(HKU),计算机科学,博士。
- 2018.08 - 2022.07,哈尔滨工业大学(HIT),信息工程,学士。
📄 技术报告

Kimi K3: Open Frontier Intelligence
Kimi Team (戚张扬,贡献者)
- 开放权重的原生多模态智能体模型:2.8T 总参数(激活 104B)的混合专家架构,100 万 token 上下文窗口,并通过 MoonViT-V2 实现原生视觉能力。
- 于 2026 年 7 月发布并完整开源权重,是迄今参数量最大的开放权重模型。

PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models
Kimi Team (戚张扬,贡献者)
- 将感知与推理解耦的评测基准:3,000 道经过验证的题目,覆盖十项原子感知能力,题目源自 42 个既有基准中模型的真实失败案例。
- 十项能力为:视觉关系、计数、属性、深度与三维、定位、比较、细粒度识别、上下文整合、OCR 与幻觉。
- 在各前沿多模态大模型上均未突破 60% 准确率,其中感知类幻觉平均表现最弱。

VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models
Haodong Duan, Xinyu Fang, Junming Yang, Xiangyu Zhao, Zerun Ma, Yuxuan Qiao, Mo Li, Tianhao Liang, Lin Zhu, Amit Agarwal, Xiaozhe Li, Shengyuan Ding, Jiazi Bu, Ziyu Liu, 戚张扬, et al., Pan Zhang, Jiaqi Wang, Dahua Lin, Kai Chen
- OpenCompass 背后的开源评测工具包,以统一接口支持 450+ 多模态模型与 330+ 评测基准。
- 我贡献了空间定位相关的评测支持,包括 DA-2K、ERQA 与 RefSpatialBench。
📝 学术论文

GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models
戚张扬, Zhixiong Zhang, Ye Fang, Jiaqi Wang, Hengshuang Zhao
- 首个将基于视频的大语言模型用于室内场景理解的工作。

Game Ground Bench: Probing the Limits of LVLMs in Complex Semantic Grounding Across Game Universes
戚张扬, Jinsong Li, Hongjian Wu, Jiaqi Wang, Hengshuang Zhao
- GGBench,面向交互式游戏环境视觉定位的大规模跨品类评测基准:涵盖卡牌、第一人称射击、角色扮演等 10 类游戏共 1,335 张测试图像,要求模型理解游戏机制与界面元素,而非简单的名词—物体匹配。
- 进一步提出 Game-R1,基于 Grounded Reinforcement Policy Optimization (GRPO) 的训练方法,以少样本实现强泛化,在 GGBench 上超越开源与闭源视觉语言模型。

GPT4Point: A Unified Framework for Point-Language Understanding and Generation
戚张扬, Ye Fang, Zeyi Sun, Xiaoyang Wu, Tong Wu, Jiaqi Wang, Dahua Lin, Hengshuang Zhao
- 首个物体级三维点云多模态大语言模型,统一了点云理解与生成任务。
- 期刊扩展版 GPT4Point++ 发表于 IEEE TPAMI 2025。

Tailor3D: Customized 3D Assets Editing and Generation with Dual-Side Images
戚张扬, Yunhan Yang, Mengchen Zhang, Long Xing, Xiaoyang Wu, Tong Wu, Dahua Lin, Xihui Liu, Jiaqi Wang, Hengshuang Zhao
- 提出基于双视图图像操作的三维物体生成与编辑框架。

OCBEV: Object-Centric BEV Transformer for Multi-View 3D Object Detection
戚张扬, Jiaqi Wang, Xiaoyang Wu, Hengshuang Zhao
- 以物体为中心的鸟瞰图(BEV)自动驾驶三维目标检测框架,在 nuScenes 数据集上以一半训练数据取得性能提升。
其他论文
-
GPT4Point++: Advancing Unified Point-Language Understanding and Generation,IEEE TPAMI 2025。
戚张扬, Ye Fang, Zeyi Sun, Xiaoyang Wu, Tong Wu, Jiaqi Wang, Dahua Lin, Hengshuang Zhao。
GPT4Point 的期刊扩展版,以统一的端到端训练方案取代原有的两阶段流程。 -
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning,Arxiv 2025。 [论文] [代码]
戚张扬, Zhixiong Zhang, Yizhou Yu, Jiaqi Wang, Hengshuang Zhao。
端到端框架,通过基于 GRPO 的强化微调与时间衰减奖励,将第一人称视频流直接转化为连续导航动作。
🎖 荣誉与奖励
- 香港博士研究生奖学金计划(HKPFS),2022。
- 香港大学校长奖学金(HKUPS),2022。
- 哈尔滨工业大学十佳大学生,2021。
- 国家奖学金,2020。
💻 学术服务
- 会议审稿人:CVPR’24、’25,ICCV’25。
- 助教:DASC7606: Deep Learning(香港大学研究生课程),2023 春、2024 春、2024 秋。