郭奕辰

郭奕辰

人工智能研究

南洋理工大学

寻求博士机会 · 2027 年春季 / 秋季

← 返回精选工作

arXiv 2026 · 审稿中

RegimeVGGT

面向视觉几何 Transformer 的逐层空间保持冗余消除

Jinhao You, Shuo Lyu, Zhuohang Lyu, Tanxuan Li, Zibo Zhao, Jiaxiang Hu, Kai Tang, Yichen Guo

郭奕辰 · 共同作者

Yichen Guo 研究主页内的项目介绍,依据下方链接中的论文整理。

项目概述

RegimeVGGT 无需额外训练即可加速视觉几何 Transformer。它结合随层变化的 token 合并与保留空间结构的 key/value 下采样,在减少冗余计算的同时,保护跨视角几何信息与相机位姿估计所需的信息。

RegimeVGGT 总览:结合显著性引导的 token 合并与选择性保护的 key/value 下采样,实现逐层压缩。
RegimeVGGT 的两种互补压缩机制,图自论文方法总览。 全文与原图

方法流程

  1. 识别不同层承担的作用

    逐层分析区分浅层、中层和深层的不同特征,由此采用 U 形压缩调度,而不是对所有层施加相同压缩程度。

  2. 合并 token 并保护空间细节

    显著性引导的分段合并,在减少视觉 token 数量时保留与几何和边缘相关的重要 token。

  3. 选择性下采样 key 与 value

    相位偏移的空间网格减少注意力计算;完整分辨率的参考帧,以及受保护的相机与 register token,维持跨帧空间覆盖和位姿信息路径。

评测

论文考察重建质量、相机位姿估计与运行时间,包含长图像序列设置。对比与消融实验分析了减少计算时必须保留的信息;具体设置和结果见原论文。

论文与资源

RegimeVGGT: Layer-Wise Spatially Preserving Redundancy Removal for Visual Geometry Grounded Transformer
arXiv:2606.18439

图示与技术介绍依据所链接的论文整理,原作者列表和发表状态见页首。

基于 Jekyll 与 Minimal Light 主题构建。

研究图示

滚动查看完整图片,按 Esc 键关闭。