STAR-Pro: Stage-Wise Token Adaptive Reduction with Progressive Refinement for Efficient Large Vision-Language Models
审稿中 · 2026 · 共同第一作者
无需训练的视觉 token 压缩:先保留特征覆盖度,再随语言与视觉交互逐步细化保留的 token。
我的贡献: 作为共同第一作者,我参与了从自适应选择到渐进剪枝的方法设计,以及跨视觉语言模型架构的评测。
审稿中 · 2026 · 共同第一作者
无需训练的视觉 token 压缩:先保留特征覆盖度,再随语言与视觉交互逐步细化保留的 token。
我的贡献: 作为共同第一作者,我参与了从自适应选择到渐进剪枝的方法设计,以及跨视觉语言模型架构的评测。
预印本 · 2026 · 核心贡献者
WorldEcho 诊断动作遵循失败;WorldSync 将生成过程与机器人动力学对齐,以支持策略学习。
我的贡献: 作为核心贡献者,我参与理解并改善机器人世界模型的动作遵循能力。
数据集目前限制访问,数据尚待上传。
CoRL 2026 · 已录用 · 共同作者
通过交互式世界模型中的想象轨迹开展 VLA 策略的安全强化学习,兼顾任务进展与安全性。
审稿中 · 2026 · 共同作者
通过逐层 token 合并与保留空间结构的 K/V 下采样,无需训练地加速视觉几何 Transformer。
稿件 · 2026 · 共同作者
通过视觉 token 工程提升一致性,缓解视觉语言模型中的幻觉。
稿件 · 2026 · 同等贡献
通过语义图层面的注意力处理,在无需训练的解码过程中缓解视觉语言模型幻觉。
稿件 · 2025 · 第一作者
STAR 的早期稿件,研究两阶段、无需训练的视觉 token 压缩;当前预印本为 STAR-Pro。
稿件 · 2025 · 共同作者
在无需训练的解码过程中聚合层间表征,改善语义一致性并缓解幻觉。
基于 Jekyll 与 Minimal Light 主题构建。