arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2025-12-11 至 2025-12-11 共收录 7
2512.09927 2025-12-11 cs.RO

Token Expand-Merge: Training-Free Token Compression for Vision-Language-Action Models

令牌扩展-合并:面向视觉-语言-动作模型的免训练 令牌压缩

Yifan Ye, Jiaqi Ma, Jun Cen, Zhihe Lu

机构 * College of Science and Engineering, Hamad Bin Khalifa University(1 科学与工程学院,哈马德·本·卡西姆大学) Mohamed bin Zayed University of Artificial Intelligence(2 摩萨·本·扎耶德人工智能大学) College of Computer Science and Technology, Zhejiang University(3 计算机科学与技术学院,浙江大学)

AI总结 TEAM-VLA通过动态令牌扩展与合并机制,实现无需训练的视觉-语言-动作模型高效推理,提升速度并保持任务性能。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09524 2025-12-11 q-bio.NC cs.AI cs.LG eess.SP

NeuroSketch: An Effective Framework for Neural Decoding via Systematic Architectural Optimization

NeuroSketch:通过系统性架构优化实现神经解码的有效框架

Gaorui Zhang, Zhizhang Yuan, Jialan Yang, Junru Chen, Li Meng, Yang Yang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Shanghai Institute of Microsystem and Information Technology(上海微系统与信息工程研究所)

AI总结 NeuroSketch通过系统性架构优化,实现了在视觉、听觉和语音等多模态下的神经解码性能提升,达到最先进的解码效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09396 2025-12-11 cs.MA cs.AI

GAIR: GUI Automation via Information-Joint Reasoning and Group Reflection

GAIR:通过信息联合推理和群体反思实现GUI自动化

Zishu Wei, Qixiang Ma, Xavier Hu, Yuhang Liu, Hui Zang, Yudong Zhao, Tao Wang, Shengyu Zhang, Fei Wu

机构 * Zhejiang University(浙江大学) Huawei Technologies Ltd.(华为技术有限公司)

AI总结 GAIR是一种基于MLLM的GUI自动化代理框架,通过信息联合推理和群体反思整合异质模型能力,提升GUI自动化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09354 2025-12-11 cs.CV

Video-QTR: Query-Driven Temporal Reasoning Framework for Lightweight Video Understanding

Video-QTR: 一种基于查询的轻量级视频理解时序推理框架

Xinkui Zhao, Zuxin Wang, Yifan Zhang, Guanjie Cheng, Yueshen Xu, Shuiguang Deng, Chang Liu, Naibo Wang, Jianwei Yin

机构 * School of Software Technology, Zhejiang University, Hangzhou, China(浙江大学软件技术学院) School of Computer Science, Zhejiang University, Hangzhou, China(浙江大学计算机科学学院) School of Software Engineering, Xidian University, Xi’an, China(西安电子科技大学软件工程学院)

AI总结 Video-QTR通过查询驱动的时序推理框架,实现轻量级视频理解,显著降低计算成本并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24403 2025-12-11 cs.CL cs.DB

Agentar-Scale-SQL: Advancing Text-to-SQL through Orchestrated Test-Time Scaling

Agentar-Scale-SQL: 通过协调的测试时扩展推进文本到SQL

Pengfei Wang, Baolin Sun, Xuemei Dong, Yaxun Dai, Hongwei Yuan, Mengdie Chu, Yingqi Gao, Xiang Qi, Peng Zhang, Ying Yan

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) Soochow University(苏州大学) Zhejiang University(浙江大学)

AI总结 Agentar-Scale-SQL通过协调的测试时扩展策略,结合内部扩展、顺序扩展和并行扩展,提升文本到SQL的性能,在BIRD基准上达到81.67%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08987 2025-12-11 cs.CV cs.AI

3DID: Direct 3D Inverse Design for Aerodynamics with Physics-Aware Optimization

3DID: 基于物理感知优化的直接三维逆向设计

Yuze Hao, Linchao Zhu, Yi Yang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) The State Key Lab of Brain-Machine Intelligence, Zhejiang University(浙江大学脑机智能状态关键实验室)

AI总结 3DID提出一种基于物理感知优化的直接三维逆向设计框架,通过连续潜在表示和两阶段优化策略生成高保真的三维几何结构,提升设计质量和灵活性。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08960 2025-12-11 cs.LG cs.AI cs.CL

Resolving Conflicts in Lifelong Learning via Aligning Updates in Subspaces

通过在子空间中对齐更新来解决终身学习中的冲突

Yueer Zhou, Yichen Wu, Ying Wei

机构 * Zhejiang University(浙江大学) Harvard University(哈佛大学)

AI总结 PS-LoRA通过在优化子空间中对齐更新,解决终身学习中的冲突问题,提升模型在新领域适应时的稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏