arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-02-03 至 2026-02-03 共收录 18
2602.02212 2026-02-03 cs.CV

MAIN-VLA: Modeling Abstraction of Intention and eNvironment for Vision-Language-Action Models

MAIN-VLA: 为视觉语言动作模型建模意图和环境的抽象

Zheyuan Zhou, Liang Du, Zixun Sun, Xiaoyu Zhou, Ruimin Ye, Qihao Chen, Yinda Chen, Lemiao Qiu

机构 * IEG, Tencent(腾讯人工智能实验室) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学)

AI总结 MAIN-VLA通过建模意图和环境的抽象,提升视觉语言动作模型在复杂动态环境中的决策质量、泛化能力和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02195 2026-02-03 cs.LG cs.AI

State Rank Dynamics in Linear Attention LLMs

线性注意力大语言模型中的状态排名动态

Ao Sun, Hongtao Zhang, Heng Zhou, Yixuan Ma, Yiran Qin, Tongrui Su, Yan Liu, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Chinese Academy of Sciences(中国科学院大学) CAS Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院人工智能安全重点实验室) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学) University of Oxford(牛津大学) Tsinghua University(清华大学)

AI总结 本研究揭示了线性注意力模型中状态排名分层现象,提出联合秩-范数剪枝策略,有效降低KV缓存开销并维持模型准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01826 2026-02-03 cs.LG cs.AI

Beyond Precision: Training-Inference Mismatch is an Optimization Problem and Simple LR Scheduling Fixes It

超越精度:训练-推理不匹配是一个优化问题,简单的学习率调度器可以解决它

Yaxiang Zhang, Yingru Li, Jiacai Liu, Jiawei Xu, Ziniu Li, Qian Liu, Haoyuan Li

机构 * National University of Singapore(新加坡国立大学) Fudan University(复旦大学) CHUK-Shenzhen(CHUK-深圳) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出通过动态学习率调度器解决强化学习中训练-推理不匹配问题,通过减少学习率来抑制梯度噪声,从而稳定训练过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01793 2026-02-03 cs.SD

ParaGSE: Parallel Generative Speech Enhancement with Group-Vector-Quantization-based Neural Speech Codec

ParaGSE: 基于分组向量量化神经语音编解码器的并行生成式语音增强

Fei Liu, Yang Ai

机构 * National Engineering Research Center of Speech and Language Information Processing(语音与语言信息处理国家级工程研究中心) University of Science and Technology of China(中国科学技术大学)

AI总结 ParaGSE通过基于分组向量量化神经语音编解码器的并行生成式语音增强方法,实现了更高的效率和更优的语音质量。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01609 2026-02-03 cs.CV

Token Pruning for In-Context Generation in Diffusion Transformers

令牌剪枝用于扩散变换器中的上下文生成

Junqing Lin, Xingyu Zheng, Pei Cheng, Bin Fu, Jingwei Sun, Guangzhong Sun

机构 * University of Science and Technology of China, Anhui, China(中国科学技术大学) Beihang University, Beijing, China(北京航空航天大学) Tencent PCG, China(腾讯PCG)

AI总结 ToPi通过无训练的令牌剪枝框架提升扩散变换器的上下文生成效率,实现30%以上的推理加速同时保持生成质量。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01608 2026-02-03 cs.AI

Reasoning with Autoregressive-Diffusion Collaborative Thoughts

基于自回归扩散协同思想的推理

Mu Yuan, Liekang Zeng, Guoliang Xing, Lan Zhang, Yunhao Liu

机构 * The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

AI总结 本文提出协同思想框架,通过自回归和扩散模型的闭环协作提升空间推理可靠性与生成可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04217 2026-02-03 cs.LG cs.AI

MLLMEraser: Achieving Test-Time Unlearning in Multimodal Large Language Models through Activation Steering

MLLMEraser: 通过激活引导在多模态大语言模型中实现测试时遗忘

Chenlu Ding, Jiancan Wu, Leheng Sheng, Fan Zhang, Yancheng Yuan, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学) Huawei(华为)

AI总结 MLLMEraser通过激活引导实现多模态大语言模型的测试时遗忘,无需训练且有效降低计算成本,同时保持保留知识的效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12596 2026-02-03 cs.LG

Constructing 3D Rotational Invariance and Equivariance with Symmetric Tensor Networks

构建3D旋转不变性和等变性与对称张量网络

Meng Zhang, Chao Wang, Hao Zhang, Shaojun Dong, Lixin He

机构 * Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究所) School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院) CAS Key Laboratory of Quantum Information, University of Science and Technology of China(中国科学技术大学量子信息关键实验室) Hefei National Laboratory, University of Science and Technology of China(合肥国家实验室)

AI总结 本文提出通过对称张量网络构建连续旋转不变和等变函数的方法,支持不同阶张量输入输出,并揭示几何图神经网络中等变基本单元的生成机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01346 2026-02-03 cs.AI

Model Specific Task Similarity for Vision Language Model Selection via Layer Conductance

为视觉语言模型选择而基于模型特定任务相似性的层导电性

Wei Yang, Hong Xie, Tao Tan, Xin Li, Defu Lian, Enhong Chen

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,科学技术大学) School of AI and Data Science, University of Science and Technology of China(人工智能与数据科学学院,科学技术大学)

AI总结 本文提出了一种基于模型特定任务相似性的视觉语言模型选择方法,通过层导电性分析和方向导电性发散度度量,提升模型选择效果。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01208 2026-02-03 cs.CL

Chronos: Learning Temporal Dynamics of Reasoning Chains for Test-Time Scaling

Chronos: 学习推理链的时序动态以实现测试时扩展

Kai Zhang, Jiayi Liao, Chengpeng Li, Ziyuan Xie, Sihang Li, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 Chronos通过学习推理链的时序动态,提升大语言模型在测试时的推理性能,实现显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01200 2026-02-03 cs.CV

Med3D-R1: Incentivizing Clinical Reasoning in 3D Medical Vision-Language Models for Abnormality Diagnosis

Med3D-R1: 促进3D医学视觉-语言模型的临床推理

Haoran Lai, Zihang Jiang, Kun Zhang, Qingsong Yao, Rongsheng Wang, Zhiyang He, Xiaodong Tao, Wei Wei, Shaohua Kevin Zhou

机构 * School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(生物医学工程学院,生命科学与医学系,中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(先进研究所,中国科学技术大学) Stanford University(斯坦福大学) Medical Business Department, iFlytek Co.Ltd(iFlytek公司医学业务部) The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine University of Science and Technology of China(中国科学技术大学第一附属医院,生命科学与医学系)

AI总结 Med3D-R1通过两阶段训练框架提升3D医学视觉-语言模型的临床推理能力,实现更准确的异常诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00780 2026-02-03 cs.AI

Environment-Aware Adaptive Pruning with Interleaved Inference Orchestration for Vision-Language-Action Models

环境感知自适应剪枝与交错推断调度用于视觉-语言-动作模型

Yuting Huang, Leilei Ding, Zhipeng Tang, Zenghuan Zhu, Jiajun Deng, Xinrui Lin, Shuo Liu, Haojie Ren, Jianmin Ji, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 EcoVLA通过环境感知自适应剪枝和交错推断调度,实现视觉-语言-动作模型的高效参数稀疏化,提升推理速度并保持高成功率。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00707 2026-02-03 cs.AI

Self-Guard: Defending Large Reasoning Models via enhanced self-reflection

Self-Guard:通过增强的自我反思防御大型推理模型

Jingnan Zheng, Jingjun Xu, Yanzhen Luo, Chenhang Cui, Gelei Deng, Zhenkai Liang, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Southern University of Science and Technology(南方科技大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

AI总结 Self-Guard通过增强的自我反思机制,有效解决大型推理模型的安全合规问题,实现安全与实用性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00671 2026-02-03 cs.CV

HPC: Hierarchical Point-based Latent Representation for Streaming Dynamic Gaussian Splatting Compression

HPC: 基于层次点表示的流式动态高斯点云压缩

Yangzhi Ma, Bojun Liu, Wenting Liao, Dong Liu, Zhu Li, Li Li

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发式智能感知与认知联合实验室,中国科学技术大学) University of Missouri, Kansas City(密苏里大学,堪萨斯城)

AI总结 HPC提出了一种基于层次点表示的流式动态高斯点云压缩框架,通过减少参数冗余和利用帧间相关性,实现了高效压缩和高保真重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20332 2026-02-03 cs.LG

Window-Diffusion: Accelerating Diffusion Language Model Inference with Windowed Token Pruning and Caching

窗口扩散:通过窗口化令牌修剪和缓存加速扩散语言模型推理

Fengrui Zuo, Zhiwei Ke, Yiming Liu, Wenqi Lou, Chao Wang, Xuehai Zhou

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) Suzhou Institute of Advanced Research, University of Science and Technology of China(苏州先进研究院,中国科学技术大学)

AI总结 Window-Diffusion通过窗口化令牌修剪和缓存技术,显著提升扩散语言模型推理速度,同时保持生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23909 2026-02-03 cs.CV

EditScore: Unlocking Online RL for Image Editing via High-Fidelity Reward Modeling

EditScore: 通过高保真奖励建模解锁图像编辑的在线强化学习

Xin Luo, Jiahao Wang, Chenyuan Wu, Shitao Xiao, Xiyan Jiang, Defu Lian, Jiajun Zhang, Dong Liu, Zheng liu

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Zhejiang University(浙江大学)

AI总结 EditScore通过高保真奖励建模解锁图像编辑的在线强化学习,提供从基准到奖励建模到RL训练的系统路径。

Comments Accepted to ICLR 2026. Code, models, and benchmark: https://github.com/VectorSpaceLab/EditScore

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00483 2026-02-03 eess.IV cs.CV cs.MM

Recent Advances of End-to-End Video Coding Technologies for AVS Standard Development

面向AVS标准开发的端到端视频编码技术最新进展

Xihua Sheng, Xiongzhuang Liang, Chuanbo Tang, Zhirui Zuo, Yifan Bian, Yutao Xie, Zhuoyuan Li, Yuqi Li, Hui Xiang, Li Li, Dong Liu

机构 * MOE Key Laboratory of Brain-Inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知教育部重点实验室,中国科学技术大学)

AI总结 本文介绍了AVS-EEM项目的发展历程和技术框架,展示了其在端到端智能视频编码中的高效压缩性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00205 2026-02-03 cs.LG cs.CV

Reducing Class-Wise Performance Disparity via Margin Regularization

通过边缘正则化减少类别间的性能差异

Beier Zhu, Kesen Zhao, Jiequan Cui, Qianru Sun, Yuan Zhou, Xun Yang, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) Hefei University of Technology(合肥工业大学) Singapore Management University(新加坡管理学院) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出MR$^2$方法,通过动态调整边缘来减少分类中类别间的性能差异,提升困难类别性能的同时不损害易类别表现。

Comments To appear in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏