arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-02-17 至 2026-02-17 共收录 11
2602.10551 2026-02-17 cs.CV cs.AI

C^2ROPE: Causal Continuous Rotary Positional Encoding for 3D Large Multimodal-Models Reasoning

C^2ROPE: 3D 大多模态模型推理中的因果连续旋转位置编码

Guanting Ye, Qiyan Zhao, Wenhao Yu, Xiaofeng Zhang, Jianmin Ji, Yanyong Zhang, Ka-Veng Yuen

机构 * State Key Laboratory of Internet of Things for Smart City, University of Macau(物联网智能城市国家重点实验室,澳门大学) Department of Automation, Shanghai Jiaotong University(上海交通大学自动化系) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) School of Computer Science and Technology, USTC(中国科学技术大学计算机科学与技术学院) School of Artificial Intelligence and Data Science, USTC(中国科学技术大学人工智能与数据科学学院)

AI总结 C^2ROPE通过引入空间-时间连续位置编码和切比雪夫因果掩码,解决3D多模态模型中视觉特征连续性和因果关系建模问题。

Comments Accepted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14166 2026-02-17 cs.CR cs.AI

IntentMiner: Intent Inversion Attack via Tool Call Analysis in the Model Context Protocol

IntentMiner: 通过模型上下文协议中的工具调用分析进行意图倒置攻击

Yunhao Yao, Zhiqiang Wang, Haoran Cheng, Yihang Cheng, Haohua Du, Xiang-Yang Li

机构 * University of Science and Technology of China(中国科学技术大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

AI总结 IntentMiner通过分析模型上下文协议中的工具调用,揭示了意图倒置攻击的机制,实现了超过85%的语义对齐,挑战了AI代理的隐私基础。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19234 2026-02-17 cs.NI cs.AI

Virne: A Comprehensive Benchmark for RL-based Network Resource Allocation in NFV

Virne:一种针对基于强化学习的网络资源分配的综合基准测试

Tianfu Wang, Liwei Deng, Xi Chen, Junyang Wang, Huiguo He, Zhengyu Hu, Wei Wu, Leilei Ding, Qilin Fan, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Aalborg University(奥胡斯大学) University of Science and Technology of China(中国科学技术大学) Sun Yat-sen University(中山大学) Chongqing University(重庆大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 Virne是一个针对NFV资源分配问题的综合基准测试框架,支持深度强化学习方法,提供多样化模拟和全面评估,推动相关算法的发展。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14376 2026-02-17 cs.CV

Event-based Visual Deformation Measurement

基于事件的视觉形变测量

Yuliang Wu, Wei Zhai, Yuxin Cui, Tiesong Zhao, Yang Cao, Zheng-Jun Zha

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知教育部重点实验室,中国科学技术大学) Fuzhou University(福州大学)

AI总结 本文提出基于事件和帧融合的视觉形变测量方法,通过仿射不变单纯框架有效缓解运动歧义,提升密集跟踪性能,且在资源消耗上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13802 2026-02-17 cs.LG

Cast-R1: Learning Tool-Augmented Sequential Decision Policies for Time Series Forecasting

Cast-R1:学习工具增强的序列决策策略用于时间序列预测

Xiaoyu Tao, Mingyue Cheng, Chuang Jiang, Tian Gao, Huanjian Zhang, Yaguo Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

AI总结 Cast-R1通过工具增强的代理工作流程,学习序列决策策略以提升时间序列预测的准确性与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00634 2026-02-17 cs.CV

LAKAN: Landmark-assisted Adaptive Kolmogorov-Arnold Network for Face Forgery Detection

LAKAN: 基于地标辅助的自适应科莫戈罗夫-阿诺尔德网络用于人脸伪造检测

Jiayao Jiang, Bin Liu, Qi Chu, Nenghai Yu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室)

AI总结 LAKAN通过结合地标辅助的自适应科莫戈罗夫-阿诺尔德网络,提升人脸伪造检测的鲁棒性和准确性。

Comments 5 pages, 3 figures. This work has been accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05289 2026-02-17 cs.CV

Towards Sequence Modeling Alignment between Tokenizer and Autoregressive Model

向 token 分词器与自回归模型对齐的序列建模

Pingyu Wu, Kai Zhu, Yu Liu, Longxiang Tang, Jian Yang, Yansong Peng, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Tongyi Lab(通义实验室)

AI总结 AliTok通过双向编码器与因果解码器设计,解决图像生成中分词器与自回归模型的对齐问题,实现高保真度和可预测性,模型在ImageNet-256和ImageNet-512上取得SOTA结果。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23522 2026-02-17 cs.CV cs.LG

OmniEarth-Bench: Towards Holistic Evaluation of Earth's Six Spheres and Cross-Spheres Interactions with Multimodal Observational Earth Data

OmniEarth-Bench: 向全面评估地球六大球体及跨球体交互的多模态观测地球数据迈进

Fengxiang Wang, Mingshuo Chen, Xuming He, Yi-Fan Zhang, Yueying Li, Feng Liu, Zijie Guo, Zhenghao Hu, Jiong Wang, Jingyi Xu, Zhangrui Li, Junchao Gong, Di Wang, Fenghua Ling, Ben Fei, Weijia Li, Long Lan, Wenjing Yang

机构 * National University of Defense Technology, China(国防科技大学) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) Beijing University of Posts and Telecommunications, China(北京邮电大学) Zhejiang University, China(浙江大学) Shanghai Jiao Tong University, China(上海交通大学) Fudan University, China(复旦大学) Sun Yat-sen University, China(中山大学) Nanjing University, China(南京大学) University of Science and Technology of China(中国科学技术大学) Wuhan University, China(武汉大学)

AI总结 OmniEarth-Bench是首个全面评估地球六大球体及跨球体交互的多模态基准测试,通过29,855个标准化注释揭示了地球系统认知能力的系统性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14560 2026-02-17 cs.LG cs.AI cs.CL

Less is More: Improving LLM Alignment via Preference Data Selection

少即是多:通过偏好数据选择改进大语言模型对齐

Xun Deng, Han Zhong, Rui Ai, Fuli Feng, Zheng Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Massachusetts Institute of Technology(麻省理工学院) Alibaba Cloud Computing(阿里云计算) MoE Key Lab of BIPC, University of Science and Technology of China(中国科学技术大学MoE关键实验室)

AI总结 通过改进偏好数据选择策略,提升大语言模型对齐效果,实验显示在较少数据下实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09807 2026-02-17 cs.CV cs.AI

TKN: Transformer-based Keypoint Prediction Network For Real-time Video Prediction

TKN:基于Transformer的关键点预测网络用于实时视频预测

Haoran Li, XiaoLu Li, Yihang Lin, Yanbin Hao, Haiyong Xie, Pengyuan Zhou, Yong Liao

机构 * University of Science and Technology of China(中国科学技术大学) Adv. Innovation Center for Human Brain Protection, Capital Medical University(人类脑保护先进创新中心,首都医科大学) Aarhus University(奥胡斯大学)

AI总结 TKN通过基于Transformer的关键点预测网络,实现1176 fps的实时视频预测,显著降低计算成本并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10098 2026-02-17 cs.RO cs.CV

VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model

VLA-JEPA: 通过潜在世界模型增强视觉-语言-动作模型

Jingwen Sun, Wenyao Zhang, Zekun Qi, Shaojie Ren, Zezhi Liu, Hanxin Zhu, Guangzhong Sun, Xin Jin, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy, Beijing, China(中关村学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Eastern Institute of Technology, Ningbo(宁波东部科技研究院) University of Chinese Academy of Sciences(中国科学院大学) Nankai University(南开大学)

AI总结 VLA-JEPA通过潜在世界模型提升视觉-语言-动作模型的泛化与鲁棒性,采用无泄露状态预测和两阶段训练策略。

详情

展开后加载摘要…

URL PDF HTML 收藏