arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

2025-12-24 至 2025-12-24 共收录 9
2512.20174 2025-12-24 cs.CV cs.CL cs.IR

Towards Natural Language-Based Document Image Retrieval: New Dataset and Benchmark

迈向基于自然语言的文档图像检索:新数据集和基准

Hao Guo, Xugong Qin, Jun Jie Ou Yang, Peng Zhang, Gangyan Zeng, Yubo Li, Hailun Lin

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Science and Engineering, Nanjing University of Science and Technology(南京理工大学 cyber 科学与工程学院) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) University of Southern California(美国南加州大学) Laboratory for Advanced Computing and Intelligence Engineering(先进计算与智能工程实验室)

AI总结 本文提出基于自然语言的文档图像检索基准,通过生成细粒度语义查询提升检索性能,推动视觉文档理解领域研究。

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20166 2025-12-24 cs.RO

LoLA: Long Horizon Latent Action Learning for General Robot Manipulation

LoLA:面向通用机器人操作的长周期隐式动作学习

Xiaofan Wang, Xingyu Gao, Jianlong Fu, Zuolei Li, Dean Fortier, Galen Mullins, Andrey Kolobov, Baining Guo

机构 * Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) University of Chinese Academy of Sciences(中国科学院大学) Microsoft Research(微软研究院)

AI总结 LoLA通过整合长期多视角观察和机器人本体感觉,实现长周期、语言引导的机器人操作任务,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20084 2025-12-24 cs.LG cs.AI

QE-Catalytic: A Graph-Language Multimodal Base Model for Relaxed-Energy Prediction in Catalytic Adsorption

QE-Catalytic: 一种图-语言多模态基础模型,用于催化吸附中放松能量的预测

Yanjie Li, Jian Xu, Xueqing Chen, Lina Yu, Shiming Xiang, Weijun Li, Cheng-lin Liu

机构 * AnnLab(安实验室) Institute of Semiconductors, Chinese Academy of Sciences(半导体研究所,中国科学院) Zhongguancun Academy(中关村学院) State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Computer Network Information Center(计算机网络信息中心)

AI总结 QE-Catalytic结合语言模型与图Transformer,实现高精度催化吸附能量预测及逆向设计

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15649 2025-12-24 cs.CV cs.AI cs.CL

VTCBench: Can Vision-Language Models Understand Long Context with Vision-Text Compression?

VTCBench: 视觉-语言模型能否通过视觉-文本压缩理解长上下文?

Hongbo Zhao, Meng Wang, Fei Zhu, Wenzhuo Liu, Bolin Ni, Fanhu Zeng, Gaofeng Meng, Zhaoxiang Zhang

机构 * 1 Institute of Automation, Chinese Academy of Sciences 2 School of Artificial Intelligence, University of Chinese Academy of Sciences 3 Centre for Artificial Intelligence Robotics, Hong Kong Institute of Science \& Innovation, CAS 4 Independent Researcher

AI总结 VTCBench评估视觉-文本压缩对视觉语言模型长上下文理解能力的影响,发现多数模型在处理压缩信息时表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16580 2025-12-24 cs.HC cs.AI

Adaptive Command: Real-Time Policy Adjustment via Language Models in StarCraft II

自适应命令:通过语言模型在星际争霸II中实现实时策略调整

Weiyu Ma, Dongyu Xu, Shu Lin, Haifeng Zhang, Jun Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) AI Centre, Department of Computer Science, UCL(UCL计算机科学系人工智能中心) Nanjing Artificial Intelligence Research of IA, China(南京人工智能研究院)

AI总结 自适应命令通过整合大型语言模型和行为树,在星际争霸II中实现实时策略调整,提升人类与AI协作的决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15802 2025-12-24 cs.LG cs.AI cs.IT math.IT

A General Error-Theoretical Analysis Framework for Constructing Compression Strategies

一种用于构建压缩策略的通用误差理论分析框架

Boyang Zhang, Daning Cheng, Yunquan Zhang, Meiqi Tu, Fangming Liu, Jiake Tian

机构 * Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院计算技术研究所) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) the School of Microelectronics, South China University of Technology, Guangzhou, China(华南理工大学微电子学院) The University of Hong Kong(香港大学)

AI总结 本文提出压缩误差理论框架,通过几何方法优化各层压缩水平,实现高效参数压缩且性能损失小。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06868 2025-12-24 cs.CV cs.AI

Compression for Better: A General and Stable Lossless Compression Framework

压缩以更好:一种通用且稳定的无损压缩框架

Boyang Zhang, Daning Cheng, Yunquan Zhang, Fangming Liu, Wenguang Chen

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Peng Cheng Laboratory(鹏城实验室) Tsinghua University(清华大学)

AI总结 本文提出LLC框架,通过总微分界定压缩邻域和边界,实现无损模型压缩,提升效率并保持性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06867 2025-12-24 cs.LG cs.AI cs.CC

Lossless Model Compression via Joint Low-Rank Factorization Optimization

通过联合低秩分解优化实现无损模型压缩

Boyang Zhang, Daning Cheng, Yunquan Zhang, Fangming Liu, Jiake Tian

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Peng Cheng Laboratory(鹏城实验室) the School of Microelectronics, South China University of Technology(华南理工大学微电子学院)

AI总结 本文提出了一种联合优化策略,通过无损压缩实现模型性能的提升,适用于多种深度学习任务。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06865 2025-12-24 cs.LG cs.AI

FP=xINT:Representing Neural Networks via Low-Bit Series Basis Functions

FP=xINT:通过低比特级数基函数表示神经网络

Boyang Zhang, Daning Cheng, Yunquan Zhang, Jiake Tian, Jing Li, Fangming Liu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学) Harbin Institute of Technology(哈尔滨工业大学) South China University of Technology(华南理工大学)

AI总结 本文提出通过低比特级数基函数表示神经网络的方法,实现无需校准集的高精度量化,实验表明在4比特设置下ResNet-50的精度达到77.03%。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏