arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

2026-01-23 至 2026-01-23 共收录 6
2601.16125 2026-01-23 cs.CV cs.CL cs.IR

Rethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image Editing

重新思考组合图像检索评估:从图像编辑中获得的细粒度基准

Tingyu Song, Yanzhao Zhang, Mingxin Li, Zhuoning Guo, Dingkun Long, Pengjun Xie, Siyue Zhang, Yilun Zhao, Shu Wu

机构 * CASIA(中国科学院自动化研究所) Tongyi Lab, Alibaba Group(阿里云实验室) UCAS(中国科学院大学) HKUST(GZ)(香港科技大学(广州)) NTU(国立新加坡大学) Yale(耶鲁大学)

AI总结 本文提出EDIR细粒度CIR基准,通过图像编辑技术生成多样化查询,揭示现有模型在多模态任务中的能力差距与局限性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15879 2026-01-23 cs.SE cs.CL

Evaluating and Achieving Controllable Code Completion in Code LLM

评估和实现可控的代码补全在代码LLM中

Jiajun Zhang, Zeyu Cui, Lei Zhang, Jian Yang, Jiaxi Yang, Qiang Liu, Zilei Wang, Binyuan Hui, Liang Wang, Junyang Lin

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出可控代码补全基准C3-Bench,评估了40种LLM在代码补全中的指令遵循能力,开发数据合成管道并推出Qwen2.5-Coder-C3模型,实现代码补全性能的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15628 2026-01-23 cs.AI

CogToM: A Comprehensive Theory of Mind Benchmark inspired by Human Cognition for Large Language Models

CogToM:一种受人类认知启发的大型语言模型全面理论思维基准

Haibo Tong, Zeyang Yue, Feifei Zhao, Erliang Lin, Lu Jia, Ruolin Chen, Yinqian Sun, Qian Zhang, Yi Zeng

机构 * BrainCog Lab, Institute of Automation, Chinese Academy of Sciences(脑认知实验室,自动化研究所,中国科学院) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究所) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) School of Artificial Intelligence, UCAS(人工智能学院,中国科学院大学) Long-term AI(长期人工智能)

AI总结 CogToM通过8000个双语实例评估LLM的理论思维能力,揭示性能异质性和认知瓶颈,为研究LLM认知边界提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15572 2026-01-23 eess.IV cs.CE cs.CV

FUGC: Benchmarking Semi-Supervised Learning Methods for Cervical Segmentation

FUGC:用于宫颈分割的半监督学习方法基准测试

Jieyun Bai, Yitong Tang, Zihao Zhou, Mahdi Islam, Musarrat Tabassum, Enrique Almar-Munoz, Hongyu Liu, Hui Meng, Nianjiang Lv, Bo Deng, Yu Chen, Zilun Peng, Yusong Xiao, Li Xiao, Nam-Khanh Tran, Dac-Phu Phan-Le, Hai-Dang Nguyen, Xiao Liu, Jiale Hu, Mingxu Huang, Jitao Liang, Chaolu Feng, Xuezhi Zhang, Lyuyang Tong, Bo Du, Ha-Hieu Pham, Thanh-Huy Nguyen, Min Xu, Juntao Jiang, Jiangning Zhang, Yong Liu, Md. Kamrul Hasan, Jie Gan, Zhuonan Liang, Weidong Cai, Yuxin Huang, Gongning Luo, Mohammad Yaqub, Karim Lekadir

机构 * Department of Cardiovascular Surgery, The First Affiliated Hospital, Jinan University(心血管外科部,济南大学第一附属医院) Imperial College London(帝国理工学院伦敦分校) University of Sydney(悉尼大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) Medical University of Innsbruck(因斯布鲁克医科大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 FUGC通过提供首个宫颈分割半监督学习基准测试,展示了在少量标记数据下半监督方法的有效性,并为早产风险评估提供了AI辅助的基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15120 2026-01-23 cs.AI

Emerging from Ground: Addressing Intent Deviation in Tool-Using Agents via Deriving Real Calls into Virtual Trajectories

从地面崛起:通过推导真实调用为虚拟轨迹来解决工具使用代理中的意图偏差

Qian Xiong, Yuekai Huang, Bo Yang, Yujia Zheng, Tianhao Li, Ziyou Jiang, Zhiyuan Chang, Zhaoyang Li, Huanxiang Feng, Mingyang Li

机构 * Beijing Forestry University(北京林业大学) State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Duke University(杜克大学)

AI总结 RISE通过推导真实调用为虚拟轨迹,解决工具使用代理中的意图偏差问题,提升任务完成和意图对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13273 2026-01-23 cs.SD cs.AI

AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs

AudioMotionBench: 评估音频大语言模型中的听觉运动感知

Zhe Sun, Yujun Cai, Jiayu Yao, Yiwei Wang

机构 * Wuhan University(武汉大学) University of Queensland(昆士兰大学) University of Chinese Academy of Sciences(中国科学院大学) University of California, Merced(加州大学默塞德分校)

AI总结 AudioMotionBench通过评估音频大语言模型对移动声源方向和轨迹的感知能力,揭示了当前模型在听觉空间推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏