arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-16 至 2026-01-16 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 18 篇

2601.10165 2026-01-16 cs.CV 85%

Advancing Adaptive Multi-Stage Video Anomaly Reasoning: A Benchmark Dataset and Method

推动自适应多阶段视频异常推理:一个基准数据集和方法

Chao Huang, Benfeng Wang, Wei Wang, Jie Wen, Li Shen, Wenqi Ren, Yong Xu, Xiaochun Cao

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学计算机科学与技术学院(深圳校区)) Shenzhen Key Laboratory of Visual Object Detection and Recognition, Harbin Institute of Technology(哈尔滨工业大学深圳视觉目标检测与识别重点实验室)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出视频异常推理任务及相应数据集,通过结构化思维链和自适应策略优化,提升多阶段视频异常推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10455 2026-01-16 cs.CL cs.RO 83%

SurgGoal: Rethinking Surgical Planning Evaluation via Goal-Satisfiability

SurgGoal: 重新思考手术计划评估 via 目标满足性

Ruochen Li, Kun Yuan, Yufei Xia, Yue Zhou, Qingyu Lu, Weihang Li, Youxiang Zhu, Nassir Navab

机构 * Technical University of Munich, Germany(慕尼黑技术大学) University of Strasbourg, France(斯特拉斯堡大学) University of Glasgow, United Kingdom(格拉斯哥大学) Nanyang Technological University, Singapore(南洋理工大学) University of Massachusetts Boston, USA(马萨诸塞大学波士顿分校)

专题命中 推理评测 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 SurgGoal通过目标满足性度量重新评估手术计划,揭示视频大语言模型在安全关键环境中的性能问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19126 2026-01-16 cs.CL 83%

AWPO: Enhancing Tool-Use of Large Language Models through Adaptive Integration of Reasoning Rewards

AWPO: 通过适应性整合推理奖励增强大语言模型的工具使用

Zihan Lin, Xiaohan Wang, Hexiong Yang, Jiajun Chai, Jie Cao, Guojun Yin, Wei Lin, Ran He

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 AWPO通过适应性整合推理奖励提升大语言模型的工具使用性能,实现多轮场景中的卓越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09709 2026-01-16 cs.LG cs.CL cs.CY 81%

Social Determinants of Health Prediction for ICD-9 Code with Reasoning Models

基于推理模型的ICD-9代码社会决定因素预测

Sharim Khan, Paul Landes, Adam Cross, Jimeng Sun

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Illinois Chicago Peoria(伊利诺伊大学芝加哥分校皮奥里亚分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出利用推理模型和传统大语言模型,在MIMIC-III数据集上对医院入院的多标签社会决定因素ICD-9代码进行分类,实现了89%的F1分数,并发现139次入院中缺失的SDoH代码。

Comments Published as part of Machine Learning for Health (ML4H) 2025 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02064 2026-01-16 cs.CV 78%

RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video

RTV-Bench: 通过实时视频对多模态大语言模型的连续感知、理解和推理进行基准测试

Shuhang Xun, Sicheng Tao, Jungang Li, Yibo Shi, Zhixin Lin, Zhanhui Zhu, Yibo Yan, Hanqian Li, Linghao Zhang, Shikang Wang, Yixin Liu, Hanbo Zhang, Ying Ma, Xuming Hu

机构 * HIT(哈尔滨工业大学) HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) XJTU(西安交通大学) SDU(山东大学) CityU(城市大学) HUST(华中科技大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 RTV-Bench通过实时视频对多模态大语言模型的连续感知、理解和推理能力进行细粒度基准测试,揭示了实时模型在长时段视频处理中的性能优势与局限。

Comments Accepted by NeurIPS 2025 Datasets and Benchmarks Track;

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02737 2026-01-16 cs.CV 75%

Unveiling and Bridging the Functional Perception Gap in MLLMs: Atomic Visual Alignment and Hierarchical Evaluation via PET-Bench

揭示和弥合MLLMs中的功能感知差距:通过PET-Bench实现原子视觉对齐和分层评估

Zanting Ye, Xiaolong Niu, Xuanbin Wu, Xu Han, Shengyuan Liu, Jing Hao, Zhihao Peng, Hao Sun, Jieqin Lv, Fanghu Wang, Yanchao Huang, Hubing Wu, Yixuan Yuan, Habib Zaidi, Arman Rahmim, Yefeng Zheng, Lijun Lu

机构 * School of Biomedical Engineering, Southern Medical University(生物医学工程学院,南方医科大学) School of Biomedical Engineering, Shanghai Jiaotong University(生物医学工程学院,上海交通大学) Department of Electronic Engineering, Chinese University of Hong Kong(电子工程系,中国香港大学) Faculty of Dentistry, The University of Hong Kong(牙科学院,香港大学) Department of Nuclear Medicine, The Second Affiliated Hospital of Guangzhou University of Chinese Medicine(核医学科,广州中医药大学第二附属医院) PET Center, Department of Nuclear Medicine, Guangdong Provincial People’s Hospital, Southern Medical University(PET中心,核医学科,广东省人民医院,南方医科大学) Department of Nuclear Medicine, Nanfang Hospital, Southern Medical University(核医学科,南芳医院,南方医科大学) Division of Nuclear Medicine and Molecular Imaging, Geneva University Hospitals(核医学与分子影像学部,日内瓦大学医院) Departments of Radiology, Physics, and Biomedical Engineering, The University of British Columbia(放射学、物理和生物医学工程系,不列颠哥伦比亚大学) Medical Artificial Intelligence Laboratory, Westlake University(医学人工智能实验室,西湖大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出AVA方法,通过原子视觉对齐解决MLLMs在功能成像中的感知差距,提升诊断准确性14.83%。

Comments 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05467 2026-01-16 cs.SE cs.AI 70%

STELP: Secure Transpilation and Execution of LLM-Generated Programs

STELP: 保障LLM生成程序的编译与执行

Swapnil Shinde, Sahil Wadhwa, Andy Luo, Akshay Gupta, Mohammad Shahed Sorower

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 STELP通过安全编译和执行LLM生成的代码,解决生产环境中的安全性和可靠性问题,提升代码执行的安全性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20323 2026-01-16 cs.CL cs.AI cs.LG 67%

PMOA-TTS: Introducing the PubMed Open Access Textual Times Series Corpus

PMOA-TTS:引入PubMed开放获取文本时间序列语料库

Shahriar Noroozizadeh, Sayantan Kumar, George H. Chen, Jeremy C. Weiss

机构 * Machine Learning Department, School of Computer Science(计算机科学系机器学习部门) Heinz College of Information Systems and Public Policy(信息系统与公共政策学院) National Library of Medicine(国家医学图书馆)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PMOA-TTS通过大规模语言模型管道构建,为时间序列分析提供结构化文本时间线,支持时间推理、生存建模和事件预测研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09733 2026-01-16 cs.CL cs.AI 62%

Closing the Data Loop: Using OpenDataArena to Engineer Superior Training Datasets

闭合数据循环:利用OpenDataArena工程更优质的训练数据集

Xin Gao, Xiaoyang Wang, Yun Zhu, Mengzhang Cai, Conghui He, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab, OpenDataArena(上海人工智能实验室、OpenDataLab、OpenDataArena)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用OpenDataArena构建闭合循环数据集,通过ODA-Math-460k和ODA-Mixture数据集展示其在数学推理和多领域指令任务上的卓越性能。

Comments Superior ODA-Math, ODA-Mixture Datasets

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10660 2026-01-16 cs.CL 57%

Detecting Winning Arguments with Large Language Models and Persuasion Strategies

利用大型语言模型和说服策略检测获胜论点

Tiziano Labruna, Arkadiusz Modzelewski, Giorgio Satta, Giovanni Da San Martino

机构 * University of Padua(帕多瓦大学) Polish-Japanese Academy of Information Technology(波兰-日本信息科技学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文利用大型语言模型和说服策略分析论证文本,通过多策略评分方法提升说服力预测,并公开发布主题注释数据集以促进研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10156 2026-01-16 cs.CL 57%

ToolSafe: Enhancing Tool Invocation Safety of LLM-based agents via Proactive Step-level Guardrail and Feedback

ToolSafe: 通过主动的步骤级防护和反馈提升基于LLM的代理的工具调用安全性

Yutao Mou, Zhangchi Xue, Lijun Li, Peiyang Liu, Shikun Zhang, Wei Ye, Jing Shao

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ToolSafe通过构建TS-Bench和TS-Guard模型,结合TS-Flow框架,有效减少LLM代理的有害工具调用并提升任务完成率。

Comments Work in Progress. Code available: https://github.com/MurrayTom/ToolSafe

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10020 2026-01-16 cs.CL 57%

EHRNavigator: A Multi-Agent System for Patient-Level Clinical Question Answering over Heterogeneous Electronic Health Records

EHRNavigator: 一种用于异构电子健康记录上患者级临床问答的多智能体系统

Lingfei Qian, Mauro Giuffre, Yan Wang, Huan He, Qianqian Xie, Xuguang Ai, Xeuqing Peng, Fan Ma, Ruey-Ling Weng, Donald Wright, Adan Wang, Qingyu Chen, Vipina K. Keloth, Hua Xu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 EHRNavigator通过多智能体系统在异构电子健康记录上实现患者级临床问答,展示出高准确率和高效响应,有效连接基准评估与临床应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10010 2026-01-16 cs.CV cs.AI 57%

VERHallu: Evaluating and Mitigating Event Relation Hallucination in Video Large Language Models

VERHallu: 评估和缓解视频大语言模型中的事件关系幻觉

Zefan Zhang, Kehua Zhu, Shijie Jiang, Hongyuan Lu, Shengkai Sun, Tian Bai

机构 * College of Computer Science and Technology, Key Laboratory of Symbolic Computation and Knowledge Engineering, Ministry of Education, Jilin University(吉林大学计算机科学与技术学院,符号计算与知识工程重点实验室,教育部,吉林大学) College of Software, Jilin University(吉林大学软件学院) Facemind Group(FaceMind集团) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出VERHallu基准,用于评估和缓解视频大语言模型中的事件关系幻觉,通过关键帧传播策略提升多事件理解能力。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09972 2026-01-16 cs.AI 57%

Chinese Labor Law Large Language Model Benchmark

中国劳动法大语言模型基准

Zixun Lan, Maochun Xu, Yifan Ren, Rui Wu, Jianghui Zhou, Xueyang Cheng, Jianan Ding Ding, Xinheng Wang, Mingmin Chi, Fei Ma

机构 * Department of Mechatronics and Robotics, Xi’an Jiaotong–Liverpool University(机械与机器人系,西安交通大学利物浦大学) Department of Applied Mathematics, Xi’an Jiaotong–Liverpool University(应用数学系,西安交通大学利物浦大学) Hansheng Lawyers Building(翰盛律师事务所) Suzhou Gewu Digital Technology Co., Ltd.(苏州葛武数字技术有限公司) Kenneth Wang School of Law, Soochow University(肯尼斯·王法学院,苏州大学) College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LabourLawLLM和LabourLawBench,专门针对中国劳动法任务,通过精确的法律知识和复杂推理提升法律AI的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09713 2026-01-16 cs.CL 57%

LLM-Driven Preference Data Synthesis for Proactive Prediction of the Next User Utterance in Human-Machine Dialogue

基于大语言模型的偏好数据合成用于人机对话中下一用户话语的前瞻性预测

Jinqiang Wang, Huansheng Ning, Jianguo Ding, Tao Zhu, Liming Chen, Chris Nugent

机构 * School of Computer & Communication Engineering, University of Science and Technology Beijing(计算机与通信工程学院,北京科技大学) Department of Computer Science, Blekinge institute of Technology(计算机科学系,布莱金厄理工大学) School of Computer Science, University of South China(计算机科学学院,南方大学) School of Computer Science and Technology, Dalian University of Technology(计算机科学与技术学院,大连理工大学) School of Computing, Ulster University(计算机科学学院,乌斯特大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ProUtt通过意图树建模和偏好数据合成,提升人机对话中下一次用户发言的预测精度。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18691 2026-01-16 cs.CL 57%

Investigating LLM Capabilities on Long Context Comprehension for Medical Question Answering

探究大语言模型在医疗问答中的长上下文理解能力

Feras AlMannaa, Talia Tseriotou, Jenny Chim, Maria Liakata

机构 * Istanbul Aydın University(伊斯坦布尔阿迪兰大学) Queen Mary University of London(伦敦女王学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究探讨大语言模型在医疗问答中处理长上下文任务的能力,分析了模型大小、记忆问题及RAG方法的效果,揭示了其在不同任务中的优势与限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16821 2026-01-16 cs.NI cs.LG eess.SP 57%

LLM-Based Emulation of the Radio Resource Control Layer: Towards AI-Native RAN Protocols

基于大语言模型的无线资源控制层仿真:迈向AI原生的无线接入网络协议

Ziming Liu, Bryan Liu, Alvaro Valcarce, Xiaoli Chu

机构 * School of Electrical and Electronic Engineering, The University of Sheffield(电子与电气工程学院,谢菲尔德大学) Nokia Bell Labs(诺基亚贝尔实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出基于大语言模型的RRC层仿真方法,通过参数高效适应和模式受限提示,实现高精度协议仿真,展示了AI原生RAN协议的可行性。

Comments This work has been submitted to the IEEE for possible publication. Focuses on applying LLMs to 5G RRC protocol generation; primary: cs.NI; cross-list: eess.SP, cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10592 2026-01-16 cs.CV 50%

Action100M: A Large-scale Video Action Dataset

Action100M:一个大规模视频动作数据集

Delong Chen, Tejaswi Kasarla, Yejin Bang, Mustafa Shukor, Willy Chung, Jade Yu, Allen Bolourchi, Theo Moutakanni, Pascale Fung

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 Action100M通过自动化流程生成大规模视频动作数据集,用于提升视频理解和世界建模的可扩展研究。

详情

展开后加载摘要…

URL PDF HTML 收藏