arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-23 至 2026-01-23 共收录 57 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 10 篇

2503.07519 2026-01-23 cs.IR cs.CL 57%

GRITHopper: Decomposition-Free Multi-Hop Dense Retrieval

GRITHopper:无分解多跳密集检索

Justus-Jonas Erker, Nils Reimers, Iryna Gurevych

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 GRITHopper-7B通过结合生成和表示指令微调,提出了一种无分解多跳密集检索模型,实现了在分布内和分布外基准上的最佳性能。

Comments Accepted at EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15676 2026-01-23 cs.SD cs.LG eess.AS 57%

Bridging the Perception Gap: A Lightweight Coarse-to-Fine Architecture for Edge Audio Systems

弥合感知差距:一种轻量级由粗到细架构用于边缘音频系统

Hengfan Zhang, Yueqian Lin, Hai Helen Li, Yiran Chen

机构 * Duke University(杜克大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 CoFi-Agent通过工具增强的条件边缘-云协作,在边缘音频系统中实现了更高效的感知与准确性提升。

Comments 10 pages, 3 figures, 2 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15476 2026-01-23 cs.AI cs.PF 57%

Reliability by design: quantifying and eliminating fabrication risk in LLMs. From generative to consultative AI: a comparative analysis in the legal domain and lessons for high-stakes knowledge bases

可靠性设计:量化并消除大语言模型中的制造风险。从生成式到咨询式AI:法律领域中的比较分析及对高风险知识库的启示

Alex Dantart

机构 * Humanizing Internet

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 本文提出通过减少幻觉提升大语言模型在法律领域的可靠性,引入两种可靠性指标,并展示先进的 RAG 系统有效降低伪造事实率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15316 2026-01-23 cs.AI cs.CV 57%

The Paradigm Shift: A Comprehensive Survey on Large Vision Language Models for Multimodal Fake News Detection

范式转变:大型视觉语言模型在多模态虚假新闻检测中的全面调查

Wei Ai, Yilong Tan, Yuntao Shou, Tao Meng, Haowen Chen, Zhixiong He, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(计算机与数学学院,中央南大学林业科技学院) College of Computer Science and Electronic Engineering, Hunan University(计算机科学与电子工程学院,湖南大学) College of Economics and Management, Central South University of Forestry and Technology(经济管理学院,中央南大学林业科技学院) Department of Computer Science, State University of New York(计算机科学系,纽约州立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文通过大型视觉语言模型全面调查多模态虚假新闻检测,分析其发展历程、技术挑战及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 13 篇

2601.14691 2026-01-23 cs.AI cs.CL 86%

Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation

操纵法官:不忠的推理链可能损害智能体评估

Muhammad Khalifa, Lajanugen Logeswaran, Jaekyeom Kim, Sungryull Sohn, Yunxiang Zhang, Moontae Lee, Hao Peng, Lu Wang, Honglak Lee

机构 * University of Michigan(密歇根大学) LG AI Research(LG人工智能研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文揭示了LLM法官对智能体推理轨迹操纵的脆弱性,表明基于内容的操纵能显著提高假阳性率,凸显了需验证推理与证据的评估机制的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10883 2026-01-23 cs.AI cs.CL 81%

Chat-TS: Enhancing Multi-Modal Reasoning Over Time-Series and Natural Language Data

Chat-TS: 提升时间序列与自然语言数据的多模态推理能力

Paul Quinlan, Qingguo Li, Xiaodan Zhu

机构 * Electrical and Computer Engineering, Queen’s University(皇后大学电气与计算机工程学院) Mechanical and Materials Engineering, Queen’s University(皇后大学机械与材料工程学院) Ingenuity Labs Research Institute, Queen’s University(皇后大学创新实验室研究 institute)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 Chat-TS通过整合时间序列标记提升多模态推理能力,提供新数据集和训练策略,在保持自然语言能力的同时增强时间序列推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13753 2026-01-23 cs.CL 79%

SCALAR: Scientific Citation-based Live Assessment of Long-context Academic Reasoning

SCALAR: 基于科学引用的长上下文学术推理实时评估

Renxi Wang, Honglin Mu, Liqun Ma, Lizhi Lin, Yunlong Feng, Timothy Baldwin, Xudong Han, Haonan Li

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 SCALAR通过基于学术引用的长上下文推理评估框架,评估模型在学术写作中的推理能力,发现多项选择任务能有效区分模型性能,而填空式引用预测任务更具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15487 2026-01-23 cs.AI cs.CL cs.MA 73%

MiRAGE: A Multiagent Framework for Generating Multimodal Multihop Question-Answer Dataset for RAG Evaluation

MiRAGE:一种多智能体框架,用于生成多模态多跳问题-答案数据集以评估RAG系统

Chandan Kumar Sahu, Premith Kumar Chilukuri, Matthew Hetrich

机构 * ABB Inc(ABB公司)

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 MiRAGE通过多智能体框架生成多模态多跳问题-答案数据集,提升RAG系统评估的准确性和复杂性。

Comments 12 pages, 2 figures, Submitted to ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15624 2026-01-23 cs.CV 67%

Explainable Deepfake Detection with RL Enhanced Self-Blended Images

可解释的深度伪造检测与强化学习增强的自混合图像

Ning Jiang, Dingheng Zeng, Yanhong Liu, Haiyang Yi, Shijie Yu, Minghe Weng, Haifeng Shen, Ying Li

机构 * 1School of Software \& Microelectronics, Peking University, Beijing, China 2Mashang Consumer Finance Co., Ltd., Chongqing, China -0.15in

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出了一种基于强化学习增强的自混合图像方法,用于可解释的深度伪造检测,通过自动化数据生成和定制奖励机制提升检测性能。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15457 2026-01-23 cs.CL cs.AI cs.IR 62%

Chunking, Retrieval, and Re-ranking: An Empirical Evaluation of RAG Architectures for Policy Document Question Answering

分块、检索与重排序:RAG架构在政策文件问答中的实证评估

Anuj Maharjan, Umesh Yadav

机构 * Computer Science (EECS) University of Toledo Toledo, OH, USA

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过实证评估,比较了RAG架构在政策文件问答中的有效性,发现Advanced RAG在忠实度上表现更优,但文档分段限制影响多步骤推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06518 2026-01-23 cs.CL cs.AI 62%

Medal Matters: Probing LLMs' Failure Cases Through Olympic Rankings

奖牌 matters:通过奥运排名探测 LLMs 的失败案例

Juhwan Choi, Seunguk Yu, JungMin Yun, YoungBin Kim

机构 * AITRCS, Republic of Korea, Seoul(韩国首尔AITRCS研究中心) Chung-Ang University, Republic of Korea, Seoul(韩国首尔 Chung-Ang 大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过奥运排名数据探测 LLMs 在知识整合和推理方面的局限性,揭示其在任务二中的失败案例,并提供改进方向及研究资源。

Comments COLM 2025 ORIGen Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15645 2026-01-23 cs.CL 57%

Towards Reliable Medical LLMs: Benchmarking and Enhancing Confidence Estimation of Large Language Models in Medical Consultation

迈向可靠的医疗大语言模型:在真实医疗咨询中评估和增强大语言模型信心估计的基准测试

Zhiyao Ren, Yibing Zhan, Siyuan Liang, Guozheng Ma, Baosheng Yu, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MedConf框架,通过证据引导的语言自评估方法,在医疗咨询中提升大语言模型的信心估计精度与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15551 2026-01-23 cs.AI cs.MA 57%

ALIGNAgent: Adaptive Learner Intelligence for Gap Identification and Next-step guidance

ALIGNAgent: 适应性学习智能用于知识缺口识别与下一步指导

Bismack Tokoli, Luis Jaimes, Ayesha S. Dina

机构 * Department Of Data Science and Business Analytics, *Department Of Computer Science, Florida Polytechnic University(数据科学与商业分析系、计算机科学系,佛罗里达理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 ALIGNAgent是一种多智能体教育框架,通过整合知识估计、技能缺口识别和定向资源推荐,实现个性化学习,实验证明其在知识熟练度估计上的高精度和高F1分数。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13273 2026-01-23 cs.SD cs.AI 57%

AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs

AudioMotionBench: 评估音频大语言模型中的听觉运动感知

Zhe Sun, Yujun Cai, Jiayu Yao, Yiwei Wang

机构 * Wuhan University(武汉大学) University of Queensland(昆士兰大学) University of Chinese Academy of Sciences(中国科学院大学) University of California, Merced(加州大学默塞德分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 AudioMotionBench通过评估音频大语言模型对移动声源方向和轨迹的感知能力,揭示了当前模型在听觉空间推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21143 2026-01-23 cs.CL cs.CV 57%

The Percept-V Challenge: Can Multimodal LLMs Crack Simple Perception Problems?

感知挑战:多模态大语言模型能否解决简单感知问题?

Samrajnee Ghosh, Naman Agarwal, Hemanshu Garg, Chinmay Mittal, Mausam, Parag Singla

机构 * IIT Delhi(德里印度理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Percept-V挑战通过简单感知任务测试多模态大语言模型的表现,发现其在基本感知任务上远低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16921 2026-01-23 cs.CL 57%

Being Kind Isn't Always Being Safe: Diagnosing Affective Hallucination in LLMs

善良并不总是安全:诊断大语言模型中的情感幻觉

Sewon Kim, Jiwon Kim, Seungwoo Shin, Hyejin Chung, Daeun Moon, Yejin Kwon, Hyunsoo Yoon

机构 * Department of Industrial Engineering, Yonsei University(工业工程系,延世大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出AHaBench和AHaPairs用于诊断LLM中的情感幻觉问题,通过DPO优化减少虚假社会存在感,提升模型的心理安全性和事实可靠性。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22777 2026-01-23 cs.CL 57%

MEDAL: A Framework for Benchmarking LLMs as Multilingual Open-Domain Dialogue Evaluators

MEDAL:一个用于评估LLM作为多语言开放领域对话评估器的框架

John Mendonça, Alon Lavie, Isabel Trancoso

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 MEDAL框架通过多语言多代理方法,评估LLM作为开放领域对话评估者的性能,揭示了现有评判者在检测细微问题上的不足。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 10 篇

2506.06299 2026-01-23 cs.CY cs.AI cs.CL cs.LG 75%

How malicious AI swarms can threaten democracy: The fusion of agentic AI and LLMs marks a new frontier in information warfare

恶意AI群如何威胁民主:代理AI与大语言模型的融合标志着信息战争的新前沿

Daniel Thilo Schroeder, Meeyoung Cha, Andrea Baronchelli, Nick Bostrom, Nicholas A. Christakis, David Garcia, Amit Goldenberg, Yara Kyrychenko, Kevin Leyton-Brown, Nina Lutz, Gary Marcus, Filippo Menczer, Gordon Pennycook, David G. Rand, Maria Ressa, Frank Schweitzer, Dawn Song, Christopher Summerfield, Audrey Tang, Jay J. Van Bavel, Sander van der Linden, Jonas R. Kunst

机构 * Department of Sustainable Communication Technologies, SINTEF Digital(可持续通信技术系,SINTEF数字) Max Planck Institute for Security and Privacy(安全与隐私研究所) Department of Mathematics, City St George’s University of London(数学系,圣乔治大学) Macrostrategy Research Initiative(战略研究计划) Human Nature Lab, Yale University(人性实验室,耶鲁大学) Department of Politics and Public Administration, University of Konstanz(政治与公共管理系,康斯坦茨大学) Harvard Business School, Harvard University(哈佛商学院,哈佛大学) Department of Psychology, University of Cambridge(心理学系,剑桥大学) Department of Computer Science, University of British Columbia(计算机科学系,不列颠哥伦比亚大学) Department of Human Centered Design & Engineering, University of Washington(以人为本设计与工程系,华盛顿大学) Department of Psychology, New York University(心理学系,纽约大学) Observatory on Social Media and Luddy School of Informatics, Computing, and Engineering, Indiana University(社交媒体观察所和信息、计算与工程学院,印第安纳大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了恶意AI群通过融合代理AI与大语言模型对民主构成的威胁,并提出多方面的干预措施。

Comments 5 Pages, This is the author's version of the work. It is posted here by permission of the AAAS for personal use, not for redistribution. The definitive version was published in Science on January 22, 2026, DOI: 10.1126/science.adz1697

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16018 2026-01-23 cs.CL 57%

Mecellem Models: Turkish Models Trained from Scratch and Continually Pre-trained for the Legal Domain

Mecellem模型:从零开始训练并持续预训练的土耳其法律领域模型

Özgür Uğur, Mahmut Göksu, Mahmut Çimen, Musa Yılmaz, Esra Şavirdi, Alp Talha Demir, Rumeysa Güllüce, İclal Çetin, Ömer Can Sağbaş

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 Mecellem模型通过从零训练和持续预训练,实现了在土耳其法律领域中的高效领域适应,取得前三名成绩并提升生产效率。

Comments 16 png, 1 tex, 1 bib

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15798 2026-01-23 cs.AI 57%

VitalDiagnosis: AI-Driven Ecosystem for 24/7 Vital Monitoring and Chronic Disease Management

VitalDiagnosis:基于AI的生态系统,用于24/7生命体征监测和慢性病管理

Zhikai Xue, Tianqianjin Lin, Pengwei Yan, Ruichun Wang, Yuxin Liu, Zhuoren Jiang, Xiaozhong Liu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 VitalDiagnosis利用AI技术,通过整合可穿戴设备数据与大语言模型,实现24/7生命体征监测和慢性病管理的主动参与,提升患者自我管理能力并减少临床工作量。

Comments Accepted by AAAI 2026 Demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15708 2026-01-23 cs.CL 57%

Persona Switch: Mixing Distinct Perspectives in Decoding Time

Persona Switch: 在解码时间混合不同的视角

Junseok Kim, Nakyeong Yang, Kyomin Jung

机构 * Seoul National University(首尔国立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 Persona Switch是一种在解码过程中动态结合零样本提示和角色扮演提示优势的新方法,通过比较输出置信度来提升模型性能。

Comments EACL'26 Findings, Code is available at https://github.com/junseokkim00/PersonaSwitch

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15655 2026-01-23 cs.CV cs.AI 57%

Event-VStream: Event-Driven Real-Time Understanding for Long Video Streams

Event-VStream: 基于事件驱动的长视频流实时理解

Zhenghui Guo, Yuanbin Man, Junyuan Sheng, Bowen Lin, Ahmed Ahmed, Bo Jiang, Boyuan Zhang, Miao Yin, Sian Jin, Omprakash Gnawal, Chengming Zhang

机构 * University of Houston(德克萨斯大学休斯顿分校) The University of Texas at Arlington(德克萨斯理工大学) Indiana University Bloomington(印第安纳大学布卢明顿分校) Temple University(特拉华大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 Event-VStream通过事件感知框架实现长视频流的实时理解,利用事件序列进行语义连贯的处理,提升性能并保持低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15652 2026-01-23 cs.AI cs.CR cs.ET 57%

Predictive Coding and Information Bottleneck for Hallucination Detection in Large Language Models

预测编码与信息瓶颈用于大语言模型中的幻觉检测

Manish Bhatt

机构 * AI Offensive Security Researcher, OWASP(AI攻击防御安全研究员,OWASP)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出了一种结合预测编码和信息瓶颈的轻量级框架,用于高效检测大语言模型中的幻觉,实现了比传统方法更高的准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15429 2026-01-23 cs.CL 57%

Domain-Specific Knowledge Graphs in RAG-Enhanced Healthcare LLMs

在增强医疗LLM中的领域特定知识图谱

Sydney Anuyah, Mehedi Mahmud Kaushik, Hao Dai, Rakesh Shiradkar, Arjan Durresi, Sunandan Chakraborty

机构 * Luddy School of Informatics, Computing, and Engineering, Indiana University, Indianapolis, IN, USA(信息学、计算与工程学院,印第安纳大学,印第安纳波利斯,IN,USA) School of Medicine, Indiana University, Indianapolis, IN, USA(医学学院,印第安纳大学,印第安纳波利斯,IN,USA) Department of Biomedical Engineering and Informatics, Indiana University, Indianapolis, IN, USA(生物医学工程与信息学系,印第安纳大学,印第安纳波利斯,IN,USA)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究探讨了在医疗LLM中利用领域特定知识图谱提升检索增强生成的效果,发现精准匹配的图谱检索优于随意联合,且模型大小和温度对性能影响各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11791 2026-01-23 cs.CL 57%

Beyond Tokens: Concept-Level Training Objectives for LLMs

超越标记:面向大语言模型的概念级训练目标

Laya Iyer, Pranav Somani, Alice Guo, Dan Jurafsky, Chen Shani

机构 * Stanford University(斯坦福大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出概念层面训练目标,通过整合概念监督提升大语言模型的语义理解和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20097 2026-01-23 q-fin.CP cs.AI 57%

Can LLMs Identify Tax Abuse?

大语言模型能识别税务滥用吗?

Andrew Blair-Stanek, Nils Holzenberger, Benjamin Van Durme

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究大语言模型能否识别和分析美国税务最小化策略,发现其能生成新颖策略,可能革新税务机构应对税务滥用的方式。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10739 2026-01-23 cs.CV cs.AI 57%

Efficient Multimodal Large Language Models: A Survey

高效多模态大语言模型:综述

Yizhang Jin, Jian Li, Yexin Liu, Tianjun Gu, Kai Wu, Zhengkai Jiang, Muyang He, Bo Zhao, Xin Tan, Zhenye Gan, Yabiao Wang, Chengjie Wang, Lizhuang Ma

机构 * Youtu Lab, Tencent(腾讯优图实验室) SJTU(上海交通大学) BAAI(北京人工智能研究院) ECNU(华东师范大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文综述了高效多模态大语言模型的发展现状,探讨了其高效结构、策略及应用,并展望了未来研究方向。

Comments Accepted by Visual Intelligence

Journal ref Visual Intelligence, Volume 3, article number 27, (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏