arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-07 至 2026-01-07 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 22 篇

2510.20059 2026-01-07 cs.CL 85%

Enhancing Reasoning Skills in Small Persian Medical Language Models Can Outperform Large-Scale Data Training

增强小规模波斯语医疗语言模型的推理能力可超越大规模数据训练

Mehrdad Ghassabi, Sadra Hakim, Hamidreza Baradaran Kashani, Pedram Rostami

机构 * Faculty of Computer Engineering University of Isfahan(计算机工程系 布鲁金斯大学) School of Computer Science University of Windsor(计算机科学学院 温莎大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 通过RLAIF和DPO方法,提升小规模波斯语医疗模型推理能力,使其在有限数据下超越大规模训练模型。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07328 2026-01-07 cs.LG cs.AI cs.CE physics.chem-ph 84%

Bridging the Plausibility-Validity Gap by Fine-Tuning a Reasoning-Enhanced LLM for Chemical Synthesis and Discovery

通过微调增强推理的LLM弥合合理性-有效性差距以用于化学合成与发现

Malikussaid, Hilal Hudan Nuha, Isman Kurniawan

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 通过微调增强推理的LLM,提升化学合成与发现的合理性-有效性,实现高准确率和透明高效的方法。

Comments 8 pages, 1 equation, 5 tables, to be published in IEEE MCSoC 2025, unabridged version exists as arXiv:2507.07328v1

Journal ref Proc. 2025 IEEE 18th Int. Symp. Embedded Multicore/Many-core SoCs (MCSoC), 2025, pp. 538-545

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02739 2026-01-07 cs.CL 83%

Mitigating Prompt-Induced Hallucinations in Large Language Models via Structured Reasoning

通过结构化推理缓解大型语言模型中的提示诱导幻觉

Jinbo Hao, Kai Yang, Qingzhen Su, Yang Chen, Yifan Li, Chao Jiang

机构 * School of Computer Engineering, Jiangsu Ocean University(江苏海洋大学计算机工程学院) School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过引入代码模块和结构化推理方法,有效缓解了大型语言模型中的提示诱导幻觉问题,提升了模型的准确性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20100 2026-01-07 cs.LG cs.AI cs.CL cs.CV 82%

MIRAGE: A Benchmark for Multimodal Information-Seeking and Reasoning in Agricultural Expert-Guided Conversations

MIRAGE:农业专家引导对话中多模态信息检索与推理的基准

Vardhan Dongre, Chi Gui, Shubham Garg, Hooshang Nayyeri, Gokhan Tur, Dilek Hakkani-Tür, Vikram S. Adve

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MIRAGE是一个用于农业专家引导对话中多模态信息检索与推理的基准,通过真实用户-专家交互数据,提供高保真的多模态推理评估平台。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22461 2026-01-07 cs.SD cs.AI cs.CL eess.AS 81%

CMDAR: A Chinese Multi-scene Dynamic Audio Reasoning Benchmark with Diverse Challenges

CMDAR:一个包含多样挑战的中文多场景动态音频推理基准

Hui Li, Changhao Jiang, Hongyu Wang, Ming Zhang, Jiajun Sun, Zhixiong Yang, Yifei Cao, Shihan Dou, Xiaoran Fan, Baoyu Fan, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) Shanghai Jiao Tong University(上海交通大学) IEIT Systems Co Ltd(IEIT系统有限公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CMDAR是一个中文多场景动态音频推理基准,旨在评估模型在复杂音频推理任务中的表现,通过精心设计的问题-答案对和多样化音频片段,揭示现有音频语言模型在复杂推理任务中的局限性。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21710 2026-01-07 cs.CL 79%

Think-on-Graph 3.0: Efficient and Adaptive LLM Reasoning on Heterogeneous Graphs via Multi-Agent Dual-Evolving Context Retrieval

Think-on-Graph 3.0: 通过多智能体双进化上下文检索实现高效自适应的异构图LLM推理

Xiaojun Wu, Cehao Yang, Xueyuan Lin, Chengjin Xu, Xuhui Jiang, Yuanliang Sun, Hui Xiong, Jia Li, Jian Guo

机构 * IDEA Research, International Digital Economy Academy(IDEA研究院,国际数字经济学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) DataArc Tech Ltd.(数据弧科技有限公司) Hithink RoyalFlush Information Network Co., Ltd(慧思皇家Flush信息网络有限公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 Think-on-Graph 3.0通过多智能体双进化上下文检索机制,实现高效自适应的异构图LLM推理,提升轻量级模型在复杂推理任务中的性能。

Comments add: reranker agent and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02604 2026-01-07 cs.CL 79%

Scalable Construction of a Lung Cancer Knowledge Base: Profiling Semantic Reasoning in LLMs

可扩展的肺癌知识库构建:在大语言模型中进行语义推理的 profiling

Cesar Felipe Martínez Cisneros, Jesús Ulises Quiroz Bautista, Claudia Anahí Guzmán Solano, Bogdan Kaleb García Rivera, Iván García Pacheco, Yalbi Itzel Balderas Martínez, Kolawole John Adebayoc, Ignacio Arroyo Fernández

机构 * Universidad Tecnológica de la Mixteca(拉巴斯技术大学) Instituto Nacional de Enfermedades Respiratorias (INER) Ismael Cosío Villegas(国家呼吸疾病研究所(INER)伊斯梅尔·科索·维利亚斯) Maynooth University(梅诺特大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出利用OpenIE构建肺癌知识库,通过语义推理提升生物医学NLP性能。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04141 2026-01-07 cs.AI 79%

The Artificial Intelligence Cognitive Examination: A Survey on the Evolution of Multimodal Evaluation from Recognition to Reasoning

人工智能认知测评:多模态评估从识别到推理的演变综述

Mayank Ravishankara, Varindra V. Persad Maharaj

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文综述了多模态AI评估从识别到推理的演变,探讨了测评方法的转变及当前前沿基准的发展。

Journal ref IEEE Access, vol. 14, Dec. 2025, Art. no. 3649182

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10963 2026-01-07 cs.CV cs.CL 79%

MMMG: A Massive, Multidisciplinary, Multi-Tier Generation Benchmark for Text-to-Image Reasoning

MMMG:大规模、跨学科、多层级的文本到图像推理生成基准

Yuxuan Luo, Yuhui Yuan, Junwen Chen, Haonan Cai, Ziyi Yue, Yuwei Yang, Fatima Zohra Daha, Ji Li, Zhouhui Lian

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出MMMG基准,用于评估文本到图像生成模型的推理能力,揭示现有模型在知识图像生成中的不足,并发布FLUX-Reason作为开放基线。

Comments 85 pages, 70 figures, code: https://github.com/MMMGBench/MMMG, project page: https://mmmgbench.github.io/

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025) Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02364 2026-01-07 cs.IR cs.AI 70%

Towards Trustworthy LLM-Based Recommendation via Rationale Integration

通过推理整合实现可信的基于大语言模型的推荐

Chung Park, Taesan Kim, Hyeongjun Yun, Dongjoon Hong, Junui Hong, Kijung Park, MinCheol Cho, Mira Myong, Jihoon Oh, Min sung Choi

机构 * SK Telecom(SK电信)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的推荐系统,通过生成逻辑严谨的理由提升推荐的可解释性和性能。

Comments Accepted at RS4SD'25 (CIKM'25 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02783 2026-01-07 cs.CV 67%

EarthVL: A Progressive Earth Vision-Language Understanding and Generation Framework

EarthVL: 一种渐进式地球视觉-语言理解和生成框架

Junjue Wang, Yanfei Zhong, Zihang Chen, Zhuo Zheng, Ailong Ma, Liangpei Zhang

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 EarthVL提出一种渐进式视觉-语言框架,通过多任务数据集和语义引导网络提升城市规划中的遥感目标识别与问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03144 2026-01-07 cs.CL cs.AI 62%

Self-Verification is All You Need To Pass The Japanese Bar Examination

自我验证就是通过日本司法考试所需

Andrew Shin

机构 * Keio University(.keio大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种自我验证模型,通过忠实复制考试格式和评分尺度,首次实现了LLM通过日本司法考试,无需修改原始问题结构或评分规则。

Comments https://github.com/shinandrew/self_verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02872 2026-01-07 cs.CL cs.AI 62%

LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark

LongBench Pro: 一个更现实且全面的双语长上下文评估基准

Ziyang Chen, Xing Wu, Junlong Jia, Chaochen Gao, Qi Fu, Debing Zhang, Songlin Hu

机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LongBench Pro通过人机协作构建,提供1500个双语长上下文样本,评估46个模型发现长上下文优化比参数扩展更有效,有效上下文长度较短且存在跨语言偏差,混合思考设计具有潜在优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10449 2026-01-07 cs.AI cs.CL cs.CR 62%

When Reject Turns into Accept: Quantifying the Vulnerability of LLM-Based Scientific Reviewers to Indirect Prompt Injection

当拒绝转为接受:量化基于LLM的科学评审员对间接提示注入的脆弱性

Devanshu Sahoo, Manish Prasad, Vasudev Majhi, Jahnvi Singh, Vinay Chamola, Yash Sinha, Murari Mandal, Dhruv Kumar

机构 * BITS Pilani KIIT University(KIIT大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究量化了基于LLM的科学评审系统对间接提示注入攻击的脆弱性,揭示了通过隐藏文本注入和布局感知攻击翻转评审决定的风险,并提出WAVS指标评估此类攻击的严重性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24867 2026-01-07 cs.CL cs.AI 62%

Encyclo-K: Evaluating LLMs with Dynamically Composed Knowledge Statements

Encyclo-K:通过动态组成的知识陈述评估LLM

Yiming Liang, Yizhi Li, Yantao Du, Ge Zhang, Jiayi Zhou, Yuchen Wu, Yinzhu Piao, Denghui Cao, Tong Sun, Ziniu Li, Li Du, Bo Lei, Jiaheng Liu, Chenghua Lin, Zhaoxiang Zhang, Wenhao Huang, Jiajun Zhang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学) The University of Manchester(曼彻斯特大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Encyclo-K通过动态组合知识陈述,提出了一种评估LLM全面理解能力的基准测试框架,有效解决了现有基准测试的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22334 2026-01-07 cs.AI cs.CL 62%

SciEvalKit: An Open-source Evaluation Toolkit for Scientific General Intelligence

SciEvalKit: 一个用于科学通用智能的开源评估工具包

Yiheng Wang, Yixin Chen, Shuo Li, Yifan Zhou, Bo Liu, Hengjian Gao, Jiakang Yuan, Jia Bu, Wanghan Xu, Yuhao Zhou, Xiangyu Zhao, Zhiwang Zhou, Fengxiang Wang, Haodong Duan, Songyang Zhang, Jun Yao, Han Deng, Yizhou Wang, Jiabei Xiao, Jiaqi Liu, Encheng Su, Yujie Liu, Weida Wang, Junchi Yao, Shenghe Zheng, Haoran Sun, Runmin Ma, Xiangchao Yan, Bo Zhang, Dongzhan Zhou, Shufei Zhang, Peng Ye, Xiaosong Wang, Shixiang Tang, Wenlong Zhang, Lei Bai

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SciEvalKit是一个开源工具包,用于评估科学通用智能,涵盖科学多模态感知、推理、理解等核心能力,并提供灵活的评估流程和可定制的基准测试环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02326 2026-01-07 cs.CL cs.AI 62%

Something Just Like TRuST : Toxicity Recognition of Span and Target

Something Just Like TRuST:Span和目标的毒性识别

Berk Atil, Namrata Sureddy, Rebecca J. Passonneau

机构 * Penn State University(宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 TRuST是一个大规模数据集,用于评估和减轻大型语言模型的毒性,通过精心设计的定义和标注方案,提升毒性检测、目标识别和有毒词汇识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03227 2026-01-07 cs.SD cs.AI 57%

The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization

声纳时刻:在音频地理定位中基准测试音频语言模型

Ruixing Zhang, Zihan Liu, Leilei Sun, Tongyu Zhu, Weifeng Lv

机构 * The State Key Laboratory of Complex and Critical Software Environment, Beihang University(复杂与关键软件环境国家重点实验室,北航) Shanghai AI Laboratory(上海人工智能实验室) The Key Laboratory of Data Science and Intelligent Computing, International Innovation Institute, Beihang University(数据科学与智能计算重点实验室,国际创新研究院,北航)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AGL1K基准,用于评估音频语言模型在音频地理定位中的能力,发现封闭源模型表现更优,语言线索在预测中起主导作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03194 2026-01-07 cs.CL 57%

X-MuTeST: A Multilingual Benchmark for Explainable Hate Speech Detection and A Novel LLM-consulted Explanation Framework

X-MuTeST:一个用于可解释仇恨言论检测的多语言基准及一种新颖的LLM咨询解释框架

Mohammad Zia Ur Rehman, Sai Kartheek Reddy Kasu, Shashivardhan Reddy Koppula, Sai Rithwik Reddy Chirra, Shwetank Shekhar Singh, Nagendra Kumar

机构 * Indian Institute of Technology Indore(印度理工学院Indore) Indian Institute of Information Technology Dharwad(印度信息科技学院Dharwad) Arizona State University(亚利桑那州立大学) Indian Institute of Technology Mandi(印度理工学院Mandi)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 X-MuTeST提出一种结合LLM和传统技术的多语言仇恨言论检测框架,通过人类注释的解释提升分类性能和可解释性。

Comments Accepted in the proceedings of AAAI 2026

Journal ref AAA 2026 (AISI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11078 2026-01-07 cs.AI 57%

Patient-Zero: Scaling Synthetic Patient Agents to Real-World Distributions without Real Patient Data

Patient-Zero: 通过无需真实患者数据实现对真实世界分布的合成患者代理扩展

Yunghwei Lai, Ziyue Wang, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能学院,清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院,清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Patient-Zero通过无需真实患者数据的合成方法,实现了对真实世界分布的高效模拟,提升了医疗数据质量和交互保真度,且在临床任务中表现出显著的性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13271 2026-01-07 cs.CL 57%

Do You Get the Hint? Benchmarking LLMs on the Board Game Concept

你得到提示了吗?对大型语言模型的棋盘游戏概念基准测试

Ine Gevers, Walter Daelemans

机构 * CLiPS, University of Antwerp(CLiPS,安特卫普大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过棋盘游戏Concept测试LLMs的演绎推理能力,发现人类易解而LLMs表现不佳,尤其在低资源语言中更差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06472 2026-01-07 cs.CV cs.MM 50%

CalliReader: Contextualizing Chinese Calligraphy via an Embedding-Aligned Vision-Language Model

CalliReader:通过嵌入对齐的视觉-语言模型 contextualizing 中文书法

Yuxuan Luo, Jiaqi Tang, Chenyi Huang, Feiyang Hao, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院)

专题命中 推理评测 :reasoning(abstract)

AI总结 CalliReader通过字符级切片、视觉-文本对齐和嵌入指令微调,解决中文书法的上下文识别问题,实现比现有方法和专业书法家更高的准确性与更低的幻觉率。

Comments 11 pages

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏