arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2510.00628 2026-02-25 cs.SD cs.CL 57%

Hearing the Order: Investigating Position Bias in Large Audio-Language Models

听序:探究大型音频-语言模型中的位置偏差

Yu-Xiang Lin, Chen-An Li, Sheng-Lun Wei, Po-Chun Chen, Hsin-Hsi Chen, Hung-yi Lee

机构 * National Taiwan University(台湾大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文首次系统研究了大型音频-语言模型中位置偏差问题,通过实验发现答案选项顺序影响模型性能,提出基于排列的策略可缓解偏差。

Comments The first two authors contributed equally. Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23434 2026-02-25 cs.LG 57%

Towards Trustworthy GUI Agents: A Survey

迈向可信的GUI代理:综述

Yucheng Shi, Wenhao Yu, Jingyuan Huang, Wenlin Yao, Wenhu Chen, Ninghao Liu

机构 * University of Georgia(佐治亚大学) Tencent AI Seattle Lab(腾讯AI西雅图实验室) Microsoft Research(微软研究院) University of Waterloo(滑铁卢大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文综述了GUI代理的可信度挑战,提出信任分类法并分析了信任评估与安全可靠部署的开放问题。

Comments 14 pages, work in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19843 2026-02-24 cs.SE cs.AI 57%

MAS-FIRE: Fault Injection and Reliability Evaluation for LLM-Based Multi-Agent Systems

MAS-FIRE:基于大语言模型的多智能体系统故障注入与可靠性评估

Jin Jia, Zhiling Deng, Zhuangbin Chen, Yingqi Wang, Zibin Zheng

机构 * Sun Yat-sen University(中山大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MAS-FIRE通过故障注入和分层分析,揭示多智能体系统在容错和鲁棒性方面的关键因素,为提升系统可靠性提供系统性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19212 2026-02-24 cs.CL 57%

Retrieval Augmented Enhanced Dual Co-Attention Framework for Target Aware Multimodal Bengali Hateful Meme Detection

基于检索增强的增强双注意力框架的目标感知多模态孟加拉语仇恨表情识别

Raihan Tanvir, Md. Golam Rabiul Alam

机构 * Department of Computer Science and Engineering, BRAC University(计算机科学与工程系,BRAC大学) Department of Computer Science and Engineering, Ahsanullah University of Science and Technology(计算机科学与工程系,Ahsanullah科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于检索增强的增强双注意力框架,用于目标感知多模态孟加拉语仇恨表情识别,通过语义对齐提升类别平衡和多样性,实验表明xDORA和RAG-Fused DORA在识别和检测任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16449 2026-02-24 cs.CV cs.AI 57%

Emotion-LLaMAv2 and MMEVerse: A New Framework and Benchmark for Multimodal Emotion Understanding

Emotion-LLaMAv2 和 MMEVerse:多模态情感理解的新框架和基准

Xiaojiang Peng, Jingyi Chen, Zebang Cheng, Bao Peng, Fengyi Wu, Yifei Dong, Shuyuan Tu, Qiyu Hu, Huiting Huang, Yuxiang Lin, Jun-Yan He, Kai Wang, Zheng Lian, Zhi-Qi Cheng

机构 * Shenzhen Technology University(深圳技术大学) Shenzhen University of Information Technology(深圳信息科技学院) University of Washington(华盛顿大学) Foundation Model Team, Meituan(美团基础模型团队) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Emotion-LLaMAv2和MMEVerse通过端到端多视图编码器、Conv Attention预融合模块和课程指令调制方案,提升了多模态情绪理解和推理能力,并构建了统一的多模态情绪基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16175 2026-02-24 cs.CV cs.AI 57%

Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight

Mantis:一种具有解耦视觉前瞻性能力的多功能视觉-语言-动作模型

Yi Yang, Xueqi Li, Yiyang Chen, Jin Song, Yihan Wang, Zipeng Xiao, Jiadi Su, You Qiaoben, Pengfei Liu, Zhijie Deng

机构 * SJTU(上海交通大学) SII(上海信息所) SUSTech(四川大学) NJUPT(南京工业大学) FDU(福建大学) BOSCH(博世)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Mantis通过解耦视觉前瞻性模块提升视觉-语言-动作模型的性能,实现高成功率和快速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23828 2026-02-24 cs.CL 57%

Beyond Understanding: Evaluating the Pragmatic Gap in LLMs' Cultural Processing of Figurative Language

超越理解:评估LLMs在处理隐喻语言中的文化差距

Mena Attia, Aashiq Muhamed, Mai Alkhamissi, Thamar Solorio, Mona Diab

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文评估了LLMs在处理隐喻语言中的文化理解差距,发现其在语用使用方面存在显著挑战,并发布了首个埃及阿拉伯语习语数据集用于进一步研究。

Comments EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03867 2026-02-24 cs.CL 57%

EuroGEST: Investigating gender stereotypes in multilingual language models

EuroGEST:研究多语言语言模型中的性别刻板印象

Jacqueline Rowe, Mateusz Klimaszewski, Liane Guillou, Shannon Vallor, Alexandra Birch

机构 * University of Edinburgh(爱丁堡大学) Warsaw University of Technology(华沙技术大学) Aveni

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 EuroGEST研究多语言语言模型中的性别刻板印象,通过跨29种欧洲语言的数据集揭示了性别刻板印象的普遍性及模型对刻板印象的编码强度。

Comments In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 32074-32096, Suzhou, China. Association for Computational Linguistics. 9 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13904 2026-02-24 cs.CL 57%

Calibrating Large Language Models with Sample Consistency

通过样本一致性校准大型语言模型

Qing Lyu, Kumar Shridhar, Chaitanya Malaviya, Li Zhang, Yanai Elazar, Niket Tandon, Marianna Apidianaki, Mrinmaya Sachan, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学) ETH Zurich(苏黎世联邦理工学院) University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 通过样本一致性方法提升大型语言模型的校准效果,改进其预测置信度评估和性能表现。

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18940 2026-02-24 cs.AI 57%

DREAM: Deep Research Evaluation with Agentic Metrics

DREAM: 基于代理度量的深度研究评估

Elad Ben Avraham, Changhao Li, Ron Dorfman, Roy Ganz, Oren Nuriel, Amir Dudai, Aviad Aberdam, Noah Flynn, Elman Mansimov, Adi Kalyanpur, Ron Litman

机构 * AWS Agentic AI(AWS敏捷人工智能) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 DREAM提出一种基于代理度量的深度研究评估框架,通过能力平衡原则解决现有基准在事实和时间衰减检测上的不足,实现可扩展的无参考评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18824 2026-02-24 cs.SI cs.AI 57%

UniRank: A Multi-Agent Calibration Pipeline for Estimating University Rankings from Anonymized Bibliometric Signals

UniRank:一种多智能体校准流程,用于从匿名化的引文计量信号中估算大学排名

Pedram Riyazimehr, Seyyed Ehsan Mahmoudi

机构 * NotionWave

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 UniRank通过多智能体校准流程,利用匿名化引文数据估算大学排名,实现零记忆误差和高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18731 2026-02-24 cs.AI 57%

Beyond Description: A Multimodal Agent Framework for Insightful Chart Summarization

超越描述:一种多模态代理框架用于深入的图表摘要

Yuhang Bai, Yujuan Ding, Shanru Lin, Wenqi Fan

机构 * The Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出多模态代理框架Chart Insight Agent Flow,通过结合MLLMs的感知与推理能力,提升图表摘要的深度和多样性,并引入新数据集ChartSummInsights以支持研究。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18693 2026-02-24 cs.CL 57%

Contradiction to Consensus: Dual Perspective, Multi Source Retrieval Based Claim Verification with Source Level Disagreement using LLM

与共识相悖:基于双视角、多源检索的声明验证系统,利用源级别分歧

Md Badsha Biswas, Ozlem Uzuner

机构 * George Mason University(乔治·梅奥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出基于双视角多源检索和跨源分歧分析的声明验证系统,利用LLM提升验证准确性并揭示来源差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18497 2026-02-24 cs.DB cs.AI 57%

PIPE-RDF: An LLM-Assisted Pipeline for Enterprise RDF Benchmarking

PIPE-RDF: 一个基于LLM的企业RDF基准测试流水线

Suraj Ranganath

机构 * UC San Deigo(加州大学圣地亚哥分校)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 PIPE-RDF通过反向查询和检索增强提示构建企业RDF基准测试,生成450个问题-SPARQL对,实现100%有效性验证。

Comments Conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18460 2026-02-24 cs.CY cs.AI cs.HC 57%

The Doctor Will (Still) See You Now: On the Structural Limits of Agentic AI in Healthcare

医生还会见你:论代理AI在医疗领域的结构性限制

Gabriela Aránguiz Dias, Kiana Jafari, Allie Griffith, Carolina Aránguiz Dias, Grace Ra Kim, Lana Saadeddin, Mykel J. Kochenderfer

机构 * Stanford University(斯坦福大学) University of Florida(佛罗里达大学) Montclair State University(蒙特克莱尔州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了代理AI在医疗领域应用中的结构性限制,指出技术期望、商业激励和临床约束的交汇对患者安全和责任归属产生实质性影响。

Comments 17 pages, 3 pages of appendix, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01678 2026-02-24 cs.LG 57%

HeurekaBench: A Benchmarking Framework for AI Co-scientist

HeurekaBench: 一个用于AI合作者的基准评估框架

Siba Smarak Panigrahi, Jovana Videnović, Maria Brbić

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL))

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 HeurekaBench通过创建基于真实科学流程的基准,为评估AI合作者提供了一种方法,通过半自动流程生成探索性问题,并展示了批评模块对提升代理性能的效果。

Comments 33 pages, 5 figures, 7 tables. Code available at https://github.com/mlbio-epfl/HeurekaBench. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24856 2026-02-24 cs.CL 57%

Do Large Language Models Grasp The Grammar? Evidence from Grammar-Book-Guided Probing in Luxembourgish

大型语言模型是否理解语法规则?来自卢森堡语语法书引导探测的证据

Lujun Li, Yewei Song, Lama Sleem, Yiqun Wang, Yangjie Xu, Cedric Lothritz, Niccolo Gentile, Radu State, Tegawende F. Bissyande, Jacques Klein

机构 * University of Luxembourg(卢森堡大学) Luxembourg Institute of Science and Technology(卢森堡科学与技术研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过卢森堡语语法书引导探测,探讨大型语言模型对语法规则的理解,发现翻译性能与语法规则理解弱相关,大模型在语义上表现良好但句法和形态学能力较弱,推理能力有助于提升语法规则理解。

Comments This paper has been accepted for publication in the proceedings of the 15th biennial Language Resources and Evaluation Conference (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05690 2026-02-24 cs.CL 57%

When to use Graphs in RAG: A Comprehensive Analysis for Graph Retrieval-Augmented Generation

在何时使用图在RAG中:图检索增强生成的全面分析

Zhishang Xiang, Chuanjie Wu, Qinggang Zhang, Shengyuan Chen, Zijin Hong, Xiao Huang, Jinsong Su

机构 * Xiamen University(厦门大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出GraphRAG-Bench基准,系统分析GraphRAG在不同任务中的表现,揭示其在特定场景下的优势与适用条件。

Comments All resources and analyses are collected at https://github.com/GraphRAG-Bench/GraphRAG-Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13662 2026-02-23 cs.CV cs.AI 57%

LeafNet: A Large-Scale Dataset and Comprehensive Benchmark for Foundational Vision-Language Understanding of Plant Diseases

LeafNet:一个大规模数据集和全面基准,用于植物病害的基础视觉-语言理解

Khang Nguyen Quoc, Phuong D. Dao, Luyl-Da Quach

机构 * School of Electrical Engineering, Korea University(韩国大学电气工程学院) Department of Integrative Biology, The University of Texas at Austin(德克萨斯大学奥斯汀分校整合生物学系) Department of Software Engineering, FPT University(FPT大学软件工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 LeafNet通过大规模多模态数据集和基准测试,揭示了VLMs在植物疾病理解中的性能差异,强调了多模态架构在提升诊断精度中的关键作用。

Comments 26 pages, 13 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17623 2026-02-20 cs.CL 57%

Unmasking the Factual-Conceptual Gap in Persian Language Models

揭示波斯语言模型中的事实-概念鸿沟

Alireza Sakhaeirad, Ali Ma'manpoosh, Arshia Hemmat

机构 * EPFL(瑞士联邦理工学院) University of Isfahan(伊斯法罕大学) University of Oxford(牛津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过DivanBench揭示波斯语言模型在文化常识推理上的不足,发现模型在处理迷信和习俗问题时存在严重偏差,且预训练并未提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17594 2026-02-20 cs.AI 57%

AI Gamestore: Scalable, Open-Ended Evaluation of Machine General Intelligence with Human Games

AI 游戏商店:通过人类游戏评估机器通用智能的可扩展性和开放性

Lance Ying, Ryan Truong, Prafull Sharma, Kaiya Ivy Zhao, Nathan Cloos, Kelsey R. Allen, Thomas L. Griffiths, Katherine M. Collins, José Hernández-Orallo, Phillip Isola, Samuel J. Gershman, Joshua B. Tenenbaum

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 通过AI GameStore评估机器通用智能,利用人类游戏测试AI在游戏中的表现,发现其在复杂游戏任务中表现不佳。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23482 2026-02-20 cs.RO cs.AI 57%

Theory of Mind for Explainable Human-Robot Interaction

可解释人机交互中的理论思维

Marie S. Bauer, Julia Gachot, Matthias Kerzel, Cornelius Weber, Stefan Wermter

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出将理论思维视为可解释人工智能的一种形式,通过XAI框架评估其在人机交互中的应用,并强调以用户为中心的解释方法。

Comments Accepted at the workshop on Theory of Mind for Artificial Intelligence (ToM4AI) at AAAI 2026

Journal ref Theory of Mind for Artificial Intelligence (ToM4AI) at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17222 2026-02-20 cs.AI 57%

Decoding the Human Factor: High Fidelity Behavioral Prediction for Strategic Foresight

解码人类因素:为战略预见的高保真行为预测

Ben Yellin, Ehud Ezra, Mark Foreman, Shula Grinapol

机构 * OMGene AI Lab(OMGene AI实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LBM模型,通过高维特质轮廓预测个体战略选择,提升高保真行为模拟能力,应用于战略预见等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15896 2026-02-19 cs.CL 57%

Every Little Helps: Building Knowledge Graph Foundation Model with Fine-grained Transferable Multi-modal Tokens

每一点帮助都有价值:通过细粒度可迁移多模态标记构建知识图谱基础模型

Yichi Zhang, Zhuo Chen, Lingbing Guo, Wen Zhang, Huajun Chen

机构 * Zhejiang University, Zhejiang, China(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出TOFU模型,通过细粒度可迁移多模态标记提升多模态知识图谱推理的跨图谱迁移能力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15850 2026-02-19 cs.CL 57%

Large Language Models for Assisting American College Applications

大型语言模型用于协助美国大学申请

Zhengliang Liu, Weihang You, Peng Shu, Junhao Chen, Yi Pan, Hanqi Jiang, Yiwei Li, Zhaojun Ding, Chao Cao, Xinliang Li, Yifan Zhou, Ruidong Zhang, Shaochen Xu, Wei Ruan, Huaqin Zhao, Dajiang Zhu, Tianming Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 EZCollegeApp 通过大型语言模型帮助高中生处理复杂大学申请流程,提供结构化表格、权威文件支持及人工控制,提升申请效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05023 2026-02-19 cs.CR cs.AI 57%

Do Vision-Language Models Respect Contextual Integrity in Location Disclosure?

视觉-语言模型在位置披露中是否尊重上下文完整性?

Ruixin Yang, Ethan Mendes, Arthur Wang, James Hays, Sauvik Das, Wei Xu, Alan Ritter

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了视觉-语言模型在位置披露中的隐私问题,指出现有模型在隐私保护方面存在不足,提出VLM-GEOPRIVACY基准以评估模型对上下文完整性的尊重程度。

Comments Accepted by ICLR 2026. Code and data can be downloaded via https://github.com/99starman/VLM-GeoPrivacyBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15270 2026-02-18 cs.AI 57%

Enhancing Diversity and Feasibility: Joint Population Synthesis from Multi-source Data Using Generative Models

增强多样性和可行性:利用生成模型从多源数据中联合合成人口

Farbod Abbasi, Zachary Patterson, Bilal Farooq

机构 * Concordia University(康科迪亚大学) Concordia Institute for Information Systems Engineering(康科迪亚信息系统工程研究所) Toronto Metropolitan University(多伦多 Metropolitan 大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出利用WGAN与梯度惩罚联合生成多源数据,提升合成人口的多样性和可行性,实验显示其在召回率和精确率上均优于传统方法。

Comments 12 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15212 2026-02-18 cs.AI 57%

Secure and Energy-Efficient Wireless Agentic AI Networks

安全且节能的无线代理人工智能网络

Yuanyan Song, Kezhi Wang, Xinmian Xu

机构 * Department of Computer Science, Brunel University of London(布鲁内尔大学计算机科学系) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种安全且节能的无线代理人工智能网络,通过动态分配代理和优化资源分配,提升服务质量并降低能耗。

Comments Submitted to journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16051 2026-02-18 cs.CL 57%

Moving Beyond Medical Exams: A Clinician-Annotated Fairness Dataset of Real-World Tasks and Ambiguity in Mental Healthcare

超越医学考试:一个由临床专家标注的现实任务及精神卫生领域模糊性公平性数据集

Max Lamparth, Declan Grabb, Amy Franks, Scott Gershan, Kaitlyn N. Kunstman, Aaron Lulla, Monika Drummond Roots, Manu Sharma, Aryan Shrivastava, Nina Vasan, Colleen Waickman

机构 * Stanford University(斯坦福大学) University of Colorado(科罗拉多大学) Northwestern University(西北大学) University of Wisconsin(威斯康星大学) Yale School of Medicine(耶鲁医学院) University of Chicago(芝加哥大学) Ohio State University(俄亥俄州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一个由临床专家标注的现实任务公平性数据集,用于评估模型在精神卫生领域决策中的性能和偏见问题。

Comments Camera-ready version for ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01445 2026-02-17 cs.LG 57%

A Meta-Knowledge-Augmented LLM Framework for Hyperparameter Optimization in Time-Series Forecasting

一种增强元知识的LLM框架用于时间序列预测中的超参数优化

Ons Saadallah, Mátyás andó, Tamás Gábor Orosz

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 LLM-AutoOpt通过结合贝叶斯优化与大型语言模型的上下文推理,提升时间序列预测中超参数优化的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏