arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2602.01193 2026-02-03 cs.CL cs.CV 57%

Bridging Lexical Ambiguity and Vision: A Mini Review on Visual Word Sense Disambiguation

弥合词汇歧义与视觉:关于视觉词义消歧的简要综述

Shashini Nilukshi, Deshan Sumanathilaka

机构 * School of Computing Informatics(计算与信息学学院) Institute of Technology(技术研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文综述了视觉词义消歧的发展,探讨了对比模型和LLM在解决词汇歧义中的作用,并指出未来发展方向。

Comments 2 figures, 2 Tables, Accepted at IEEE TIC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01163 2026-02-03 cs.CV cs.AI 57%

Semantically Aware UAV Landing Site Assessment from Remote Sensing Imagery via Multimodal Large Language Models

基于多模态大语言模型的语义感知无人机着陆地评估:从遥感图像

Chunliang Hua, Zeyuan Yang, Lei Zhang, Jiayang Sun, Fengwen Chen, Chunlan Zeng, Xiao Hu

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) LASER, International Digital Economy Academy(LASER,国际数字经济学院) Department of Electronic Engineering, East China Normal University(电子工程系,华东师范大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于多模态大语言模型的无人机着陆地评估方法,通过语义感知与多模态融合提升风险识别精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01030 2026-02-03 cs.CL cs.SD eess.AS 57%

Bias in the Ear of the Listener: Assessing Sensitivity in Audio Language Models Across Linguistic, Demographic, and Positional Variations

倾听者之偏见:评估音频语言模型在语言、人口统计和位置变化中的敏感性

Sheng-Lun Wei, Yu-Ling Liao, Yen-Hua Chang, Hen-Hsen Huang, Hsin-Hsi Chen

机构 * Department of Computer Science and Information Engineering, National Taiwan University, Taiwan(国家台湾大学计算机科学与信息工程系) Institute of Information Science, Academia Sinica, Taiwan(台湾学术院信息科学研究所) AI Research Center (AINTU), National Taiwan University, Taiwan(国家台湾大学人工智能研究中心(AINTU))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过BiasInEar数据集评估音频语言模型在语言、人口统计和位置变化中的敏感性,揭示语音放大结构性偏见的机制,并提出统一的公平性与稳健性评估框架。

Comments Accepted as a long findings paper at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07450 2026-02-03 cs.CV cs.CL 57%

GLEAM: Learning to Match and Explain in Cross-View Geo-Localization

GLEAM: 在跨视图地理定位中学习匹配与解释

Xudong Lu, Zhi Zheng, Yi Wan, Yongxiang Yao, Annan Wang, Renrui Zhang, Panwang Xia, Qiong Wu, Qingyun Li, Weifeng Lin, Xiangyu Zhao, Peifeng Ma, Xue Yang, Hongsheng Li

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 GLEAM提出了一种结合多模态、多视角对齐与可解释对应分析的CVGL方法,通过双阶段训练策略提升精度并增强可解释性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00376 2026-02-03 cs.LG 57%

MATRIX: A Multimodal Benchmark and Post-Training Framework for Materials Science

MATRIX: 一种用于材料科学的多模态基准和后训练框架

Delia McGrath, Curtis Chong, Rohil Kulkarni, Gerbrand Ceder, Adeesh Kolluru

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 MATRIX通过多模态后训练提升材料科学推理,展示视觉引导对实验解释和文本任务的显著改进。

Comments 17 pages, 9 Figures, submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00292 2026-02-03 cs.CV cs.AI 57%

LogicGaze: Benchmarking Causal Consistency in Visual Narratives via Counterfactual Verification

LogicGaze:通过反事实验证基准测试视觉叙事中的因果一致性

Rory Driscoll, Alexandros Christoforos, Chadbourne Davis

机构 * Boston University(波士顿大学) Suffolk University(索尔福德大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 LogicGaze通过反事实验证基准测试,评估视觉语言模型在视觉叙事中因果一致性验证的能力,揭示了现有模型在处理因果链和幻觉问题上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00026 2026-02-03 cs.CY cs.AI 57%

Strategies for Creating Uncertainty in the AI Era to Trigger Students Critical Thinking: Pedagogical Design, Assessment Rubric, and Exam System

人工智能时代创建不确定性的策略以激发学生批判性思维:教学设计、评估量规与考试系统

Ahmad Samer Wazan

机构 * Zayed University(泽耶德大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过创建人工智能时代的不确定性情境,结合可控AI工具和批判性评估量规,激发学生批判性思维的教学方法与考试系统设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23183 2026-02-02 cs.CL 57%

JobResQA: A Benchmark for LLM Machine Reading Comprehension on Multilingual Résumés and JDs

JobResQA:一个用于多语言简历和职位描述的LLM机器阅读理解基准

Casimiro Pio Carrino, Paula Estrella, Rabih Zbib, Carlos Escolano, José A. R. Fonollosa

机构 * Avature Machine Learning(Avature 机器学习) Universitat Politècnica de Catalunya(巴塞罗那理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 JobResQA是一个用于评估LLM在多语言简历和职位描述上的机器阅读理解能力的基准,揭示了多语言MRC在人力资源应用中的关键差距。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23058 2026-02-02 cs.LG 57%

From Absolute to Relative: Rethinking Reward Shaping in Group-Based Reinforcement Learning

从绝对到相对:重新思考基于群体的强化学习中的奖励塑造

Wenzhe Niu, Wei He, Zongxia Xie, Jinpeng Ou, Huichuan Fan, Yuchen Ge, Yanru Sun, Ziyin Wang, Yizhao Sun, Chengshun Shi, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * Tianjin University(天津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出RLRR框架,通过将奖励塑造从绝对评分转为相对排名,解决群体强化学习中奖励稳定性与监督稀疏性问题,并在推理和生成任务中取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20730 2026-02-02 cs.CL 57%

AgentLongBench: A Controllable Long Benchmark For Long-Contexts Agents via Environment Rollouts

AgentLongBench: 通过环境回放构建可控的长上下文代理基准

Shicheng Fang, Yuxin Wang, Xiaoran Liu, Jiahao Lu, Chuanyuan Tan, Xinchi Chen, Yining Zheng, Xuanjing Huang, Xipeng Qiu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 AgentLongBench通过模拟环境回放评估代理在长上下文任务中的表现,揭示代理在动态信息综合方面的不足。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01017 2026-02-02 cs.AI 57%

ChartAnchor: Chart Grounding with Structural-Semantic Fidelity

ChartAnchor: 图表接地与结构-语义保真

Xinhang Li, Jingbo Zhou, Pengfei Luo, Yixiong Xiao, Tong Xu

机构 * Baidu Research(百度研究) USTC

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 ChartAnchor提出一个综合图表接地基准测试,通过图表到代码生成和受控表格重建任务,评估模型在结构和数值层面的保真度,揭示MLLMs在数值精度和代码合成方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22699 2026-02-02 cs.CL 57%

Models Know Models Best: Evaluation via Model-Preferred Formats

模型最擅长模型评估:通过模型偏好的格式进行评估

Joonhak Lee, Sungmok Jung, Jongyeon Park, Jaejin Lee

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Dept. of Computer Science and Engineering, Seoul National University(计算机科学与工程系,首尔国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种动态格式对齐策略,通过模型生成的信号确定最佳评估格式,提升零样本准确率,揭示模型潜在能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22595 2026-02-02 cs.AI 57%

Learn More with Less: Uncertainty Consistency Guided Query Selection for RLVR

学得更多,用得更少:不确定性一致性引导的查询选择用于RLVR

Hao Yi, Yulan Hu, Xin Li, Sheng Ouyang, Lizhong Ding, Yong Liu

机构 * Renmin University of China(中国人民大学) Gaoling School of Artificial Intelligence(北京人工智能学院) Amap, Alibaba Group(阿里集团阿里的地图部门) School of Computer Science & Technology(计算机科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于不确定性一致性的查询选择方法,通过改进RLVR的样本选择策略,减少查询预算,提升推理任务的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22575 2026-02-02 cs.CV cs.CL 57%

PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios

PhoStream:面向移动场景的多模态助手实时流基准测试

Xudong Lu, Huankang Guan, Yang Bo, Jinpeng Chen, Xintong Guo, Shuhan Li, Fang Liu, Peiwen Sun, Xueying Li, Wei Zhang, Xue Yang, Rui Liu, Hongsheng Li

机构 * CUHK MMLab(CUHK 多模态实验室) Huawei Research(华为研究) City University of Hong Kong(城市大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PhoStream是首个面向移动场景的多模态助手实时流基准测试,通过统一屏幕内外场景评估视频、音频和时间推理能力,揭示了大语言模型在决定何时发言上的局限性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22076 2026-02-02 cs.LG cs.DC 57%

Where Do the Joules Go? Diagnosing Inference Energy Consumption

焦耳去哪儿了?诊断推理能耗

Jae-Won Chung, Ruofan Wu, Jeff J. Ma, Mosharaf Chowdhury

机构 * University of Michigan \& The ML.ENERGY Initiative

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 研究通过大规模测量发现生成式AI中不同任务和硬件配置对能耗的影响差异,并提出框架解释能耗与利用率等隐含指标的关系,为优化数据中心能耗提供依据。

Comments The ML ENERGY Leaderboard v3.0 is open at https://ml.energy/leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16993 2026-02-02 cs.DL cs.AI 57%

BibAgent: An Agentic Framework for Traceable Miscitation Detection in Scientific Literature

BibAgent: 一种用于科学文献中可追溯的误引检测代理框架

Peiran Li, Fangzhou Lin, Shuo Xing, Xiang Zheng, Xi Hong, Siyuan Yang, Jiashuo Sun, Zhengzhong Tu, Chaoqun Ni

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Worcester Polytechnic Institute(沃斯特理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 BibAgent是一种用于科学文献中可追溯误引检测的代理框架,通过整合检索、推理和自适应证据聚合,实现高效且透明的引文验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21903 2026-02-02 cs.SE cs.AI 57%

TOM-SWE: User Mental Modeling For Software Engineering Agents

TOM-SWE:软件工程代理的用户心理建模

Xuhui Zhou, Valerie Chen, Zora Zhiruo Wang, Graham Neubig, Maarten Sap, Xingyao Wang

机构 * Language Technology Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 TOM-SWE通过双代理架构实现用户心理建模,提升软件工程代理的任务成功率和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06307 2026-02-02 cs.AI 57%

Can AI Make Energy Retrofit Decisions? An Evaluation of Large Language Models

人工智能能做出能源改造决策吗?大型语言模型的评估

Lei Shu, Dong Zhao

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文评估了大型语言模型在住宅能源改造决策中的表现,发现其在技术目标上表现较好,但在社会技术决策上受限于经济权衡和本地环境,需进一步提升准确性与上下文处理能力。

Journal ref Buildings 2025, 15(22), 4081

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22155 2026-01-30 cs.CV cs.CL 57%

UEval: A Benchmark for Unified Multimodal Generation

UEval:一个统一多模态生成的评估基准

Bo Li, Yida Yin, Wenhao Chai, Xingyu Fu, Zhuang Liu

机构 * Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 UEval是一个评估统一多模态生成模型的基准,通过专家精选问题和评分表系统,揭示推理能力对复杂任务的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21977 2026-01-30 cs.HC cs.AI cs.CY 57%

From Particles to Agents: Hallucination as a Metric for Cognitive Friction in Spatial Simulation

从粒子到代理:幻觉作为空间模拟中认知摩擦的度量

Javier Argota Sánchez-Vaquerizo, Luis Borunda Monsivais

机构 * Computational Social Science. ETH Zürich(ETH Zurich计算社会科学) Virginia Tech School of Architecture(弗吉尼亚理工大学建筑学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出代理环境模拟,通过认知摩擦度量揭示建筑空间的象征性模糊,挑战传统HCI范式,提出人类中心的认知编排框架。

Comments Paper selected for the workshop Human Cognition, AI, and the Future of HCI: Navigating the Disruptive and Wild Landscape of Large Language Models and Agentic AI as part of the Human-Computer Interaction (HCI) conference of the Alpine region (AlpCHI 2026) hosted at the Congressi Stefano Franscini, March 1st to March 5th, 2026 on Monte Verità in Ascona, Switzerland

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21804 2026-01-30 cs.CL 57%

Distribution-Aware Reward Estimation for Test-Time Reinforcement Learning

面向分布的奖励估计用于测试时强化学习

Bodong Du, Xuanqi Huang, Xiaomeng Li

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology, Hong Kong, China(电子与计算机工程系,香港科学与技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 DARE通过利用回放分布而非单一多数结果来改进测试时强化学习的奖励估计,提高了优化稳定性和最终性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09277 2026-01-30 cs.CL 57%

NeuroFaith: Evaluating LLM Self-Explanation Faithfulness via Internal Representation Alignment

NeuroFaith:通过内部表示对齐评估LLM自解释的忠实性

Milan Bhan, Jean-Noel Vittaut, Nicolas Chesneau, Sarath Chandar, Marie-Jeanne Lesot

机构 * Sorbonne Université, CNRS, LIP6(索邦大学、国家科学研究中心、LIP6实验室) Mila - Quebec AI Institute, Université de Montréal(魁北克人工智能研究院、蒙特利尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 NeuroFaith通过内部表示对齐评估LLM自解释的忠实性,提出了一种灵活的框架和线性探针以提高模型的解释可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21551 2026-01-30 cs.CL 57%

Note2Chat: Improving LLMs for Multi-Turn Clinical History Taking Using Medical Notes

Note2Chat: 通过医疗笔记提升LLM在多轮临床病史采集中的表现

Yang Zhou, Zhenting Sheng, Mingrui Tan, Yuting Song, Jun Zhou, Yu Heng Kwan, Lian Leng Low, Yang Bai, Yong Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Note2Chat通过医疗笔记训练LLM提升多轮临床病史采集的准确性和效率

Comments Accepted at AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21420 2026-01-30 cs.LG 57%

ConceptMoE: Adaptive Token-to-Concept Compression for Implicit Compute Allocation

ConceptMoE: 适应性令牌到概念压缩以实现隐式计算分配

Zihao Huang, Jundong Zhou, Xingwei Qu, Qiyang Min, Ge Zhang

机构 * ByteDance Seed(字节跳动种子)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 ConceptMoE通过动态合并语义相似令牌实现隐式计算分配,提升语言和视觉语言任务性能,同时减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21403 2026-01-30 cs.AI cs.MA 57%

DataCross: A Unified Benchmark and Agent Framework for Cross-Modal Heterogeneous Data Analysis

DataCross: 一个统一的基准和代理框架,用于跨模态异构数据分析

Ruyi Qi, Zhou Liu, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 DataCross提出一个统一的基准和代理框架,用于跨模态异构数据分析,通过多步骤联合推理提升事实性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21342 2026-01-30 cs.AI 57%

Ostrakon-VL: Towards Domain-Expert MLLM for Food-Service and Retail Stores

Ostrakon-VL:面向食品服务与零售商店的领域专家MLLM

Zhiyong Shen, Gongpeng Zhao, Jun Zhou, Li Yu, Guandong Kou, Jichen Li, Chuanlei Dong, Zuncheng Li, Kaimao Li, Bingkun Wei, Shicheng Hu, Wei Xia, Wenguo Duan

机构 * Rajax Network Technology (Taobao Shangou of Alibaba)(Rajax网络技术(淘宝商购的阿里巴巴))

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Ostrakon-VL通过多阶段训练策略在FSRS场景中取得新突破,实现60.1的高分表现,超越现有模型并展示更高参数效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20975 2026-01-30 cs.CL 57%

DeepSearchQA: Bridging the Comprehensiveness Gap for Deep Research Agents

DeepSearchQA:弥合深度研究代理的全面性差距

Nikita Gupta, Riju Chatterjee, Lukas Haas, Connie Tao, Andrew Wang, Chang Liu, Hidekazu Oiwa, Elena Gribovskaya, Jan Ackermann, John Blitzer, Sasha Goldshtein, Dipanjan Das

机构 * Google(谷歌)

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 DeepSearchQA通过设计具有挑战性的多步骤信息检索任务,评估代理在复杂搜索计划中的全面性能力,揭示当前代理在高召回与精确性平衡上的局限性。

Comments DeepSearchQA can be found at https://www.kaggle.com/benchmarks/google/dsqa/leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13561 2026-01-30 cs.SE cs.AI 57%

OpenDerisk: An Industrial Framework for AI-Driven SRE, with Design, Implementation, and Case Studies

OpenDerisk: 一个面向AI驱动SRE的工业框架,包含设计、实现与案例研究

Peng Di, Faqiang Chen, Xiao Bai, Hongjun Yang, Qingfeng Li, Ganglin Wei, Jian Mou, Feng Shi, Keting Chen, Peng Tang, Zhitao Shen, Zheng Li, Wenhui Shi, Junwei Guo, Hang Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 OpenDerisk是一个专为SRE设计的开源多智能体框架,通过整合诊断协作模型、推理引擎和知识引擎,实现复杂问题的自动化解决,已在蚂蚁集团大规模部署并验证其高效性和可扩展性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10163 2026-01-30 cs.CL 57%

Compound-QA: A Benchmark for Evaluating LLMs on Compound Questions

Compound-QA:一个评估大语言模型在复合问题上的基准

Yutao Hou, Yajing Luo, Zhiwen Ruan, Hongru Wang, Weifeng Ge, Yun Chen, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海财经大学) University of Edinburgh(爱丁堡大学) Southern University of Science and Technology(南方科技大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Compound-QA基准通过评估LLM在复合问题上的表现,揭示其在理解和推理方面的不足,并提出改进策略。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20705 2026-01-29 cs.CV cs.AI 57%

LEMON: How Well Do MLLMs Perform Temporal Multimodal Understanding on Instructional Videos?

LEMON:大型语言模型在教学视频中的时间多模态理解表现如何?

Zhuang Yu, Lei Shen, Jing Zhao, Shiliang Sun

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 LEMON是一个针对教学视频的多模态理解评估基准,旨在评估大型语言模型在时间推理和跨模态整合方面的表现,揭示其在复杂教育内容中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏