arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2512.15949 2025-12-19 cs.CV 50%

The Perceptual Observatory Characterizing Robustness and Grounding in MLLMs

感知观测站:多模态大语言模型的鲁棒性与基础性表征

Tejas Anvekar, Fenil Bardoliya, Pavan K. Turaga, Chitta Baral, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 感知观测站通过系统性扰动和真实数据集,评估多模态大语言模型在视觉基础性和关系结构上的鲁棒性,揭示其在扰动下的表现,为模型分析提供系统基础。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15251 2025-12-19 cs.SE 50%

Input Reduction Enhanced LLM-based Program Repair

输入减少增强的基于大语言模型的程序修复

Boyang Yang, Luyao Ren, Xin Yin, Jiadong Ren, Haoye Tian, Shunfu Jin

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究提出ReduceFix方法,通过减少故障诱导输入提升基于LLM的程序修复性能,实验表明其在多个基准上显著提高了修复准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05788 2025-12-18 eess.SY cs.SY 50%

Task-Specific Trust Evaluation for Multi-Hop Collaborator Selection via GNN-Aided Distributed Agentic AI

基于图神经网络的多跳协作者选择任务特定信任评估

Botao Zhu, Xianbin Wang, Dusit Niyato

专题命中 推理评测 :planning(abstract)

AI总结 本文提出基于图神经网络的分布式代理人工智能框架,用于多跳协作者选择中的任务特定信任评估,通过整合设备可信度评估结果,实现隐私保护的任务路径规划。

Journal ref IEEE Journal on Selected Areas in Communications, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05195 2025-12-18 cs.CE 50%

Using Large Language Models for Solving Thermodynamic Problems

利用大语言模型解决热力学问题

Rebecca Loubet, Pascal Zittlau, Luisa Vollmer, Marco Hoffmann, Sophie Fellenz, Fabian Jirasek, Heike Leitte, Hans Hasse

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究了大语言模型在解决热力学问题中的能力,发现其在简单问题上表现良好,但在复杂问题上存在理解不足和推理能力有限的问题,需进一步整合领域知识。

Comments This document is the unedited Author's version of a Submitted Work to Computers and Chemical Engineering. 19 pages, 2 figures, SI available (15 pages)

Journal ref Comput. Chem. Eng. 204 (2026) 109333

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12592 2025-12-16 cs.CY 50%

Beyond Static Scoring: Enhancing Assessment Validity via AI-Generated Interactive Verification

超越静态评分:通过AI生成的交互验证提升评估效度

Tom Lee, Sihoon Lee, Seonghun Kim

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出人机协作框架,通过AI生成的交互验证提升评估效度,解决传统静态评分无法捕捉过程证据的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12224 2025-12-16 cs.SE cs.CR 50%

Cluster-guided LLM-Based Anonymization of Software Analytics Data: Studying Privacy-Utility Trade-offs in JIT Defect Prediction

基于聚类的LLM软件分析数据匿名化:研究JIT缺陷预测中的隐私-效用权衡

Maaz Khan, Gul Sher Khan, Ahsan Raza, Pir Sami Ullah, Abdul Ali Bangash

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出基于LLM的聚类引导去标识化方法,用于JIT缺陷预测中的隐私-效用权衡研究,通过上下文感知参数配置提升隐私保护水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12107 2025-12-16 cs.CV 50%

EchoVLM: Measurement-Grounded Multimodal Learning for Echocardiography

EchoVLM:基于测量的多模态学习用于超声心动图

Yuheng Li, Yue Zhang, Abdoul Aziz Amadou, Yuxiang Lai, Jike Zhong, Tiziano Passerini, Dorin Comaniciu, Puneet Sharma

机构 * Georgia Institute of Technology(佐治亚理工学院) Siemens Healthineers(西门子医疗) Siemens Healthcare Limited(西门子医疗有限公司) Emory University(埃默里大学) University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 EchoVLM通过引入基于测量的多模态学习方法,实现了超声心动图的端到端解读,提升了疾病分类和视图识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11805 2025-12-16 cs.CY 50%

AI Integration In ERP Evaluation Across Trends and Architectures

人工智能在ERP评估中的整合:跨趋势与架构

Monu Sharma

专题命中 推理评测 :planning(abstract)

AI总结 本文提出了一种理论模型,将AI赋能的ERP性能评估指标与预测智能和自适应自动化相结合,以改进AI整合ERP的评估方法。

Comments 9 pages, 2 Figures. Journal of Information Systems Engineering and Management,2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11680 2025-12-15 cs.CV 50%

Cross-modal Context-aware Learning for Visual Prompt Guided Multimodal Image Understanding in Remote Sensing

跨模态上下文感知学习:用于遥感中视觉提示引导的多模态图像理解

Xu Zhang, Jiabin Fang, Zhuoming Ding, Jin Yuan, Xuan Liu, Qianjun Zhang, Zhiyong Li

机构 * College of Computer Science and Electronic Engineering, Hunan University(计算机科学与电子工程学院,湖南大学) School of Robotics and the National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人学院及机器人视觉感知与控制技术国家工程研究中心,湖南大学) School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算与人工智能学院,西南交通大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 CLV-Net通过跨模态上下文感知学习,利用视觉提示引导遥感多模态图像理解,提升目标识别精度和用户意图对齐能力。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06915 2025-12-15 cs.SE 50%

Multi-Docker-Eval: A `Shovel of the Gold Rush' Benchmark on Automatic Environment Building for Software Engineering

多Docker评估:软件工程自动环境构建的‘淘金之铲’基准

Kelin Fu, Tianyu Liu, Zeyu Shang, Yingwei Ma, Jian Yang, Jiaheng Liu, Kaigui Bian

专题命中 推理评测 :reasoning(abstract)

AI总结 Multi-Docker-Eval基准通过评估自动环境构建的性能,揭示了当前模型在成功率、效率及影响因素上的关键发现,为构建全自动SWE流水线提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11039 2025-12-15 cs.SD 50%

Listening Between the Frames: Bridging Temporal Gaps in Large Audio-Language Models

在帧之间倾听:在大型音频-语言模型中弥合时间缺口

Hualei Wang, Yiming Li, Shuo Ma, Hong Liu, Xiangdong Wang

专题命中 推理评测 :reasoning(abstract)

AI总结 TimeAudio通过引入时间标记和绝对时间编码,提升大型音频-语言模型在时间定位和长音频理解上的能力,有效解决时间戳表示、架构和数据限制问题。

Comments Accepted by The Fortieth AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10619 2025-12-12 cs.CV 50%

DOCR-Inspector: Fine-Grained and Automated Evaluation of Document Parsing with VLM

DOCR-Inspector: 基于VLM的文档解析细粒度与自动化评估

Qintong Zhang, Junyuan Zhang, Zhifei Ren, Linke Ouyang, Zichen Wen, Junbo Niu, Yuan Qu, Bin Wang, Ka-Ho Chow, Conghui He, Wentao Zhang

机构 * Peking University(北京大学) Shanghai AI Laboratory(上海人工智能实验室) The University of HongKong(香港大学) Shanghai Jiaotong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 DOCR-Inspector通过细粒度错误检测和分析,提供文档解析质量的自动化评估,优于现有商业和开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10487 2025-12-12 cs.CR 50%

LLM-Assisted AHP for Explainable Cyber Range Evaluation

基于大语言模型的AHP可解释性网络评估

Vyron Kampourakis, Georgios Kavallieratos, Georgios Spathoulas, Vasileios Gkioulos, Sokratis Katsikas

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出基于大语言模型的AHP方法,用于可解释性网络评估,通过多准则决策方法评估CR平台的技术真实性和其他关键因素,实现一致的评估标准和可重复的对比结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09913 2025-12-11 cs.CV 50%

NordFKB: a fine-grained benchmark dataset for geospatial AI in Norway

NordFKB:挪威地理空间AI的细粒度基准数据集

Sander Riisøen Jyhne, Aditya Gupta, Ben Worsley, Marianne Andersen, Ivar Oveland, Alexander Salveson Nossum

机构 * Kartverket Kristiansand(挪威地图局克里斯蒂安桑分部) University of Agder(阿格德大学) Norkart Kristiansand(挪威地图公司克里斯蒂安桑分部)

专题命中 推理评测 :planning(abstract)

AI总结 NordFKB为挪威地理空间AI提供细粒度基准数据集,包含高分辨率影像和详细注释,支持语义分割和目标检测的标准化评估。

Comments 8 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23981 2025-12-11 cs.CV 50%

TeleEgo: Benchmarking Egocentric AI Assistants in the Wild

TeleEgo:在真实场景中评估第一人称AI助手的基准测试

Jiaqi Yan, Ruilong Ren, Jingren Liu, Shuning Xu, Ling Wang, Yiheng Wang, Xinlin Zhong, Yun Wang, Long Zhang, Xiangyu Chen, Changzhi Sun, Jixiang Luo, Dell Zhang, Hao Sun, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 推理评测 :reasoning(abstract)

AI总结 TeleEgo是一个用于评估第一人称AI助手在真实场景中多模态处理能力的基准测试,通过长持续时间流媒体数据和严格评估指标,推动未来具有更强流媒体记忆能力的助手发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02022 2025-12-11 cs.CV 50%

Do You See Me : A Multidimensional Benchmark for Evaluating Visual Perception in Multimodal LLMs

你看见我:一个多维基准用于评估多模态大语言模型的视觉感知

Aditya Kanade, Tanuja Ganu

机构 * Microsoft Research India(微软印度研究院)

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究提出‘你看见我’基准,评估多模态大语言模型的视觉感知能力,发现其在复杂任务中表现远低于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08233 2025-12-10 cs.RO 50%

Semantic-Metric Bayesian Risk Fields: Learning Robot Safety from Human Videos with a VLM Prior

语义-度量贝叶斯风险场:从人类视频中学习机器人安全性的方法

Timothy Chen, Marcus Dominguez-Kuhne, Aiden Swann, Xu Liu, Mac Schwager

机构 * Stanford University(斯坦福大学) California Institute of Technology(加州理工学院)

专题命中 推理评测 :planning(abstract)

AI总结 本文提出基于贝叶斯框架的语义-度量风险场,通过人类视频学习机器人安全风险模型,实现类人风险评估与规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07007 2025-12-10 cs.CV 50%

MELLM: A Flow-Guided Large Language Model for Micro-Expression Understanding

MELLM:一种面向微表情理解的流引导大型语言模型

Sirui Zhao, Zhengye Zhang, Shifeng Liu, Xinglong Mao, Shukang Yin, Chaoyou Fu, Tong Xu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) Nanjing University(南京大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 MELLM通过结合光学流敏感性与LLM推理能力,首次实现对微表情的全面理解,显著提升微表情识别的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04650 2025-12-09 cs.CV 50%

EncQA: Benchmarking Vision-Language Models on Visual Encodings for Charts

EncQA:在图表视觉编码上评估视觉-语言模型的基准测试

Kushin Mukherjee, Donghao Ren, Dominik Moritz, Yannick Assogba

机构 * Stanford University(斯坦福大学) Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract)

AI总结 EncQA通过系统覆盖图表理解的关键视觉编码和任务,揭示了不同编码和任务间VLMs性能的显著差异,强调了针对性策略的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14069 2025-12-09 cs.IR 50%

Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement Learning

过程奖励与结果奖励:哪种对代理RAG强化学习更有效

Wenlin Zhang, Xiangyang Li, Kuicai Dong, Yichao Wang, Pengyue Jia, Xiaopeng Li, Yingyi Zhang, Derong Xu, Zhaocheng Du, Huifeng Guo, Ruiming Tang, Xiangyu Zhao

专题命中 推理评测 :reasoning(abstract)

AI总结 ReasonRAG通过过程级奖励提升代理RAG强化学习性能,以更高效训练和更少数据实现更优结果

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06589 2025-12-09 cs.CR cs.CV 50%

OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation

OmniSafeBench-MM:多模态 jailbreak 攻击-防御评估的统一基准和工具箱

Xiaojun Jia, Jie Liao, Qi Guo, Teng Ma, Simeng Qin, Ranjie Duan, Tianlin Li, Yihao Huang, Zhitao Zeng, Dongxian Wu, Yiming Li, Wenqi Ren, Xiaochun Cao, Yang Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学) BraneMatrix AI, China(BraneMatrix AI) Chongqing University, China(重庆大学) Xi’an Jiaotong University, China(西安交通大学) Northeastern University, China(东北大学) Sun Yat-sen University, China(中山大学) Alibaba, China(阿里巴巴) National University of Singapore, Singapore(新加坡国立大学) ByteDance, China(字节跳动)

专题命中 推理评测 :reasoning(abstract)

AI总结 OmniSafeBench-MM提供一个多模态jailbreak攻击-防御评估的统一基准和工具箱,整合13种攻击方法、15种防御策略及广泛数据集,通过三维评估协议深入分析安全与效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06376 2025-12-09 cs.CV 50%

Are AI-Generated Driving Videos Ready for Autonomous Driving? A Diagnostic Evaluation Framework

AI生成的驾驶视频是否准备好用于自动驾驶?一种诊断评估框架

Xinhao Xiang, Abhijeet Rastogi, Jiawei Zhang

机构 * IFM Lab, University of California, Davis(加州大学戴维斯分校IFM实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出了一种诊断评估框架,系统研究AI生成驾驶视频在自动驾驶训练和评估中的可靠性,通过分析失败模式和构建基准测试,验证了过滤AIGVs可提升性能并补充现实数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18908 2025-12-08 eess.AS 50%

A Survey on Speech Large Language Models for Understanding

语音大语言模型理解综述

Jing Peng, Yucheng Wang, Bohan Li, Yiwei Guo, Hankun Wang, Yangui Fang, Yu Xi, Haoyu Li, Xu Li, Ke Zhang, Shuai Wang, Kai Yu

专题命中 推理评测 :reasoning(abstract)

AI总结 本文综述了语音大语言模型的理解方法,分析其架构并提出解决指令敏感性和语义推理退化问题的方向。

Comments This paper has been ACCEPTED for publication as a SPECIAL ISSUE paper in the IEEE Journal of Selected Topics in Signal Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04673 2025-12-05 cs.SE 50%

Cross-Task Benchmarking and Evaluation of General-Purpose and Code-Specific Large Language Models

跨任务基准测试与通用型和代码特定大型语言模型的评估

Gunjan Das, Paheli Bhattacharya, Rishabh Gupta

专题命中 推理评测 :reasoning(abstract)

AI总结 本文评估了通用和代码特定大型语言模型在跨任务基准测试中的表现,发现代码优化模型在推理和语法精确度上优于通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03064 2025-12-04 cs.SI 50%

Demographic Inference from Social Media Data with Multimodal Foundation Models: Strategies, Evaluation, and Benchmarking

从社交媒体数据中推断人口特征:多模态基础模型的策略、评估与基准测试

Hao Yang, Angela Yao, Eric Chang, Hexiang Wang

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究利用GPT-5多模态基础模型,从社交媒体资料中推断年龄、性别和种族,展示了其在提高人口特征推断准确性、公平性和可扩展性方面的潜力。

Comments 21 pages, 10 figures and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22826 2025-12-04 cs.CV 50%

Some Modalities are More Equal Than Others: Decoding and Architecting Multimodal Integration in MLLMs

某些模态比其他模态更平等:在MLLMs中解码和架构多模态整合

Tianle Chen, Chaitanya Chakka, Arjun Reddy Akula, Xavier Thomas, Deepti Ghadiyaram

机构 * Boston University(波士顿大学) Google DeepMind(谷歌DeepMind)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究了多模态大语言模型对矛盾模态的鲁棒性,提出模态对齐调优策略以提升多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19582 2025-12-04 cs.CV 50%

Guard Me If You Know Me: Protecting Specific Face-Identity from Deepfakes

Kaiqing Lin, Zhiyuan Yan, Ke-Yue Zhang, Li Hao, Yue Zhou, Yuzhen Lin, Weixiang Li, Taiping Yao, Shouhong Ding, Bin Li

机构 * Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) Shenzhen Key Laboratory of Media Security(深圳媒体安全重点实验室) SZU-AFS Joint Innovation Center for AI Technology(深圳大学-腾讯优图联合创新中心) Shenzhen University(深圳大学) School of Electronic and Computer Engineering(电子与计算机工程学院) Peking Univerisity(北京大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02492 2025-12-03 cs.CV 50%

YingVideo-MV: Music-Driven Multi-Stage Video Generation

YingVideo-MV: 基于音乐的多阶段视频生成

Jiahui Chen, Weida Wang, Runhua Shi, Huan Yang, Chaofan Ding, Zihao Chen

机构 * AI Lab, GiantNetwork(人工智能实验室)

专题命中 推理评测 :planning(abstract)

AI总结 YingVideo-MV通过整合音频语义分析、时间感知扩散模型和摄像机运动控制模块,实现了基于音乐的高质量视频生成。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01989 2025-12-02 cs.CV 50%

PAI-Bench: A Comprehensive Benchmark For Physical AI

PAI-Bench: 一个全面的物理AI基准

Fengzhe Zhou, Jiannan Huang, Jialuo Li, Deva Ramanan, Humphrey Shi

机构 * Georgia Tech(佐治亚理工学院) CMU(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 PAI-Bench通过评估视频生成和理解任务,揭示了当前模型在物理合理性和动态一致性上的不足,为物理AI的发展指明了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01827 2025-12-02 cs.CV 50%

CauSight: Learning to Supersense for Visual Causal Discovery

CauSight: 通过因果推理进行视觉因果发现

Yize Zhang, Meiqi Chen, Sirui Chen, Bo Peng, Yanxi Zhang, Tianyu Li, Chaochao Lu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Tongji University(同济大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 CauSight通过因果推理进行视觉因果发现,利用因果图数据集和强化学习方法,实现对视觉因果关系的高效发现。

Comments project page: https://github.com/OpenCausaLab/CauSight

详情

展开后加载摘要…

URL PDF HTML 收藏