arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

1401.4606 2014-01-21 cs.AI 57%

Drake: An Efficient Executive for Temporal Plans with Choice

Patrick Raymond Conrad, Brian Williams

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Journal ref Journal Of Artificial Intelligence Research, Volume 42, pages 607-659, 2011

详情

展开后加载摘要…

URL PDF HTML 收藏
1207.4708 2013-06-24 cs.AI 57%

The Arcade Learning Environment: An Evaluation Platform for General Agents

Marc G. Bellemare, Yavar Naddaf, Joel Veness, Michael Bowling

专题命中 推理评测 :planning(abstract);分类 cs.AI

Journal ref Journal of Artificial Intelligence Research 47, pages 253-279

详情

展开后加载摘要…

URL PDF HTML 收藏
1211.4552 2012-11-20 cs.AI 57%

A Dataset for StarCraft AI \& an Example of Armies Clustering

Gabriel Synnaeve, Pierre Bessiere

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Artificial Intelligence in Adversarial Real-Time Games 2012, Palo Alto : United States (2012)

详情

展开后加载摘要…

URL PDF HTML 收藏
cs/0205022 2009-11-30 cs.AI cs.IR 57%

The Traits of the Personable

Naren Ramakrishnan

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10642 2025-04-16 cs.CV 56%

SilVar-Med: A Speech-Driven Visual Language Model for Explainable Abnormality Detection in Medical Imaging

Tan-Hanh Pham, Chris Ngo, Trong-Duong Bui, Minh Luu Quang, Tan-Huong Pham, Truong-Son Hy

机构 * Florida Institute of Technology(佛罗里达理工学院) Knovel Engineering Lab(诺维尔工程实验室) Vietnam Military Medical University(越南军事医科大学) Military Central Hospital(108陆军中央医院) Can Tho University of Medicine and Pharmacy(芹苴医药大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

专题命中 推理评测 :reasoning(abstract,comments)

Comments CVPR Multimodal Algorithmic Reasoning Workshop 2025 - SilVarMed

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.02459 2016-11-09 cs.HC 56%

Using cognitive agent-based simulation for the evaluation of indoor wayfinding systems

Helmut Schrom-Feiertag, Martin Stubenschrott, Georg Regal, Johann Schrammel, Volker Settgast

专题命中 推理评测 :planning(abstract,comments)

Comments 13th International Conference on Design & Decision Support Systems in Architecture and Urban Planning. June 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10687 2026-07-03 cs.MA cs.AI cs.CL cs.GT 版本更新 54%

Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents

谁获得奖励 & 谁受到责备?面向多LLM智能体的评估对齐训练信号

Chih-Hsuan, Yang, Tanwi Mallick, Le Chen, Krishnan Raghavan, Amal Gueroudji, Ian T. Foster, Rajeev Thakur

机构 * Argonne National Laboratory(阿贡国家实验室) University of Chicago(芝加哥大学)

专题命中 推理评测 :分类 cs.CL、cs.AI;reasoning(comments);planning(comments)

AI总结 提出一个理论框架,结合合作博弈归因与过程奖励建模,将系统级评估转化为智能体信用和消息级信号,用于多LLM智能体训练。

Comments Accepted at the NeurIPS 2025 Workshop on Bridging Language, Agent, and World Models for Reasoning and Planning (LAW 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27065 2026-08-28 cs.CV 新提交 50%

Video-OPSD: Exploiting Privileged Visual Evidence for On-Policy Self-Distillation in Video Large Language Models

Video-OPSD:利用特权视觉证据实现视频大语言模型中的在线自蒸馏

Ziyue Wang, Shiqi Huang, Weiwen Xu, Bihan Wen, Xudong Jiang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究提出Video-OPSD框架,利用视频内特权视觉证据构建自教师并优化令牌级蒸馏,在多个视频基准上优于标准OPSD,性能接近GRPO且训练时间大幅缩短,为Video-LLMs提供高效后训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26431 2026-08-28 cs.SD eess.AS 新提交 50%

AudioSpan: Spanning the Duration and Depth of Audio Comprehension

AudioSpan:覆盖音频理解的时长与深度

Wen Huang, Yunfei Chu, Meng Gao, Haolin He, Jin Xu

机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究提出覆盖10分钟至2小时音频的基准AudioSpan,含3240个分三认知层级的问题,评估12个大型音频-语言模型,发现从长音频提取相关事实是核心难点,该基准可公开获取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26067 2026-08-27 cs.CV 新提交 50%

StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models

StreamPI:面向视觉-语言-动作模型的流式多模态时序建模

Zhe Liu, Jinghua Hou, Yuxiang Lu, Zhenya Yang, Xianzhe Fan, Junwei Luo, Junyi Li, Ruihua Han, Zhi Hou, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) ACE Robotics(ACE机器人公司)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出StreamPI框架,为单帧VLA模型赋予时序推理能力,通过指令锚定时序建模、随机间隔流式训练等方法,在真实机器人与仿真基准任务上性能优于pi0.5。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25905 2026-08-27 cs.SE 新提交 50%

Answer Is Cheap, Show Me the Evidence! Augmenting Automated Vulnerability Assessment with Evidence

答案很廉价,给我看证据!用证据增强自动化漏洞评估

Shengyi Pan, Zelong Zheng, Jiayuan Zhou, Xing Hu, Xin Xia, Shanping Li

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对现有自动化漏洞评估方法缺乏证据支持的问题,提出EAVA框架,通过LLM智能体和两阶段训练流程实现更优性能,且提供的证据对安全专家实用。

Comments accepted by ISSTA 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16081 2026-08-27 cs.CV 版本更新 50%

SafeGesture: Evaluating Fine-Grained Hand Gesture Understanding in Vision-Language Models through Scenario-Conditioned Safety Interpretation

SafeGesture:通过场景条件安全解释评估视觉语言模型的细粒度手势理解能力

Taegang Kim, Saleh Afroogh, Junfeng Jiao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Urban Information Lab, The University of Texas at Austin(德克萨斯大学奥斯汀分校城市信息实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出SafeGesture基准,评估5款视觉语言模型的细粒度手势安全理解能力,发现模型存在感知与推理脱节,瓶颈为场景条件安全推理而非手势识别。

Comments 14 pages, 22 tables, 2 figures. Code and benchmark resources available at https://github.com/The-Responsible-AI-Initiative/SafeGesture

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13024 2026-08-27 cs.CE 版本更新 50%

TIEM: Temporal Integration of Hypergraph Evidence and Skill Memory for Event-Driven Financial Forecasting

TIEM:用于事件驱动金融预测的超图证据与技能记忆的时间整合框架

Wenjin Liu, Shen Pang, Chenxi Wang, Tiesunlong Shen, Zhe Cui, Xiaobao Wu, Anh Tuan Luu, Haoran Luo

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究针对事件驱动金融预测中大型语言模型智能体存在的证据鸿沟问题,提出带时间戳门控的TIEM框架,引入FinPURE基准,经多组金融基准验证其性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13207 2026-08-27 cs.CV 版本更新 50%

GTPred: Benchmarking MLLMs for Interpretable Geo-localization and Time-of-capture Prediction

GTPred:评估多模态大语言模型在可解释地理定位和拍摄时间预测中的基准测试

Jinnao Li, Tingzhu Chen, Changbo Wang

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(上海交通大学图像通信与信息处理研究院) School of Humanities, Shanghai Jiao Tong University(上海交通大学人文学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 GTPred是一个新的地理-时间预测基准测试,通过评估多模态大语言模型在可解释地理定位和拍摄时间预测中的表现,揭示了当前模型在世界知识和时空推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24269 2026-08-26 cs.SE cs.CR 新提交 50%

Towards LLM-Enhanced Android Taint Analysis

面向大语言模型增强的Android污点分析

Nicholas Miazzo, Marco Alecci, Jordan Samhi, Jacques Klein, Eleonora Losiouk

专题命中 推理评测 :reasoning(abstract)

AI总结 本文探究商用LLM能否有效推理Android应用的污点流,提出智能体交互策略,在DroidBench基准上Gemini-3 Flash的F1分数达0.96(优于FlowDroid的0.55),还能识别真实应用中FlowDroid未发现的潜在数据泄露,可补充传统静态污点分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23974 2026-08-26 cs.CV cs.MM 新提交 50%

Boot-and-Feedback Framework for Generalist-Expert Model Collaboration in Breast Ultrasound Diagnosis

用于乳腺超声诊断的通才-专家模型协作的引导与反馈框架

Ming Cheng, Hongyu Sun, Zhaolin Chen, Jun Liu, Hossein Rahmani, Qiuhong Ke

机构 * Monash University(莫纳什大学) Renmin University of China(中国人民大学) Lancaster University(兰卡斯特大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 针对乳腺超声诊断中深度学习的可靠性与可解释性难题,提出BooF框架实现MLLM与专家模型协作,经多数据集验证其性能优于现有最优方法。

Comments 5 pages, 2 figures. Published in ICASSP 2026

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23785 2026-08-26 cs.CR 新提交 50%

A Scenario-Based Evaluation of CRQC+AI Vulnerability Spectrum for TLS 1.3 Cryptographic Dependencies

针对TLS 1.3密码依赖项的CRQC+AI漏洞谱的基于场景的评估

Noel Grover, Mussie Haile, Brad Pedersen, Eric Uner, Bradley J Erickson

专题命中 推理评测 :reasoning(abstract)

AI总结 本文基于四场景能力模型评估TLS 1.3密码依赖项的CRQC+AI漏洞谱,明确NIST算法未被破解,提出PQC迁移强制要求及相关补充措施。

Comments 23 figures, 68 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00468 2026-08-26 cs.SE 版本更新 50%

Cloud-OpsBench: A Reproducible Benchmark for Agentic Root Cause Analysis in Cloud Systems

Cloud-OpsBench: 一种可重现的云系统代理根本原因分析基准

Yilun Wang, Guangba Yu, Haiyu Huang, Yujie Huang, Zirui Wang, Pengfei Chen, Michael R. Lyu

专题命中 推理评测 :reasoning(abstract)

AI总结 Cloud-OpsBench 是一个用于云系统代理根本原因分析的可重现基准,通过构建确定性数字孪生,提供数据引擎、强化学习环境和诊断标准,支持下一代SRE研究。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19001 2026-08-26 cs.CV 版本更新 50%

Life-Bench: A Benchmark and Knowledge Graph Framework for Multimodal Personalization Beyond Concept Recognition

一个用于高级多模态个性化研究的基准和知识引导框架

Xia Hu, Honglei Zhuang, Brian Potetz, Alireza Fathi, Bo Hu, Babak Samari, Howard Zhou

机构 * Google(谷歌) DeepMind(深Mind)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Life-Bench基准和LifeGraph框架,用于解决高级多模态个性化研究中的复杂任务挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22281 2026-08-25 eess.IV cs.CV 新提交 50%

CiUNet: A Hybrid Swin-CNN UNet for Medical Image Segmentation

CiUNet:用于医学图像分割的混合Swin-CNN UNet

Bin Dong, Jinghong Chen

机构 * Ciphowork GmbH(Ciphowork有限公司)

专题命中 推理评测 :reasoning(abstract)

AI总结 针对医学图像分割的隐私、效率需求,提出基于Swin-UNet的混合架构,融合并行CNN编码器与XSkip连接等,在Synapse数据集上实现SOTA分割性能,为临床部署提供可行方案。

Comments 14 pages, 3 figures. The demo predictor and trained weights are available at:https://github.com/ciphoBD/CiUNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22660 2026-08-25 cs.CY 新提交 50%

Evaluation in the Age of AI: Output as Evidence of Learning

AI时代的评价:输出作为学习的证据

Md Zarzees Uddin Shah Chowdhury, Samin Rahman Khan

专题命中 推理评测 :reasoning(abstract)

AI总结 本文探讨AI时代大学教育评价的伦理挑战,指出传统评价指标易被AI外包的问题,提出需转向重视过程的替代评价模式,以保留学生自主性与问责制。

Comments 12 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22323 2026-08-25 cs.CV 新提交 50%

MedReaMM: Evaluating Large Multimodal Models on Expert-Level Clinical Diagnostic Synthesis

MedReaMM:评估大型多模态模型在专家级临床诊断综合能力上的表现

Lai Wei, Yuchao Chen, Zhenbiao Cao, Xiaojin Zhang, Zhongyu Wei, Bangting Wang, Wei Chen, Xiang Bai

机构 * The First Affiliated Hospital with Nanjing Medical University(南京医科大学第一附属医院) Jiangsu Province Hospital(江苏省医院) Huazhong University of Science Technology(华中科技大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究构建了多模态临床诊断基准MedReaMM,评估23个大型多模态模型的诊断综合能力,发现多数模型准确率不足50%,揭示了该领域的能力差距及相关影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22004 2026-08-25 cs.SE 新提交 50%

LLM-Enhanced Commit Message Generation via Issue Information: An Exploratory Study

结合问题信息的大语言模型增强型提交消息生成:一项探索性研究

Zongen Ren, Wei Shi, Bo Xiong, Chong Wang, Peng Liang

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究提出ISAC框架,将代码差异与问题信息结合作为LLM输入生成提交消息,经实验验证其性能优于现有基线,且纳入问题信息可提升CMG效果。

Comments 28 pages, 7 images, 11 tables, Manuscript submitted to a journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31192 2026-08-25 cs.CV 版本更新 50%

Specialist-Generalist Fusion with Outcome-Supervised Rationales for Deepfake Detection

语言训练深度伪造检测器的正则化能力

Benedikt Hopf, Zongwei Wu, Radu Timofte

机构 * Computer Vision Lab, CAIDAS, University of Würzburg(计算机视觉实验室,CAIDAS,乌尔姆大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出利用多模态大语言模型的双编码器架构和两阶段训练,通过语言正则化缓解过拟合,提升深度伪造检测的泛化性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00968 2026-08-25 cs.HC 版本更新 50%

SherpaAI: A Multi-modal Solution for Delivering Personalized and Adaptive Fitness Interventions

FlexAI: 一种多模态解决方案,用于提供个性化和自适应的健身干预

Shivangi Agarwal, Zoya Ghoshal, Bharat Jain, Siddharth

专题命中 推理评测 :reasoning(abstract)

AI总结 FlexAI通过整合计算机视觉、生理传感器和大语言模型,提供实时个性化健身指导,显著提升用户参与度和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18537 2026-08-25 cs.SE 版本更新 50%

CRANE-LLM: Runtime-Augmented LLMs for Crash Prediction and Diagnosis in ML Notebooks

运行时增强的LLM用于ML笔记本的崩溃检测与诊断

Yiran Wang, José Antonio Hernández López, Ulf Nilsson, Dániel Varró

专题命中 推理评测 :reasoning(abstract)

AI总结 CRANE-LLM通过整合运行时信息提升ML笔记本崩溃检测与诊断的准确性与F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23155 2026-08-25 cs.RO 版本更新 50%

LaGEA: Language Guided Embodied Agents for Robotic Manipulation

LAGEA:基于语言引导的机器人操作代理

Abdul Monaf Chowdhury, Akm Moshiur Rahman Mazumder, Safaeid Hossain Arib, Rabeya Akter

机构 * Department of Robotics Mechatronics Engineering, University of Dhaka, Bangladesh Center for Computational \& Data Sciences, Independent University, Bangladesh

专题命中 推理评测 :reasoning(abstract)

AI总结 LAGEA通过语言引导具身代理学习,提升机器人操作任务的成功率和效率。

Comments ICML 2026 Main Track Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21133 2026-08-24 cs.CV cs.CR 新提交 50%

Masking Is Not Enough: Generative Restoration for Multimodal De-Identification in Medical AI

仅掩码不足:面向医疗AI的多模态去标识化生成式修复

Shiva Shrestha, Zongxing Xie, Chen Zhao, Liran Ma, Zhipeng Cai, Honghui Xu

机构 * Kennesaw State University(肯尼索州立大学) Miami University(迈阿密大学) Georgia State University(佐治亚州立大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 针对医疗图像-文本数据的PHI泄漏问题,提出端到端多模态净化框架ClinX,结合图像侧生成式修复与文本侧渐进式去标识化,在MedVQA中验证其优于仅OCR掩码的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17474 2026-08-24 eess.AS cs.SD 版本更新 50%

Benchmarking Commercial Speech Recognition and Multimodal Large Language Models on Dysarthric Speech: Severity-Stratified Baselines and Architecture-Specific Prompting Effects

基于商业自动语音识别和多模态大语言模型的口吃语音零样本识别

Ali Alsayegh, Tariq Masood

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究评估了商业ASR和MLLM在口吃语音识别中的性能,发现GPT-4o在重度口吃情况下显著降低WER,而Gemini变体表现下降,为辅助语音接口技术选择提供实证依据。

Comments 32 pages. Revised peer-reviewed version. Updated dataset filtering and transcript normalization, expanded four-condition prompting ablation and error analysis, and revised statistical reporting. Published in International Journal of Intelligent Systems

Journal ref International Journal of Intelligent Systems, 2026; 2026:6065038

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17546 2026-08-21 cs.SE 版本更新 50%

REST API Testing with Verified LLM-Inferred Dependencies and Response-Driven Refinement

基于经验证的LLM推断依赖关系与响应驱动优化的REST API测试

Tu Nguyen, Thanh Nguyen, Huy Nguyen, Viet Nguyen, Tien N. Nguyen, Vu Nguyen

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出APIPilot框架,通过执行验证LLM推断的REST API依赖关系,结合响应驱动优化,在16个真实API上实现高覆盖率与成功率,优于现有基线。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏