arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-24 至 2025-11-24 共收录 48 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 6 篇

2511.17036 2025-11-24 cs.CL cs.CV 57%

Do Vision-Language Models Understand Visual Persuasiveness?

视觉-语言模型理解视觉说服力吗?

Gyuwon Park

机构 * Department of Computer Science and Engineering, UNIST(计算机科学与工程系,UNIST)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文研究视觉-语言模型对视觉说服力的理解,发现模型在链接说服对象与沟通意图方面存在局限。

Comments 8 pages (except for reference and appendix), 5 figures, 7 tables, to be published in NeurIPS 2025 Workshop: VLM4RWD

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11313 2025-11-24 cs.CV 50%

DocSLM: A Small Vision-Language Model for Long Multimodal Document Understanding

DocSLM:一种用于长多模态文档理解的小型视觉-语言模型

Tanveer Hannan, Dimitrios Mallios, Parth Pathak, Faegheh Sardari, Thomas Seidl, Gedas Bertasius, Mohsen Fayyaz, Sunando Sengupta

机构 * Microsoft(微软公司) LMU Munich(慕尼黑大学) MCML FAIR Meta(Meta FAIR) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 DocSLM通过高效的小型视觉-语言模型,在受限内存下实现长多模态文档理解,使用更少的资源达到与先进方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 11 篇

2511.17052 2025-11-24 cs.CV 82%

PathAgent: Toward Interpretable Analysis of Whole-slide Pathology Images via Large Language Model-based Agentic Reasoning

PathAgent: 通过基于大型语言模型的代理推理实现全切片病理图像的可解释分析

Jingyun Chen, Linghan Cai, Zhikang Wang, Yi Huang, Songhan Jiang, Shenjin Huang, Hongpeng Wang, Yongbing Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Fudan University(复旦大学) Sichuan University(四川大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 PathAgent通过基于大型语言模型的代理推理,实现全切片病理图像的可解释分析,展现出强大的零样本泛化能力和临床应用潜力。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16885 2025-11-24 cs.CL 79%

Improving Latent Reasoning in LLMs via Soft Concept Mixing

通过软概念混合改进大语言模型的潜在推理

Kang Wang, Xiangyu Duan, Tianyi Du

机构 * School of Computer Science and Technology, Soochow University(计算机科学与技术学院,苏州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 通过引入Soft Concept Mixing方法,改进大语言模型的潜在推理能力,提升推理性能并保持训练稳定性。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07772 2025-11-24 cs.CR cs.AI cs.CL cs.LG 75%

SALT: Steering Activations towards Leakage-free Thinking in Chain of Thought

SALT: 通过泄漏自由思考引导激活以避免链式思维中的信息泄露

Shourya Batra, Pierce Tillman, Samarth Gaggar, Shashank Kesineni, Kevin Zhu, Sunishchal Dev, Ashwinee Panda, Vasu Sharma, Maheep Chaudhary

机构 * Independent(独立研究者) RAND University of Maryland(马里兰大学) META Algoverse

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SALT通过在链式思维中注入引导向量减少隐私泄露,提升模型隐私保护能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15511 2025-11-24 cs.RO cs.AI 70%

AeroVerse: UAV-Agent Benchmark Suite for Simulating, Pre-training, Finetuning, and Evaluating Aerospace Embodied World Models

AeroVerse:用于模拟、预训练、微调和评估航空航天具身世界模型的UAV-Agent基准套件

Fanglong Yao, Yuanchang Yue, Youzhi Liu, Xian Sun, Kun Fu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Key Laboratory of Target Cognition and Application Technology(TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所目标认知与应用技术重点实验室)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 AeroVerse是一个用于模拟、预训练、微调和评估航空航天具身世界模型的基准套件,包含多个数据集和评估指标,旨在推动航空航天具身智能的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17238 2025-11-24 cs.CL cs.AI cs.CV 62%

Lost in Translation and Noise: A Deep Dive into the Failure Modes of VLMs on Real-World Tables

迷失在翻译与噪声中:对VLMs在现实表格上的失败模式的深入探讨

Anshul Singh, Rohan Chaudhary, Gagneet Singh, Abhay Kumary

机构 * Indian Institute of Science(印度科学研究院) Panjab University(旁遮普大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MirageTVQA通过多语言和视觉不完美的表格挑战VLMs,揭示了模型在现实噪声和语言转换中的失败模式。

Comments Accepted as Spotligh Talk at EurIPS 2025 Workshop on AI For Tabular Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17309 2025-11-24 cs.AI cs.CL 62%

RubiSCoT: A Framework for AI-Supported Academic Assessment

RubiSCoT:一种支持人工智能的学术评估框架

Thorsten Fröhlich, Tim Schlippe

机构 * IU International University of Applied Sciences(国际应用科学大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 RubiSCoT通过人工智能技术提升学术论文评估的效率和一致性,提供从提案到最终提交的全面评估解决方案。

Journal ref The 6th International Conference on Artificial Intelligence in Education Technology (AIET 2025), Munich, Germany, 29-31 July 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17131 2025-11-24 cs.SE cs.AI 57%

UI-CUBE: Enterprise-Grade Computer Use Agent Benchmarking Beyond Task Accuracy to Operational Reliability

UI-CUBE:超越任务准确性的企业级计算机使用代理基准测试到操作可靠性

Horia Cristescu, Charles Park, Trong Canh Nguyen, Sergiu Talmacel, Alexandru-Gabriel Ilie, Stefan Adam

机构 * UiPath Romania(UiPath罗马尼亚) UiPath UK(UiPath英国) UiPath France(UiPath法国)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 UI-CUBE通过系统性测试揭示CUA在复杂流程中的性能断崖,表明内存管理等架构限制而非训练优化可解决

Comments 18 pages, 8 figures, 5 tables. Benchmark comprising 226 tasks across two difficulty tiers. Code and benchmark available at https://github.com/UiPath/uipath_enterprise_benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16937 2025-11-24 cs.CV cs.AI 57%

OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios

OmniGround: 一个全面的时空接地基准用于现实复杂场景

Hong Gao, Jingyu Wu, Xiangkai Xu, Kangni Xie, Yunchen Zhang, Bin Zhong, Xurui Gao, Min-Ling Zhang

机构 * SouthEast University(东南大学) ZTE Corporation(中兴通讯)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 OmniGround提出一个全面的时空接地基准,通过改进的标注流程和评估框架,提升了复杂现实场景中视频目标定位的性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02894 2025-11-24 cs.LG cs.CR 57%

Adaptive and Robust Data Poisoning Detection and Sanitization in Wearable IoT Systems using Large Language Models

基于大语言模型的可适应和鲁棒数据污染检测与净化在可穿戴物联网系统中的应用

W. K. M Mithsara, Ning Yang, Ahmed Imteaj, Hussein Zangoti, Abdur R. Shahid

机构 * Southern Illinois University(辛辛那提大学) Florida Atlantic University(佛罗里达 Atlantic 大学) Jazan University(贾兹安大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出利用大语言模型进行可穿戴物联网系统中的数据污染检测与净化,通过角色扮演和逐步推理策略提升系统安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16853 2025-11-24 cs.CV 50%

Towards Unified Vision Language Models for Forest Ecological Analysis in Earth Observation

面向地球观测森林生态分析的统一视觉语言模型

Xizhe Xue, Xiao Xiang Zhu

机构 * Xizhe Xue 1, 2 Xiao Xiang Zhu 1, 2

专题命中 推理评测 :reasoning(abstract)

AI总结 REO-Instruct提出首个面向地球观测森林生态分析的统一视觉语言模型基准,旨在解决描述与回归任务中的多模态感知与生物物理变量对齐问题。

Comments AAAI2026 AI for Environmental Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09439 2025-11-24 eess.AS cs.SD 50%

Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?

Omni-R1:你真的需要音频来微调你的音频大语言模型吗?

Andrew Rouditchenko, Saurabhchand Bhati, Edson Araujo, Samuel Thomas, Hilde Kuehne, Rogerio Feris, James Glass

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Goethe University of Frankfurt(法兰克福歌德大学) IBM Research AI(IBM人工智能研究部) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 Omni-R1通过强化学习方法GRPO微调多模态大语言模型,实现了在音频问答任务上的新SOTA性能,同时发现文本推理能力提升对音频性能有显著贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 5 篇

2504.05185 2025-11-24 cs.CL 79%

Concise Reasoning via Reinforcement Learning

通过强化学习实现简洁推理

Mehdi Fatemi, Banafsheh Rafiee, Mingjie Tang, Kartik Talamadupula

机构 * Wand AI

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过强化学习提出两阶段方法,减少推理响应长度同时保持准确性,并揭示错误答案驱动冗长的优化副作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12972 2025-11-24 cs.CV cs.AI 79%

Aligning Vision to Language: Annotation-Free Multimodal Knowledge Graph Construction for Enhanced LLMs Reasoning

对齐视觉与语言:无需注释的多模态知识图谱构建以增强大语言模型推理

Junming Liu, Siyuan Meng, Yanting Gao, Song Mao, Pinlong Cai, Guohang Yan, Yirong Chen, Zilin Bian, Ding Wang, Botian Shi

机构 * Tongji University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Stanford University(斯坦福大学) New York University(纽约大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出 VaLiK 方法,通过跨模态信息补充构建无需注释的多模态知识图谱,提升大语言模型推理能力。

Comments 14 pages, 7 figures, 6 tables; Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16691 2025-11-24 cs.CL 57%

Reproducibility Report: Test-Time Training on Nearest Neighbors for Large Language Models

可重复性报告:为大语言模型进行邻近邻居测试时训练

Boyang Zhou, Johan Lindqvist, Lindsey Li

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 通过测试时训练邻近邻居方法,提升大语言模型在多种领域上的性能,尤其在结构化数据集上表现显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16998 2025-11-24 cs.CV 50%

VLM-Augmented Degradation Modeling for Image Restoration Under Adverse Weather Conditions

增强型退化建模用于恶劣天气下的图像修复

Qianyi Shao, Yuanfan Zhang, Renxiang Xiao, Liang Hu

专题命中 其他推理 :chain-of-thought(abstract)

AI总结 本文提出了一种结合视觉-语言模型和隐式记忆库的统一模型,用于在恶劣天气下高效恢复图像,提升了修复精度和计算效率。

Journal ref Proc. 2025 30th International Conference on Automation and Computing (ICAC), pp. 1-6, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18267 2025-11-24 cs.HC 50%

From Checking to Sensemaking: A Caregiver-in-the-Loop Framework for AI-Assisted Task Verification in Dementia Care

从验证到理解:一种护理人员在循环框架中的AI辅助任务验证方法用于痴呆症护理

Joy Lai, Kelly Beaton, David Black, Bing Ye, Alex Mihailidis

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出了一种护理人员在循环框架中的AI辅助任务验证方法,通过生成式AI支持照护者主导的任务验证,提升痴呆症护理中的信任与协作。

详情

展开后加载摘要…

URL PDF HTML 收藏