arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-24 至 2025-11-24 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 11 篇

2511.17052 2025-11-24 cs.CV 82%

PathAgent: Toward Interpretable Analysis of Whole-slide Pathology Images via Large Language Model-based Agentic Reasoning

PathAgent: 通过基于大型语言模型的代理推理实现全切片病理图像的可解释分析

Jingyun Chen, Linghan Cai, Zhikang Wang, Yi Huang, Songhan Jiang, Shenjin Huang, Hongpeng Wang, Yongbing Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Fudan University(复旦大学) Sichuan University(四川大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 PathAgent通过基于大型语言模型的代理推理,实现全切片病理图像的可解释分析,展现出强大的零样本泛化能力和临床应用潜力。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16885 2025-11-24 cs.CL 79%

Improving Latent Reasoning in LLMs via Soft Concept Mixing

通过软概念混合改进大语言模型的潜在推理

Kang Wang, Xiangyu Duan, Tianyi Du

机构 * School of Computer Science and Technology, Soochow University(计算机科学与技术学院,苏州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 通过引入Soft Concept Mixing方法,改进大语言模型的潜在推理能力,提升推理性能并保持训练稳定性。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07772 2025-11-24 cs.CR cs.AI cs.CL cs.LG 75%

SALT: Steering Activations towards Leakage-free Thinking in Chain of Thought

SALT: 通过泄漏自由思考引导激活以避免链式思维中的信息泄露

Shourya Batra, Pierce Tillman, Samarth Gaggar, Shashank Kesineni, Kevin Zhu, Sunishchal Dev, Ashwinee Panda, Vasu Sharma, Maheep Chaudhary

机构 * Independent(独立研究者) RAND University of Maryland(马里兰大学) META Algoverse

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SALT通过在链式思维中注入引导向量减少隐私泄露,提升模型隐私保护能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15511 2025-11-24 cs.RO cs.AI 70%

AeroVerse: UAV-Agent Benchmark Suite for Simulating, Pre-training, Finetuning, and Evaluating Aerospace Embodied World Models

AeroVerse:用于模拟、预训练、微调和评估航空航天具身世界模型的UAV-Agent基准套件

Fanglong Yao, Yuanchang Yue, Youzhi Liu, Xian Sun, Kun Fu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Key Laboratory of Target Cognition and Application Technology(TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所目标认知与应用技术重点实验室)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 AeroVerse是一个用于模拟、预训练、微调和评估航空航天具身世界模型的基准套件,包含多个数据集和评估指标,旨在推动航空航天具身智能的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17238 2025-11-24 cs.CL cs.AI cs.CV 62%

Lost in Translation and Noise: A Deep Dive into the Failure Modes of VLMs on Real-World Tables

迷失在翻译与噪声中:对VLMs在现实表格上的失败模式的深入探讨

Anshul Singh, Rohan Chaudhary, Gagneet Singh, Abhay Kumary

机构 * Indian Institute of Science(印度科学研究院) Panjab University(旁遮普大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MirageTVQA通过多语言和视觉不完美的表格挑战VLMs,揭示了模型在现实噪声和语言转换中的失败模式。

Comments Accepted as Spotligh Talk at EurIPS 2025 Workshop on AI For Tabular Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17309 2025-11-24 cs.AI cs.CL 62%

RubiSCoT: A Framework for AI-Supported Academic Assessment

RubiSCoT:一种支持人工智能的学术评估框架

Thorsten Fröhlich, Tim Schlippe

机构 * IU International University of Applied Sciences(国际应用科学大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 RubiSCoT通过人工智能技术提升学术论文评估的效率和一致性,提供从提案到最终提交的全面评估解决方案。

Journal ref The 6th International Conference on Artificial Intelligence in Education Technology (AIET 2025), Munich, Germany, 29-31 July 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17131 2025-11-24 cs.SE cs.AI 57%

UI-CUBE: Enterprise-Grade Computer Use Agent Benchmarking Beyond Task Accuracy to Operational Reliability

UI-CUBE:超越任务准确性的企业级计算机使用代理基准测试到操作可靠性

Horia Cristescu, Charles Park, Trong Canh Nguyen, Sergiu Talmacel, Alexandru-Gabriel Ilie, Stefan Adam

机构 * UiPath Romania(UiPath罗马尼亚) UiPath UK(UiPath英国) UiPath France(UiPath法国)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 UI-CUBE通过系统性测试揭示CUA在复杂流程中的性能断崖,表明内存管理等架构限制而非训练优化可解决

Comments 18 pages, 8 figures, 5 tables. Benchmark comprising 226 tasks across two difficulty tiers. Code and benchmark available at https://github.com/UiPath/uipath_enterprise_benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16937 2025-11-24 cs.CV cs.AI 57%

OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios

OmniGround: 一个全面的时空接地基准用于现实复杂场景

Hong Gao, Jingyu Wu, Xiangkai Xu, Kangni Xie, Yunchen Zhang, Bin Zhong, Xurui Gao, Min-Ling Zhang

机构 * SouthEast University(东南大学) ZTE Corporation(中兴通讯)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 OmniGround提出一个全面的时空接地基准,通过改进的标注流程和评估框架,提升了复杂现实场景中视频目标定位的性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02894 2025-11-24 cs.LG cs.CR 57%

Adaptive and Robust Data Poisoning Detection and Sanitization in Wearable IoT Systems using Large Language Models

基于大语言模型的可适应和鲁棒数据污染检测与净化在可穿戴物联网系统中的应用

W. K. M Mithsara, Ning Yang, Ahmed Imteaj, Hussein Zangoti, Abdur R. Shahid

机构 * Southern Illinois University(辛辛那提大学) Florida Atlantic University(佛罗里达 Atlantic 大学) Jazan University(贾兹安大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出利用大语言模型进行可穿戴物联网系统中的数据污染检测与净化,通过角色扮演和逐步推理策略提升系统安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16853 2025-11-24 cs.CV 50%

Towards Unified Vision Language Models for Forest Ecological Analysis in Earth Observation

面向地球观测森林生态分析的统一视觉语言模型

Xizhe Xue, Xiao Xiang Zhu

机构 * Xizhe Xue 1, 2 Xiao Xiang Zhu 1, 2

专题命中 推理评测 :reasoning(abstract)

AI总结 REO-Instruct提出首个面向地球观测森林生态分析的统一视觉语言模型基准,旨在解决描述与回归任务中的多模态感知与生物物理变量对齐问题。

Comments AAAI2026 AI for Environmental Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09439 2025-11-24 eess.AS cs.SD 50%

Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?

Omni-R1:你真的需要音频来微调你的音频大语言模型吗?

Andrew Rouditchenko, Saurabhchand Bhati, Edson Araujo, Samuel Thomas, Hilde Kuehne, Rogerio Feris, James Glass

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Goethe University of Frankfurt(法兰克福歌德大学) IBM Research AI(IBM人工智能研究部) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 Omni-R1通过强化学习方法GRPO微调多模态大语言模型,实现了在音频问答任务上的新SOTA性能,同时发现文本推理能力提升对音频性能有显著贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏