arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-02 至 2025-12-02 共收录 122 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 31 篇

2511.12263 2025-12-02 cs.CV cs.AI 79%

CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models

CrossVid: 一个用于评估多模态大语言模型在跨视频推理中的综合基准

Jingyao Li, Jingyun Wang, Molin Tan, Haochen Wang, Cilin Yan, Likun Shi, Jiayin Cai, Xiaolong Jiang, Yao Hu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 CrossVid是首个用于评估多模态大语言模型跨视频推理能力的综合基准,通过多样化的任务和数据集验证了模型在复杂视频推理任务中的表现。

Comments Accepted to AAAI 2026 (main track). For code and data, see https://github.com/chuntianli666/CrossVid

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11278 2025-12-02 cs.HC cs.AI cs.SE 79%

Is General-Purpose AI Reasoning Sensitive to Data-Induced Cognitive Biases? Dynamic Benchmarking on Typical Software Engineering Dilemmas

通用人工智能推理是否受数据诱导的认知偏差影响?典型软件工程困境中的动态基准测试

Francesco Sovrano, Gabriele Dominici, Rita Sevastjanova, Alessandra Stramiglio, Alberto Bacchelli

机构 * Collegium Helveticum, ETH Zurich(瑞士苏黎世联邦理工学院) University of Zurich(苏黎世大学) University of Italian-speaking Switzerland(意大利语瑞士大学) ETH Zurich(苏黎世联邦理工学院) University of Bologna(博洛尼亚大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过动态基准测试框架评估GPAI在软件工程中对数据诱导认知偏差的敏感性,发现GPAI系统在面对偏见诱导语言线索时易产生错误推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00215 2025-12-02 cs.SE 78%

Demystifying Errors in LLM Reasoning Traces: An Empirical Study of Code Execution Simulation

解析LLM推理轨迹中的错误:对代码执行模拟的实证研究

Mohammad Abdollahi, Khandaker Rifah Tasnia, Soumit Kanti Saha, Jinqiu Yang, Song Wang, Hadi Hemmati

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本研究通过实证分析揭示LLM推理轨迹中的错误类型,开发了九类错误分类体系,并展示工具增强推理可有效提升LLM的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01010 2025-12-02 cs.MA cs.AI cs.LG cs.SE physics.comp-ph physics.flu-dyn 73%

Chain of Unit-Physics: A Primitive-Centric Approach to Scientific Code Synthesis

单元物理链:一种以基础原理为中心的科学代码合成方法

Vansh Sharma, Venkat Raman

机构 * University of Michigan(密歇根大学)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出单元物理链框架,通过以基础原理为中心的多代理系统,有效解决科学代码生成中的可靠性问题,实现高精度和高效能的代码生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17220 2025-12-02 cs.CL cs.AI cs.CE cs.LG 67%

PARROT: Persuasion and Agreement Robustness Rating of Output Truth -- A Sycophancy Robustness Benchmark for LLMs

PARROT:输出真实性的说服与同意鲁棒性评级——面向大语言模型的共情鲁棒性基准

Yusuf Çelebi, Özay Ezerceli, Mahmoud El Hussieni

专题命中 推理评测 :self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PARROT提出了一种评估大语言模型在权威压力下鲁棒性的基准,发现先进模型表现稳健,而旧模型易出现知识崩溃,强调需将抗过度拟合压力作为安全部署的关键目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01852 2025-12-02 cs.CL cs.AI cs.ET 62%

BHRAM-IL: A Benchmark for Hallucination Recognition and Assessment in Multiple Indian Languages

BHRAM-IL:多印度语言中的幻觉识别与评估基准

Hrishikesh Terdalkar, Kirtan Bhojani, Aryan Dongare, Omm Aditya Behera

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 BHRAM-IL是一个用于多印度语言中幻觉识别与评估的基准,通过评估14种多语言LLM在多个任务上的表现,揭示了幻觉检测的跨语言和事实性问题。

Comments Accepted at BHASHA Workshop @ IJCNLP/AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01507 2025-12-02 cs.AI cs.LG 62%

SynthStrategy: Extracting and Formalizing Latent Strategic Insights from LLMs in Organic Chemistry

SynthStrategy: 从有机化学中提取并形式化大语言模型中的潜在战略洞察

Daniel Armstrong, Zlatko Jončev, Andres M Bran, Philippe Schwaller

机构 * \'Ecole Polytechnique F\' e d\' e rale de Lausanne (EPFL)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 SynthStrategy通过将大语言模型中的合成策略转化为可验证代码,实现了基于自然语言的路线检索,并在基准测试中达到75%的Top-3准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00586 2025-12-02 cs.LG cs.CL q-bio.QM 62%

Statistical NLP for Optimization of Clinical Trial Success Prediction in Pharmaceutical R&D

统计自然语言处理用于药理研发中临床试验成功预测的优化

Michael R. Doane

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.LG

AI总结 本文利用统计自然语言处理技术开发了基于BioBERT的模型,以优化神经科学领域临床试验成功预测,提升研发决策效率。

Comments Doctor of Engineering Praxis Dissertation, The George Washington University. 122 pages. Present affiliation: Iambic Therapeutics

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16671 2025-12-02 cs.CL cs.AI cs.CV 62%

MimeQA: Towards Socially-Intelligent Nonverbal Foundation Models

MimeQA: 向具有社会智能的非语言基础模型迈进

Hengzhi Li, Megan Tjandrasuwita, Yi R. Fung, Armando Solar-Lezama, Paul Pu Liang

机构 * Massachusetts Institute of Technology(麻省理工学院) Imperial College London(伦敦帝国理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MimeQA通过引入非语言互动数据集,评估视频大语言模型在非语言社会推理中的表现,发现其准确率较低,人类表现更优。

Comments NeurIPS 2025 Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00290 2025-12-02 cs.CL cs.AI 62%

EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education

EduEval: 一个用于评估大语言模型在中文教育中表现的分层认知基准

Guoqing Ma, Jia Zhu, Hanghui Guo, Weijie Shi, Yue Cui, Jiawei Shen, Zilong Li, Yidan Liang

机构 * Zhejiang Normal University(浙江师范大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 EduEval通过分层认知基准评估大语言模型在中文教育中的表现,揭示其在事实性任务与创造性任务上的差异,并发现开源模型在复杂教育推理上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00042 2025-12-02 cs.CV cs.AI cs.CL cs.CY 62%

Closing the Gap: Data-Centric Fine-Tuning of Vision Language Models for the Standardized Exam Questions

弥合差距:面向标准化考试题目的视觉语言模型数据驱动微调

Egemen Sert, Şeyda Ertekin

机构 * organization= Department of Computer Engineering, Middle East Technical University (METU) , city= Ankara , country= Türkiye organization= METU-DTX Digital Transformation \& Innovation Centre, METU , city= Ankara , country= Türkiye

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过高质量数据和优化语法提升视觉语言模型在标准化考试题目的多模态推理性能,达到接近SOTA的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00039 2025-12-02 cs.NI cs.AI cs.CL 62%

LM4Opt-RA: A Multi-Candidate LLM Framework with Structured Ranking for Automating Network Resource Allocation

LM4Opt-RA: 一种带有结构化排序的多候选LLM框架,用于自动化网络资源分配

Tasnim Ahmed, Siana Rizwan, Naveed Ejaz, Salimur Choudhury

机构 * School of Computing(计算机学院) Queen’s University(女王大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LM4Opt-RA通过结构化排序机制和多种提示策略,提升网络资源分配优化的LLM性能,实现优于基线模型的数学评估成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01558 2025-12-02 cs.LG cs.CL 62%

Predicting the Performance of Black-box LLMs through Follow-up Queries

通过后续查询预测黑盒大语言模型的性能

Dylan Sam, Marc Finzi, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文通过后续查询预测黑盒大语言模型性能,利用响应概率训练可靠预测器,有效区分模型正确性及对抗性影响。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01255 2025-12-02 cs.CR cs.CL cs.SE 57%

Large Language Models Cannot Reliably Detect Vulnerabilities in JavaScript: The First Systematic Benchmark and Evaluation

大语言模型无法可靠地检测JavaScript中的漏洞:首个系统性基准和评估

Qingyuan Fei, Xin Liu, Song Li, Shujiang Wu, Jianwei Hou, Ping Chen, Zifeng Kang

机构 * Lanzhou University(兰州大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Technology Support Center of the Cyberspace Administration of China(国家互联网信息办公室技术支撑中心) Fudan University(复旦大学) Beijing University of Posts(北京邮电大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文首次提出FORGEJS框架,构建首个系统性JavaScript漏洞检测基准ARENAJS,并揭示LLM在漏洞检测中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01232 2025-12-02 cs.SE cs.AI 57%

LLM-as-a-Judge for Scalable Test Coverage Evaluation: Accuracy, Operational Reliability, and Cost

基于LLM的判别器用于可扩展的测试覆盖率评估:准确性、操作可靠性与成本

Donghao Huang, Shila Chew, Anna Dutkiewicz, Zhaoxia Wang

机构 * School of Computing and Information Systems(计算与信息系统学院) Singapore Management University(新加坡管理大学) Research and Development(研发)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 LLM-as-a-Judge通过低成本高可靠性的测试覆盖率评估方法,显著降低评估成本并提升准确性。

Comments 7 pages, accepted by the AAAI 2026 Workshop on Next Gen Code Development with Collaborative AI Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01191 2025-12-02 cs.CL 57%

Generalist Large Language Models Outperform Clinical Tools on Medical Benchmarks

通用大语言模型在医疗基准测试中优于临床工具

Krithik Vishwanath, Mrigayu Ghosh, Anton Alyakin, Daniel Alexander Alber, Yindalon Aphinyanaphongs, Eric Karl Oermann

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 通用大语言模型在医疗基准测试中表现优于临床工具,揭示了临床AI系统在某些关键能力上的不足。

Comments 17 pages, 4 figures (2 regular, 2 supplemental)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00630 2025-12-02 cs.LG q-fin.CP 57%

Financial Text Classification Based On rLoRA Finetuning On Qwen3-8B model

基于Qwen3-8B模型的金融文本分类研究:rLoRA微调

Zhiming Lian

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出基于rLoRA微调的Qwen3-8B模型,用于金融文本分类,展示了其在准确率和训练效率上的优势。

Comments This paper has been accepted to the 2025 2nd International Conference on Digital Economy and Computer Science (DECS 2025) and is awaiting publication in the ACM International Conference Proceeding Series

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00231 2025-12-02 cs.SE cs.AI 57%

CodeFlowLM: Incremental Just-In-Time Defect Prediction with Pretrained Language Models and Exploratory Insights into Defect Localization

CodeFlowLM:基于预训练语言模型的增量即需缺陷预测与缺陷定位的探索性洞察

Monique Louise Monteiro, George G. Cabral, Adriano L. I. OLiveira

机构 * cin.ufpe.br(佛罗里达大学佩德罗斯分校计算机学院) Recife-PE – Brazil(巴西佩德罗斯)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CodeFlowLM通过增量学习提升即时软件缺陷预测性能,同时探索LLMs在缺陷定位中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01989 2025-12-02 cs.CV 50%

PAI-Bench: A Comprehensive Benchmark For Physical AI

PAI-Bench: 一个全面的物理AI基准

Fengzhe Zhou, Jiannan Huang, Jialuo Li, Deva Ramanan, Humphrey Shi

机构 * Georgia Tech(佐治亚理工学院) CMU(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 PAI-Bench通过评估视频生成和理解任务,揭示了当前模型在物理合理性和动态一致性上的不足,为物理AI的发展指明了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01827 2025-12-02 cs.CV 50%

CauSight: Learning to Supersense for Visual Causal Discovery

CauSight: 通过因果推理进行视觉因果发现

Yize Zhang, Meiqi Chen, Sirui Chen, Bo Peng, Yanxi Zhang, Tianyu Li, Chaochao Lu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Tongji University(同济大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 CauSight通过因果推理进行视觉因果发现,利用因果图数据集和强化学习方法,实现对视觉因果关系的高效发现。

Comments project page: https://github.com/OpenCausaLab/CauSight

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01298 2025-12-02 cs.CV 50%

TBT-Former: Learning Temporal Boundary Distributions for Action Localization

TBT-Former:基于时间边界分布的学习用于动作定位

Thisara Rathnayaka, Uthayasanker Thayasivam

机构 * Dept. of Computer Science \& Engineering University of Moratuwa Sri Lanka

专题命中 推理评测 :reasoning(abstract)

AI总结 TBT-Former通过改进的Transformer架构和边界分布回归头,提升动作定位性能,实现THUMOS14和EPIC-Kitchens 100数据集上的新高。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21053 2025-12-02 cs.RO cs.CV 50%

AerialMind: Towards Referring Multi-Object Tracking in UAV Scenarios

AerialMind:迈向无人机场景中的指称多目标跟踪

Chenglizhao Chen, Shaofeng Liang, Runwei Guan, Xiaolou Sun, Haocheng Zhao, Haiyun Jiang, Tao Huang, Henghui Ding, Qing-Long Han

专题命中 推理评测 :planning(abstract)

AI总结 AerialMind是首个针对无人机场景的RMOT基准,通过COALA框架和HETrack方法提升无人机的自然语言交互能力与多目标跟踪性能。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 10 篇

2512.01278 2025-12-02 cs.LG cs.AI 86%

Accelerating Large-Scale Reasoning Model Inference with Sparse Self-Speculative Decoding

通过稀疏自推测解码加速大规模推理模型推理

Yilong Zhao, Jiaming Tang, Kan Zhu, Zihao Ye, Chi-Chih Chang, Chaofan Lin, Jongseok Park, Guangxuan Xiao, Mohamed S. Abdelfattah, Mingyu Gao, Baris Kasikci, Song Han, Ion Stoica

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 SparseSpec通过自推测解码框架和稀疏注意力机制,显著提升了大规模推理模型的推理效率和内存利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12003 2025-12-02 cs.AI 85%

Look as You Think: Unifying Reasoning and Visual Evidence Attribution for Verifiable Document RAG via Reinforcement Learning

看而思:通过强化学习统一推理与视觉证据归因以实现可验证文档RAG

Shuochen Liu, Pengfei Luo, Chao Zhang, Yuhao Chen, Haotian Zhang, Qi Liu, Xin Kou, Tong Xu, Enhong Chen

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 通过强化学习统一推理与视觉证据归因,提升多模态问答的可验证性和准确性。

Comments Poster of AAAI'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04341 2025-12-02 cs.AI 80%

Monitor-Generate-Verify (MGV): Formalising Metacognitive Theory for Language Model Reasoning

Monitor-Generate-Verify (MGV): 形式化语言模型推理的元认知理论

Nick Oh, Fernand Gobet

机构 * socius labs Centre for Philosophy of Natural and Social Science (CPNSS)(哲学自然与社会科学中心) London School of Economics(伦敦经济学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 MGV框架通过引入监控机制,弥补生成-验证范式中监控过程的缺失,以提升语言模型推理的准确性和鲁棒性。

Comments Presented at the Workshop on the Foundations of Reasoning in Language Models at NeurIPS 2025 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01878 2025-12-02 cs.AI 79%

Graph Distance as Surprise: Free Energy Minimization in Knowledge Graph Reasoning

图距离作为惊喜:知识图谱推理中的自由能最小化

Gaganpreet Jhajj, Fuhua Lin

机构 * School of Computing(计算学院) Information Systems(信息系统) Athabasca University(亚伯达大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出利用图距离最小化惊喜来改进知识图谱推理,通过连接自由能原理与KG系统,探索图距离在生成模型中的应用及其对语法结构的影响。

Comments Accepted to NORA Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00722 2025-12-02 cs.AI 79%

SpeContext: Enabling Efficient Long-context Reasoning with Speculative Context Sparsity in LLMs

SpeContext: 通过推测上下文稀疏性在LLMs中实现高效的长上下文推理

Jiaming Xu, Jiayi Pan, Hanzhen Wang, Yongkang Zhou, Jiancai Ye, Yu Wang, Guohao Dai

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 SpeContext通过推测上下文稀疏性,在LLMs中实现高效的长上下文推理,显著提升云和边缘环境的吞吐量和速度,同时保持精度。

Comments Accepted by ASPLOS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00016 2025-12-02 cs.AR cs.AI cs.LG 62%

Architect in the Loop Agentic Hardware Design and Verification

循环架构代理硬件设计与验证

Mubarek Mohammed

机构 * Western Washington University(西雅图华盛顿大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种带有工程师参与的代理自动化处理器设计与验证方法,通过生成HDL代码和测试平台,实现高效且经济的硬件设计实验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00966 2025-12-02 cs.CR cs.LG 57%

Mitigating Indirect Prompt Injection via Instruction-Following Intent Analysis

通过指令遵循意图分析缓解间接提示注入

Mintong Kang, Chong Xiang, Sanjay Kariyappa, Chaowei Xiao, Bo Li, Edward Suh

机构 * NVIDIA University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 IntentGuard通过分析指令遵循意图,有效缓解间接提示注入攻击,保持模型性能并降低攻击成功率

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00834 2025-12-02 cs.AI cs.NI 57%

SemAgent: Semantic-Driven Agentic AI Empowered Trajectory Prediction in Vehicular Networks

SemAgent:基于语义的代理AI赋能的车联网轨迹预测

Lin Zhu, Kezhi Wang, Luping Xiang, Kun Yang

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Intelligent Software and Engineering, Nanjing University (Suzhou Campus)(智能软件与工程学院,南京大学(苏州校区)) Department of Computer Science, Brunel University London(计算机科学系,布伦尔大学伦敦)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 SemAgent通过整合语义通信与代理AI,提升车联网环境下的轨迹预测性能,实验显示在低信噪比条件下预测精度提升达47.5%。

Comments Submitted for possible journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏