arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-09 至 2025-12-09 共收录 29 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 29 篇

2510.10072 2025-12-09 cs.CL 85%

Unilaw-R1: A Large Language Model for Legal Reasoning with Reinforcement Learning and Iterative Inference

Unilaw-R1:基于强化学习和迭代推理的法律推理大语言模型

Hua Cai, Shuang Zhao, Liang Zhang, Xuli Shen, Qing Xu, Weilin Shen, Zihao Wen, Tianke Ban

机构 * UniDT Fudan University(复旦大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 Unilaw-R1通过强化学习和迭代推理,提升法律推理能力,在多个基准测试中超越同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00974 2025-12-09 cs.CL 85%

RPRO: Ranked Preference Reinforcement Optimization for Enhancing Medical QA and Diagnostic Reasoning

RPRO:基于优先级的强化优化用于增强医学问答与诊断推理

Chia-Hsuan Hsu, Jun-En Ding, Hsin-Ling Hsu, Chih-Ho Hsu, Li-Hung Yao, Chun-Chieh Liao, Feng Liu, Fang-Ming Hung

机构 * Department of Computer Science and Information Engineering, National Taiwan University of Science and Technology(计算机科学与信息工程系,台湾科技大学) Department of Systems Engineering, Stevens Institute of Technology(系统工程系,史蒂文斯理工学院) Department of Management Information Systems, National Chengchi University(管理信息系,National Chengchi University) AI Research Center, Agaruda System(Agaruda系统人工智能研究中心) Department of Computer Science, Stevens Institute of Technology(计算机科学系,史蒂文斯理工学院) Far Eastern Memorial Hospital(东部纪念医院) Smart Healthcare Interdisciplinary College, National Taipei University of Nursing and Health Sciences(智慧医疗跨领域学院,台北大学护理及健康科学学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 RPRO通过结合强化学习与优先级驱动的推理细化,提升医疗问答和诊断推理的可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07611 2025-12-09 cs.AI cs.LG 81%

Comparative Analysis and Parametric Tuning of PPO, GRPO, and DAPO for LLM Reasoning Enhancement

PPO、GRPO和DAPO在LLM推理增强中的比较分析与参数调优

Yongsheng Lian

机构 * Mechanical Engineering Department University of Louisville(路易斯维尔大学机械工程系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过比较PPO、GRPO和DAPO在LLM推理增强中的表现,发现GRPO和DAPO在参数调优下具有更稳定的训练动态和更高的准确性,而DAPO禁用动态采样时表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07136 2025-12-09 cs.CV cs.AI 79%

A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning

大规模多模态数据集与基准用于人类活动场景理解和推理

Siyang Jiang, Mu Yuan, Xiang Ji, Bufang Yang, Zeyu Liu, Lilin Xu, Yang Li, Yuting He, Liran Dong, Wenrui Lu, Zhenyu Yan, Xiaofan Jiang, Wei Gao, Hongkai Chen, Guoliang Xing

机构 * The Chinese University of Hong Kong, Hong Kong(香港中文大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) University of Pittsburgh(匹兹堡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 CUHK-X是一个大规模多模态数据集和基准,用于人类活动场景理解和推理,通过生成逻辑一致的活动序列提升描述一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21933 2025-12-09 cs.CL cs.AI 79%

Why Chain of Thought Fails in Clinical Text Understanding

为什么链式思维在临床文本理解中失效

Jiageng Wu, Kevin Xie, Bowen Gu, Nils Krüger, Kueiyu Joshua Lin, Jie Yang

机构 * Harvard Medical School(哈佛医学院) MIT(麻省理工学院) Broad Institute of MIT and Harvard(MIT与哈佛大学Broad研究所)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现链式思维在临床文本理解中导致性能下降,揭示了其在临床任务中可靠性与可解释性的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23478 2025-12-09 cs.CV 78%

Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models

Video-R2: 通过强化一致性和基于现实的推理提升多模态语言模型

Muhammad Maaz, Hanoona Rasheed, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Linköping University(林肯皮大学) Australian National University(澳大利亚国立大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 Video-R2通过强化学习提升多模态模型在视频推理中的时间对齐和逻辑一致性,提高准确性和可信度。

Comments Video-R2 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04702 2025-12-09 cs.SE 78%

POLARIS: Is Multi-Agentic Reasoning the Next Wave in Engineering Self-Adaptive Systems?

POLARIS:多智能体推理是否是工程自适应系统下一波浪潮?

Divyansh Pandey, Vyakhya Gupta, Prakhar Singhal, Karthik Vaidhyanathan

专题命中 推理评测 :reasoning(title,abstract)

AI总结 POLARIS通过多智能体推理框架提升自适应系统在复杂环境中的适应能力与预测性能。

Comments Accepted as a short paper at SEAMS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06751 2025-12-09 cs.CL cs.AI cs.LG 67%

Becoming Experienced Judges: Selective Test-Time Learning for Evaluators

成为经验丰富的法官:用于评估者的选择性测试时间学习

Seungyeon Jwa, Daechul Ahn, Reokyoung Kim, Dongyeop Kang, Jonghyun Choi

机构 * Seoul National University(首尔国立大学) University of Minnesota(明尼苏达大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出选择性测试时间学习框架,使评估者在推理过程中逐步改进,通过自适应元提示提升评估效果,实验证明其在多个基准上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07608 2025-12-09 cs.CL cs.AI 62%

Metric-Fair Prompting: Treating Similar Samples Similarly

度量公平提示:对待相似样本同样

Jing Wang, Jie Shen, Xing Niu, Tong Zhang, Jeremy Weiss

机构 * NLM(国家医学图书馆) Stevens Institute of Technology(史蒂文斯理工学院) AWS AI(亚马逊人工智能) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 度量公平提示通过促进个体公平性,提高LLM在高风险临床多选问题上的准确性。

Journal ref NeurIPS 2025 Workshop on Socially Responsible and Trustworthy Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07090 2025-12-09 cs.CL cs.AI 62%

Leveraging KV Similarity for Online Structured Pruning in LLMs

利用键值相似性实现LLMs中的在线结构剪枝

Jungmin Lee, Gwangeun Byeon, Yulhwa Kim, Seokin Hong

机构 * Sungkyunkwan University(成均馆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Token Filtering方法,利用键值相似性实现在线结构剪枝,提升LLMs推理效率与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07079 2025-12-09 cs.LG cs.AI 62%

Procrustean Bed for AI-Driven Retrosynthesis: A Unified Framework for Reproducible Evaluation

AI驱动的逆合成回溯的普罗克鲁斯床:可重复评估的统一框架

Anton Morgunov, Victor S. Batista

机构 * Yale University(耶鲁大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RetroCast框架,通过标准化评估基础设施,揭示了基于搜索和序列的方法在可解性与路线质量上的差异,并释放了标准化数据库以促进可重复发展。

Comments 11 pages + 7 pages of SI. RetroCast is available on GitHub, see https://github.com/ischemist/project-procrustes. SynthArena is publicly available, see https://syntharena.ischemist.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07011 2025-12-09 cs.LG cs.CL cs.PF 62%

Block Sparse Flash Attention

块稀疏Flash注意力

Daniel Ohayon, Itay Lamprecht, Itay Hubara, Israel Cohen, Daniel Soudry, Noam Elata

机构 * Technion -- Israel Institute of Technology, Haifa, Israel(技术离子-以色列理工学院, 海法, 以色列) Intel -- Habana Labs, Tel Aviv, Israel(英特尔 -- Habana实验室, 特拉维夫, 以色列)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 块稀疏Flash注意力通过精确计算查询-键相似性,提升长上下文推理效率并保持高准确性。

Comments 10 pages, 5 figures. Code: https://github.com/Danielohayon/Block-Sparse-Flash-Attention

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06097 2025-12-09 cs.CL cs.AI 62%

Empathy by Design: Aligning Large Language Models for Healthcare Dialogue

设计中的共情:为医疗对话对齐大语言模型

Emre Umucu, Guillermina Solis, Leon Garza, Emilia Rivas, Beatrice Lee, Anantaa Kotal, Aritran Piplai

机构 * Department of Public Health Sciences, The University of Texas at El Paso, USA(公共卫生科学系,德克萨斯理工大学埃尔帕索分校) Department of Nursing, The University of Texas at El Paso, USA(护理系,德克萨斯理工大学埃尔帕索分校) Department of Rehabilitation Sciences, The University of Texas at El Paso, USA(康复科学系,德克萨斯理工大学埃尔帕索分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于DPO的对齐框架,通过优化医疗对话中事实准确性、语义连贯性和共情能力,提升AI助手在医疗场景中的可信度和人文关怀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07777 2025-12-09 cs.CL 57%

Mary, the Cheeseburger-Eating Vegetarian: Do LLMs Recognize Incoherence in Narratives?

玛丽,吃汉堡的素食者:LLMs能否识别叙述中的不一致?

Karin de Langis, Püren Öncel, Ryan Peters, Andrew Elfenbein, Laura Kristen Allen, Andreas Schramm, Dongyeop Kang

机构 * Department of Computer Science and Engineering, University of Minnesota(计算机科学与工程系,明尼苏达大学) Department of Educational Psychology, University of Minnesota(教育心理学系,明尼苏达大学) Department of Linguistics, Hamline University(语言学系,哈姆林大学) Department of English, University of Minnesota(英语系,明尼苏达大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究发现LLMs在识别叙述不一致时存在不足,尤其在处理设定冲突和角色特征冲突时表现不一致,表明其对叙事一致性理解不完整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07186 2025-12-09 cs.CV cs.AI 57%

START: Spatial and Textual Learning for Chart Understanding

START: 空间与文本学习用于图表理解

Zhuoming Liu, Xiaofeng Gao, Feiyang Niu, Qiaozi Gao, Liu Liu, Robinson Piramuthu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Amazon AGI(亚马逊人工智能实验室) MIT(麻省理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 START通过空间与文本学习提升图表理解能力,引入图表元素定位和图表到代码生成,增强多模态大语言模型对图表结构和数据细节的理解。

Comments WACV2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07075 2025-12-09 cs.CL 57%

Do Large Language Models Truly Understand Cross-cultural Differences?

大型语言模型真的能理解跨文化差异吗?

Shiwei Guo, Sihang Jiang, Qianxi He, Yanghua Xiao, Jiaqing Liang, Bi Yude, Minggui He, Shimin Tao, Li Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出SAGE基准,通过跨文化核心概念对齐和生成任务设计,评估LLMs的跨文化理解和推理能力,揭示其在跨文化推理中的系统性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07059 2025-12-09 cs.CL 57%

Replicating TEMPEST at Scale: Multi-Turn Adversarial Attacks Against Trillion-Parameter Frontier Models

在大规模上复制TEMPEST:针对万亿参数前沿模型的多轮对抗攻击

Richard Young

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过TEMPEST框架评估了十种前沿模型对多轮对抗攻击的鲁棒性,发现模型规模不影响鲁棒性,而思考模式能提升安全性。

Comments 30 pages, 11 figures, 5 tables. Code and data: https://github.com/ricyoung/tempest-replication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04002 2025-12-09 cs.CL 57%

AgriGPT-VL: Agricultural Vision-Language Understanding Suite

AgriGPT-VL:农业视觉-语言理解套件

Bo Yang, Yunkui Chen, Lanfei Feng, Yu Zhang, Xiao Xu, Jianyu Zhang, Nueraili Aierken, Runhe Huang, Hongjian Lin, Yibin Ying, Shijian Li

机构 * Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 AgriGPT-VL通过构建农业专用的视觉-语言模型和评估套件,提升了农业领域的多模态理解和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18229 2025-12-09 cs.RO cs.AI 57%

BEDI: A Comprehensive Benchmark for Evaluating Embodied Agents on UAVs

BEDI:一种用于无人机上具身智能体评估的综合基准

Mingning Guo, Mengwei Wu, Jiarun He, Shaoxian Li, Haifeng Li, Chao Tao

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 BEDI提出了一种标准化的无人机具身智能体评估基准,通过动态任务范式和混合测试平台,全面评估UAV-EAs的六个核心技能,并揭示现有VLMs在具身任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06747 2025-12-09 cs.CR cs.AI 57%

PrivLLMSwarm: Privacy-Preserving LLM-Driven UAV Swarms for Secure IoT Surveillance

PrivLLMSwarm: 用于安全物联网监控的隐私保护大语言模型驱动的无人机群

Jifar Wakuma Ayana, Huang Qiming

机构 * Department of Information and Communication Engineering, School of Computer and Communication Engineering, University of Science and Technology Beijing(信息与通信工程系,计算机与通信工程学院,北京科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 PrivLLMSwarm通过安全多方计算实现隐私保护的大语言模型驱动无人机群,实现高准确性和低延迟的加密推理,适用于隐私敏感的物联网应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06710 2025-12-09 cs.AI 57%

Stochasticity in Agentic Evaluations: Quantifying Inconsistency with Intraclass Correlation

代理评估中的随机性:通过组内相关系数量化不一致性

Zairah Mustahsan, Abel Lim, Megna Anand, Saahil Jain, Bryan McCann

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过组内相关系数量化代理评估中的不一致性,以提高评估可靠性,建议在基准测试中报告ICC和查询内方差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06688 2025-12-09 cs.CL 57%

PersonaMem-v2: Towards Personalized Intelligence via Learning Implicit User Personas and Agentic Memory

PersonaMem-v2:通过学习隐式用户人设和代理记忆实现个性化智能

Bowen Jiang, Yuan Yuan, Maohao Shen, Zhuoqun Hao, Zhangchen Xu, Zichen Chen, Ziyi Liu, Anvesh Rao Vijjini, Jiashu He, Hanchao Yu, Radha Poovendran, Gregory Wornell, Lyle Ungar, Dan Roth, Sihao Chen, Camillo Jose Taylor

机构 * University of Pennsylvania(宾夕法尼亚大学) Massachusetts Institute of Technology(麻省理工学院) University of Washington(华盛顿大学) University of California Santa Barbara(加州大学圣巴巴拉分校) Meta University of Southern California(南加州大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft Corporation(微软公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PersonaMem-v2通过学习隐式用户人设和代理记忆提升LLM个性化能力,实验显示强化微调使模型在隐式个性化任务中准确率达53%。

Comments Data is available at https://huggingface.co/datasets/bowen-upenn/PersonaMem-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06396 2025-12-09 cs.CR cs.AI 57%

AgenticCyber: A GenAI-Powered Multi-Agent System for Multimodal Threat Detection and Adaptive Response in Cybersecurity

AgenticCyber: 一种基于生成式AI的多智能体系统,用于多模态威胁检测与自适应响应在网络安全中

Shovan Roy

机构 * TNTech

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 AgenticCyber通过生成式AI驱动的多智能体系统,实现多模态威胁检测与自适应响应,提升网络安全性能和态势感知能力。

Comments 6 pages for IEEE conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06032 2025-12-09 cs.CV cs.AI 57%

The SAM2-to-SAM3 Gap in the Segment Anything Model Family: Why Prompt-Based Expertise Fails in Concept-Driven Image Segmentation

在Segment Anything模型家族中SAM2到SAM3之间的鸿沟:基于提示的专家知识为何在概念驱动的图像分割中失效

Ranjan Sapkota, Konstantinos I. Roumeliotis, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of the Peloponnese(希腊皮洛斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文分析了SAM2到SAM3在分割模型中的断层,指出基于提示的分割方法在概念驱动分割中失效的原因,并探讨了SAM3的多模态架构与评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05969 2025-12-09 cs.CV cs.AI 57%

Video Models Start to Solve Chess, Maze, Sudoku, Mental Rotation, and Raven' Matrices

视频模型开始解决国际象棋、迷宫、数独、心理旋转和雷文矩阵任务

Hokin Deng

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 视频模型通过强化学习提升推理能力,在多项任务上达到60%的成功率。

Comments See $\href{https://grow-ai-like-a-child.com/video-reason/}{results}$ and $\href{https://github.com/hokindeng/VMEvalKit}{code}$

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04650 2025-12-09 cs.CV 50%

EncQA: Benchmarking Vision-Language Models on Visual Encodings for Charts

EncQA:在图表视觉编码上评估视觉-语言模型的基准测试

Kushin Mukherjee, Donghao Ren, Dominik Moritz, Yannick Assogba

机构 * Stanford University(斯坦福大学) Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract)

AI总结 EncQA通过系统覆盖图表理解的关键视觉编码和任务,揭示了不同编码和任务间VLMs性能的显著差异,强调了针对性策略的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14069 2025-12-09 cs.IR 50%

Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement Learning

过程奖励与结果奖励:哪种对代理RAG强化学习更有效

Wenlin Zhang, Xiangyang Li, Kuicai Dong, Yichao Wang, Pengyue Jia, Xiaopeng Li, Yingyi Zhang, Derong Xu, Zhaocheng Du, Huifeng Guo, Ruiming Tang, Xiangyu Zhao

专题命中 推理评测 :reasoning(abstract)

AI总结 ReasonRAG通过过程级奖励提升代理RAG强化学习性能,以更高效训练和更少数据实现更优结果

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06589 2025-12-09 cs.CR cs.CV 50%

OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation

OmniSafeBench-MM:多模态 jailbreak 攻击-防御评估的统一基准和工具箱

Xiaojun Jia, Jie Liao, Qi Guo, Teng Ma, Simeng Qin, Ranjie Duan, Tianlin Li, Yihao Huang, Zhitao Zeng, Dongxian Wu, Yiming Li, Wenqi Ren, Xiaochun Cao, Yang Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学) BraneMatrix AI, China(BraneMatrix AI) Chongqing University, China(重庆大学) Xi’an Jiaotong University, China(西安交通大学) Northeastern University, China(东北大学) Sun Yat-sen University, China(中山大学) Alibaba, China(阿里巴巴) National University of Singapore, Singapore(新加坡国立大学) ByteDance, China(字节跳动)

专题命中 推理评测 :reasoning(abstract)

AI总结 OmniSafeBench-MM提供一个多模态jailbreak攻击-防御评估的统一基准和工具箱,整合13种攻击方法、15种防御策略及广泛数据集,通过三维评估协议深入分析安全与效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06376 2025-12-09 cs.CV 50%

Are AI-Generated Driving Videos Ready for Autonomous Driving? A Diagnostic Evaluation Framework

AI生成的驾驶视频是否准备好用于自动驾驶?一种诊断评估框架

Xinhao Xiang, Abhijeet Rastogi, Jiawei Zhang

机构 * IFM Lab, University of California, Davis(加州大学戴维斯分校IFM实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出了一种诊断评估框架,系统研究AI生成驾驶视频在自动驾驶训练和评估中的可靠性,通过分析失败模式和构建基准测试,验证了过滤AIGVs可提升性能并补充现实数据。

详情

展开后加载摘要…

URL PDF HTML 收藏