arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-27 至 2025-11-27 共收录 69 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 22 篇

2511.21339 2025-11-27 cs.CV cs.AI 57%

SurgMLLMBench: A Multimodal Large Language Model Benchmark Dataset for Surgical Scene Understanding

SurgMLLMBench: 一个用于手术场景理解的多模态大语言模型基准数据集

Tae-Min Choi, Tae Kyeong Jeong, Garam Kim, Jaemin Lee, Yeongyoon Koh, In Cheul Choi, Jae-Ho Chung, Jong Woong Park, Juyoun Park

机构 * Samsung Research(三星研究所) Center for Humanoid Research, Korea Institute of Science and Technology(人类研究学院,韩国科学技术院) Department of plastic surgery, College of medicine, Korea University(医学院整形外科部,韩国大学) Department of orthopedic surgery, College of medicine, Korea University(医学院骨科部,韩国大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SurgMLLMBench是一个用于手术场景理解的多模态大语言模型基准数据集,整合了像素级分割和结构化VQA注释,支持跨领域的全面评估和更丰富的视觉-对话交互。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20795 2025-11-27 cs.CV cs.AI 57%

Revisiting KRISP: A Lightweight Reproduction and Analysis of Knowledge-Enhanced Vision-Language Models

重新审视 KRISP:一种轻量级的知识增强视觉-语言模型的再现与分析

Souradeep Dutta, Keshav Bulia, Neena S Nair

机构 * Centre For Digital Health(数字健康中心) Indian Institute of Technology Bombay(孟买印度理工学院) Department of Metallurgical engineering & Material science(冶金工程与材料科学系) Department of Bioscience & Bioengineering(生物科学与生物工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究重新审视 KRISP,通过轻量级模型揭示知识增强 VQA 的设计缺陷与资源受限下的有效性。

Comments 7 pages , 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15277 2025-11-27 cs.CL 57%

Web-Shepherd: Advancing PRMs for Reinforcing Web Agents

Web-Shepherd: 促进强化网络代理的PRMs

Hyungjoo Chae, Sunghwan Kim, Junhee Cho, Seungone Kim, Seungjun Moon, Gyeom Hwangbo, Dongha Lim, Minjin Kim, Yeonjun Hwang, Minju Gwak, Dongwook Choi, Minseok Kang, Gwanhoon Im, ByeongUng Cho, Hyojun Kim, Jun Hee Han, Taeyoon Kwon, Minju Kim, Beong-woo Kwak, Dongjin Kang, Jinyoung Yeo

机构 * Georgia Institute of Technology(佐治亚理工学院) Department of Artificial Intelligence, Yonsei University(延世大学人工智能系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :verifier(abstract);分类 cs.CL

AI总结 Web-Shepherd是首个用于强化网络代理的PRM,通过构建大规模数据集和元评估基准,提升了网络导航任务的准确性和效率。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21380 2025-11-27 cs.SE 50%

Multi-Agent Systems for Dataset Adaptation in Software Engineering: Capabilities, Limitations, and Future Directions

多智能体系统在软件工程数据集适应中的应用:能力、限制与未来方向

Jingyi Chen, Xiaoyan Guo, Songqiang Chen, Shing-Chi Cheung, Jiasi Shen

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究了多智能体系统在软件工程数据集适应中的能力与限制,发现提示干预能显著提升适应效果,为未来更可靠的智能体发展提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 5 篇

2511.20669 2025-11-27 cs.CL cs.AI 81%

Structured Definitions and Segmentations for Legal Reasoning in LLMs: A Study on Indian Legal Data

结构化定义与分割在大语言模型法律推理中的应用:对印度法律数据的研究

Mann Khatri, Mirza Yusuf, Rajiv Ratn Shah, Ponnurangam Kumaraguru

机构 * Indraprastha Institute of Information Technology(印度普拉斯塔学院信息科技研究所) International Institute of Information Technology Hyderabad(国际信息科技研究所(海得拉巴))

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过结构化定义与分割方法提升大语言模型在法律推理中的性能,实验显示在印度法律数据集上模型性能提升达1.5%-4.36%。

Comments Accepted at BDA 2025 as short paper; This paper is long version

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14815 2025-11-27 cs.CL cs.IR 79%

Machine Reading Comprehension using Case-based Reasoning

基于案例推理的机器阅读理解

Dung Thai, Dhruv Agarwal, Mudit Chaudhary, Wenlong Zhao, Rajarshi Das, Manzil Zaheer, Jay-Yoon Lee, Hannaneh Hajishirzi, Andrew McCallum

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 基于案例推理的机器阅读理解方法在准确性和鲁棒性上优于基线模型,能有效识别正确答案及支持证据。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00396 2025-11-27 cs.CV 78%

Saliency-R1: Incentivizing Unified Saliency Reasoning Capability in MLLM with Confidence-Guided Reinforcement Learning

Saliency-R1: 通过置信度引导的强化学习激励多模态大语言模型统一的显著性推理能力

Long Li, Shuichen Ji, Ziyang Luo, Zhihui Li, Dingwen Zhang, Junwei Han, Nian Liu

机构 * Northwestern Polytechnical University(西北工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 Saliency-R1通过置信度引导的强化学习,提升多模态大语言模型在显著性推理任务中的统一能力,实现显著物体检测、显著实例分割和共显著物体检测的高效处理。

Comments Main text (excluding references): 8 pages, 4 figures; Supplementary Materials (excluding references): 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14476 2025-11-27 cs.AI 57%

Operationalizing Pluralistic Values in Large Language Model Alignment Reveals Trade-offs in Safety, Inclusivity, and Model Behavior

在大型语言模型对齐中操作多元价值观揭示了安全、包容性和模型行为之间的权衡

Dalia Ali, Dora Zhao, Allison Koenecke, Orestis Papakyriakopoulos

机构 * Technical University of Munich(慕尼黑技术大学) Stanford University(斯坦福大学) Cornell University(康奈尔大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究探讨了在大型语言模型对齐中融入多元价值观的影响,发现不同群体偏好和设计选择对模型行为和安全性有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21270 2025-11-27 cs.SD cs.CV 50%

Multi-Reward GRPO for Stable and Prosodic Single-Codebook TTS LLMs at Scale

多奖励GRPO用于大规模稳定且有声调的单代码本TTS LLMs

Yicheng Zhong, Peiji Yang, Zhisheng Wang

机构 * Tencent Technology Co.Ltd(腾讯科技有限公司)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出多奖励GRPO框架,通过优化单代码本TTS LLMs的生成策略,提升语音的语调稳定性、说话者相似性和自然度。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏