arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-25 至 2025-12-25 共收录 41 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 1 篇

2512.20647 2025-12-25 cs.AI 85%

Reasoning Relay: Evaluating Stability and Interchangeability of Large Language Models in Mathematical Reasoning

推理中继:评估大型语言模型在数学推理中的稳定性与可替换性

Leo Lu, Jonathan Zhang, Sean Chua, Spencer Kim, Kevin Zhu, Sean O'Brien, Vasu Sharma

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Binghamton University(宾夕法尼亚州立大学布林茅尔分校) University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校) Algoverse

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本研究探讨大型语言模型在数学推理中的稳定性与可替换性,通过评估不同模型间推理链的延续性,揭示推理过程的可靠性和一致性。

Comments NeurIPS 2025 Workshop on Socially Responsible and Trustworthy Foundation Models (ResponsibleFM)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 3 篇

2512.13725 2025-12-25 cs.AI 79%

Compressed Causal Reasoning: Quantization and GraphRAG Effects on Interventional and Counterfactual Accuracy

压缩因果推理:量化与图RAG对干预和反事实准确率的影响

Steve Nwaiwu, Nipat Jongsawat, Anucha Tungkasthan

机构 * School of Data and Information(数据与信息学院) Rajamangala University of Technology(拉贾穆angala技术大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 研究探讨量化与图结构增强对因果推理准确率的影响,发现四比特量化对因果推理具有鲁棒性,图结构增强可提升干预准确性,现有反事实基准需改进以捕捉更深层次因果脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21048 2025-12-25 cs.CR cs.DC cs.LG 57%

zkFL-Health: Blockchain-Enabled Zero-Knowledge Federated Learning for Medical AI Privacy

zkFL-Health: 区块链赋能的零知识联邦学习用于医疗AI隐私

Savvy Sharma, George Petrovic, Sarthak Kaushik

机构 * School of Arts And Technology(艺术与技术学院) George Brown Polytechnic(乔治布朗理工学院)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.LG

AI总结 zkFL-Health通过结合联邦学习、零知识证明和可信执行环境,实现医疗AI的隐私保护和可验证协作训练。

Comments 10 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20884 2025-12-25 cs.AI 57%

The Silent Scholar Problem: A Probabilistic Framework for Breaking Epistemic Asymmetry in LLM Agents

沉默学者问题:一种基于概率的框架,用于在LLM代理中打破知识不对称性

Zan-Kai Chong, Hiroyuki Ohsaki, Bryan Ng

机构 * School of Science and Technology(科学与技术学院) Kwansei Gakuin University(冈山大学) School of Engineering & Computer Science(工程与计算机科学学院) Victoria University of Wellington(惠灵顿维多利亚大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于概率的框架,用于在LLM代理中打破知识不对称性,通过双向知识交流和不确定性驱动的主动学习策略提升代理的适应性和信息获取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 4 篇

2505.14582 2025-12-25 cs.CL 89%

Can Pruning Improve Reasoning? Revisiting Long-CoT Compression with Capability in Mind for Better Reasoning

剪枝能否提升推理?基于能力对齐的Long-Cot压缩以获得更好的推理

Shangziqi Zhao, Jiahao Yuan, Jinyang Wu, Zhenglin Wang, Guisong Yang, Usman Naseem

机构 * XJTU(西安交通大学) ECNU(华东师范大学) THU(清华大学) SEU(上海师范大学) USST(上海师范大学)

专题命中 逻辑推理 :reasoning(title,abstract);CoT(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出Prune-on-Logic框架,通过结构感知剪枝提升Long-CoT推理效率,发现验证剪枝在保持准确性的同时减少令牌使用,揭示剪枝与模型容量对齐的重要性。

Comments 19 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21250 2025-12-25 cs.CR cs.MA 82%

CoTDeceptor:Adversarial Code Obfuscation Against CoT-Enhanced LLM Code Agents

CoTDeceptor:对抗增强CoT的LLM代码代理的对抗性代码混淆

Haoyang Li, Mingjin Li, Jinxin Zuo, Siqi Li, Xiao Li, Hao Wu, Yueming Lu, Xiaochuan He

专题命中 逻辑推理 :CoT(title,abstract);reasoning(abstract)

AI总结 CoTDeceptor通过构建多阶段混淆策略链,有效对抗增强CoT的LLM检测器,实现对14个漏洞类别的绕过。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20812 2025-12-25 cs.CL 79%

Semantic Deception: When Reasoning Models Can't Compute an Addition

语义欺骗:当推理模型无法计算加法时

Nathaniël de Leeuw, Marceau Nahon, Mathis Reymond, Raja Chatila, Mehdi Khamassi

机构 * Institute of Intelligent Systems and Robotics(智能系统与机器人研究所) CNRS(法国国家科学研究中心) Sorbonne University(索邦大学) Paris Cité University(巴黎城市大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究发现LLMs在面对语义欺骗时表现不佳,揭示其在符号操作上的局限性及对表面语义的依赖。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20664 2025-12-25 cs.AI cs.LO 79%

Eidoku: A Neuro-Symbolic Verification Gate for LLM Reasoning via Structural Constraint Satisfaction

Eidoku:一种通过结构约束满足的神经符号验证门用于LLM推理

Shinobu Miya

机构 * Independent Researcher(独立研究者)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Eidoku通过结构约束满足方法有效检测LLM推理中的结构不一致幻觉,提供神经符号验证机制。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 7 篇

2512.19512 2025-12-25 cs.CV cs.AI 79%

Anatomy-R1: Enhancing Anatomy Reasoning in Multimodal Large Language Models via Anatomical Similarity Curriculum and Group Diversity Augmentation

Anatomy-R1: 通过解剖相似性课程和群体多样性增强多模态大语言模型的解剖推理

Ziyang Song, Zelin Zang, Zuyao Chen, Xusheng Liang, Dong Yi, Jinlin Wu, Hongbin Liu, Jiebo Luo, Zhen. Lei

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Anatomy-R1通过解剖相似性课程和群体多样性增强方法提升多模态大语言模型在医学影像中的解剖推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20997 2025-12-25 cs.NI 67%

LLM-Empowered Agentic AI for QoE-Aware Network Slicing Management in Industrial IoT

基于大语言模型的代理AI用于工业物联网中面向QoE的网络切片管理

Xudong Wang, Lei Feng, Ruichen Zhang, Fanqin Zhou, Hongyang Du, Wenjing Li, Dusit Niyato, Abbas Jamalipour, Ping Zhang

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出一种基于大语言模型的代理AI方法,用于工业物联网中面向服务质量的网络切片管理,通过整合推理、规划和适应能力,提升网络切片的延迟、可靠性和成本效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21243 2025-12-25 cs.RO cs.AI cs.LG 62%

LookPlanGraph: Embodied Instruction Following Method with VLM Graph Augmentation

LookPlanGraph: 一种基于视觉语言模型图增强的具身指令跟随方法

Anatoly O. Onishchenko, Alexey K. Kovalev, Aleksandr I. Panov

机构 * MIRAI Cognitive AI Systems Lab(认知人工智能系统实验室)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 LookPlanGraph通过动态更新场景图实现具身指令跟随,利用视觉语言模型增强环境感知,优于静态场景图方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21120 2025-12-25 cs.CL cs.IR 57%

ClarifyMT-Bench: Benchmarking and Improving Multi-Turn Clarification for Conversational Large Language Models

ClarifyMT-Bench: 会话大语言模型多轮澄清的基准测试与改进

Sichun Luo, Yi Huang, Mukai Li, Shichang Meng, Fengyuan Liu, Zefa Hu, Junlan Feng, Qi Liu

机构 * The University of Hong Kong(香港大学) JIUTIAN Research, China Mobile(中移动巨泰研宄院) CityUHK(城市大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 ClarifyMT-Bench通过多轮对话基准测试和ClarifyAgent代理方法,解决LLM在多轮对话中澄清不足的问题,提升在模糊情境下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20789 2025-12-25 eess.SY cs.AI cs.SY 57%

X-GridAgent: An LLM-Powered Agentic AI System for Assisting Power Grid Analysis

X-GridAgent: 一种基于大语言模型的代理AI系统,用于协助电力 grid 分析

Yihan, Wen, Xin Chen

机构 * Department of Electrical and Computer Engineering, Texas A&M University(电气与计算机工程系,德克萨斯A&M大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 X-GridAgent是一种基于大语言模型的代理AI系统,通过自然语言查询实现电力系统分析的自动化,结合提示优化和混合检索增强生成算法,提升电网分析的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20778 2025-12-25 cs.MA cs.AI cs.RO 57%

Towards Optimal Performance and Action Consistency Guarantees in Dec-POMDPs with Inconsistent Beliefs and Limited Communication

在具有不一致信念和有限通信的Dec-POMDPs中实现最优性能和行动一致性保证

Moshe Rafaeli Shimron, Vadim Indelman

机构 * Technion - Israel Institute of Technology(技术学院-以色列理工学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种去中心化框架,用于在具有不一致信念和有限通信的Dec-POMDPs中实现最优联合行动选择,提供行动一致性和性能的概率保证,并在需要时触发通信。

Comments 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09141 2025-12-25 cs.RO 50%

RGMP: Recurrent Geometric-prior Multimodal Policy for Generalizable Humanoid Robot Manipulation

RGMP: 基于几何先验的多模态策略用于通用人形机器人操作

Xuetao Li, Wenke Huang, Nengyuan Pan, Kaiyan Zhao, Songhua Yang, Yiming Wang, Mengde Li, Mang Ye, Jifeng Xuan, Miao Li

专题命中 规划推理 :reasoning(abstract)

AI总结 RGMP通过结合几何-语义推理与递归高斯适应,实现了高效的人形机器人多模态操作控制。

Journal ref Proceedings of the AAAI conference on artificial intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 4 篇

2512.20934 2025-12-25 cs.CV cs.AI cs.CL cs.MA 81%

Transductive Visual Programming: Evolving Tool Libraries from Experience for Spatial Reasoning

归纳式视觉编程:从经验中演化工具库以进行空间推理

Shengguang Wu, Xiaohan Wang, Yuhui Zhang, Hao Zhu, Serena Yeung-Levy

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过从经验中归纳学习工具库,TVP在空间推理任务中实现了更高效的工具发现和重用,优于现有方法。

Comments Project Website: https://transductive-visualprogram.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21194 2025-12-25 cs.CV 78%

VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs

VisRes Bench: 关于评估视觉语言模型的视觉推理能力

Brigitta Malagurski Törtei, Yasser Dahou, Ngoc Dung Huynh, Wamiq Reyaz Para, Phúc H. Lê Khac, Ankit Singh, Sofian Chaybouti, Sanath Narayan

机构 * Technology Innovation Institute, Abu Dhabi, UAE(阿布扎比技术创新研究所) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 VisRes Bench通过三个层次评估VLMs的视觉推理能力,揭示其在复杂任务中的局限性,并为多模态研究提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20940 2025-12-25 cs.RO 71%

ETP-R1: Evolving Topological Planning with Reinforcement Fine-tuning for Vision-Language Navigation in Continuous Environments

连续环境中的视觉-语言导航(VLN-CE)需要一个具身体验的智能体在连续环境中导航至目标,遵循自然语言指令。虽然当前基于图的方法通过将环境抽象为拓扑地图并简化动作空间到路径选择,提供了一种高效、结构化的方法,但它们在利用大规模数据和先进训练范式方面落后于基于大视觉-语言模型(LVLMs)的方法。在本文中,我们通过引入ETP-R1框架,将数据扩展和强化微调(RFT)范式应用于基于图的VLN-CE模型,以弥合这一差距。

Shuhao Ye, Sitong Mao, Yuxiang Cui, Xuan Yu, Shichao Zhai, Wen Chen, Shunbo Zhou, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学) Huawei Technologies Co., Ltd(华为技术有限公司) Zhejiang Humanoid Robot Innovation Center(浙江人形机器人创新中心)

专题命中 视觉空间推理 :planning(title)

AI总结 ETP-R1通过数据扩展和强化微调范式,提升基于图的连续环境视觉-语言导航性能,实现新状态最先进的表现。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19083 2025-12-25 cs.RO 50%

CoDrone: Autonomous Drone Navigation Assisted by Edge and Cloud Foundation Models

CoDrone:由边缘和云基础模型辅助的自主无人机导航

Pengyu Chen, Tao Ouyang, Ke Luo, Weijie Hong, Xu Chen

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 CoDrone通过整合云-边-端协作计算框架和基础模型,提升无人机自主导航性能,实现更高效和精确的环境感知与动态适应。

Comments This paper is accepted by the IEEE Internet of Things Journal (IoT-J) for publication in the Special Issue on "Augmented Edge Sensing Intelligence for Low-Altitude IoT Systems"

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 复杂问题求解 7 篇

2512.20954 2025-12-25 cs.CL cs.AI 88%

Reflection Pretraining Enables Token-Level Self-Correction in Biological Sequence Models

反射预训练使生物序列模型实现token级自我修正

Xiang Zhang, Jiaqi Wei, Yuejin Yang, Zijie Qiu, Yuhan Chen, Zhiqiang Gao, Muhammad Abdul-Mageed, Laks V. S. Lakshmanan, Wanli Ouyang, Chenyu You, Siqi Sun

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of British Columbia(不列颠哥伦比亚大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Stony Brook University(石溪大学)

专题命中 复杂问题求解 :self-correction(title);reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出反射预训练方法,通过生成辅助标记提升生物序列模型的token表达能力,实现token级自我修正和推理能力提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26226 2025-12-25 cs.LG cs.CL 86%

Thinking-Free Policy Initialization Makes Distilled Reasoning Models More Effective and Efficient Reasoners

无需思考的策略初始化使蒸馏推理模型更有效和高效

Xin Xu, Cliveb AI, Kai Yang, Tianhao Chen, Yang Wang, Saiyong Yang, Can Yang

机构 * LLM Department, Tencent(腾讯大语言模型部门) The Hong Kong University of Science and Technology(香港科技大学) The University of Hong Kong(香港大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 TFPI通过简化RLVR训练流程,提高了推理模型的效率和性能,实现了更高效的模型训练和更高的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21017 2025-12-25 cs.CL cs.AI 79%

Rethinking Supervised Fine-Tuning: Emphasizing Key Answer Tokens for Improved LLM Accuracy

重新思考监督微调:强调关键答案标记以提高LLM准确性

Xiaofeng Shi, Qian Kou, Yuduo Li, Hua Zhou

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院) Beijing Jiaotong University (BJTU)(北京交通大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 SFTKey通过两阶段训练方案,强调关键答案标记以提高LLM在复杂推理任务中的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20856 2025-12-25 cs.CL cs.AI cs.LG 67%

NVIDIA Nemotron 3: Efficient and Open Intelligence

NVIDIA Nemotron 3:高效且开放的智能

NVIDIA, :, Aaron Blakeman, Aaron Grattafiori, Aarti Basant, Abhibha Gupta, Abhinav Khattar, Adi Renduchintala, Aditya Vavre, Akanksha Shukla, Akhiad Bercovich, Aleksander Ficek, Aleksandr Shaposhnikov, Alex Kondratenko, Alexander Bukharin, Alexandre Milesi, Ali Taghibakhshi, Alisa Liu, Amelia Barton, Ameya Sunil Mahabaleshwarkar, Amir Klein, Amit Zuker, Amnon Geifman, Amy Shen, Anahita Bhiwandiwalla, Andrew Tao, Anjulie Agrusa, Ankur Verma, Ann Guan, Anubhav Mandarwal, Arham Mehta, Ashwath Aithal, Ashwin Poojary, Asif Ahamed, Asit Mishra, Asma Kuriparambil Thekkumpate, Ayush Dattagupta, Banghua Zhu, Bardiya Sadeghi, Barnaby Simkin, Ben Lanir, Benedikt Schifferer, Besmira Nushi, Bilal Kartal, Bita Darvish Rouhani, Boris Ginsburg, Brandon Norick, Brandon Soubasis, Branislav Kisacanin, Brian Yu, Bryan Catanzaro, Carlo del Mundo, Chantal Hwang, Charles Wang, Cheng-Ping Hsieh, Chenghao Zhang, Chenhan Yu, Chetan Mungekar, Chintan Patel, Chris Alexiuk, Christopher Parisien, Collin Neale, Cyril Meurillon, Damon Mosk-Aoyama, Dan Su, Dane Corneil, Daniel Afrimi, Daniel Lo, Daniel Rohrer, Daniel Serebrenik, Daria Gitman, Daria Levy, Darko Stosic, David Mosallanezhad, Deepak Narayanan, Dhruv Nathawani, Dima Rekesh, Dina Yared, Divyanshu Kakwani, Dong Ahn, Duncan Riach, Dusan Stosic, Edgar Minasyan, Edward Lin, Eileen Long, Eileen Peters Long, Elad Segal, Elena Lantz, Ellie Evans, Elliott Ning, Eric Chung, Eric Harper, Eric Tramel, Erick Galinkin, Erik Pounds, Evan Briones, Evelina Bakhturina, Evgeny Tsykunov, Faisal Ladhak, Fay Wang, Fei Jia, Felipe Soares, Feng Chen, Ferenc Galko, Frank Sun, Frankie Siino, Gal Hubara Agam, Ganesh Ajjanagadde, Gantavya Bhatt, Gargi Prasad, George Armstrong, Gerald Shen, Gorkem Batmaz, Grigor Nalbandyan, Haifeng Qian, Harsh Sharma, Hayley Ross, Helen Ngo, Herbert Hum, Herman Sahota, Hexin Wang, Himanshu Soni, Hiren Upadhyay, Huizi Mao, Huy C Nguyen, Huy Q Nguyen, Iain Cunningham, Ido Galil, Ido Shahaf, Igor Gitman, Ilya Loshchilov, Itamar Schen, Itay Levy, Ivan Moshkov, Izik Golan, Izzy Putterman, Jan Kautz, Jane Polak Scowcroft, Jared Casper, Jatin Mitra, Jeffrey Glick, Jenny Chen, Jesse Oliver, Jian Zhang, Jiaqi Zeng, Jie Lou, Jimmy Zhang, Jinhang Choi, Jining Huang, Joey Conway, Joey Guman, John Kamalu, Johnny Greco, Jonathan Cohen, Joseph Jennings, Joyjit Daw, Julien Veron Vialard, Junkeun Yi, Jupinder Parmar, Kai Xu, Kan Zhu, Kari Briski, Katherine Cheung, Katherine Luna, Keith Wyss, Keshav Santhanam, Kevin Shih, Kezhi Kong, Khushi Bhardwaj, Kirthi Shankar, Krishna C. Puvvada, Krzysztof Pawelec, Kumar Anik, Lawrence McAfee, Laya Sleiman, Leon Derczynski, Li Ding, Lizzie Wei, Lucas Liebenwein, Luis Vega, Maanu Grover, Maarten Van Segbroeck, Maer Rodrigues de Melo, Mahdi Nazemi, Makesh Narsimhan Sreedhar, Manoj Kilaru, Maor Ashkenazi, Marc Romeijn, Marcin Chochowski, Mark Cai, Markus Kliegl, Maryam Moosaei, Matt Kulka, Matvei Novikov, Mehrzad Samadi, Melissa Corpuz, Mengru Wang, Meredith Price, Michael Andersch, Michael Boone, Michael Evans, Miguel Martinez, Mikail Khona, Mike Chrzanowski, Minseok Lee, Mohammad Dabbah, Mohammad Shoeybi, Mostofa Patwary, Nabin Mulepati, Najeeb Nabwani, Natalie Hereth, Nave Assaf, Negar Habibi, Neta Zmora, Netanel Haber, Nicola Sessions, Nidhi Bhatia, Nikhil Jukar, Nikki Pope, Nikolai Ludwig, Nima Tajbakhsh, Nir Ailon, Nirmal Juluru, Nishant Sharma, Oleksii Hrinchuk, Oleksii Kuchaiev, Olivier Delalleau, Oluwatobi Olabiyi, Omer Ullman Argov, Omri Puny, Oren Tropp, Ouye Xie, Parth Chadha, Pasha Shamis, Paul Gibbons, Pavlo Molchanov, Pawel Morkisz, Peter Dykas, Peter Jin, Pinky Xu, Piotr Januszewski, Pranav Prashant Thombre, Prasoon Varshney, Pritam Gundecha, Przemek Tredak, Qing Miao, Qiyu Wan, Rabeeh Karimi Mahabadi, Rachit Garg, Ran El-Yaniv, Ran Zilberstein, Rasoul Shafipour, Rich Harang, Rick Izzo, Rima Shahbazyan, Rishabh Garg, Ritika Borkar, Ritu Gala, Riyad Islam, Robert Hesse, Roger Waleffe, Rohit Watve, Roi Koren, Ruoxi Zhang, Russell Hewett, Russell J. Hewett, Ryan Prenger, Ryan Timbrook, Sadegh Mahdavi, Sahil Modi, Samuel Kriman, Sangkug Lim, Sanjay Kariyappa, Sanjeev Satheesh, Saori Kaji, Satish Pasumarthi, Saurav Muralidharan, Sean Narentharen, Sean Narenthiran, Seonmyeong Bak, Sergey Kashirsky, Seth Poulos, Shahar Mor, Shanmugam Ramasamy, Shantanu Acharya, Shaona Ghosh, Sharath Turuvekere Sreenivas, Shelby Thomas, Shiqing Fan, Shreya Gopal, Shrimai Prabhumoye, Shubham Pachori, Shubham Toshniwal, Shuoyang Ding, Siddharth Singh, Simeng Sun, Smita Ithape, Somshubra Majumdar, Soumye Singhal, Stas Sergienko, Stefania Alborghetti, Stephen Ge, Sugam Dipak Devare, Sumeet Kumar Barua, Suseella Panguluri, Suyog Gupta, Sweta Priyadarshi, Syeda Nahida Akter, Tan Bui, Teodor-Dumitru Ene, Terry Kong, Thanh Do, Tijmen Blankevoort, Tim Moon, Tom Balough, Tomer Asida, Tomer Bar Natan, Tomer Ronen, Tugrul Konuk, Twinkle Vashishth, Udi Karpas, Ushnish De, Vahid Noorozi, Vahid Noroozi, Venkat Srinivasan, Venmugil Elango, Victor Cui, Vijay Korthikanti, Vinay Rao, Vitaly Kurin, Vitaly Lavrukhin, Vladimir Anisimov, Wanli Jiang, Wasi Uddin Ahmad, Wei Du, Wei Ping, Wenfei Zhou, Will Jennings, William Zhang, Wojciech Prazuch, Xiaowei Ren, Yashaswi Karnati, Yejin Choi, Yev Meyer, Yi-Fu Wu, Yian Zhang, Yigong Qin, Ying Lin, Yonatan Geifman, Yonggan Fu, Yoshi Subara, Yoshi Suhara, Yubo Gao, Zach Moshe, Zhen Dong, Zhongbo Zhu, Zihan Liu, Zijia Chen, Zijie Yan

机构 * NVIDIA

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 NVIDIA推出的Nemotron 3系列模型通过混合Mamba-Transformer架构实现高效推理与大上下文长度,提供多种规模模型以满足不同应用场景需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20662 2025-12-25 cs.AI 57%

Quantifying Laziness, Decoding Suboptimality, and Context Degradation in Large Language Models

量化懒惰、解码亚优性和上下文退化现象于大语言模型

Yiqing Ma, Jung-Hua Liu

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究量化了大语言模型在多部分指令中的懒惰、解码亚优性和上下文退化现象,发现模型在简单任务中表现稳健,但需通过自我完善和动态提示提升指令合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20135 2025-12-25 cs.AI 57%

MolAct: An Agentic RL Framework for Molecular Editing and Property Optimization

MolAct:一种用于分子编辑和性质优化的代理强化学习框架

Zhuo Yang, Yeyun Chen, Jiaqing Xie, Ben Gao, Shuaike Shen, Wanhao Liu, Liujia Yang, Beilun Wang, Tianfan Fu, Yuqiang Li

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xidian University(西安电子科技大学) Shanghai Innovation Institute(上海创新研究院) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学) Southeast University(东南大学) Nanjing University(南京大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 MolAct框架通过代理强化学习方法,实现了分子编辑和性质优化的多步骤、工具增强过程,提升了分子设计的可靠性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20986 2025-12-25 cs.CR 50%

AegisAgent: An Autonomous Defense Agent Against Prompt Injection Attacks in LLM-HARs

AegisAgent:一种对抗LLM-HAR中提示注入攻击的自主防御代理

Yihan Wang, Huanqi Yang, Shantanu Pal, Weitao Xu

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 AegisAgent通过自主推理和验证机制,有效降低LLM-HAR系统中提示注入攻击的成功率,提升系统安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 推理评测 11 篇

2512.20936 2025-12-25 cs.CV 85%

Reasoning-Driven Amodal Completion: Collaborative Agents and Perceptual Evaluation

基于推理的无遮挡完成:协作代理与感知评估

Hongxing Fan, Shuyu Zhao, Jiayang Ao, Lu Sheng

机构 * School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北京航空航天大学) School of Software, Beihang University(软件学院,北京航空航天大学) School of Computing and Information Systems, The University of Melbourne(计算与信息系统学院,墨尔本大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract)

AI总结 本文提出一种协作多代理推理框架,通过解耦语义规划与视觉合成,提升无遮挡完成任务的语义一致性和结构完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12140 2025-12-25 cs.CL 79%

Exploring Efficiency Frontiers of Thinking Budget in Medical Reasoning: Scaling Laws between Computational Resources and Reasoning Quality

探索医疗推理中的思维预算效率前沿:计算资源与推理质量之间的缩放规律

Ziqian Bi, Lu Chen, Junhao Song, Hongying Luo, Enze Ge, Junmin Huang, Tianyang Wang, Keyu Chen, Chia Xin Liang, Zihan Wei, Huafeng Liu, Chunjie Tian, Jibin Guan, Joe Yeong, Yongzhi Xu, Peng Wang, Xinyuan Song, Junfeng Hao

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究通过评估医疗推理任务中的思维预算机制,揭示了计算资源与推理质量的缩放规律,并提出了不同效率阶段的优化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17019 2025-12-25 cs.CV cs.AI cs.CY 79%

Let Androids Dream of Electric Sheep: A Human-Inspired Image Implication Understanding and Reasoning Framework

让安卓梦见电羊:一种受人类启发的图像隐喻理解和推理框架

Chenhao Zhang, Yazhe Niu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出LAD框架,通过三阶段方法解决图像隐喻理解问题,在多个基准测试中取得优异成绩,推动视觉语言推理和人机交互发展。

Comments 19 pages, 9 figures, 7 tables. Code & Dataset: https://github.com/MING-ZCH/Let-Androids-Dream-of-Electric-Sheep

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02622 2025-12-25 cs.CV 78%

RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence

RULER-Bench: 探索下一代视频生成模型的基于规则的推理能力以实现视觉基础智能

Xuming He, Zehao Fan, Hengjia Li, Fan Zhuo, Hankun Xu, Senlin Cheng, Di Weng, Haifeng Liu, Can Ye, Boxi Wu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 RULER-Bench通过评估视频生成模型的基于规则的推理能力,揭示了其在时间一致性等指标上的不足,为提升视频生成模型的推理能力提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏