arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-16 至 2025-12-16 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 17 篇

2512.13668 2025-12-16 cs.LG 85%

A Scientific Reasoning Model for Organic Synthesis Procedure Generation

有机合成过程生成的科学推理模型

Guoqing Liu, Junren Li, Zihan Zhao, Eray Inanc, Krzysztof Maziarz, Jose Garrido Torres, Victor Garcia Satorras, Shoko Ueda, Christopher M. Bishop, Marwin Segler

机构 * Microsoft Research AI for Science(微软研究院人工智能科学部) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);分类 cs.LG

AI总结 QFANG通过化学引导推理框架生成高质量合成程序,提升计算机辅助合成规划与自动化实验室合成的衔接。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13510 2025-12-16 cs.AI 79%

MedCEG: Reinforcing Verifiable Medical Reasoning with Critical Evidence Graph

MedCEG: 通过关键证据图强化可验证的医学推理

Linjie Mu, Yannian Gu, Zhongzhen Huang, Yakun Zhu, Shaoting Zhang, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) SII

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 MedCEG通过关键证据图强化医学推理,提升临床决策的可靠性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12799 2025-12-16 cs.CV 78%

DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning

DrivePI: 基于空间感知的4D MLLM用于统一自动驾驶理解、感知、预测与规划

Zhe Liu, Runhui Huang, Rui Yang, Siming Yan, Zining Wang, Lu Hou, Di Lin, Xiang Bai, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Yinwang Intelligent Technology Co. Ltd.(英维智能科技有限公司) Tianjin University(天津大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 DrivePI是一种基于空间感知的4D MLLM,用于统一自动驾驶的理解、感知、预测和规划,通过端到端优化实现多任务并行,提升性能并减少碰撞率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12794 2025-12-16 eess.SY cs.SY 78%

A Rule-Aware Prompt Framework for Structured Numeric Reasoning in Cyber-Physical Systems

面向物理系统结构化数值推理的规则感知提示框架

Yichen Liu, Hongyu Wu, Bo Liu

专题命中 规划推理 :reasoning(title,abstract)

AI总结 本文提出一种规则感知提示框架,用于在基于物理的系统中实现结构化数值推理,通过模块化设计提升规则遵循性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01948 2025-12-16 cs.CL 70%

How Far Are We from Genuinely Useful Deep Research Agents?

我们距离真正有用的深度研究代理还有多远?

Dingling Zhang, He Zhu, Jincheng Ren, Kangqi Song, Xinran Zhou, Boyu Feng, Shudong Liu, Jiabin Luo, Weihao Xie, Zhaohui Wang, Tianrui Qin, King Zhu, Yuqing Wang, Qianben Chen, Yuchen Eleanor Jiang, Wei Wang, Jiaheng Liu, Wangchunshu Zhou

机构 * OPPO AI Agent Team(OPPO 人工智能代理团队)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 本文提出FINDER基准和DEFT分类,揭示当前深度研究代理在证据整合与推理鲁棒性规划方面的不足。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12716 2025-12-16 cs.CL 70%

CoDA: A Context-Decoupled Hierarchical Agent with Reinforcement Learning

CoDA:一种解耦的层次代理

Xuanzhang Liu, Jianglun Feng, Zhuoran Zhuang, Junzhe Zhao, Maofei Que, Jieting Li, Dianlei Wang, Hao Tong, Ye Chen, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) Alibaba Group(阿里巴巴集团)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 CoDA通过解耦的层次代理设计,利用强化学习有效缓解上下文爆炸问题,在复杂任务中实现性能提升。

Comments Accepted to WSDM '26 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13004 2025-12-16 eess.SY cs.SY 67%

Large Language Models for Power System Applications: A Comprehensive Literature Survey

大语言模型在电力系统应用中的综述:全面的文献调查

Muhammad Sarwar, Muhammad Rizwan, Mubushra Aziz, Abdul Rehman Sudais

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文综述了大语言模型在电力系统中的应用,探讨了其在故障诊断、负荷预测等领域的潜力及面临的挑战,提出未来研究方向。

Comments 17 pages, 1 table, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12692 2025-12-16 cs.AI cs.CL cs.LG 67%

WebOperator: Action-Aware Tree Search for Autonomous Agents in Web Environment

WebOperator: 基于动作意识的树搜索用于网络环境中的自主代理

Mahir Labib Dihan, Tanzima Hashem, Mohammed Eunus Ali, Md Rizwan Parvez

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Bangladesh University of Engineering and Technology (BUET)(孟加拉工程与技术大学) Faculty of Information Technology(信息技术学院) Monash University(莫纳什大学) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 WebOperator通过引入树搜索框架,实现可靠的回溯和战略探索,提升自主代理在网页环境中的任务成功率。

Comments Under review at ICLR 2026. Project page: https://kagnlp.github.io/WebOperator/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20601 2025-12-16 cs.AI cs.CL cs.LG 67%

NutriGen: Personalized Meal Plan Generator Leveraging Large Language Models to Enhance Dietary and Nutritional Adherence

NutriGen:利用大型语言模型生成个性化餐计划以提高饮食和营养依从性

Saman Khamesian, Asiful Arefeen, Stephanie M. Carpenter, Hassan Ghasemzadeh

机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 NutriGen利用大型语言模型生成个性化餐计划,通过构建营养数据库和提示工程提高饮食依从性和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11862 2025-12-16 cs.LG cs.AI 62%

Hierarchical Task Offloading and Trajectory Optimization in Low-Altitude Intelligent Networks Via Auction and Diffusion-based MARL

低空智能网络中的分层任务卸载与轨迹优化:通过拍卖和基于扩散的MARL

Jiahao You, Ziye Jia, Can Cui, Chao Dong, Qihui Wu, Zhu Han

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于拍卖和扩散的MARL方法,用于低空智能网络中的分层任务卸载与轨迹优化,以提升能耗效率和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13059 2025-12-16 cs.CL 57%

An Open and Reproducible Deep Research Agent for Long-Form Question Answering

一个开放且可重复的深度研究代理用于长格式问答

Ikuya Yamada, Wataru Ikeda, Ko Yoshida, Mengyu Ye, Hinata Sugimoto, Masatoshi Suzuki, Hisanori Ozaki, Jun Suzuki

机构 * Studio Ousia(Ousia工作室) Tohoku University(东京大学) DENTSU SOKEN INC.(DENTSU SOKEN公司) RIKEN(日本学术振兴会) NII LLMC(日本信息处理学会LLMC)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究提出一个开放的深度研究代理,结合开源大语言模型和网络搜索API,通过偏好微调提升长格式问答的推理质量。

Comments Technical report of a winning system in the NeurIPS MMU-RAG competition

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12662 2025-12-16 cs.CV cs.AI 57%

Anatomy-Guided Representation Learning Using a Transformer-Based Network for Thyroid Nodule Segmentation in Ultrasound Images

基于变压器网络的解剖引导表示学习用于超声图像甲状腺结节分割

Muhammad Umar Farooq, Abd Ur Rehman, Azka Rehman, Muhammad Usman, Dong-Kyu Chae, Junaid Qadir

机构 * 1 Department of Computer Science, Hanyang University, Seoul, 04762, South Korea 2 Department of Computer Science, The University of Alabama, Seoul, 04762, South Korea 3 Department of Biomedical Sciences, Seoul National University, Seoul, 08826, South Korea ( ) 4 Department of Anesthesiology, Perioperative Pain Medicine, Stanford University, CA 94305, USA ( ) 5 Department of Computer Science, Hanyang University, Seoul, 04762, South Korea ( ) 6 Department of Computer Engineering, Qatar University, Doha, Qatar ( )

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出SSMT-Net,通过半监督多任务变压器网络实现甲状腺结节分割,利用未标注数据提升特征提取能力,有效应对超声图像中结节分割的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12154 2025-12-16 cs.CR cs.LG 57%

Keep the Lights On, Keep the Lengths in Check: Plug-In Adversarial Detection for Time-Series LLMs in Energy Forecasting

保持灯光亮起,保持长度在控制中:用于能源预测时间序列LLM的插件对抗检测

Hua Ma, Ruoxi Sun, Minhui Xue, Xingliang Yuan, Carsten Rudolph, Surya Nepal, Ling Liu

机构 * The University of Melbourne, Australia(墨尔本大学) Monash University, Australia(莫纳什大学) Georgia Institute of Technology, United States(佐治亚理工学院)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出一种用于时间序列LLM的插件对抗检测方法,通过采样诱导的分歧检测对抗性示例,提升能源预测的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11984 2025-12-16 cs.SE cs.AI 57%

Evidence-Driven Decision Support for AI Model Selection in Research Software Engineering

基于证据的AI模型选择决策支持:研究软件工程中的AI模型选择

Alireza Joonbakhsh, Alireza Rostami, AmirMohammad Kamalinia, Ali Nazeri, Farshad Khunjush, Bedir Tekinerdogan, Siamak Farshidi

机构 * organization= Department of Computer Science Engineering, Shiraz University , city= Shiraz , country= Iran organization= Wageningen University \& Research , city= Wageningen , country= The Netherlands

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ModelSelect框架,通过多准则决策方法支持AI模型选择,提升科研软件决策的透明性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11943 2025-12-16 cs.MA cs.AI econ.GN q-fin.EC 57%

How AI Agents Follow the Herd of AI? Network Effects, History, and Machine Optimism

AI代理如何跟随AI的群体?网络效应、历史与机器乐观

Yu Liu, Wenwen Li, Yifan Dou, Guangnan Ye

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究探讨AI代理在网络效应游戏中的决策行为,发现历史数据对LLM推理有显著影响,揭示了AI系统中均衡结果受历史塑造而非单纯激励驱动的特性。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13380 2025-12-16 cs.RO 50%

Universal Dexterous Functional Grasping via Demonstration-Editing Reinforcement Learning

通过演示编辑强化学习实现通用灵巧功能抓取

Chuan Mao, Haoqi Yuan, Ziye Huang, Chaoyi Xu, Kai Ma, Zongqing Lu

机构 * Peking University(北京大学) BeingBeyond

专题命中 规划推理 :planning(abstract)

AI总结 本研究提出DemoFunGrasp,通过演示编辑强化学习实现通用灵巧功能抓取,提升抓取性能和现实泛化能力。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12246 2025-12-16 cs.CV 50%

Moment and Highlight Detection via MLLM Frame Segmentation

通过MLLM帧分割进行时刻和亮点检测

I Putu Andika Bagas Jiwanta, Ayu Purwarianti

机构 * School of Electrical Engineering and Informatics(电气工程与信息学院) Institut Teknologi Bandung(万隆技术大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出通过MLLM帧分割实现视频时刻和亮点检测,利用分割损失与因果LM损失结合,提升检测精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏