arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11167 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11167 篇

2512.13059 2025-12-16 cs.CL 57%

An Open and Reproducible Deep Research Agent for Long-Form Question Answering

一个开放且可重复的深度研究代理用于长格式问答

Ikuya Yamada, Wataru Ikeda, Ko Yoshida, Mengyu Ye, Hinata Sugimoto, Masatoshi Suzuki, Hisanori Ozaki, Jun Suzuki

机构 * Studio Ousia(Ousia工作室) Tohoku University(东京大学) DENTSU SOKEN INC.(DENTSU SOKEN公司) RIKEN(日本学术振兴会) NII LLMC(日本信息处理学会LLMC)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究提出一个开放的深度研究代理,结合开源大语言模型和网络搜索API,通过偏好微调提升长格式问答的推理质量。

Comments Technical report of a winning system in the NeurIPS MMU-RAG competition

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12662 2025-12-16 cs.CV cs.AI 57%

Anatomy-Guided Representation Learning Using a Transformer-Based Network for Thyroid Nodule Segmentation in Ultrasound Images

基于变压器网络的解剖引导表示学习用于超声图像甲状腺结节分割

Muhammad Umar Farooq, Abd Ur Rehman, Azka Rehman, Muhammad Usman, Dong-Kyu Chae, Junaid Qadir

机构 * 1 Department of Computer Science, Hanyang University, Seoul, 04762, South Korea 2 Department of Computer Science, The University of Alabama, Seoul, 04762, South Korea 3 Department of Biomedical Sciences, Seoul National University, Seoul, 08826, South Korea ( ) 4 Department of Anesthesiology, Perioperative Pain Medicine, Stanford University, CA 94305, USA ( ) 5 Department of Computer Science, Hanyang University, Seoul, 04762, South Korea ( ) 6 Department of Computer Engineering, Qatar University, Doha, Qatar ( )

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出SSMT-Net,通过半监督多任务变压器网络实现甲状腺结节分割,利用未标注数据提升特征提取能力,有效应对超声图像中结节分割的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12154 2025-12-16 cs.CR cs.LG 57%

Keep the Lights On, Keep the Lengths in Check: Plug-In Adversarial Detection for Time-Series LLMs in Energy Forecasting

保持灯光亮起,保持长度在控制中:用于能源预测时间序列LLM的插件对抗检测

Hua Ma, Ruoxi Sun, Minhui Xue, Xingliang Yuan, Carsten Rudolph, Surya Nepal, Ling Liu

机构 * The University of Melbourne, Australia(墨尔本大学) Monash University, Australia(莫纳什大学) Georgia Institute of Technology, United States(佐治亚理工学院)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出一种用于时间序列LLM的插件对抗检测方法,通过采样诱导的分歧检测对抗性示例,提升能源预测的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11984 2025-12-16 cs.SE cs.AI 57%

Evidence-Driven Decision Support for AI Model Selection in Research Software Engineering

基于证据的AI模型选择决策支持:研究软件工程中的AI模型选择

Alireza Joonbakhsh, Alireza Rostami, AmirMohammad Kamalinia, Ali Nazeri, Farshad Khunjush, Bedir Tekinerdogan, Siamak Farshidi

机构 * organization= Department of Computer Science Engineering, Shiraz University , city= Shiraz , country= Iran organization= Wageningen University \& Research , city= Wageningen , country= The Netherlands

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ModelSelect框架,通过多准则决策方法支持AI模型选择,提升科研软件决策的透明性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11943 2025-12-16 cs.MA cs.AI econ.GN q-fin.EC 57%

How AI Agents Follow the Herd of AI? Network Effects, History, and Machine Optimism

AI代理如何跟随AI的群体?网络效应、历史与机器乐观

Yu Liu, Wenwen Li, Yifan Dou, Guangnan Ye

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究探讨AI代理在网络效应游戏中的决策行为,发现历史数据对LLM推理有显著影响,揭示了AI系统中均衡结果受历史塑造而非单纯激励驱动的特性。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10099 2025-12-12 cs.RO cs.LG 57%

Push Smarter, Not Harder: Hierarchical RL-Diffusion Policy for Efficient Nonprehensile Manipulation

推智而非推力:用于高效非抓取操作的分层RL-扩散策略

Steven Caro, Stephen L. Smith

机构 * Department of Electrical and Computer Engineering, University of Waterloo(电子与计算机工程系,滑铁卢大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出HeRD,一种分层RL-扩散策略,用于高效非抓取操作,通过分层目标选择与轨迹生成提升成功率和泛化能力。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10034 2025-12-12 cs.AI cs.CE 57%

DynaMate: An Autonomous Agent for Protein-Ligand Molecular Dynamics Simulations

DynaMate:一种用于蛋白质-配体分子动力学模拟的自主代理

Salomé Guilbert, Cassandra Masschelein, Jeremy Goumaz, Bohdan Naida, Philippe Schwaller

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL)) National Centre of Competence in Research (NCCR) Catalysis(催化领域研究卓越中心(NCCR Catalysis))

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 DynaMate是一种自主代理框架,能够自主设计和执行蛋白质-配体分子动力学模拟工作流程,并提供自由能结合亲和力计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21838 2025-12-12 cs.CY cs.AI 57%

Dark Speculation: Combining Qualitative and Quantitative Understanding in Frontier AI Risk Analysis

暗推测:在前沿人工智能风险分析中结合定性和定量理解

Daniel Carpenter, Carson Ezell, Pratyush Mallick, Alexandria Westray

机构 * Harvard University(哈佛大学) Harvard College(哈佛学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出'暗推测'方法,结合定性和定量分析,系统性地处理前沿人工智能的灾难性风险,以生成概率分布并指导决策。

Comments 43 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09440 2025-12-11 cs.CL 57%

Knowledge-Augmented Large Language Model Agents for Explainable Financial Decision-Making

基于知识增强的大语言模型代理的可解释金融决策方法

Qingyuan Zhang, Yuxi Wang, Cancan Hua, Yulin Huang, Ning Lyu

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于知识增强的大语言模型代理,通过整合外部知识检索、语义表示和推理生成,提升金融决策的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09410 2025-12-11 cs.RO cs.LG cs.MA 57%

Generalizable Collaborative Search-and-Capture in Cluttered Environments via Path-Guided MAPPO and Directional Frontier Allocation

在 cluttered 环境中通过路径引导的 MAPPO 和方向性前沿分配实现可泛化的协作搜索与捕获

Jialin Ying, Zhihao Li, Zicheng Dong, Guohua Wu, Yihuan Liao

机构 * Department of Automation, Central South University, Changsha, China(自动化系,中南大学,长沙,中国)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出 PGF-MAPPO 方法,通过路径引导的 MAPPO 和方向性前沿分配,在 cluttered 环境中实现高效的协作搜索与捕获,展示了出色的泛化能力和性能优势。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06653 2025-12-11 cs.AI 57%

LightSearcher: Efficient DeepSearch via Experiential Memory

LightSearcher: 通过经验记忆实现高效的深度搜索

Hengzhi Lan, Yue Yu, Li Qian, Li Peng, Jie Wu, Wei Liu, Jian Luan, Ting Bai

机构 * BaiJia AI Team, Beijing, China(北杰人工智能团队) Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 LightSearcher通过引入经验记忆和自适应奖励机制,实现了高效深度搜索,显著提升效率并保持准确性。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17918 2025-12-11 cs.LG 57%

LLM Meeting Decision Trees on Tabular Data

基于逻辑决策树的表格数据LLM决策树

Hangting Ye, Jinmeng Li, He Zhao, Dandan Guo, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) CSIRO’s Data61(CSIRO数据61) Monash University(墨尔本大学) International Center of Future Science, Jilin University(吉林大学未来科学国际中心) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(知识驱动人机智能工程研究中心,教育部,中国)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出DeLTa方法,通过逻辑决策树规则中介将LLM整合到表格数据中,避免数据序列化,实现全数据学习,提升表格预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08953 2025-12-11 cs.HC cs.AI 57%

SimClinician: A Multimodal Simulation Testbed for Reliable Psychologist AI Collaboration in Mental Health Diagnosis

SimClinician: 一种多模态模拟测试平台,用于心理健康诊断中可靠的心理学家AI协作

Filippo Cenacchi, Longbing Cao, Deborah Richards

机构 * Macquarie University(麦考瑞大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 SimClinician是一种多模态模拟平台,通过整合音频、文本和目光-表情模式,帮助心理学家在心理健康诊断中与AI协作,提升诊断的准确性和交互的流畅性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08596 2025-12-10 cs.CY cs.AI 57%

Examining Student Interactions with a Pedagogical AI-Assistant for Essay Writing and their Impact on Students Writing Quality

考察学生与教学型AI助手在议论文写作中的互动及其对学生写作质量的影响

Wicaksono Febriantoro, Qi Zhou, Wannapon Suraworachet, Sahan Bulathwela, Andrea Gauthier, Eva Millan, Mutlu Cukurova

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究探讨学生与教学型AI助手在议论文写作中的互动及其对写作质量的影响,发现主动写作和反馈共享更有效,建议教师鼓励学生主动参与并优化AI系统设计。

Comments 17 pages, 3 Figures, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08536 2025-12-10 cs.AI 57%

Principles2Plan: LLM-Guided System for Operationalising Ethical Principles into Plans

Principles2Plan: 伦理原则引导的计划系统

Tammy Zhong, Yang Song, Maurice Pagnucco

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 Principles2Plan通过人机协作生成基于伦理原则的可操作规则,提升自动规划的伦理实用性

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08145 2025-12-10 cs.RO cs.AI 57%

Chat with UAV -- Human-UAV Interaction Based on Large Language Models

与无人机对话——基于大语言模型的人机交互

Haoran Wang, Zhuohang Chen, Guang Li, Bo Ma, Chuanghuang Li

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的双智能体HUI框架,通过任务规划和执行智能体提升无人机交互的个性化和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08131 2025-12-10 cs.CL 57%

Universal Adversarial Suffixes for Language Models Using Reinforcement Learning with Calibrated Reward

语言模型中用于强化学习的通用对抗后缀

Sampriti Soor, Suklav Ghosh, Arijit Sur

机构 * Center for Intelligent Cyber Physical Systems, Indian Institute of Technology Guwahati, India(智能网络物理系统中心,印度理工学院古瓦哈提) Department of Computer Science and Engineering, Indian Institute of Technology Guwahati, India(计算机科学与工程系,印度理工学院古瓦哈提)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种基于强化学习的通用对抗后缀生成方法,通过校准交叉熵提升迁移性,并在多个NLP数据集上验证了其有效性。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07094 2025-12-10 cs.AI 57%

VIGIL: A Reflective Runtime for Self-Healing Agents

VIGIL:一种用于自愈代理的反射性运行时

Christopher Cruz

机构 * Christopher Cruz

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 VIGIL是一种反射性运行时,通过自我诊断和修复机制提升代理系统的可靠性和自我维护能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04207 2025-12-10 cs.AI 57%

Orchestrator Multi-Agent Clinical Decision Support System for Secondary Headache Diagnosis in Primary Care

协调多代理临床决策支持系统用于初级医疗二次头痛诊断

Xizhi Wu, Nelly Estefanie Garduno-Rapp, Justin F Rousseau, Mounika Thakkallapally, Hang Zhang, Yuelyu Ji, Shyam Visweswaran, Yifan Peng, Yanshan Wang

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于多代理架构的临床决策支持系统,通过协调机制提升继发性头痛诊断的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02581 2025-12-10 cond-mat.mtrl-sci cs.LG 57%

Automated Construction of Artificial Lattice Structures with Designer Electronic States

自动化构建人工晶格结构以实现设计电子态

Ganesh Narasimha, Mykola Telychko, Wooin Yang, Arthur P. Baddorf, P. Ganesh, An-Ping Li, Rama Vasudevan

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出基于强化学习的自动化方法,用于在铜基底上操控CO分子构建人工晶格,实现原子级精确的电子态设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08179 2025-12-10 q-fin.ST cs.AI 57%

RAG-IT: Retrieval-Augmented Instruction Tuning for Automated Financial Analysis -- A Case Study for the Semiconductor Sector

RAG-IT:基于检索的指令微调用于自动化财务分析——半导体行业案例研究

Hai-Thien To, Tien-Cuong Bui, Van-Duc Le

机构 * University of Transport Technology(运输技术大学) Arontier Co., Ltd.(阿隆蒂尔公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 RAG-IT通过检索增强和指令微调,提升LLM在半导体行业财务分析中的性能,实现与商业系统相当的财务报告生成能力。

Comments We updated title, abstract and added more details in experiment section. We also updated the list of authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06990 2025-12-09 cs.AI cs.CV eess.IV 57%

Utilizing Multi-Agent Reinforcement Learning with Encoder-Decoder Architecture Agents to Identify Optimal Resection Location in Glioblastoma Multiforme Patients

利用基于编码器-解码器架构的多智能体强化学习识别胶母细胞瘤患者的最优切除位置

Krishna Arun, Moinak Bhattachrya, Paras Goel

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本研究利用多智能体强化学习与编码器-解码器架构,通过诊断和治疗计划优化,提高胶母细胞瘤患者生存率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05397 2025-12-09 cs.HC cs.AI 57%

Simulating Life Paths with Digital Twins: AI-Generated Future Selves Influence Decision-Making and Expand Human Choice

用数字双胞胎模拟人生路径:AI生成的未来自我影响决策并拓展人类选择

Rachel Poonsiriwong, Chayapatr Archiwaranguprok, Constanze Albrecht, Peggy Yin, Nattavudh Powdthavee, Hal Hershfield, Monchai Lertsutthiwong, Kavin Winson, Pat Pataranutaporn

机构 * MIT Media Lab(MIT媒体实验室) Stanford University(斯坦福大学) Nanyang Technological University(南洋理工大学) University of California, Los Angeles(加州大学洛杉矶分校) KASIKORN Labs(KASIKORN实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究利用AI生成的未来自我虚拟形象,通过模拟人生路径拓展人类选择,发现平衡呈现和新增选项能有效影响决策,提升自主性认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03072 2025-12-09 cs.AI cs.LO 57%

Beyond the Black Box: A Cognitive Architecture for Explainable and Aligned AI

超越黑箱:可解释和对齐的AI认知架构

Hu Keyi

机构 * Tongji University(同济大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出'权重计算主义'认知架构,通过分解认知为逻辑原子和基本操作,实现可解释、普遍和可追溯的价值对齐,为通用人工智能的发展提供理论和实践基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06573 2025-12-09 cs.AI cs.MA 57%

The Effect of Belief Boxes and Open-mindedness on Persuasion

信念盒子和开放心态对说服力的影响

Onur Bilgin, Abdullah As Sami, Sriram Sai Vujjini, John Licato

机构 * Advancing Machine and Human Reasoning (AMHR) Lab, University of South Florida(先进机器与人类推理实验室,佛罗里达州立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨信念盒子和开放心态对智能体说服力的影响,发现开放心态影响信念变化的接受度,而信念陈述影响对对立观点的抵抗能力。

Comments Accepted at the 18th International Conference on Agents and Artificial Intelligence (ICAART 2026), Marbella, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06106 2025-12-09 cs.HC cs.AI 57%

Future You: Designing and Evaluating Multimodal AI-generated Digital Twins for Strengthening Future Self-Continuity

未来你:设计和评估多模态AI生成的数字双胞胎以加强未来自我连续性

Constanze Albrecht, Chayapatr Archiwaranguprok, Rachel Poonsiriwong, Awu Chen, Peggy Yin, Monchai Lertsutthiwong, Kavin Winson, Hal Hershfield, Pattie Maes, Pat Pataranutaporn

机构 * MIT Media Lab(MIT媒体实验室) Harvard University(哈佛大学) Stanford University(斯坦福大学) KASIKORN Labs(KASIKORN实验室)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本研究通过多模态AI生成的未来自我探索其对自我连续性、情绪和动机的影响,发现avatar效果最佳,但各模态无显著差异,互动质量是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05982 2025-12-09 physics.soc-ph cs.AI cs.MA 57%

FlockVote: LLM-Empowered Agent-Based Modeling for Simulating U.S. Presidential Elections

FlockVote: 基于大语言模型的智能体建模用于模拟美国总统选举

Lingfeng Zhou, Yi Xu, Zhenyu Wang, Dequan Wang

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 FlockVote利用大语言模型构建智能体建模框架,用于模拟美国总统选举,实现高保真度的社会模拟与可解释性研究。

Comments Published as a conference paper at ICAIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04416 2025-12-09 cs.AI cs.SE 57%

DataGovBench: Benchmarking LLM Agents for Real-World Data Governance Workflows

DataGovBench: 为现实世界数据治理工作流程评估LLM代理

Zhou Liu, Zhaoyang Han, Guochen Yan, Hao Liang, Bohan Zeng, Xing Chen, Yuanfeng Song, Wentao Zhang

机构 * Peking University(北京大学) ByteDance(字节跳动)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 DataGovBench通过150种现实任务评估LLM代理在数据治理中的表现,提出DataGovAgent框架提升复杂任务性能和调试效率。

Comments Equal contribution: Zhou Liu and Zhaoyang Han. Corresponding authors: Yuanfeng Song and Wentao Zhang

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10680 2025-12-09 cs.LG stat.ML 57%

LAD-BNet: Lag-Aware Dual-Branch Networks for Real-Time Energy Forecasting on Edge Devices

LAD-BNet:面向边缘设备实时能源预测的时滞感知双分支网络

Jean-Philippe Lignier

机构 * University of La Réunion(留尼旺大学) PIMENT Laboratory(PIMENT实验室) Physics and Mathematical Engineering for Energy, Environment and Building(能源、环境与建筑的物理与数学工程)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 LAD-BNet通过时滞感知双分支网络在边缘设备上实现高效的实时能源预测,提升预测精度并降低推断时间,适用于智能电网和建筑领域。

Comments 27 pages, in French language. 10 tables, 26 references. Submitted to Energy and AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05824 2025-12-08 cs.AI cs.CV 57%

Multimodal Oncology Agent for IDH1 Mutation Prediction in Low-Grade Glioma

多模态肿瘤代理用于低级别胶质瘤IDH1突变预测

Hafsa Akebli, Adam Shephard, Vincenzo Della Mea, Nasir Rajpoot

机构 * Department of Mathematics, Computer Science and Physics, University of Udine(乌迪大学数学、计算机科学与物理系) Tissue Image Analytics Centre, Department of Computer Science, University of Warwick(沃里克大学计算机科学系组织图像分析中心) Histofy Ltd(Histofy有限公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出多模态肿瘤代理,结合组织学工具和外部生物医学资源,实现低级别胶质瘤IDH1突变的高精度预测。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏