arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-03 至 2025-12-03 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 20 篇

2512.01830 2025-12-03 cs.CV 87%

OpenREAD: Reinforced Open-Ended Reasoning for End-to-End Autonomous Driving with LLM-as-Critic

OpenREAD: 基于LLM作为批评者的开放性推理端到端自动驾驶框架

Songyan Zhang, Wenhui Huang, Zhan Chen, Chua Jiahao Collister, Qihang Huang, Chen Lv

机构 * Nanyang Technological University, Singapore(南洋理工大学) Harvard University, USA(哈佛大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 OpenREAD通过端到端强化微调框架,结合LLM作为批评者,提升自动驾驶中的推理与规划能力,实现从高层推理到低层轨迹规划的全面优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02499 2025-12-03 cs.AI 85%

COPE: Chain-Of-Thought Prediction Engine for Open-Source Large Language Model Based Stroke Outcome Prediction from Clinical Notes

COPE:基于开源大语言模型的链式推理预测引擎用于从临床笔记预测中风结局

Yongkai Liu, Helena Feng, Bin Jiang, Yixin Wang, Max Wintermark, David S. Liebeskind, Michael Moseley, Maarten Lansberg, Gregory Albers, Jeremy Heit, Greg Zaharchuk

专题命中 规划推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 COPE通过链式推理框架从临床笔记预测中风预后,优于现有模型,提供轻量级且可解释的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13352 2025-12-03 cs.AI cs.RO 79%

Agentic UAVs: LLM-Driven Autonomy with Integrated Tool-Calling and Cognitive Reasoning

智能无人机:基于大语言模型的自主性与集成工具调用和认知推理

Anis Koubaa, Khaled Gabr

机构 * AlfaisalX: Center of Excellence of Cognitive Robotics and Autonomous Agents(阿尔法西尔研究中心:认知机器人与自主代理中心) Alfaisal University(阿尔法西尔大学) Prince Sultan University(普森大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Agentic UAVs框架,利用大语言模型实现无人机的高自主性与外部系统集成,通过模拟实验验证其在搜索救援任务中的有效性。

Comments 17 pages, 2 figure

Journal ref The International Conference on Smart Systems and Emerging Technologies (SmartTech 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02555 2025-12-03 cs.CL cs.AI cs.IR 73%

ADORE: Autonomous Domain-Oriented Relevance Engine for E-commerce

ADORE:面向电商的自主领域导向相关性引擎

Zheng Fang, Donghao Xie, Ming Pang, Chunyuan Yuan, Xue Jiang, Changping Peng, Zhangang Lin, Zheng Luo

机构 * JD.COM Beijing China(京东公司)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 ADORE通过规则意识、错误类型感知和关键属性增强的创新,实现电商搜索中高效且认知对齐的相关性建模。

Comments Accepted by SIGIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02038 2025-12-03 cs.CL cs.AI cs.IR 73%

Deep Research: A Systematic Survey

深度研究:系统性综述

Zhengliang Shi, Yiqun Chen, Haitao Li, Weiwei Sun, Shiyu Ni, Yougang Lyu, Run-Ze Fan, Bowen Jin, Yixuan Weng, Minjun Zhu, Qiujie Xie, Xinyu Guo, Qu Yang, Jiayi Wu, Jujia Zhao, Xiaqiang Tang, Xinbei Ma, Cunxiang Wang, Jiaxin Mao, Qingyao Ai, Jen-Tse Huang, Wenxuan Wang, Yue Zhang, Yiming Yang, Zhaopeng Tu, Zhaochun Ren

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文系统综述了深度研究系统,提出三阶段路线图,引入四个核心组件,并总结优化技术与评估标准,旨在推动该领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02321 2025-12-03 cs.CR cs.CL 70%

LeechHijack: Covert Computational Resource Exploitation in Intelligent Agent Systems

LeechHijack: 智能代理系统中的隐蔽计算资源利用

Yuanhe Zhang, Weiliu Wang, Zhenhong Zhou, Kun Wang, Jie Zhang, Li Sun, Yang Liu, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Hangzhou Dianzi University(杭州电子科技大学) Nanyang Technological University(南洋理工大学) CFAR North China Electric Power University(华北电力大学) Chongqing University of Posts(重庆邮电大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 LeechHijack通过隐式毒性攻击利用MCP框架中的信任边界,隐蔽劫持代理计算资源,揭示对计算溯源和资源认证机制的迫切需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16264 2025-12-03 cs.CL cs.AI cs.HC cs.LG 67%

ParlAI Vote: A Web Platform for Analyzing Gender and Political Bias in Large Language Models

ParlAI Vote:一个用于分析大型语言模型中性别和政治偏见的网络平台

Wenjie Lin, Hange Liu, Yingying Zhuang, Xutao Mao, Jingwei Shi, Xudong Han, Tianyu Shi, Jinrui Yang

机构 * Purdue University(普渡大学) Johns Hopkins University(约翰霍普金斯大学) Vanderbilt University(范德比大学) University of Toronto(多伦多大学) The University of Melbourne(墨尔本大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ParlAI Vote是一个用于分析大型语言模型中性别和政治偏见的网络平台,通过可视化和交互功能揭示LLMs在政治分析中的系统性偏见。

Comments online demo: https://euro-parl-vote-demo.vercel.app/; Video: https://www.youtube.com/@Jinrui-sf2jg

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11306 2025-12-03 cs.CL cs.AI cs.MA 62%

iMAD: Intelligent Multi-Agent Debate for Efficient and Accurate LLM Inference

iMAD: 智能多智能体辩论用于高效准确的LLM推理

Wei Fan, JinYi Yoon, Bo Ji

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 iMAD通过智能触发多智能体辩论,高效减少令牌消耗并提升LLM推理准确性

Comments Accepted in AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01155 2025-12-03 cs.SE cs.AI 57%

Beyond Greenfield: The D3 Framework for AI-Driven Productivity in Brownfield Engineering

超越Greenfield:面向Brownfield工程的D3框架:AI驱动的生产力框架

Krishna Kumaar Sharma

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出D3框架,通过双代理提示架构提升Brownfield工程中LLM的应用效果,实验证明在遗留系统探索、文档重建等任务中,AI辅助显著提升生产力和减少认知负荷。

Comments 53 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02660 2025-12-03 cs.AI cs.AR 57%

Hey AI, Generate Me a Hardware Code! Agentic AI-based Hardware Design & Verification

嘿,AI,为我生成一段硬件代码!基于代理的AI硬件设计与验证

Deepak Narayan Gadde, Keerthan Kopparam Radhakrishna, Vaisakh Naduvodi Viswambharan, Aman Kumar, Djones Lettnin, Wolfgang Kunz, Sebastian Simon

机构 * 1 Infineon Technologies Dresden GmbH \& Co. KG, Germany 2 Infineon Technologies India Pvt. Ltd., India 3 Infineon Technologies AG, Germany 4 Rheinland-Pf \"a lzische Technische Universit \"a t Kaiserslautern-Landau, Germany

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于代理的AI方法,用于硬件设计验证,通过与人类在环的协作,实现动态迭代和自我反思,提升设计覆盖率并减少验证时间。

Comments To appear at the 38th SBC/SBMicro/IEEE Symposium on Integrated Circuits and Systems Design (SBCCI), August 25-29, 2025, Manaus, BRAZIL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19686 2025-12-03 cs.AI 57%

From Memories to Maps: Mechanisms of In-Context Reinforcement Learning in Transformers

从记忆到地图:变换器中上下文强化学习的机制

Ching Fang, Kanaka Rajan

机构 * Harvard Medical School(哈佛医学院) Harvard University(哈佛大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究通过变换器模型探索上下文强化学习的机制,发现记忆在存储经验与缓存计算中扮演关键角色,支持灵活行为。

Comments Revised to around 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02485 2025-12-03 cs.CV cs.AI 57%

UCAgents: Unidirectional Convergence for Visual Evidence Anchored Multi-Agent Medical Decision-Making

UCAgents: 视觉证据锚定的多智能体医学决策收敛

Qianhan Feng, Zhongzhen Huang, Yakun Zhu, Xiaofan Zhang, Qi Dou

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 UCAgents通过结构化证据审计和单向收敛机制,在医疗视觉问答中提升准确率并降低计算成本,平衡视觉证据揭示与文本干扰避免。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02358 2025-12-03 cs.AI 57%

Beyond Playtesting: A Generative Multi-Agent Simulation System for Massively Multiplayer Online Games

超越试玩:一种生成式多智能体仿真系统用于大规模多人在线游戏

Ran Zhang, Kun Ouyang, Tiancheng Ma, Yida Yang, Dong Fang

机构 * independent researcher(独立研究者)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于生成式多智能体仿真的系统,利用大型语言模型优化大规模多人在线游戏的数值设计,提升玩家体验并提高优化效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07226 2025-12-03 cs.RO cs.AI 57%

Large Language Models for Robotics: A Survey

大语言模型在机器人中的应用:综述

Fanlong Zeng, Wensheng Gan, Zezheng Huai, Lichao Sun, Hechang Chen, Yongheng Wang, Ning Liu, Philip S. Yu

机构 * School of Intelligent Systems Science and Engineering(智能系统科学与工程学院) Jinan University(济南大学) School of Artificial Intelligence(人工智能学院) Jilin University(吉林大学) Shanghai Innovation Institute(上海创新研究院) Lehigh University(莱文斯顿大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文综述了大语言模型在机器人领域的应用,探讨了其在机器人控制、感知、决策和规划等方面的影响与挑战。

Comments Preprint. 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02981 2025-12-03 cs.CV 50%

InEx: Hallucination Mitigation via Introspection and Cross-Modal Multi-Agent Collaboration

InEx:通过内省与跨模态多智能体协作缓解幻觉

Zhongyu Yang, Yingfang Yuan, Xuanming Jiang, Baoyi An, Wei Pang

专题命中 规划推理 :reasoning(abstract)

AI总结 InEx通过内省推理和跨模态多智能体协作,自主缓解大型语言模型的幻觉问题,实验表明其在多个基准上表现优异。

Comments Published in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02715 2025-12-03 cs.CV 50%

GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding

GeoViS: 基于地理奖励的视觉搜索用于遥感视觉定位

Peirong Zhang, Yidan Zhang, Luxiao Xu, Jinliang Lin, Zonghao Guo, Fengxiang Wang, Xue Yang, Kaiwen Wei, Lei Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) National University of Defense Technology(国防科技大学) Shanghai Jiao Tong University(上海交通大学) Chongqing University(重庆大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 GeoViS通过地理奖励机制,实现了遥感影像中的细粒度视觉定位,通过逐步搜索和推理提升小目标检测精度与跨领域泛化能力。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01589 2025-12-03 cs.CV 50%

Toward Content-based Indexing and Retrieval of Head and Neck CT with Abscess Segmentation

面向头颈CT中脓肿内容基于索引与检索的进展

Thao Thi Phuong Dao, Tan-Cong Nguyen, Trong-Le Do, Truong Hoang Viet, Nguyen Chi Thanh, Huynh Nguyen Thuan, Do Vo Cong Nguyen, Minh-Khoi Pham, Mai-Khiem Tran, Viet-Tham Huynh, Trong-Thuan Nguyen, Trung-Nghia Le, Vo Thanh Toan, Tam V. Nguyen, Minh-Triet Tran, Thanh Dinh Le

机构 * University of Science, VNU-HCM(越南国家大学) Vietnam National University(越南国家大学) Thong Nhat Hospital(同奈医院) University of Social Sciences and Humanities, VNU-HCM(越南国家人文社会大学) Dublin City University(都柏林城市大学) University of Dayton(戴维森大学) John von Neumann Institute(约翰·冯·诺伊曼研究所) University of Health Sciences, VNU-HCM(越南国家卫生科学大学)

专题命中 规划推理 :planning(abstract)

AI总结 本研究提出AbscessHeNe数据集,用于头颈CT中脓肿的语义分割及内容基于检索,通过高精度分割和临床元数据支持智能诊断与治疗决策。

Comments The 2025 IEEE International Conference on Content-Based Multimedia Indexing (IEEE CBMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07424 2025-12-03 cs.HC 50%

Feed-O-Meter: Investigating AI-Generated Mentee Personas as Interactive Agents for Scaffolding Design Feedback Practice

Feed-O-Meter:探究AI生成的指导者人设作为交互代理在支架设计反馈实践中的应用

Hyunseung Lim, Dasom Choi, DaEun Choi, Sooyohn Nam, Hwajung Hong

专题命中 规划推理 :reasoning(abstract)

AI总结 Feed-O-Meter通过AI代理帮助学生练习设计反馈,提升其反馈能力和反思能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03079 2025-12-03 cs.CV 50%

Bias Beyond Demographics: Probing Decision Boundaries in Black-Box LVLMs via Counterfactual VQA

偏见超越人口统计:通过反事实视觉问答探测黑盒大视觉-语言模型的决策边界

Zaiying Zhao, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文通过反事实VQA基准探测黑盒LVLMs的决策边界,揭示非人口属性对决策的更大影响,并展示人类规范验证示例对提升模型响应一致性和公平性的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02310 2025-12-03 cs.CY 50%

The MEVIR Framework: A Virtue-Informed Moral-Epistemic Model of Human Trust Decisions

MEVIR框架:一种基于美德的道德认知人类信任决策模型

Daniel Schwabe

专题命中 规划推理 :reasoning(abstract)

AI总结 MEVIR框架通过整合美德认知理论和道德基础理论,探讨人类信任决策中的认知偏差与道德直觉,旨在构建决策支持系统以提升元认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏