arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-03 至 2026-02-03 共收录 233 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 52 篇

2602.02468 2026-02-03 cs.AI cs.CL 62%

Avenir-Web: Human-Experience-Imitating Multimodal Web Agents with Mixture of Grounding Experts

Avenir-Web: 人类经验模拟的多模态网络代理与接地专家混合

Aiden Yiliu Li, Xinyue Hao, Shilong Liu, Mengdi Wang

机构 * University College London(伦敦大学学院) The University of Edinburgh(爱丁堡大学) Princeton University(普林斯顿大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 Avenir-Web通过融合接地专家与经验模仿规划,实现了在复杂网络界面中可靠执行长周期任务的开源网络代理新纪录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20048 2026-02-03 cs.AI cs.CL 62%

Insight Agents: An LLM-Based Multi-Agent System for Data Insights

洞察代理:基于LLM的多智能体数据洞察系统

Jincheng Bai, Zhenyu Zhang, Jennifer Zhang, Zhihuai Zhu

机构 * Amazon(亚马逊)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM的洞察代理系统,通过多智能体架构实现高效的数据洞察与商业决策支持,准确率达90%且延迟低于15秒。

Comments Accepted to SIGIR 2025. DOI: 10.1145/3726302.3731959

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01419 2026-02-03 cs.LG cs.AI 62%

Semi-supervised CAPP Transformer Learning via Pseudo-labeling

半监督CAPP变换器学习 via 假设标签

Dennis Gross, Helge Spieker, Arnaud Gotlieb, Emmanuel Stathatos, Panorios Benardos, George-Christopher Vosniakos

机构 * Simula Research Laboratory(Simula研究实验室) National Technical University of Athens(希腊国家技术大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种半监督学习方法,通过假设标签改进基于变换器的CAPP模型,提升数据稀缺环境下的制造过程规划准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09635 2026-02-03 cs.AI cs.LG 62%

Large-Scale Optimization Model Auto-Formulation: Harnessing LLM Flexibility via Structured Workflow

大规模优化模型自动生成:通过结构化工作流利用LLM的灵活性

Kuo Liang, Yuhang Lu, Jianming Mao, Shuyi Sun, Chunwei Yang, Congcong Zeng, Xiao Jin, Hanzhang Qin, Ruihao Zhu, Chung-Piaw Teo

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 LEAN-LLM-OPT通过结构化工作流利用LLM灵活性,实现大规模优化模型自动生成,并在多个场景中展现优越性能。

Comments Updated version of https://papers.ssrn.com/sol3/papers.cfm?abstract_id=5329027

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01598 2026-02-03 cs.CL 57%

The Art of Socratic Inquiry: A Framework for Proactive Template-Guided Therapeutic Conversation Generation

苏格拉底式探究的艺术:一种主动模板引导治疗对话生成的框架

Mingwen Zhang, Minqiang Yang, Changsheng Ma, Yang Yu, Hui Bai, Chen Xu, Xiangzhen Kong, Bin Hu

机构 * School of Information Science and Engineering, Lanzhou University(信息科学与工程学院,兰州大学) School of Medical Technology, Beijing Institute of Technology(医学技术学院,北京理工大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Socratic Inquiry Framework,通过策略锚定和模板检索分离提问时机与内容,提升LLMs的主动提问能力,推动心理引导型大语言模型的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01556 2026-02-03 cs.AI 57%

Autonomous Question Formation for Large Language Model-Driven AI Systems

面向大语言模型驱动AI系统的自主问题生成

Hong Su

机构 * School of Computer Science, Chengdu University of Information Technology(计算机学院,成都信息科技学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于人类模拟的框架,使大语言模型驱动的AI系统能够自主生成问题并设定任务,通过环境感知和跨代理感知提示显著提升决策质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01532 2026-02-03 cs.AI cs.HC 57%

PRISM: Festina Lente Proactivity -- Risk-Sensitive, Uncertainty-Aware Deliberation for Proactive Agents

PRISM:Festina Lente主动性——面向风险敏感和不确定性意识的主动代理 deliberation

Yuxuan Fu, Xiaoyu Tan, Teqi Hao, Chen Zhan, Xihe Qiu

机构 * Shanghai University of Engineering Science(上海工程技术大学) National University of Singapore(新加坡国立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 PRISM通过决策理论门控与选择性慢速推理,提升主动代理的精确性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01485 2026-02-03 cs.LG stat.ML 57%

Predicting and improving test-time scaling laws via reward tail-guided search

通过奖励尾部引导搜索预测并改进测试时间扩展规律

Muheng Li, Jian Qian, Wenlong Mou

机构 * Department of Statistical Sciences, University of Toronto(多伦多大学统计科学系) Department of AI and Data Science, University of Hong Kong(香港大学人工智能与数据科学系)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出通过奖励尾部引导搜索预测并改进LLM测试时间扩展规律,通过动态分配计算资源提升推理能力。

Comments 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02589 2026-02-03 cs.AI cs.SE 57%

PaperDebugger: A Plugin-Based Multi-Agent System for In-Editor Academic Writing, Review, and Editing

PaperDebugger:一种基于插件的多智能体系统用于编辑器中的学术写作、审阅和编辑

Junyi Hou, Andre Lin Huikai, Nuo Chen, Yiwei Gong, Bingsheng He

机构 * National University of Singapore(新加坡国立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 PaperDebugger是一种在编辑器内集成多智能体系统和插件的学术写作助手,通过Chrome扩展、Kubernetes编排层和MCP工具链实现LLM驱动的写作、审阅和编辑功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17778 2026-02-03 cs.AI cs.NI 57%

AgentRAN: An Agentic AI Architecture for Autonomous Control of Open 6G Networks

AgentRAN: 一种面向自主控制开放6G网络的代理AI架构

Maxime Elkael, Salvatore D'Oro, Leonardo Bonati, Michele Polese, Yunseong Lee, Koichiro Furueda, Tommaso Melodia

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 AgentRAN是一种基于自然语言意图的AI代理架构,通过自组织层次结构和AI-RAN工厂实现开放6G网络的自主控制与持续自我优化。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08664 2026-02-03 cs.RO cs.AI 57%

A Social Robot with Inner Speech for Dietary Guidance

具有内部言语的社交机器人用于饮食指导

Valerio Belcamino, Alessandro Carfì, Valeria Seidita, Fulvio Mastrogiovanni, Antonio Chella

机构 * TheEngineRoom, Department of Informatics Bioengineering, Robotics and System Engineering, University of Genoa, Genoa, Italy(TheEngineRoom,信息生物工程与机器人系统工程系,热那亚大学,热那亚,意大利) Department of Engineering, University of Palermo, Palermo, Italy(工程系,巴勒莫大学,巴勒莫,意大利)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一款具备内部言语功能的社交机器人,通过增强透明度和信任度来提供饮食指导,结合大语言模型和知识图谱提升交互效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01331 2026-02-03 cs.MA cs.CL 57%

A-MapReduce: Executing Wide Search via Agentic MapReduce

A-MapReduce:通过代理MapReduce执行广泛搜索

Mingju Chen, Guibin Zhang, Heng Chang, Yuchen Guo, Shiji Zhou

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算创新中心,人工智能学院,北京航空航天大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) BNRist, Tsinghua University(BNRist,清华大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 A-MapReduce通过引入MapReduce范式,提出一种多代理框架,将广泛搜索转化为水平结构的检索问题,实现高效且低成本的广泛搜索执行。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01206 2026-02-03 cs.AI 57%

Addressing Explainability of Generative AI using SMILE (Statistical Model-agnostic Interpretability with Local Explanations)

通过SMILE(统计模型无关可解释性与局部解释)解决生成AI的可解释性问题

Zeinab Dehghani

机构 * School of Computer Science(计算机科学学院) University of Hull(赫尔大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 gSMILE通过受控扰动、Wasserstein距离和加权替代模型,提升生成AI的可解释性,实现细粒度归因和直观热图生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01202 2026-02-03 cs.AI 57%

Workflow-R1: Group Sub-sequence Policy Optimization for Multi-turn Workflow Construction

Workflow-R1: 多轮工作流构建的分组子序列策略优化

Mingze Kong, Zikun Qu, Zhongquan Zhou, Pengyu Liang, Xiang Li, Zhiwei Shang, Zhi Hong, Kaiyu Huang, Zhiyong Wang, Zhongxiang Dai

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Tianjin University(天津大学) Tongji University(同济大学) University of Edinburgh(爱丁堡大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 Workflow-R1通过分组子序列策略优化提升多轮工作流构建的灵活性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00907 2026-02-03 cs.LG 57%

PyGALAX: An Open-Source Python Toolkit for Advanced Explainable Geospatial Machine Learning

PyGALAX:一个用于高级可解释地理空间机器学习的开源Python工具包

Pingping Wang, Yihong Yuan, Lingcheng Li, Yongmei Lu

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 PyGALAX通过整合AutoML和XAI技术,提供了一个用于高级可解释地理空间机器学习的开源Python工具包,解决了空间非平稳性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00726 2026-02-03 cs.HC cs.AI 57%

Augmenting Clinical Decision-Making with an Interactive and Interpretable AI Copilot: A Real-World User Study with Clinicians in Nephrology and Obstetrics

通过交互式和可解释的AI助手增强临床决策:与泌尿科和产科医生的现实世界用户研究

Yinghao Zhu, Dehao Sui, Zixiang Wang, Xuning Hu, Lei Gu, Yifan Qi, Tianchen Wu, Ling Wang, Yuan Wei, Wen Tang, Zhihan Cui, Yasha Wang, Lequan Yu, Ewen M Harrison, Junyi Gao, Liantao Ma

机构 * Peking University(北京大学) University of Hong Kong(香港大学) Hong Kong University of Science and Technology(香港科学与技术大学) Peking University Third Hospital(北京大学第三医院) Affiliated Xuzhou Municipal Hospital of Xuzhou Medical University(徐州医科大学附属徐州市人民医院) University of Edinburgh(爱丁堡大学) Health Data Research UK(英国健康数据研究)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 AICare通过交互式和可解释的AI助手提升临床决策,通过实验证明其降低认知负荷并增强医生信任

Comments Accepted by ACM CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00704 2026-02-03 cs.LG 57%

LocalV: Exploiting Information Locality for IP-level Verilog Generation

LocalV: 利用信息局部性进行IP级Verilog生成

Hanqi Lyu, Di Huang, Yaoyu Zhu, Kangcheng Liu, Bohan Dou, Chongxiao Li, Pengwei Jin, Shuyao Cheng, Rui Zhang, Zidong Du, Qi Guo, Xing Hu, Yunji Chen

机构 * University of Science(科学大学) SKL of Processors, Institute of Computing Technology, CAS(处理器研究所,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 LocalV通过利用模块化硬件设计中的信息局部性,解决IP级Verilog生成中的长文档处理、长代码生成和调试挑战,实现更高的生成准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04220 2026-02-03 cs.CL 57%

On Group Relative Policy Optimization Collapse in Agent Search: The Lazy Likelihood-Displacement

关于代理搜索中群体相对策略优化崩溃:懒惰似然位移

Wenlong Deng, Yushu Li, Boying Gong, Yi Ren, Christos Thrampoulidis, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Meta AI

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出LLDS正则化方法,解决GRPO在代理搜索中因LLD导致的训练崩溃问题,提升模型性能达45.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08952 2026-02-03 cs.LG 57%

When LLM Agents Meet Graph Optimization: An Automated Data Quality Improvement Approach

当大语言模型代理遇见图优化:一种自动化数据质量改进方法

Zhihan Zhang, Xunkai Li, Yilong Zuo, Yanzhe Wen, Zhaoxin Fan, Zhenjun Li, Bing Zhou, Rong-Hua Li, Guoren Wang

机构 * Shenzhen Institute of Technology(深圳理工大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 LAGA是一种统一的多代理框架,通过协调多模态优化全面提升文本属性图的数据质量,验证了数据驱动的质量优化在可靠分析中的重要性。

Comments 12 pages, 10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00129 2026-02-03 cs.LG cs.SE 57%

Monte Carlo Tree Search for Execution-Guided Program Repair with Large Language Models

基于大语言模型的执行引导程序修复的蒙特卡罗树搜索

Yixuan Liang

机构 * Illinois Institute of Technology Chicago, USA(伊利诺伊理工学院芝加哥分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 CodePilot结合MCTS和大语言模型,通过执行反馈引导程序修复,实现高效的问题解决。

Comments 10 pages, 5 figures. Submitted to a conference workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02411 2026-02-03 cs.RO 50%

Multi-Agent Monte Carlo Tree Search for Makespan-Efficient Object Rearrangement in Cluttered Spaces

多智能体蒙特卡洛树搜索用于 cluttered 空间中的 makespan 高效物体重新排列

Hanwen Ren, Junyong Kim, Aathman Tharmasanthiran, Ahmed H. Qureshi

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出CAM-MCTS框架,通过集中式任务分配与异步执行策略,提升杂乱环境中物体重新排列的makespan效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01986 2026-02-03 cs.HC 50%

Belief Updating and Delegation in Multi-Task Human-AI Interaction: Evidence from Controlled Simulations

信念更新与委托在多任务人机交互中的作用:来自受控模拟的证据

Shreyan Biswas, Alexander Erlei, Ujwal Gadiraju

专题命中 规划推理 :planning(abstract)

AI总结 研究发现用户在多任务人机交互中形成路径依赖的期望,保守更新信念,并基于主观信念而非客观性能决定对AI的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01952 2026-02-03 cs.DB 50%

SQLAgent: Learning to Explore Before Generating as a Data Engineer

SQLAgent: 作为数据工程师在生成前学习探索

Wenjia Jiang, Yiwei Wang, Boyan Han, Joey Tianyi Zhou, Chi Zhang

专题命中 规划推理 :reasoning(abstract)

AI总结 SQLAgent通过两阶段框架实现数据库探索与查询生成解耦,利用蒙特卡洛树搜索策略构建知识库,并通过双代理系统提升SQL查询准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01870 2026-02-03 cs.RO 50%

BTGenBot-2: Efficient Behavior Tree Generation with Small Language Models

BTGenBot-2: 基于小语言模型的高效行为树生成

Riccardo Andrea Izzo, Gianluca Bardaro, Matteo Matteucci

机构 * Department of Electronics, Information, and Bioengineering(电子、信息与生物工程系)

专题命中 规划推理 :planning(abstract)

AI总结 BTGenBot-2是一种基于小语言模型的高效行为树生成方法,通过开源模型实现零样本生成和快速推理,显著提升机器人任务规划效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01854 2026-02-03 cs.CV 50%

Fact or Fake? Assessing the Role of Deepfake Detectors in Multimodal Misinformation Detection

事实还是假象?评估深度伪造检测器在多模态虚假信息检测中的作用

A S M Sharifuzzaman Sagar, Mohammed Bennamoun, Farid Boussaid, Naeha Sharif, Lian Xu, Shaaban Sahmoud, Ali Kishk

机构 * The University of Western Australia(西澳大学) Fatih Sultan Mehmet Vakif University(法提赫·苏丹·梅赫梅特·瓦基夫大学) Aljazeera Media Network Investigative Department(半岛电视台调查部门)

专题命中 规划推理 :reasoning(abstract)

AI总结 研究评估了深度伪造检测器在多模态虚假信息检测中的作用,发现其独立价值有限,而证据驱动的事实核查系统表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19338 2026-02-03 cs.HC 50%

The Psychological Science of Artificial Intelligence: A Rapidly Emerging Field of Psychology

人工智能心理学科学:一个迅速发展的心理学领域

Zheng Yan, Ru-Yuan Zhang

专题命中 规划推理 :planning(abstract)

AI总结 本文综述了人工智能心理学科学的现有文献,旨在提供一个全面的概念框架,用于规划、开展和评估该领域内的科学研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01278 2026-02-03 cs.CV 50%

DSFC-Net: A Dual-Encoder Spatial and Frequency Co-Awareness Network for Rural Road Extraction

DSFC-Net:一种用于农村道路提取的双编码空间和频率协同网络

Zhengbo Zhang, Yihe Tian, Wanke Xia, Lin Chen, Yue Sun, Kun Ding, Ying Wang, Bing Xu, Shiming Xiang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) Department of Earth System Science, Tsinghua University(清华大学地球系统科学系) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院)

专题命中 规划推理 :planning(abstract)

AI总结 DSFC-Net通过双编码框架融合空间和频域信息,有效解决农村道路提取中的植被遮挡和狭窄道路连续性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00808 2026-02-03 cs.RO 50%

Physics-informed Diffusion Mamba Transformer for Real-world Driving

物理引导的扩散Mamba变换器用于现实驾驶

Hang Zhou, Qiang Zhang, Peiran Liu, Yihao Qin, Zhaoxu Yan, Yiding Ji

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology(Guangzhou)(香港科学与技术大学(广州)机器人与自主系统方向) MoSense Technologies

专题命中 规划推理 :planning(abstract)

AI总结 本文提出了一种结合Mamba和注意力机制的扩散模型,通过整合物理约束提升自动驾驶轨迹预测的准确性和可解释性。

Journal ref International Conference on Robotics & Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00558 2026-02-03 cs.NI 50%

NetWorld: Communication-Based Diffusion World Model for Multi-Agent Reinforcement Learning in Wireless Networks

NetWorld: 基于通信的扩散世界模型用于无线网络中的多智能体强化学习

Kechen Meng, Rongpeng Li, Yansha Deng, Zhifeng Zhao, Honggang Zhang

专题命中 规划推理 :planning(abstract)

AI总结 NetWorld通过通信增强的扩散世界模型,实现无线网络中多智能体强化学习的少样本泛化和高效轨迹规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00500 2026-02-03 cs.RO 50%

Inject Once Survive Later: Backdooring Vision-Language-Action Models to Persist Through Downstream Fine-tuning

一次注入,后期存活:向视觉-语言-动作模型注入后门以在下游微调中持续存在

Jianyi Zhou, Yujie Wei, Ruichen Zhen, Bo Zhao, Xiaobo Xia, Rui Shao, Xiu Su, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Harbin Institute of Technology(哈尔滨工业大学) Meituan Academy of Robotics Shenzhen, Meituan(美团机器人深圳研究院) Shanghai Jiaotong University(上海交通大学) National University of Singapore(新加坡国立大学) Central South University(中南大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出INFUSE框架,首次实现对VLA模型的后门攻击,使其在用户微调后仍能保持有效性,显著提升攻击成功率并保持任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏