arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 493 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 493 篇

2502.05110 2026-08-04 cs.CY cs.AI 版本更新 70%

ApplE: A Modular Ontology of Applied Ethics and Event Context for Ethical Decision Modeling

ApplE:用于伦理决策建模的应用伦理与事件上下文模块化本体

Aisha Aijaz, Raghava Mutharaju, Manohar Kumar

专题命中 规划推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 该研究提出模块化应用伦理本体ApplE,采用改进SAMOD构建,结合伦理理论与事件上下文,经医疗用例验证,遵循FAIR原则,可用于伦理AI系统等的建模资源。

Comments Accepted at ER2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01427 2026-07-31 cs.AI 版本更新 70%

A Tale of LLMs and Induced Small Proxies: Scalable Small Language Models for Knowledge Mining

小型语言模型代理实现高效高质量的知识挖掘

Sipeng Zhang, Longfei Yun, Zilong Wang, Letian Peng, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Carneigie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出Falconer框架,结合大语言模型的代理推理与轻量级代理模型,通过规划与标注实现可扩展的知识挖掘,在保持指令遵循精度的同时降低90%推理成本并加速20倍以上。

Comments Code available: https://github.com/LongfeiYun17/falconer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18080 2026-07-28 cs.CV cs.AI 版本更新 70%

Sparse Evidence Can Suffice: Agentic Evidence Seeking for Multimodal Video Misinformation Detection

稀疏证据就足够了:用于多模态视频错误信息检测的智能证据搜索

Haochen Zhao, Yongxiu Xu, Xinkui Lin, Dong Xie, Jiarui Lu, Yuqi Qian, Yubin Wang, Hongbo Xu, Gaopeng Gou

专题命中 规划推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 研究多模态视频错误信息检测,提出SIEVE框架,通过智能体探索多模态证据构建证据包,由验证器判断真实性。智能体经特殊训练,实验表明该框架性能优于基线,能提供可检查证据线索,提升检测透明度与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16275 2026-07-28 cs.CV cs.AI 版本更新 70%

GFLAN: Generative Functional Layouts

GFLAN:生成功能布局

Mohamed Abouagour, Eleftherios Garyfallidis

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 GFLAN通过两阶段分解生成功能布局,结合拓扑规划与几何实现,提升建筑生成的准确性与合理性。

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18334 2026-07-28 cs.RO cs.AI cs.MA 版本更新 70%

CoopReflect: Towards Natural Language Communication for Cooperative Autonomous Driving via Multi-Agent Learning

CoopReflect:通过多智能体学习实现协同自动驾驶的自然语言通信

Jiaxun Cui, Chen Tang, Jarrett Holtz, Janice Nguyen, Alessandro G. Allievi, Hang Qiu, Peter Stone

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Robert Bosch LLC(罗伯特·博世有限公司) University of California, Riverside(加州大学河滨分校) Sony AI(索尼人工智能)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究探索自然语言用于车对车通信的潜力,开发基于大语言模型的驾驶智能体,引入CoopReflect多智能体学习框架,通过试错等为智能体配备相关知识,实验表明其能生成更优消息,实现跨场景泛化并降低决策延迟。

Journal ref Proc. 25th Int. Conf. Autonomous Agents and Multiagent Systems (AAMAS), 744-752 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02024 2026-07-27 cs.AI 版本更新 70%

From Mind to Machine: The Rise of Manus AI as a Fully Autonomous Digital Agent

从心智到机器:Manus AI作为完全自主数字代理的崛起

Minjie Shen, Yanshu Li, Lulu Chen, Zhichao Fan, Yanhang Li, Qikai Yang, Haochen Yang

机构 * Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工学院电气与计算机工程系) Department of Computer Science, Brown University(布朗大学计算机科学系) Department of Computer Science, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Khoury College of Computer Sciences, Northeastern University(东北大学科里尔计算机科学学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 Manus AI是一款通用人工智能代理,结合大语言模型的推理与规划能力,执行复杂任务并产生实际成果,本文全面介绍了其技术架构、跨行业应用及未来潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18034 2026-07-23 cs.AI 版本更新 70%

AdaHome: An Adaptive Smart Home Assistant using Local Small Language Models

AdaHome:一种使用本地小语言模型的自适应智能家居助手

Eu Jin Lim, Zhaoxing Li, Sebastian Stein

机构 * University of Southampton(南安普顿大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究旨在解决智能家居助手问题,提出AdaHome,通过意图感知规划框架、草稿链策略及偏好适应机制,在本地小语言模型上实现高效决策与个性化,实验显示其在命令准确性、延迟及多轮场景中有良好表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12527 2026-07-22 cs.AI 版本更新 70%

Evidence-Grounded AI for Musculoskeletal Care

用于肌肉骨骼护理的基于证据的人工智能

Wenjie Li, Yujie Zhang, Fanrui Zhang, Haoran Sun, Renhao Yang, Junjun He, Weiran Huang, Yuanfeng Ji, Chenrun Wang, Kailing Wang, Hongcheng Gao, Kaipeng Zhang, Hanyu Wang, Angela Lin Wang, Xingqi He, Yilin Huang, Shiyi Yao, Lilong Wang, Yankai Jiang, Yirong Chen, Chenglong Ma, Jiyao Liu, Ming Hu, Gen Li, Yidong Xu, Chengyu Zhuang, Jiawei Liu, Yin Zhang, Lequan Yu, Lu Chen, Yinpeng Dong, Lei Liu, Carlos Gutierrez Sanroman, Yu Qiao, Weijie Ma, Xiaosong Wang, Lei Wang

机构 * Ruijin Hospital, College of Health Science and Technology, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院,健康科学技术学院) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学脑启发智能感知与认知教育部重点实验室) School of Basic Medical Sciences, Intelligent Medicine Institute, Fudan University(复旦大学基础医学院智能医学研究院) Department of Radiation Oncology, Stanford University School of Medicine(斯坦福大学医学院放射肿瘤学系) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对肌肉骨骼护理中证据分散问题,提出基于大语言模型的OrthoPilot系统,整合多源数据进行持续管理。该系统在诊断推理等方面超越专家,优于其他智能系统,还提升了管理成功率和病床病例数等,推动临床人工智能实现纵向管理。

Comments All co-authors have now consented to the submission and approved the authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14661 2026-07-21 cs.AI 版本更新 70%

SmartRAG: Native Graph-Based RAG for Mobile Device

SmartRAG:用于移动设备的基于原生图的RAG

Zhihan Jiang, Meng Li, Shenghao Liu, Keran Li, Ruiben Zhou, Wei Wang, Xianjun Deng, Shuai Wang, Haipeng Dai

机构 * Nanjing University(南京大学) HUST(华中科技大学) Southeast University(东南大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对移动设备部署大语言模型的问题,提出SmartRAG框架,围绕四个模块组织智能助手,核心是可持续学习的EvoNER,知识存于MRGraph,通过混合管道检索,实验表明其在多跳推理性能上有竞争力且能在普通智能手机上运行。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15830 2026-07-21 cs.AI 版本更新 70%

Mini Amusement Parks (MAPs): A Testbed for Modelling Business Decisions

迷你游乐园(MAPs):一个用于模拟商业决策的测试平台

Stéphane Aroca-Ouellette, Ian Berlot-Attwell, Panagiotis Lymperopoulos, Abhiramon Rajasekharan, Tongqi Zhu, Herin Kang, Kaheer Suleman, Sam Pasupalak

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 介绍用于评估智能体决策能力的游乐园模拟器Mini Amusement Parks (MAPs),统一现实决策多方面挑战,提供人类基线和对先进语言模型智能体的评估,发现人类表现更优并揭示智能体在多方面的弱点,为基准测试适应性决策智能体提供新基础。

Comments 9 pages (main paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00446 2026-07-21 cs.AI 版本更新 70%

Benchmarking Agentic Newswriting via Journalistic Workflows

通过新闻工作流程对智能新闻写作进行基准测试

Yen-Che Chien, Kuang-Da Wang, Wei-Yao Wang, Wen-Chih Peng

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Sony Group Corporation(索尼集团)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究智能体在新闻写作工作流程中的表现,引入NEWSAGENT基准,给定写作指令和部分材料,评估智能体搜索、选信息及改草稿能力,发现其检索事实尚可,但规划和叙事整合有困难,为评估智能体能力提供现实测试平台。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10350 2026-07-20 cs.AI cs.RO 版本更新 70%

ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory

ABot-AgentOS:一个具有终身多模态记忆的通用机器人智能体操作系统

Jiayi Tian, Shiao Liu, Yuting Xu, Jia Lu, Zihao Guan, Honglin Han, Di Yang, Minqi Gu, Yifei Qian, Tianlin Zhang, Yanqing Zhu, Zeqian Ye, Menglin Yang, Fei Wang, Xu Hu, Xiuxian Li, Wei Zhang, Shihui Su, Yiyan Ji, Jingbo Wang, Ziteng Feng, Jiaheng Liu, Zhaoxiang Zhang, Xiaolong Wu, Zixiao Tang, Zhining Gu, Yang Cai, Linbo Zheng, Jingjing Ma, Mingyang Yin, Zedong Chu, Wenbin Tang, Mu Xu

机构 * AMAP CV Lab(AMAP计算机视觉实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对长期具身智能体运行需求,提出ABot-AgentOS通用机器人智能体操作系统,引入EmbodiedWorldBench基准,采用通用多模态图记忆及失败驱动自我进化循环,在相关测试中表现良好,证明该系统层可提升具身执行并提供持久记忆。

Comments Code: https://github.com/amap-cvlab/ABot-AgentOS Project page: https://amap-cvlab.github.io/ABot-AgentOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05396 2026-07-16 cs.CL cs.SE 版本更新 70%

FairCoder: Probing LLM Bias in High-Stakes Decision Making via Coding Tasks

FairCoder:通过编码任务探究高风险决策中语言模型的偏差

Yongkang Du, Jen-tse Huang, Jieyu Zhao, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学) University of Southern California(南加州大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 研究通过FairCoder基准将决策制定设为编码任务,探究LLMs在多领域的偏差,针对现有指标不足提出FairScore指标,经实验揭示了此前未充分探索的偏差模式,凸显LLMs作决策代理的风险并提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23276 2026-07-15 cs.LG cs.MA 版本更新 70%

Auditable Context-Aware HFMD Forecasting with Structured LLM Agents

基于结构化大语言模型代理的可审计上下文感知手足口病预测

Joongwon Chae, Runming Wang, Chen Xiong, Gong Yunhan, Lian Zhang, Ji Jiansong, Dongmei Yu, Peiwu Qin

机构 * Institute of Biomedicine and Health Engineering, Tsinghua Shenzhen International Graduate School (SIGS), Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院生物医学与健康工程学院) The Fifth Affiliated Hospital of Wenzhou Medical University, Lishui 323000, China(温州医科大学第五附属医院) Hengqin Laboratory, Zhuhai, China(横琴实验室) The First Hospital of Hebei Medical University, Shijiazhuang, China(河北医科大学第一医院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 研究针对手足口病预测,提出双代理神经符号框架,由基于大语言模型的事件解释器和预测生成器组成,通过摄取异构信号并结合历史病例数进行预测,在两个数据集评估中实现有竞争力的点准确性、可靠区间及可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11503 2026-07-14 q-bio.NC cs.AI cs.GT 版本更新 70%

People use fast and flat simulation to reason about new games

人们使用快速且扁平的模拟来对新游戏进行推理

Katherine M. Collins, Cedegao E. Zhang, Lionel Wong, Mauricio Barba da Costa, Graham Todd, Adrian Weller, Samuel J. Cheyette, Thomas L. Griffiths, Joshua B. Tenenbaum

机构 * Massachusetts Institute of Technology(麻省理工学院) Princeton University(普林斯顿大学) University of Cambridge(剑桥大学) Stanford University(斯坦福大学) New York University(纽约大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究人们对新游戏的推理,通过超千名参与者和121种新棋盘游戏的研究,发现人们玩新游戏或评估时具系统性和适应性理性,用“直观玩家”模型解释,为新问题应对及类人AI系统设计提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20297 2026-07-13 cs.AI 版本更新 70%

Improving Language Agents through BREW: Bootstrapping expeRientially-learned Environmental knoWledge

通过BREW改进语言智能体:引导式经验学习环境知识

Shashank Kirtania, Param Biyani, Priyanshu Gupta, Yasharth Bajpai, Roshni Iyer, Sumit Gulwani, Gustavo Soares

机构 * University of Michigan(密歇根大学) Independent(独立研究者) Microsoft(微软) Apple(苹果公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究基于LLM的智能体无法从经验学习的问题,提出BREW框架,通过提炼交互轨迹成知识库、引入EG-MCTS算法及适应事后重标记等方法,在多基准测试中提升任务成功率并减少执行步骤,且知识库具有良好特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20134 2026-07-13 cs.AI cs.ET quant-ph 版本更新 70%

QAgent: An LLM-based Multi-Agent System for Autonomous OpenQASM programming

QAgent:一种基于大语言模型的用于自主OpenQASM编程的多智能体系统

Zhenxiao Fu, Lei Jiang, Yilun Xu, Gang Huang, Fan Chen

机构 * Zhenxiao Fu1, Lei Jiang1, Yilun Xu2, Gang Huang2, Fan Chen1(作者1、作者2、作者3、作者4、作者5)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对OpenQASM编程挑战提出QAgent,它是基于大语言模型的多智能体系统,集成规划、合成和校准工作流程,利用检索增强生成及多智能体推理确保正确性,在多模型评估中表现出色,证明集成对可靠量子程序生成很关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29014 2026-07-07 cs.AI cs.DL 版本更新 70%

Customized Generative AI Agent for Transportation Engineering Practice: A Development and Continued Pre-training Guideline

面向交通工程实践的定制化生成式AI智能体:开发与持续预训练指南

Dianwei Chen, Yuan-Zheng Lei, Zifan Zhang, Yuchen Liu, Xianfeng Yang

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出基于LoRA框架对六种大语言模型进行持续预训练的方法,以提升其在交通工程领域的专业内容理解与推理能力,Qwen2.5-7B和LLaMA-3.1-8B表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18157 2026-07-07 cs.CV cs.LG 版本更新 70%

Agentic Very Long Video Understanding

智能体超长视频理解

Aniket Rege, Arka Sadhu, Yuliang Li, Kejie Li, Ramya Korlakai Vinayak, Yuning Chai, Yong Jae Lee, Hyo Jin Kim

机构 * Reality Labs Research at Meta(Meta 实验室) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 针对智能眼镜等设备带来的长视频理解需求,以实体场景图为核心构建增强智能体框架EGAgent,实现结构化搜索、推理及跨模态能力,在相关数据集实验中取得较好表现。

Comments 29 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04988 2026-07-02 cs.MA cs.AI 版本更新 70%

When AI Agents Compete for Jobs: Strategic Capabilities and Economic Dynamics of AI Labour Markets

当AI代理竞争工作岗位:AI劳动力市场的战略能力与经济动态

Christopher Chiu, Simpson Zhang, Mihaela van der Schaar

机构 * DAMTP, University of Cambridge(剑桥大学应用数学与理论物理系)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出AI-Work模拟平台,研究AI代理在劳动力市场中的竞争行为,发现元认知、竞争意识和长期战略规划能力使代理获得更高利润和市场份额。

Comments Accepted at ICML 2026, Code available at https://github.com/chy-chiu/ai-work

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01442 2026-06-29 cs.AI 版本更新 70%

Agentic Episodic Control

智能体情节控制

Xidong Yang, Wenhao Li, Junjie Sheng, Yun Hua, Haosheng Chen, Chuyun Shen, Xiangfeng Wang

机构 * East China Normal University(华东师范大学) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) Shanghai University of International Business and Economics(上海对外经贸大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出智能体情节控制(AEC),利用大语言模型增强情节强化学习,通过语义增强器和关键状态识别器提升数据效率和泛化能力,在BabyAI-Text环境中实现2-6倍数据效率提升。

Comments Accepted to Findings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21720 2026-06-18 cs.AI 版本更新 70%

PosterForest: Hierarchical Multi-Agent Collaboration for Scientific Poster Generation

PosterForest: 用于科学海报生成的分层多智能体协作

Jiho Choi, Seojeong Park, Seongjong Song, Hyunjung Shim

机构 * Graduate School of Artificial Intelligence, KAIST(韩国釜山国立大学人工智能研究生院) School of Integrated Technology, Yonsei University(延世大学整合技术学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出PosterForest,一种无需训练的科学海报生成框架,通过Poster Tree分层表示文档结构,并利用内容与布局智能体进行分层推理与递归优化,实现内容与布局的联合优化,提升语义连贯性、逻辑流畅性和视觉平衡。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05963 2026-06-16 cs.LG 版本更新 70%

Next-Latent Prediction Transformers Learn Compact World Models

下一潜在预测变换器学习紧凑世界模型

Jayden Teoh, Manan Tomar, Kwangjun Ahn, Edward S. Hu, Tim Pearce, Pratyusha Sharma, Akshay Krishnamurthy, Riashat Islam, Alex Lamb, John Langford

机构 * Massachusetts Institute of Technology(麻省理工学院) Microsoft Research(微软研究院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 提出NextLat方法,通过潜在空间中的自监督预测训练变换器学习紧凑世界模型,提升泛化能力和推理效率。

Comments Microsoft Research Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21714 2026-06-16 cs.AI 版本更新 70%

E-mem: Multi-agent based Episodic Context Reconstruction for LLM Agent Memory

E-mem:基于多智能体的事件上下文重建用于LLM智能体记忆

Kaixiang Wang, Yidan Lin, Jiong Lou, Zhaojiacheng Zhou, Bunyod Suvonov, Jie Li

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 E-mem通过多智能体协同重建事件上下文,提升LLM在长时序任务中的推理能力,实现54%的F1分数,优于现有方法7.75%,并降低70%的token成本。

Comments This paper has been accepted by ICML 2026. If you find our project helpful, please consider giving it a star: https://github.com/dog-last/E-mem

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06399 2026-06-09 cs.CL 版本更新 70%

CollabSim: A CSCW-Grounded Methodology for Investigating Collaborative Competence of LLM Agents through Controlled Multi-Agent Experiments

CollabSim: 一种基于CSCW的方法,通过受控多智能体实验研究LLM智能体的协作能力

Jiaju Chen, Bo Sun, Yuxuan Lu, Yun Wang, Dakuo Wang, Bingsheng Yao

机构 * Northeastern University(东北大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 提出CollabSim框架,结合CSCW理论定义协作能力、控制交互条件并探测智能体内部状态,以系统分析LLM多智能体系统的协作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10758 2026-07-08 cs.CR 版本更新 69%

Agents at Risk: How Users Unwittingly Undermine LLM Safety

处于风险中的智能体:用户如何在不知情的情况下破坏大语言模型的安全性

Fengchao Chen, Tingmin Wu, Van Nguyen, Surya. Nepal, Carsten Rudolph

专题命中 规划推理 :planning(abstract,comments);reasoning(abstract)

AI总结 研究基于大语言模型的智能体安全问题,介绍用户中继上下文操纵攻击,通过让良性用户在请求中传递对抗性内容,实验表明该攻击在多种防御下优于提示注入基线,揭示当前智能体框架设计缺陷。

Comments User-relayed Context Manipulation; LLM-based Agents; Agent Security; Human Factors in Cybersecurity; Web-Use Agents; Planning Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24744 2026-08-11 cs.RO cs.CV 版本更新 67%

Data Pyramid for Embodied Manipulation: A Survey

用于具身操纵的数据金字塔

Yifan Ye, Yankai Fu, Yaoxu Lv, Bohan Hou, Jun Cen, Lingdong Kong, Duo Zheng, Tianxing Chen, Jiaming Liu, Ziang Cao, Yunfan Lou, Wei Chow, Xian Sun, Yingshuo Wang, Kuangzhi Ge, Xiaowei Chi, Xidong Zhang, Zhibo Pang, Yiwu Zhong, Sirui Han, Zhihe Lu, Weihao Yuan, Qifeng Chen, Michael Yu Wang, Yao Mu, Ziwei Liu, Jianfei Yang, Ping Luo, Shanghang Zhang

机构 * PKU(北京大学) NTU(南洋理工大学) HKUST(香港科技大学) NUS(新加坡国立大学) CUHK(香港中文大学) HKU(香港大学) Duke(杜克大学) UCB(加州大学伯克利分校) GBU(未提及具体中文名的机构) NJU(南京大学) SJTU(上海交通大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 研究围绕具身操纵数据生态系统展开,构建跨越五个互补数据源的“数据金字塔”,通过数据配方分析具身基础模型,将数据组成与多种能力联系起来,并讨论了六个开放挑战,为下一代具身系统设计奠定基础。

Comments Awesome Embodied Data Pyramid; Project Page at https://jasper-aaa.github.io/embodied-data-pyramid/ GitHub Repo at https://github.com/worldbench/awesome-embodied-data-pyramid

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00028 2026-08-10 cs.CL cs.AI cs.LG cs.SI 版本更新 67%

Harnessing the Synergy between LLM Agents and Knowledge Graphs for Urban Socioeconomic Prediction

利用大语言模型智能体与知识图谱的协同作用进行城市社会经济预测

Zhilun Zhou, Jingyang Fan, Yu Liu, Fengli Xu, Depeng Jin, Yong Li

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出LLM智能体与知识图谱的协同框架,结合二者优势完成城市社会经济预测,经实验验证该协同设计可提升预测效果,为跨任务信息共享提供思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12029 2026-08-05 cs.SE 版本更新 67%

Enhancing LLM Performance Through Debate: An Empirical Study on Multi-Agent Debate for Coding Tasks

通过辩论提升大语言模型性能:针对编码任务的多智能体辩论实证研究

Yong Jin Chun, Qihong Chen, Jiawei Li, Iftekhar Ahmed

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本研究探究多智能体辩论(MAD)在软件工程四类编码任务上的有效性,适配NLP的MAD框架并提出两种变体,证实结构化辩论可提升LLM编码性能,凸显其协作协同效应。

Comments accepted to ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15671 2026-08-04 cs.RO 版本更新 67%

Long-Term Memory for VLA-based Agents in Open-World Task Execution

基于VLA的智能体长期记忆在开放世界任务执行中的应用

Xu Huang, Weixin Mao, Yinhao Li, Hua Chen, Jiabao Zhao

机构 * Nanjing University(南京大学) LimX Dynamics(LimX 动态)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出ChemBot框架,通过双层记忆和MCP服务器提升复杂化学实验中的任务执行效率与安全性。

Comments Added references

详情

展开后加载摘要…

URL PDF HTML 收藏