arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11047 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11047 篇

2607.16591 2026-07-21 cs.LG cs.AI 新提交 73%

Learning from World Feedback: Why Model Uncertainty Fails as a Risk Signal in Model-Based RL

从世界反馈中学习:为何模型不确定性在基于模型的强化学习中无法作为风险信号

Zhaohui Wang

专题命中 规划推理 :planning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨 RLxF 中学习信号应源于世界反馈,在安全模型控制中实例化并提炼原则。通过实验表明基于动力学的不确定性惩罚会增加碰撞率,用世界反馈信号可降低碰撞率,提取原则并指出其适用于多种相关方法。

Comments Accepted at the ICML 2026 Workshop on Reinforcement Learning from X Feedback (RLxF). 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13389 2026-07-16 cs.LG cs.CL 新提交 73%

Where Should RL Post-Training Compute Go? Model Size, Search, Learning, and Feedback

强化学习训练后计算资源应投向何处?模型大小、搜索、学习与反馈

Patrick Wilhelm, Odej Kao

机构 * Technische Universität Berlin(柏林工业大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.LG

AI总结 研究强化学习训练后计算资源分配问题,引入浮点运算核算框架,通过LoRA适配的Qwen2.5策略发现条件分配前沿,揭示模型选择与训练分配关联及奖励系统对核算影响,提出RACE协议,建议相关论文报告总浮点运算及计算分配方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16727 2026-07-15 cs.AI cs.LG 版本更新 73%

Mobility-Aware Cache Framework for Scalable LLM-Based Human Mobility Simulation

面向可扩展性的LLM基人类移动模拟移动感知缓存框架

Hua Yan, Heng Tan, Yingxue Zhang, Yu Yang

机构 * Lehigh University(莱维大学) State University of New York at Binghamton(纽约州立大学布法罗分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 MobCache通过移动感知缓存框架提升大规模LLM基人类移动模拟的效率和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10795 2026-07-14 cs.AI cs.CL 新提交 73%

STEC: Evidence Compression for Deep Search in Open-domain Multi-Hop QA

STEC:开放域多跳问答中深度搜索的证据压缩

Xinkang Li, Rong Jiang, Xin Song, Ye Wang, Yue Han, Changjian Li

机构 * National University of Defense Technology(国防科技大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 规划推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 研究开放域多跳问答中最终答案选择难题,提出STEC证据压缩框架从候选集选答案。通过答案级证据压缩和证据引导的答案验证机制,将选择从原始轨迹比较转为候选级证据比较,实验显示其性能最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11324 2026-07-14 cs.RO cs.AI cs.LG 版本更新 73%

Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models

Embodied-R1.5:通过具身基础模型演化物理智能

Yifu Yuan, Yaoting Huang, Xianze Yao, Yutong Li, Shuoheng Zhang, Linqi Han, Pengyi Li, Jiangeng Sun, Wenting Jia, Zhao Zhang, Yuhao Liu, Ruihao Liao, Yucheng Hu, Qiyu Wu, Yuxiao Li, Zibin Dong, Fei Ni, Yan Zheng, Shuyang Gu, Yi Ma, Hongyao Tang, Han Hu, Jianye Hao

机构 * Tianjin University(天津大学) Tencent Hunyuan(腾讯混元)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 提出统一具身基础模型Embodied-R1.5,通过自动化数据管道和多任务平衡强化学习,在8B参数下实现24项基准中16项最优,并支持微调为VLA模型。

Comments Embodied R1.5 technical report. Project page: https://embodied-r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06452 2026-07-08 cs.CL cs.AI 新提交 73%

From Voting to Agent Collaboration: Answer-Type-Aware LLM Pipelines for BioASQ 14b

从投票到智能体协作:用于BioASQ 14b的答案类型感知大语言模型管道

Taeyun Roh, Eunha Lee, Wonjune Jang, Sohyun Chung, Junha Jung, Jaewoo Kang

机构 * Korea University(韩国大学) Myongji University(明知大学) AIGEN Sciences(爱根科学公司)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对BioASQ 14b任务B提出特定问题类型的大语言模型框架,依据不同问题类型选择不同推理程序,如为是/否问题用片段洗牌等,经初步实验和官方评估,框架性能具竞争力,在第4批次事实性子任务中夺冠,证明相关方法结合的有效性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07468 2026-07-07 cs.LG cs.CL cs.MA 版本更新 73%

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

通过在线自我博弈强化学习追踪移动目标以实现更安全的语言模型

Mickel Liu, Liwei Jiang, Yancheng Liang, Simon Shaolei Du, Yejin Choi, Tim Althoff, Natasha Jaques

专题命中 规划推理 :chain-of-thought(abstract);planning(abstract);分类 cs.CL、cs.LG

AI总结 研究传统大语言模型安全对齐问题,引入Self-RedTeam算法,通过在线自我博弈多智能体强化学习持续共同进化攻防策略,有理论安全保障,实证效果好,推动从被动修补到主动协同进化转变。

Comments ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19775 2026-07-03 cs.AI cs.CL cs.ET cs.MA cs.RO 版本更新 73%

From Actions to Understanding: Conformal Interpretability of Temporal Concepts in LLM Agents

从行为到理解:LLM代理中时间概念的符合可解释性

Trilok Padhi, Ramneet Kaur, Krishiv Agarwal, Adam D. Cobb, Daniel Elenius, Manoj Acharya, Colin Samplawski, Alexander M. Berenbeim, Nathaniel D. Bastian, Susmit Jha, Ugur Kursuncu, Anirban Roy

机构 * Georgia State University(佐治亚州立大学) Computer Science Lab, SRI(SRI计算机科学实验室) Army Cyber Institute(陆军网络学院) United States Military Academy(美国军事学院) University of Florida(佛罗里达大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过符合视角解释LLM代理时间概念演变的框架,结合逐步奖励建模与符合预测,识别时间概念的潜在方向,实验表明这些概念可线性分离,为LLM代理提供可靠故障检测和干预方法。

Comments Accepted at the Mechanistic Interpretability Workshop, 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06288 2026-07-03 cs.AI cs.LG 版本更新 73%

BuilderBench: The Building Blocks of Intelligent Agents

BuilderBench:智能体的构建模块

Raj Ghugare, Roger Creus Castanyer, Catherine Ji, Kathryn Wantlin, Jin Schofield, Karthik Narasimhan, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学) Mila – Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 提出BuilderBench基准,通过开放式探索训练智能体构建结构,实验表明现有前沿语言模型和强化学习算法无法解决任何非平凡任务。

Comments Blogpost: https://rajghugare19.github.io/builderbench and Code: https://github.com/rajghugare19/builderbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05257 2026-06-30 cs.CL cs.AI 73%

Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions

通过增量多轮交互评估LLM代理的记忆能力

Yuanzhe Hu, Yu Wang, Julian McAuley

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MemoryAgentBench,通过多轮交互模拟记忆代理的信息积累过程,评估准确检索、测试时学习、长程理解与选择性遗忘四项核心能力。

Comments Y. Hu and Y. Wang contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20334 2026-06-30 cs.RO cs.AI cs.LG 73%

Demonstration-Free Robotic Control via LLM Agents

无需演示的机器人控制 via LLM 代理

Brian Y. Tsui, Alan Y. Fang, Tiffany J. Hwu

机构 * independent researchers(独立研究人员)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FAEA框架,利用通用大语言模型实现无需演示的机器人操控,通过迭代推理生成操控策略,在多个基准测试中取得高成功率,展示了通用代理在任务规划中的有效性。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28182 2026-06-29 cs.LG cs.AI cs.CV cs.RO 新提交 73%

LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior

LLawCo: 学习合作法则以建模具身多智能体行为

Qinhong Zhou, Chuang Gan, Anoop Cherian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 提出LLawCo框架,通过反思失败提取行为模式并推导高层合作法则,结合监督微调融入推理,提升具身多智能体在分散部分可观测环境中的合作效率与任务成功率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20657 2026-06-26 cs.AI cs.LG 新提交 73%

A-Evolve-Training: Autonomous Post-Training of a 30B Model

A-Evolve-Training: 30B模型的自主后训练

Zhan Shi, Bing He, Yisi Sang, Hanqing Lu, Benoit Dumoulin

机构 * A-EVO-Lab, Amazon(亚马逊A-EVO实验室)

专题命中 规划推理 :reasoning(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出一个无需人工干预的自主后训练系统,对30B参数模型进行多轮训练,在NVIDIA排行榜上接近人类最佳成绩,并展示了系统能自主发现并修正指标误导问题。

Comments 12 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25606 2026-06-25 cs.CV cs.AI cs.LG 新提交 73%

Expresso-AI: Explainable Video-Based Deep Learning Models for Depression Diagnosis

Expresso-AI: 基于可解释视频的深度学习模型用于抑郁症诊断

Felipe Moreno, Sharifa Alghowinem, Hae Won Park, Cynthia Breazeal

机构 * Media Lab MIT Cambridge, USA(媒体实验室 MIT 摄影实验室 美国剑桥)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 提出一种可解释的深度学习框架,通过微调动作识别预训练的DCNN,分析面部视频中的时空特征,生成显著性图以解释模型决策,同时提升抑郁症严重程度预测性能。

Comments 8 pages. Accepted at the 2023 11th International Conference on Affective Computing and Intelligent Interaction (ACII). Code: https://github.com/felmoreno1726/Expresso-AI

Journal ref 2023 11th International Conference on Affective Computing and Intelligent Interaction (ACII), 2023, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21891 2026-06-23 cs.AI cs.CL 新提交 73%

Learning the ARTS of Search for Automated Discovery

学习搜索的艺术以实现自动发现

Gurusha Juneja, Arnav Kumar Jain, Deepak Nathani, William Yang Wang, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Université de Montréal and Mila- Quebec AI Institute(蒙特利尔大学和Mila-魁北克人工智能研究所)

专题命中 规划推理 :reasoning(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出ARTS方法,利用推理语言模型在假设与实验空间中迭代搜索,通过测试时训练解决上下文长度问题,在22个任务上优于现有算法,相对提升超15.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19812 2026-06-19 cs.AI cs.LG 新提交 73%

Human-on-the-Loop Orchestration for AI-Assisted Legal Discovery

AI辅助法律发现中的人机协同编排

Anushree Sinha, Srivaths Ranganathan, Abhishek Dharmaratnakar, Debanshu Das

机构 * Google LLC(谷歌公司) Mountain View, CA, USA(美国加利福尼亚州山景城)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 针对AI代理在电子取证中因多步推理错误导致的法律风险,提出一种四层验证架构,通过人机协同阈值减少特权豁免风险达61%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19782 2026-06-19 cs.AI cs.CL 新提交 73%

AgentFinVQA: A Deployable Multi-Agent Pipeline for Auditable Financial Chart QA

AgentFinVQA:一种可部署的多智能体管道用于可审计的金融图表问答

Aravind Narayanan, Shaina Raza

机构 * Vector Institute(向量研究所)

专题命中 规划推理 :planning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出多智能体管道AgentFinVQA,通过分解查询步骤并记录可追溯的模型评估包,在金融图表问答中实现可审计性与本地部署,在FinMME上提升准确率7.68个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19354 2026-06-19 cs.CL cs.LG 新提交 73%

Granularity-Regulated Adaptive Computational Efficiency for Optimal Verification in Test-Time Scaling

粒度调控的自适应计算效率:测试时扩展中的最优验证

Ardit Krasniqi, Luan Vejsiu, Elira Dervishi

机构 * European University of Tirana(欧洲地拉那大学)

专题命中 规划推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.LG

AI总结 提出GRACE理论框架,将验证粒度建模为问题难度、验证器准确率和计算预算的函数,证明存在相变:细粒度验证在计算预算大或问题难时占优,粗粒度验证在低预算简单问题时更优,自适应策略可达到计算-性能帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17107 2026-06-17 cs.LG cs.AI 新提交 73%

Models Take Notes at Prefill: KV Cache Can Be Editable and Composable

模型在预填充阶段记笔记:KV缓存可编辑且可组合

Bojie Li

机构 * Pine AI

专题命中 规划推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 研究发现KV缓存像笔记一样存储结论,支持编辑和组合:编辑单个字段可修正决策(8B模型准确率1.00,仅需~1%计算),组合预编译技能可无缝插入任意上下文(logit余弦相似度0.90-0.999),延迟降低至O(L)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16774 2026-06-16 cs.AI cs.CL 新提交 73%

OpenClaw-Skill: Collective Skill Tree Search for Agentic Large Language Models

OpenClaw-Skill:面向智能体大语言模型的集体技能树搜索

Tianyi Lin, Chuanyu Sun, Jingyi Zhang, Changxu Wei, Huanjin Yao, Shunyu Liu, Xikun Zhang, Liu Liu, Jiaxing Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) Royal Melbourne Institute of Technology(皇家墨尔本理工大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 提出集体技能树搜索(CSTS)框架,通过集体智能生成和评估技能节点,构建结构化、多样且可泛化的技能树,并引入集体技能强化学习,提升大语言模型在工具使用、多步推理和动态环境交互中的智能体能力。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15079 2026-06-16 cs.CL cs.AI 新提交 73%

Ling and Ring 2.6 Technical Report: Efficient and Instant Agentic Intelligence at Trillion-Parameter Scale

Ling 和 Ring 2.6 技术报告:高效且即时的万亿参数规模智能体智能

Ang Li, Ben Liu, Bin Han, Bin Hu, Bin Jing, Binbin Hu, Bing Li, Cai Chen, Caizhi Tang, Changxin Tian, Chao Huang, Chao Zhang, Chen Liang, Chen Qian, Chengfu Tang, Chengyao Wen, Chilin Fu, Chunwei Wu, Cong Zhang, Cunyin Peng, Daixin Wang, Dalong Zhang, Deng Zhao, Dingnan Jin, Dingyuan Zhu, Donghao Zhang, Fan Yuan, Fangzheng Zhao, Fanzhuang Meng, Feifan Wu, Feng Xu, Fengbin Fang, Gangshan Wang, Guodong Yang, Hailin Zhao, Haitao Wang, Haitao Zhang, Hanxiao Zhang, Hanzi Wang, Hao Dai, Hao Liu, Hao Qian, Hao Wu, Haoxiong Liu, Haoyu Xu, Heng Zhang, Hong Liu, Hongliang Zhang, Hongrui Liu, Hongxun Li, Hongzhi Ruan, Huaidong Xiong, Huihuang Zheng, Huikang Tang, Jia Guo, Jia Li, Jia Liu, Jiameng Wang, Jiaming Liu, Jiannan Shi, Jianping Wei, Jiaolong Yang, Jiapeng Wang, Jie Gao, Jie Wang, Jiewei Wu, Jin Yang, Jinjin Li, Jinjing Huang, Jinquan Sun, Jinyao Chen, Juanhui Tu, Jun Liu, Jun Mei, Jun Xu, Jun Zhou, Junjie Ou, Junnan Sipan, Junpeng Fang, Kaihong Zhang, Kaiqin Hu, Ke Shi, Kuan Xu, Kun Tang, Kunlong Chen, Lanyin Mei, Lei Chen, Lei Liang, Lei Xu, Li Tang, Liang Jiang, Liangcheng Fu, Lihui Zhang, Linfeng Shi, Lintao Ma, Liyuan Liu, Longfei Li, Longfei Zheng, Lu Liu, Lu Yu, Man Li, Meiqi Zhu, Meng Li, Mengjie Gao, Mengshu Sun, Mingming Yin, Mingyang Zhang, Mingyuan Fan, Nuo Xu, Pan Tang, Peijie Jiang, Peilong Zhao, Peng Lin, Pingping Liu, Qi Zuo, Qian Zhao, Qiang Cheng, Qianggang Cao, Qiaoben Bao, Qing Cui, Qingyuan Yang, Qitao Shi, Qiyin Huang, Qizheng Zhou, Quan Wan, Runyuan Zhao, Shaomian Zheng, Shaowei Wei, Shengnan Zhang, Shuaicheng Li, Shujie Li, Shuo Zhang, Sikang Bian, Tianchu Yao, Tiange Xu, Tianshu Wang, Ting Guo, Tinghao Wang, Tingwei Huang, Tong Zhao, Tongkai Yang, Wang Hong, Wanli Gu, Wei Lu, Weichang Wu, Weiguang Han, Weiquan Li, Wenbo Shen, Wenjing Fang, Wenzhi Tang, Xiang Shu, Xiao Shi, Xiaodong Yan, Xiaolu Zhang, Xiaopei Wan, Xiaqing Sun, Xin Zhao, Xingyu Lu, Xinxing Yang, Xinyao Tang, Xinyu Kong, Xinyu Liu, Xiong Xu, Xuan Sun, Xudong Han, Xudong Wang, Xujie Shen, Yalin Zhang, Yangyang Hou, Yankun Ren, Yao Zhao, Ye Chen, Yeyang Chen, Yibo Cao, Yifan Zuo, Yijie Chen, Ying Li, Yingjie Song, Yingxue Li, Yiqi Wang, Yixuan Sun, Yizhu Xiao, Yongfei Xu, Yu Liu, Yuchen Fang, Yue Gao, Yue Yu, Yue Zhang, Yuqi Zhang, Yuxiao He, Yuxiao Lu, Yuxin Tian, Yuxuan Li, Yuzhuo Fu, Zhankai Xu, Zhaoxin Huan, Zhenduo Zhang, Zhengke Gui, Zhengyu Huang, Zhenjun Ma, Zhenxuan Pan, Zheping Qu, Zhibo Zhu, Zhidong Fan, Zhigang Huangfu, Zhihao Wang, Zhiqiang Zhang, Zhizhen Liu, Zhuyan Zhou, Zibin Lin, Zihang Zeng, Zihao Wang, Zilong Wang, Ziqi Liu, Zitao Xuan, Zixuan Cheng, Zujie Wen, Zuoli Tang

机构 * Ling Team(Ling团队) Inclusion AI

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出Ling-2.6和Ring-2.6模型系列,通过架构迁移预训练、混合线性注意力设计及KPop强化学习框架,实现低延迟、强推理与高效部署,开源所有检查点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01101 2026-06-16 cs.AI cs.CL cs.SD eess.AS 版本更新 73%

Virtual Speech Therapist: A Clinician-in-the-Loop AI Speech Therapy Agent for Personalized and Supervised Therapy

虚拟言语治疗师:一种临床医生参与的AI言语治疗代理,用于个性化和监督式治疗

Shakeel Sheikh, Patrick Marmaroli, MD Sahidullah, Slim Ouni, Fabrice Hirsch, Goncalo Leal, Bjorn W Schuller

机构 * The Kashmir Hub for Artficial Intelligence(喀布尔人工智能中心) Microsoft / Vocametrix(微软 / Vocametrix) IAI, TCG CREST(IAI,TCG CREST) Université de Lorraine, CNRS, Inria, LORIA(洛林大学,CNRS,Inria,LORIA) Laboratoire Praxiling, UMR5267, CNRS et Université Paul-Valéry Montpellier 3(Praxiling实验室,UMR5267,CNRS及蒙彼利埃Paul-Valéry大学) Speechcare iStutter, Portuguese Catholic University(Speechcare iStutter,葡萄牙天主教大学) CHI – Chair of Health Informatics, TUM University Hospital(健康信息学系,TUM大学医院) GLAM – Group on Language, Audio, & Music, Imperial College London(语言、音频与音乐小组,伦敦帝国理工学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 提出虚拟言语治疗师(VST)平台,集成深度学习口吃分类与多智能体大语言模型推理,自动生成个性化治疗方案,并通过临床医生反馈优化,实验证明其高质量推荐。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10684 2026-06-10 cs.LG cs.AI 新提交 73%

Divide and Cooperate: Role-Decomposed Multi-Agent LLM Training with Cross-Agent Learning Signals

分工与合作:基于跨智能体学习信号的角色分解多智能体LLM训练

Jaewan Park, Solbee Cho, Jay-Yoon Lee

机构 * Seoul National University(首尔大学)

专题命中 规划推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出DAC框架,将多步推理分解为搜索和生成两个子任务,分别由专用智能体处理,并通过跨智能体学习信号解决信用分配问题,在QA基准上超越全参数微调的单体模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16898 2026-06-10 cs.RO cs.AI cs.CV cs.LG 73%

MALLVI: A Multi-Agent Framework for Integrated Generalized Robotics Manipulation

MALLVI:一种多智能体框架用于集成通用机器人操作

Mehrshad Taji, Arad Mahdinezhad Kashani, Iman Ahmadi, AmirHossein Jadidi, Saina Kashani, Babak Khalaj

机构 * Department of Electrical Engineering, Sharif University of Technology(电气工程系,谢里夫大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 MALLVI通过多智能体协作实现闭环反馈驱动的机器人操作,提升泛化能力和零样本任务成功率。

Comments Some fundemental change in text and codebase

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01637 2026-06-09 cs.CL cs.AI 版本更新 73%

Easier to Mislead Than to Correct: Harmful and Beneficial Revision in LLM Conformity

误导比纠正更容易:LLM 从众中的有害与有益修正

Jiaming Qu, Lucheng Fu, Yibo Hu

机构 * Amazon(亚马逊) Georgia Institute of Technology(佐治亚理工学院) Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 通过控制实验,研究大语言模型在多智能体系统中面对同伴答案时的从众行为,发现同伴一致意见更容易误导原本正确的模型,而权威标签使模型更倾向于选择被认可的答案,且通用推理干预无法可靠地减少有害修正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04632 2026-06-04 cs.LG cs.CL 73%

VentAgent: When LLMs Learn to Breathe -- Multi-Objective Arbitration for ARDS Ventilation

VentAgent:当大语言模型学会呼吸——ARDS通气的多目标仲裁

Teqi Hao, Yuxuan Fu, Xiaoyu Tan, Shaojie Shi, Bohao Lv, Yinghui Xu, Xihe Qiu

机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子与电气工程学院) Tencent Youtu Lab(腾讯优图实验室) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.LG

AI总结 提出VentAgent分层框架,利用大语言模型作为透明仲裁者,通过感知-规划-编排三阶段将机械通气控制转化为动态多目标仲裁过程,在生理模拟器上优于强化学习和经典控制基线,并提供可解释的推理链。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29861 2026-06-04 cs.CL cs.AI 73%

Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation

迈向可验证的多模态深度研究:用于交错报告生成的多智能体框架

Chenghao Zhang, Guanting Dong, Yufan Liu, Tong Zhao, Xiaoxi Li, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 规划推理 :planning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出多智能体框架Ptah,通过规划、研究和写作阶段生成交错文本与视觉证据的多模态报告,并引入验证器确保事实准确性和跨模态一致性。

Comments In progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04944 2026-06-04 cs.CL cs.AI 73%

Inclusion-of-Thoughts: Mitigating Preference Instability via Purifying the Decision Space

包含思维:通过净化决策空间缓解偏好不稳定性

Mohammad Reza Ghasemi Madani, Soyeon Caren Han, Shuo Yang, Jey Han Lau

机构 * School of Computing and Information Systems, The University of Melbourne(计算与信息系统学院,墨尔本大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出包含思维(IoT)策略,通过逐步自过滤干扰选项来重构多选题,从而稳定模型偏好并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03304 2026-06-03 cs.CL cs.LG 73%

From Script to Semantics: Prompting Strategies for African NLI

从脚本到语义:非洲自然语言推理的提示策略

Anuj Tiwari, Terry Oko-odion, Hannah Nwokocha

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本研究系统评估了五种提示策略在斯瓦希里语、约鲁巴语和豪萨语的自然语言推理任务上的表现,发现对比提示策略最可靠且能显著提升模型性能。

Comments Accepted at the RAIL Workshop, LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02951 2026-06-03 cs.RO cs.AI cs.CL cs.CV cs.HC 73%

SCOPE: Real-Time Natural Language Camera Agent at the Edge

SCOPE:边缘实时自然语言相机代理

Nikolaj Hindsbo, Sina Ehsani, Pragyana Mishra

机构 * Armada AI

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 提出SCOPE模块化代理,用于自然语言控制的PTZ相机,在边缘部署实现实时感知、规划与控制,并通过仿真和物理实验评估延迟、准确性和错误模式。

Comments 9 pages, 4 figures, 6 tables. Accepted at HRI '26 (21st ACM/IEEE International Conference on Human-Robot Interaction), Edinburgh, Scotland, March 16--19, 2026. Code: https://github.com/HindsboNikolaj/SCOPE

Journal ref Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (HRI '26), ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏