DistFlow: A Fully Distributed RL Framework for Scalable and Efficient LLM Post-Training
DistFlow: 一种用于可扩展高效LLM后训练的全分布式强化学习框架
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出DistFlow框架,通过解耦数据传输与控制调度、采用多控制器范式和基于DAG的任务调度器,实现近线性可扩展性并提升吞吐量达2.63倍。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
DistFlow: 一种用于可扩展高效LLM后训练的全分布式强化学习框架
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出DistFlow框架,通过解耦数据传输与控制调度、采用多控制器范式和基于DAG的任务调度器,实现近线性可扩展性并提升吞吐量达2.63倍。
从平面到层次:演化树状思维以实现细粒度Alpha挖掘
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出树状思维演化(TreEvo)方法,通过层次化分解思维扩展有效搜索空间,并设计结构化思维演化算子,在四个真实市场数据集上以最多200倍更少的评估次数获得与传统方法竞争性的Alpha,且平均比LLM驱动的演化算法高出14.31%。
PLanAR:面向机器人操作的规划语言基础智能推理
机构 * Purdue University(普渡大学) ; Istituto Italiano di Tecnologia(意大利理工研究院)
专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract)
AI总结 提出PLanAR框架,通过规划语言接口定义VLM推理空间,实现开放词汇的长时域机器人操作,并支持逐步验证与重规划。
Comments New version with updated framing, contributions, experiments, and figures
世界模型:架构、方法论、推理范式与应用的全面综述
机构 * School of Computer and Cyber Sciences, Augusta University(奥古斯塔大学计算机与网络科学学院) ; School of Computing, University of Georgia(佐治亚大学计算机学院) ; Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) ; Department of Radiology, Massachusetts General Hospital, Harvard Medical School(麻省总医院放射科,哈佛医学院) ; Department of Computer Science and Engineering, University of Texas at Arlington(德克萨斯大学阿灵顿分校计算机科学与工程系) ; Department of Graduate Psychology, James Madison University(詹姆斯麦迪逊大学研究生心理学系) ; Computer Science and Engineering, Lehigh University(莱斯大学计算机科学与工程系) ; School of Biomedical Engineering, The University of Sydney(悉尼大学生物医学工程学院) ; Tandon School of Engineering, New York University(纽约大学泰坦工程学院) ; Department of Radiation Oncology, City of Hope National Medical Center(城市希望国家医学中心放射肿瘤科) ; Department of Mayo Clinic Comprehensive Cancer Center, Mayo Clinics(梅奥诊所综合癌症中心,梅奥诊所) ; Savannah River Ecology Laboratory (SREL), University of Georgia(萨凡纳河生态实验室(SREL),佐治亚大学)
专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);分类 cs.LG
AI总结 本文提出一个多轴分类法,从架构、方法论、推理策略和应用领域四个维度系统综述世界模型,涵盖从早期认知科学基础到PlaNet、Dreamer系列、MuZero、Sora等里程碑系统,并指出未来方向。
RLVR 无需无效样本:面向 LLM 推理的群体优先级离策略优化
机构 * Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 针对强化学习中无效样本导致学习信号不足的问题,提出群体优先级离策略优化(POPO),通过优先级群体重放和解耦重要性采样,在不增加额外采样开销的情况下提升推理性能。
AblationBench:评估实证AI研究中消融实验的自动规划
机构 * Google Research(谷歌研究)
专题命中 规划推理 :planning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 提出AblationBench基准套件,包含作者消融和审稿人消融两个任务,用于评估语言模型在AI研究中规划消融实验的能力,实验表明当前最佳模型仅能识别45%的原始消融,低于人类水平。
Comments AI4Science Workshop, ICML 2026; Project page: https://ablation-bench.github.io/
基于轻结构化文本数据库和推理大语言模型的自然语言材料加工设计
机构 * State Key Laboratory of Advanced Materials for Intelligent Sensing, Key Laboratory of Organic Integrated Circuit, Ministry of Education & Tianjin Key Laboratory of Molecular Optoelectronic Sciences, Department of Chemistry, School of Science, Tianjin University(智能传感先进材料国家重点实验室、有机集成电路重点实验室、教育部、天津分子光电子科学重点实验室、化学系、天津大学) ; Language Intelligence Technology Co., Ltd.(语言智能技术有限公司) ; College of Intelligence and Computing, Tianjin University(智能与计算学院、天津大学) ; School of Materials and Chemical Engineering, Ningbo University of Technology(材料与化学工程学院、宁波工业大学)
专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 将材料合成规划重构为文本推理问题,通过轻结构化知识基底结合检索增强生成与经验增强推理,在氮化硼纳米片剥离中三轮迭代获得高质量协议。
TravelEval:评估基于LLM的旅行规划代理的综合基准框架
机构 * Zhejiang University(浙江大学) ; Hong Kong Polytechnic University(香港理工大学) ; Southeast University(东南大学) ; HKUST (GZ) & HKUST Guangzhou(香港科技大学(广州)& 香港科技大学(广州))
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 针对现有基准过度关注约束合规、缺乏真实性和多维评估的问题,提出TravelEval,通过六维评估框架、真实数据沙盒和模拟全局评估方法,全面评估LLM在旅行规划中的表现。
Comments 31pages, 8 figures, accepted by KDD 2026
一种机器到机器知识引导的LLM智能体用于泛化放射治疗计划
机构 * National Institutes of Health (NIH)(国家卫生研究院) ; Department of Physics, The University of Texas at Arlington(德克萨斯理工大学阿灵顿分校物理系) ; Department of Radiation Oncology and Molecular Radiation Sciences, Johns Hopkins University(约翰霍普金斯大学放射肿瘤学与分子放射科学系)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract)
AI总结 提出一种机器到机器知识引导的大语言模型框架,通过深度强化学习发现的治疗计划参数分布知识迁移至LLM智能体,实现无需人工干预的自主迭代规划,在多种病例中显著提升规划质量和泛化能力。
Comments 10 pages, 6 figures
ForesightKV: 通过学习长期贡献优化推理模型的KV缓存驱逐
机构 * Zhejiang University(浙江大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 提出ForesightKV框架,通过监督学习和强化学习预测KV对在长文本生成中的重要性,在仅用一半缓存预算下优于现有方法。
Comments ICML 2026
LLM演化模式生成器用于最优经典规划
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 提出首个通过LLM驱动的进化程序合成学习可容许启发式函数的方法,用于最优经典规划,结合饱和成本分区保证A*搜索的最优性。
CAREAgent: 具有结构化推理和工具集成的临床智能体用于医嘱生成
机构 * East China University of Science and Technology, Shanghai, China(东华大学上海科学技术学院) ; Zhongshan Hospital, Fudan University, Shanghai, China(复旦大学中山医院)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出CAREAgent,通过两阶段推理数据构建和监督微调与强化学习,生成细粒度临床医嘱,在ClinicalBench上F1提升5.05%。
MindZero:零标注的在线心智推理学习
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出MindZero框架,通过自监督强化学习训练多模态大语言模型,实现高效鲁棒的在线心智推理,无需显式心智状态标注。
Comments ICML 2026. Website: https://scai.cs.jhu.edu/MindZero
SPARC: 通过注意力智能体通信实现空间感知路径规划
机构 * Nanyang Technological University(南洋理工大学)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 提出关系增强多头注意力(RMHA)机制,通过嵌入曼哈顿距离到注意力权重计算,优先处理空间邻近机器人的消息,在40x40网格上从8机器人零样本泛化到128机器人时,在30%障碍密度下实现约75%成功率,超越基线25个百分点以上。
Comments The manuscript is being withdrawn at the request of the first author for the purpose of revising content and re-uploading a revised version with updated data/figures/text . The revised manuscript will be resubmitted to arXiv promptly with the same author list and research theme
面向双臂操作的语义-几何任务表示:从人类示范到机器人动作规划
机构 * Interactive Robot Perception & Learning (PEARL) Lab, Computer Science Dept., TU Darmstadt, Germany(图腾大学达姆施塔特分校计算机科学系交互机器人感知与学习实验室) ; Hessian.AI, Darmstadt, Germany(黑森人工智能公司) ; Robotics Institute Germany (RIG)(德国机器人研究所) ; Interactive AI Algorithms & Cognitive Models for Human-AI Interaction (IKIDA), Computer Science Dept., TU Darmstadt, Germany(人机交互的交互人工智能算法与认知模型(IKIDA),图腾大学达姆施塔特分校计算机科学系) ; Center for Cognitive Science, TU Darmstadt, Germany(图腾大学达姆施塔特分校认知科学中心)
专题命中 规划推理 :planning(title);reasoning(abstract);分类 cs.LG
AI总结 提出一种语义-几何图任务表示,通过消息传递神经网络编码器和Transformer解码器联合编码对象身份、语义关系和运动历史,实现从人类示范中学习结构化任务表示,并支持跨实体迁移和双臂操作规划。
Comments 9 pages, 7 figures, preprint
DAG-Plan:生成有向无环依赖图用于双臂协作规划
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences (CASIA)(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院(CASIA)) ; School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,北京大学计算机科学学院) ; Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) ; OpenGVLab, Shanghai AI Laboratory(上海人工智能实验室,OpenGVLab)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 提出DAG-Plan框架,首次使用有向无环图作为双臂协调的核心表示,通过一次LLM解析生成结构化DAG,实现自适应并行执行,在双臂厨房基准测试中成功率提升48%,执行效率提升84.1%。
Comments ICRA 2026
基于视觉表示引导的视频-大语言模型推理的无训练组合视频检索
机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) ; State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
专题命中 规划推理 :reasoning(title,abstract)
AI总结 提出无训练框架,先利用冻结DINOv3模型筛选视觉相关候选,再通过大视觉语言模型评估指令匹配,最后推理精化,在CVPR 2026挑战赛中取得48.78 Recall@1和51.48 Recall@5。
Comments CVPR 2026, VidLLMs workshop
流形划分诱导的时序光学推理与决策框架用于光子计算
专题命中 规划推理 :reasoning(title,abstract)
AI总结 提出时序光学推理与决策(SORD)框架,通过几何引导的数据划分将全局任务分解为粗到细的步骤,使单层衍射光学神经网络实现100类光纤散斑分类,准确率94%,能效23.3 TOPS/W。
Comments 25 pages, 5 figures, submitted to a journal
通过交错运动规划使您的VLA更鲁棒而无需更多数据
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 规划推理 :planning(title,abstract)
AI总结 提出MPVI框架,将基于模型的运动规划与视觉-语言-动作模型交错结合,通过VLM完成检查和本体感受触发实现可靠切换,无需额外训练即可提升长时域移动操作任务的鲁棒性,在BEHAVIOR-1K基准上任务进度提升113%。
基于扩散建模与多智能体强化学习引导的生成式多机器人运动规划
机构 * School of Manufacturing Systems and Networks, Arizona State University, Mesa, AZ(1制造系统与网络学院,亚利桑那州立大学,梅萨,AZ) ; Michael W. Hall School of Mechanical Engineering, Mississippi State University, Starkville, MS(2迈克尔·W·霍尔机械工程学院,密西西比州立大学,斯塔克维尔,MS)
专题命中 规划推理 :planning(title,abstract)
AI总结 提出一种结合扩散模型与多智能体强化学习的框架,通过值函数引导反向扩散过程实现交互感知的轨迹生成,降低多机器人冲突率。
Comments 11 pages, 6 figures, 1 table. This paper has been accepted for publication in the proceedings of ASME IDETC-CIE 2026
结构使语言模型能够有效自我定位错误
机构 * Meta AI ; Columbia University(哥伦比亚大学) ; Meta Superintelligence Labs(Meta超智能实验室) ; Tel Aviv University(特拉维夫大学)
专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);self-correction(abstract);分类 cs.AI
AI总结 本文提出结构化推理方法,通过将推理分解为离散语义步骤,使语言模型能更可靠地定位错误,并基于此设计了迭代纠正采样框架Thought-ICS,实现20-40%的自我纠正提升。
LayerRoute: 基于LoRA微调的输入条件自适应层跳过方法用于智能语言模型
机构 * Accenture(埃森哲)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出LayerRoute,通过为每个Transformer块添加轻量级路由器和LoRA适配器,根据输入类型(工具调用或规划推理)自适应跳过层,在仅增加0.22%可训练参数下实现12.91%的跳过差异并提升质量。
Comments 10 pages, 3 figures, 4 tables
交通系统管理与运营中的大语言模型:从文本推理到多模态决策支持
机构 * Bourns College of Engineering, Center for Environmental Research and Technology, University of California at Riverside, CA, USA(伯恩斯工程学院,环境研究与技术中心,加州大学河滨分校,美国,加利福尼亚州河滨)
专题命中 规划推理 :reasoning(title);分类 cs.AI
AI总结 本文综述了大语言模型(LLM)和多模态大语言模型(MM-LLM)在交通系统管理与运营(TSMO)中的应用,涵盖运营与服务、移动性与车队服务、数据建模与决策支持三大领域,并指出了数据异构性、实时推理、可解释性等挑战及未来方向。
Comments Preprint version
CAPF:基于信用衰减特权反馈引导搜索智能体轨迹生成
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 规划推理 :reasoning(abstract);verifier(abstract);分类 cs.AI
AI总结 针对结果奖励稀疏导致搜索智能体学习困难的问题,提出训练时利用验证器侧信息(CAPF)将零奖励轨迹修复为正奖励轨迹,并衰减相关信用以适配无特权反馈的部署场景,在七个开放域问答基准上将Qwen3-4B的平均精确匹配分数从44.7%提升至48.5%。
用于可靠的工具增强型大语言模型系统的自愈代理编排器
机构 * Independent Researcher(独立研究者) ; Senior Member, IEEE(IEEE高级成员)
专题命中 规划推理 :planning(abstract);verifier(abstract);分类 cs.AI
AI总结 提出一种自愈代理编排器,通过将可靠性视为有界运行时控制问题,映射故障信号、选择恢复动作并验证轨迹,在100任务故障注入基准上达到98.8%任务成功率,优于重试和完全重规划基线。
ExpWeaver: LLM智能体通过潜在RAG从经验中学习
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL
AI总结 提出ExpWeaver框架,利用潜在检索增强生成(无独立RAG模块)使LLM智能体从经验中学习,通过隐藏状态编码经验、潜在空间检索和交叉注意力聚合,在13个任务中12个达到最优,token效率高且跨域泛化强。
APEX-SQL: 通过智能体探索与数据对话实现Text-to-SQL
机构 * The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学) ; LIGHTSPEED
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 提出APEX-SQL框架,通过假设验证循环、逻辑规划、双路径剪枝、并行数据分析和确定性探索机制,解决静态模式表示在复杂企业数据库中的语义模糊和扩展性问题,在BIRD和Spider 2.0-Snow上取得领先性能。
Comments KDD 2026
MT-EditFlow:基于流匹配的多轮图像编辑强化学习
机构 * Apple(苹果公司) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Lambda, Inc(Lambda公司)
专题命中 规划推理 :reasoning(abstract);planning(abstract)
AI总结 提出MT-EditFlow框架,通过流匹配强化学习优化多轮图像编辑的奖励信号,解决单轮编辑模型在多轮交互中的失败和误差传播问题,显著提升多轮编辑性能。
面向策略性多智能体系统的层框架:从共识到纳什均衡
专题命中 规划推理 :reasoning(abstract);planning(abstract)
AI总结 本文提出一个统一的范畴框架,通过引入博弈层概念,将事件演算、SCEL类集成形成和博弈论奖励结构整合到时空历史的格罗滕迪克拓扑中,并证明纳什均衡对应于派生最佳响应对应层的全局截面,而同调障碍分类策略一致性的失败。
Baton: 用于联合视频-音频生成的显式语义蓝图
机构 * Fudan University(复旦大学) ; Tencent Hunyuan(腾讯幻元)
专题命中 规划推理 :reasoning(abstract);planning(abstract)
AI总结 提出Baton框架,通过VA-Planner生成语义对齐的模态感知规划令牌作为蓝图,注入扩散骨干以协调视频和音频去噪,解决现有方法因缺乏共享长期规划导致的跨模态对齐脆弱问题。