Strategy-Aware Parameter-Efficient Adaptation for LLM-based Auto-Bidding
基于大语言模型的自动出价的策略感知参数高效适配
专题命中 逻辑推理 :reasoning(abstract)
AI总结 研究广告自动出价问题,提出SAGE框架,通过位置增强、文本对齐和约束门控LoRA三个组件,实现参数高效多模态对齐,在大规模基准实验中性能卓越,调整参数少,消融研究验证各组件贡献。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
基于大语言模型的自动出价的策略感知参数高效适配
专题命中 逻辑推理 :reasoning(abstract)
AI总结 研究广告自动出价问题,提出SAGE框架,通过位置增强、文本对齐和约束门控LoRA三个组件,实现参数高效多模态对齐,在大规模基准实验中性能卓越,调整参数少,消融研究验证各组件贡献。
并行与分布式推理语言模型的性能基础
机构 * ETH Zurich(苏黎世联邦理工学院)
专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);self-correction(abstract)
AI总结 该研究针对RL-for-LLM范式,分析主流后训练算法框架,构建RLM并行策略分类体系,提炼实用指南并概述开放方向,以推动开发高性能可扩展的高性价比RLM。
利用视觉语言模型推理来约束任务和运动规划
机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系) ; Department of Computer Science, Rice University(莱斯大学计算机科学系) ; Ken Kennedy Institute, Rice University(莱斯大学肯尼迪研究所)
专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract)
AI总结 本文提出VIZ-COAST方法,利用大预训练视觉语言模型的空间推理能力,提前识别向下细化中的问题,减少规划时间并消除失败。
Comments 9 pages, 7 figures, 1 table. Submitted to AAAI 2027
DeepPlanner:通过优势塑造提升深度研究智能体的规划能力
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Amazon(亚马逊) ; University of California, San Diego(加州大学圣地亚哥分校)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对现有深度研究智能体规划阶段优化不足的问题,提出端到端 RL 框架 DeepPlanner,通过塑造 token 级优势与选择性提升样本级优势,在7个基准上以更低训练预算实现最优规划效果。
Comments Accepted by ACL 2026
Behavior2Trip:基于用户行为轨迹的个性化旅行规划
机构 * Meituan Inc.(美团公司) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; Beijing Institute of Technology(北京理工大学) ; University of Edinburgh(爱丁堡大学)
专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究提出行为感知旅行规划新任务,构建Behavior2Trip基准,提出B2T-Agent智能体,实验显示其在旅行规划任务上表现优于基线,凸显任务挑战性与模型泛化性。
Comments Accepted by EMNLP 2026 Findings
STEP:基于多模态大语言模型的状态感知任务估计与规划,用于人机协作
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Honda Research Institute(本田研究所)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 该研究针对多模态大语言模型用于人机协作任务规划时的状态理解缺失问题,提出STEP方法,在机器人装配模拟任务中使动作可执行性提升32.8%、最终状态误差降低14.8%。
Comments Published in IEEE International Conference on Robot and Human Interactive Communication (RO-MAN), 2026, 8 pages, 4 figuers, 5 tables
可指令智能体的规划与控制解耦
机构 * UC Berkeley(加州大学伯克利分校) ; UBC(不列颠哥伦比亚大学) ; Google DeepMind(谷歌DeepMind)
专题命中 规划推理 :planning(title);分类 cs.CL、cs.AI
AI总结 本研究提出Instruct-to-Act系统,将VLM规划器与世界模型控制器解耦,在七个具身环境中验证其性能优于仅控制器、直接VLM动作生成等基线,可替换VLM规划器且保持快速控制。
Comments Published as a conference paper at COLM 2026. Project page: this https URL (https://zinengtang.github.io/instruct-to-act/)
学习搜索的艺术以实现自动发现
机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) ; Université de Montréal and Mila- Quebec AI Institute(蒙特利尔大学和Mila-魁北克人工智能研究所)
专题命中 规划推理 :reasoning(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出ARTS方法,利用推理语言模型在假设与实验空间中迭代搜索,通过测试时训练解决上下文长度问题,在22个任务上优于现有算法,相对提升超15.3%。
AgentFold:用于蛋白质折叠模型设计的闭环智能体搜索
机构 * Hunan University(湖南大学) ; Nanjing University(南京大学) ; The Chinese University of Hong Kong(香港中文大学) ; Zhejiang University(浙江大学) ; Yale University(耶鲁大学) ; Wuhan University of Science and Technology(武汉科技大学) ; Southeast University(东南大学) ; Stanford University(斯坦福大学)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 AgentFold是将蛋白质折叠模型开发转化为闭环搜索的多智能体框架,以ESMFold为起点,通过MCTS策略分配计算资源,在匹配预算下较Codex提案提升lDDT 7.5%,优于随机搜索。
面向专家级金融问答的自改进检索增强生成(RAG)
机构 * University of California, Berkeley(加州大学伯克利分校) ; California Polytechnic State University(加州州立理工大学) ; Hofstra University(霍夫斯特拉大学)
专题命中 规划推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL
AI总结 该研究针对专家级金融问答的合规与防幻觉需求,提出自改进RAG框架,通过三个专门智能体及反馈自校正实现,在FinanceBench数据集上获86%神谕引导准确率,为金融监管应用提供可解释方案。
Comments 17 pages, 2 figures. Accepted at the ICLR 2026 Workshop on Advances in Financial AI
朴素提示优化:重新思考复杂提示搜索的必要性
机构 * Purdue University(普渡大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出轻量级朴素提示优化(NPO),发现其性能优于复杂优化器GEPA,且优化后的提示可迁移至同系列其他模型,表明简单线性提示优化可媲美复杂搜索方法。
Comments 22 pages, 12 figures
AdaThinking-E:用于自适应思考的单token熵调控
机构 * Meituan(美团) ; MoE Key Lab of Artificial Intelligence(MoE人工智能重点实验室) ; AI Institute(人工智能研究院) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; MAIS&NLPR, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 提出AdaThinking-E强化学习框架,通过单token熵调控实现自适应思考,使模型在不同复杂度文档任务中兼顾准确率与效率
ProvenanceGuard: 基于MCP的LLM智能体的源感知事实性验证
机构 * Multiverse Computing ; Parque Cientifico y Tecnológico de Gipuzkoa(吉普斯夸科技园) ; Centre for Social Innovation(社会创新中心) ; Donostia International Physics Center(多诺斯蒂亚国际物理中心) ; Ikerbasque Foundation for Science(伊克尔巴斯克科学基金会)
专题命中 规划推理 :verifier(abstract);分类 cs.CL、cs.AI
AI总结 提出ProvenanceGuard,一种源感知验证器,通过追踪MCP工具调用、分解声明并路由到特定源,检测跨源混淆错误,在医疗领域数据集上优于源无关基线。
Comments 20 pages, 4 figures
MCCE:基于相似度过滤偏好学习的离散空间多大语言模型协同搜索框架
机构 * Zhongguancun Academy(中关村学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; University of Manchester(曼彻斯特大学) ; Tongji University(同济大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 MCCE是结合冻结闭源LLM与轻量可训练模型的混合框架,通过轨迹记忆与强化学习优化小型模型,在多目标药物设计基准上实现最优帕累托前沿质量,优于基线方法,为混合LLM系统提供持续演化新范式。
Comments Accepted at ICML 2026
ASIL:用结构化状态与语义动作替代截图点击
机构 * Shanghai Jiao Tong University(上海交通大学) ; BIGAI(北京智源人工智能研究院)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本文提出ASIL智能体-软件交互层,以结构化状态与语义动作替代低效的截图点击界面,在多应用基准任务中表现优于截图点击,还可提升Qwen系列模型的性能。
Comments Accepted to Findings of EMNLP 2026. 19 pages, 7 figures: 9-page main paper followed by limitations, ethics, acknowledgments, references, and appendices A-E. Project page: this https URL (https://sharryxr.github.io/ASIL/)
DSA:面向多市场股票研究的证据感知大语言模型智能体编排框架
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究提出DSA框架,基于LLM智能体实现多市场股票研究的证据感知编排,通过工作流组织、配置文件差异化处理及测试验证,确保系统实现一致性。
Comments 6 pages, 2 figures, 3 tables. Code available at this https URL (https://github.com/ZhuLinsen/daily_stock_analysis)
超越能力基准:从生产事件元数据学习LLM云服务的操作指纹
机构 * Google Cloud Platform, Google LLC(谷歌云平台,谷歌有限责任公司)
专题命中 规划推理 :planning(abstract);分类 cs.LG
AI总结 该研究提出OpEmbed框架,利用生产支持案例元数据学习LLM云服务的操作指纹,在Google Cloud的大规模生产案例评估中表现优异,可用于模型上线、支持评估等场景。
面向时间序列的大语言模型(LLM)智能体:一项综述
机构 * Northwestern University(西北大学) ; Datadog AI Research(Datadog人工智能研究院) ; Nokia(诺基亚)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本综述针对LLM智能体在时间序列问题上设计差异大的问题,采用问题驱动分类法梳理现有系统,分析任务对架构等的影响,对比模型性能,为相关设计提供指南并指出未来缺口。
Comments Accepted to Findings of EMNLP 2026
MACGen:通过多智能体协作实现功能正确且安全的代码生成
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 MACGen是整合规划等多环节的多智能体代码生成框架,在CWEval、BaxBench基准上,较直接提示显著提升安全代码生成的功能与安全性指标。
Comments 8 pages
学习终端智能体的可泛化行为
机构 * Salesforce AI Research(Salesforce人工智能研究院) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 规划推理 :verifier(abstract);分类 cs.LG
AI总结 本研究针对终端智能体泛化问题,提出智能体组合泛化假设,开发训练方案River,其用不足30%的TMax环境使多规模模型在两个基准上RL增益平均提升超100%,且性能优于开源8B模型、可跨多维度泛化。
单独对齐,共同错位:预测大语言模型智能体群体中的对抗捕获
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 该研究针对LLM智能体群体,提出从群体无攻击时的良性运行状态校准响应函数,可提前预测坚定少数群体引发的对抗捕获,且捕获为临时状态,孤立对齐不等同于群体对齐。
Nomad:自主探索与发现
机构 * Inception, G42(G42 的 Inception) ; G42 ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 规划推理 :verifier(abstract);分类 cs.AI
AI总结 Nomad通过探索优先架构,构建领域探索地图,系统遍历以平衡广度与深度,生成并验证假设,最终生成可信报告。
受限仓库中多智能体取送货任务的动态避风港选择
专题命中 规划推理 :planning(abstract,comments)
AI总结 针对受限仓库多智能体取送货任务的固定避风港缺陷,提出自适应SHARP方法,经大量实验验证其在总完成时间上显著优于SHARP,树形地图中位数减少16.7%
Comments 19 pages, 4 figures, and 3 tables. Accepted at the Joint Workshop on Planning for Complex Real-World Applications (CAIPI) and Bridging the Gap Between AI Planning and (Reinforcement) Learning (PRL), co-located with IJCAI-ECAI 2026
密集仓库中在线多智能体取送货任务的固定安全港预留机制
专题命中 规划推理 :planning(abstract,comments)
AI总结 针对密集仓库在线多智能体取送货任务,提出固定安全港预留机制,实现100%任务完成鲁棒性,相关变体实验揭示了固定返回和撤退中重新分配对性能的影响。
Comments 11 pages, 9 figures. Accepted at the 14th Workshop on Planning and Robotics (PlanRob), co-located with ICAPS 2026
SPA:通过优先计划的信息流控制保护跨查询的持久化大语言模型智能体
专题命中 规划推理 :planning(abstract)
AI总结 SPA是一种优先计划的架构,通过双格信息流控制保护LLM智能体的规划、执行与跨查询状态复用,在AgentDojo和AgentDojo-MQ上可显著降低攻击成功率,同时揭示了安全与效用的权衡。
Comments Submitted to USENIX Security 2027. 24 pages, 17 figures
DeepRepro:面向演化仓库中论文到代码复现的状态感知子规划
专题命中 规划推理 :planning(abstract)
AI总结 针对现有论文到代码复现系统因静态规划易出现不一致的问题,提出DeepRepro状态感知框架,通过动态生成子规划并结合编排与监控,在PaperBench Code-Dev上表现优于基线
Comments Accepted by CIKM2026 Demo Track
多智能体自主系统中的规模与权衡
专题命中 规划推理 :planning(abstract)
AI总结 通过大规模仿真和量纲分析,揭示自主无人机蜂群在三种典型场景中的标度律,量化智能体数量与平台参数间的权衡,并展示最优路径规划对结果标度律的改善。
Comments 16 pages, 12 figures
句法与语义:Transformer如何学习深层依赖关系
专题命中 视觉空间推理 :CoT(summary_cn,abstract);chain-of-thought(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出机械框架揭示Transformer学习深层语义依赖的梯度饥饿现象,解释CoT有效性,验证于多规模模型,提出拓扑对齐对比目标在变量绑定任务提升超2倍。
Think3D: 基于空间的思考以实现空间推理
机构 * Dalian University of Technology(大连理工大学) ; University of California San Diego(加州大学圣地亚哥分校) ; University of Oxford(牛津大学)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 Think3D通过引入交互式3D推理框架,提升多模态代理的空间推理能力,实现在BLINK Multi-view和MindCube上的7.8%性能提升,并通过Think3D-RL优化小模型性能。
AffectOmni:面向社交与艺术相关场景的可通过强化学习验证的以人为中心的接地情感推理
机构 * Lanzhou University(兰州大学) ; Hainan University(海南大学) ; National University of Singapore(新加坡国立大学)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 AffectOmni是面向社交与艺术场景的可验证情感推理框架,通过GRPO训练,引入两类奖励优化以人为中心的证据选择与时间推理,经多数据集实验较7B基线实现显著性能提升。
Comments 12 pages, 5 figures