Deal Me Maybe: The Role of Emotions in Multi-Agent Negotiation
或许与我成交:情绪在多智能体谈判中的作用
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 该研究探讨提示条件下的情绪对LLM多智能体价格谈判的影响,发现愤怒买方成交率极低,快乐买方成交率最高但价格较差,情绪效应具有角色依赖性,引发商业中情绪条件智能体的担忧。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
或许与我成交:情绪在多智能体谈判中的作用
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 该研究探讨提示条件下的情绪对LLM多智能体价格谈判的影响,发现愤怒买方成交率极低,快乐买方成交率最高但价格较差,情绪效应具有角色依赖性,引发商业中情绪条件智能体的担忧。
用于聚合物自动化粗粒度分子动力学的多智能体框架
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST))
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 本文提出CGMas多智能体框架,可自动完成聚合物粗粒度分子动力学的拓扑构建等全流程,完成27项任务,22项密度匹配度在5%内,模拟时间大幅缩短,确立了智能体式LLM用于聚合物粗粒化的可行性。
可信代理网络:在代理网络中,信任必须被内置,而非事后添加
机构 * University of Southern California(南加州大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Stanford University(斯坦福大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文探讨了在代理网络中信任必须被内置而非事后添加的问题,提出了一个综合的概念框架,通过四个设计支柱来建立代理网络中的信任。
Comments Accepted at SIGKDD 2026 Blue Sky Ideas Track
开源权重大语言模型能否生成内核验证的Coq证明?一项试点研究
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本研究在CoqStoq的100个定理上评估6种开源权重LLMs,发现仅Gemma 4等3个模型能生成Coq内核验证的证明,总体成功率3.5%,未确立模型通用排名。
PhaseCoder: 无关麦克风几何的多模态大语言模型空间音频理解
机构 * Google DeepMind(谷歌DeepMind) ; Media Lab, MIT(媒体实验室,麻省理工学院) ; Google AR(谷歌AR)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 PhaseCoder是一种无需麦克风几何结构的Transformer空间音频编码器,能够生成空间嵌入并使LLM实现复杂空间推理和转录任务。
思维链可监控性中“看不见即想不到”吗?
机构 * University of Amsterdam(阿姆斯特丹大学) ; University of Edinburgh(爱丁堡大学)
专题命中 推理与问题求解 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL
AI总结 本研究对比显式与潜在CoT的可监控性,发现其更多取决于任务属性和模型内部访问程度,而非推理模式。
Comments 23 pages
STRIVE:探究分级合理性生成与评估中的推理极限
机构 * University of Pittsburgh(匹兹堡大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL
AI总结 STRIVE是基于LLM的框架,可联合生成评估跨越合理性类别与难度的受控事件集,实验中其优化后高质量事件集生成率达75.0%,为心理语言学研究减少手动工作量。
Comments Under Review
ExeCRE:基于执行一致性引导的自校正代码生成可靠性估计
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 ExeCRE是基于执行一致性的代码可靠性估计框架,可减少自校正代码生成中的误导性反馈,提升有效性与稳定性,在GPT-5.2搭配LiveCodeBench及数学推理场景均有显著收益。
Comments 13 pages, 5 figures. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)
stratum: 一种支持大规模基于代理的机器学习工作负载的系统基础设施
机构 * BIFOLD & TU Berlin(BIFOLD与柏林技术大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 stratum是一种支持大规模基于代理的机器学习工作负载的系统基础设施,通过解耦流水线执行与规划推理,提升大规模代理流水线搜索效率。
Comments Accepted at PVLDB 2026 (Vol. 19, No. 11). Artifact available on GitHub
Journal ref Proc. VLDB Endow. 19(11): 3799-3806, 2026
ReflectRL:通过反思到直接推理从优质负轨迹中学习
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 ReflectRL是一种轻量即插即用框架,将专家失败的优质负轨迹作为反思对象而非丢弃,经反思推理与策略转换,在多基准、多模型及多训练方法上以极小开销提升大语言模型推理性能。
Comments Project page: https://github.com/bibisbar/ReflectRL
ToolLIFT:将工具特定轨迹提升为函数级图以实现可泛化的工具规划
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出ToolLIFT框架,通过将工具特定轨迹提升为函数级工作流图,实现了更具泛化性的工具规划,在多个基准上优于现有方法,对未见过的工具集泛化能力强。
TCPO:回合级信用策略优化
机构 * Moore Threads AI(摩尔线程人工智能)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 该研究针对验证器引导多回合强化学习的信用分配问题,提出TCPO方法,在多类任务和模型上提升了LLM的多回合推理与智能体性能。
智能体图令牌推理
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本研究提出智能体图令牌推理,将图令牌化融入推理过程,通过三阶段训练实现,在七个图领域评估中大幅优于基线,可零样本迁移至未见领域,推动图分析向智能体范式发展。
VFEAgent: 面向端到端自动化有限元分析的多模态智能体框架
机构 * Peking University(北京大学) ; China Agricultural University(中国农业大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出VFEAgent多智能体系统,通过多模态视觉-语言流水线和验证优先的代码合成框架,实现从输入图像和问题描述到有限元建模与仿真的端到端自动化。
Comments 9 pages, 3 figures, 2 tables. Equal contribution: Jiachen Zhang and Junyi Lao. Corresponding author: Songfang Huang. Preprint
智能体AI中的OpenClaw与Ollama:迈向完全自主且可扩展的AI智能体系统
机构 * University of the Peloponnese(伯罗奔尼撒大学) ; Cornell University(康奈尔大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究提出智能体AI的分层架构,分析OpenClaw与Ollama组成的全栈系统,验证系统集成可提升智能体能力,指出相关挑战并提供路线图,所有资源公开以支持研究。
CPInj:揭示文本协作式提示优化中的提示注入风险
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; McMaster University(麦斯特大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究文本协作式提示优化(TCPO)中提示注入风险,提出协作式提示注入攻击CPInj,用恶意指令污染全局提示,降低下游任务性能,现有防御方法无效;还提出防御导向聚合方法APAgg,实验表明TCPO存在关键漏洞,攻击有待更强大防御。
Comments Accepted by COLM 2026 and AI4GOOD workshop
基于FEA-AI混合方法的IPMSM设计优化多智能体系统
机构 * Cho Chun Shik Graduate School of Mobility, KAIST(KAIST Cho Chun Shik 移动研究生院) ; Department of Mechanical Engineering, Hanyang University(汉阳大学机械工程系) ; Narnia Labs
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出一种端到端自动化IPMSM设计优化框架,通过RAG结构化问题定义与不确定性感知的FEA-AI混合优化流水线,平衡计算成本与预测可靠性,在同等FEA预算下优于纯FEA或纯AI方法。
Comments 37 pages, 31 figures
GoGoTB:基于规范驱动覆盖闭合的智能体式RTL验证
机构 * Tencent(腾讯) ; School of Integrated Circuits, Peking University(北京大学集成电路学院) ; Southwest Jiaotong University(西南交通大学) ; Institute of Electronic Design Automation, Peking University(北京大学电子设计自动化研究所) ; Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路高精尖创新中心)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 GoGoTB是实现端到端验证闭合的智能体式RTL验证框架,在8个RTL设计上无需人工干预,实现100%环境生成成功率及多维度高覆盖率,优于现有方法。
Comments 9 pages, 7 figures, 3 tables. Xin Xin and Jincheng Lou contributed equally to this work and share first authorship
用于自主量子传感实验中科学推理的智能体人工智能
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究围绕大语言模型智能体实现用于金刚石中NV中心自主实验的智能体人工智能工作流程,主要贡献为展示自主实验流程,引入离线基准评估智能体推理,结果表明自主实验中智能体与代码分工明确,智能体负责假设和数据评估,代码控制硬件与执行安全约束。
Comments 11 pages, 4 figures + Supplementary Information
评估可解释人工智能对人工智能辅助代码审查中信任的影响
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究可解释人工智能(XAI)对开发人员在人工智能辅助代码审查中信任的影响,通过对34名参与者的受试者内用户研究,比较不同XAI支持水平的系统,发现解释水平显著影响信任和认同,结果为可信代码审查系统设计等研究提供信息。
Comments 23 pages, 4 figures, 5 tables. To appear in Proceedings of the ACM on Software Engineering (PACMSE), Vol. 3, No. ISSTA, Article ISSTA093 (ISSTA 2026). Published under CC BY 4.0. Replication package: https://doi.org/10.5281/zenodo.21457282
HydroAgent:将预报员专业知识形式化为技能编排的洪水预报工作流程
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究针对业务洪水预报中隐性预报员专业知识难形式化等问题,提出HydroAgent框架,将大语言模型嵌入洪水预报工作流程,经实验验证其有效性,能转化隐性知识为可审核流程,辅助决策并展示规则引导语言模型推理补充物理模拟的作用。
PerfAgent:用于仓库级代码优化的分析器引导迭代优化
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Rensselaer Polytechnic Institute(罗切斯特理工学院) ; IBM(IBM公司) ; Michigan State University(密歇根州立大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对仓库级代码优化难题,提出PerfAgent分析器引导迭代优化方法,该方法能让编码代理找到热点并改进,在两个优化基准测试中大幅提升专家匹配补丁率,且以低成本超越基线。
ToolVerse:为智能强化学习解锁大规模环境和长时任务
机构 * LongCat Interaction Team, Meituan(美团长猫互动团队) ; Peking University(北京大学) ; Fudan University(复旦大学) ; Wuhan University(武汉大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 研究针对LLM智能体在复杂环境中工具集成问题,提出ToolVerse框架。通过构建大规模训练环境、设计任务策略及提出新算法,经实验验证该框架能增强LLM长时工具使用能力,提升性能与推理能力。
GraphDx:一种用于顺序诊断的成本感知知识增强多智能体框架
机构 * Shandong University(山东大学) ; Nankai University(南开大学) ; East China Normal University(华东师范大学) ; National Technological University(国立科技大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对顺序诊断中平衡诊断准确性与资源成本的问题,提出GraphDx框架。该框架通过构建特殊知识图谱及引入协作智能体实现创新,实验表明其能显著提高诊断成功率并降低测试成本,为自动临床诊断提供有效方案。
Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 21721-21736, 2026
基于商用现货二进制文件的智能体漏洞推理
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.LG
AI总结 研究LLM智能体对COTS二进制文件漏洞的推理能力,构建SLYP管道,结合二进制探索与动态调试验证漏洞。在COM基准测试中表现出色,发现更多真实漏洞,生成验证PoC,还发现多个零日漏洞,证明工具集和模型选择的重要性及通用性。
用于混合表格和文本的金融推理的黄金引导式程序蒸馏
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究针对混合表格和文本数据的金融推理问题,基于程序蒸馏开发方法,利用黄金推导指导程序合成,经执行验证转移可靠数值推理,引入迭代恢复阶段,实验表明该框架能有效训练小模型进行可靠数值推理。
Comments 12 pages, 7 figures
HG-RAG:用于结构化知识图谱的层次引导检索增强生成
机构 * University of California, Merced(加州大学默塞德分校)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对RAG系统在处理结构化知识推理时的不足,提出HG-RAG框架,通过在层次知识图谱上遍历为语言模型提供结构化上下文,经多规模多类型查询评估,该框架在相关推理任务中优于基线,减少幻觉并保持一致性。
Comments 8 pages, 3 figures
REST:基于零样本目标导航的视界探索Steiner树
机构 * State Key Laboratory of Internet of Things for Smart City, University of Macau(智能城市物联网国家重点实验室,澳门大学) ; University of Michigan(密歇根大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 REST通过构建开放词汇3D地图、生成以代理为中心的路径树以及利用LLM推理选择最佳路径,在多个基准测试中实现了高成功率和高效路径效率。
Comments Accepted to IROS'26
用于安全且符合道德的自动驾驶车辆的人在回路机器学习:原理、挑战与机遇
机构 * IEEE
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文针对自动驾驶车辆面临的挑战,对人在回路机器学习进行教程式综述,涵盖课程学习、人在回路强化学习、人在回路大语言模型、主动学习等方法及道德原则,以推动安全且符合道德的自动驾驶发展。
Comments 19 pages, 4 figures
深度交互:一种用于大型推理模型的高效人机交互方法
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对大语言模型推理出错时现有交互方法的问题,提出深度交互机制,可直接编辑原始响应并提炼精炼提示引导模型,在STEM任务推理中纠正成功率大幅提升,令牌使用量显著减少。