Strategy-first synthesis planning for complex natural products
复杂天然产物的优先策略合成规划
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 基于大语言模型的智能体框架SynthEx,可规划出传统算法无法实现的复杂天然产物合成路线,其关键步骤获化学家认可,相关路线数据库SynthAtlas已开放。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
复杂天然产物的优先策略合成规划
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 基于大语言模型的智能体框架SynthEx,可规划出传统算法无法实现的复杂天然产物合成路线,其关键步骤获化学家认可,相关路线数据库SynthAtlas已开放。
面向决策与智能体AI的因果数据管理生态系统
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文针对AI生态系统决策混杂问题,提出构建共享可查询的因果世界系统(CWS),为面向决策与智能体AI的因果数据管理生态系统提供支持。
Comments Accepted at ACM AI Leadership Summit 2026
用于可泛化深度伪造视频检测的多智能体取证推理
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对深度伪造检测的现有方法泛化性不足问题,本文构建含10万视频的FaceVid-Forensics-100K数据集,提出多智能体取证推理框架,在域外测试集上性能优于GPT、Gemini等模型。
Comments 22 pages, 8 figures, 14 tables
WebGrader:利用自演化程序化评分器训练用于网页开发的大语言模型
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究提出自演化程序化评分器WebGrader,通过分离测试规划等环节生成准确奖励,训练8B策略在WebGen-Bench、WG-core-250数据集上的功能成功率及得分优于多款大语言模型。
Comments 17 pages, 3 figures. Supplementary material is included in the main PDF
符号执行的智能体规划
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 该研究提出智能体规划系统Agolic,利用早期符号执行运行的证据配置后续有界符号执行,在C/C++程序上平均覆盖3倍以上分支,覆盖更多分支及对比语料库未覆盖的分支,扩展了符号执行的实际覆盖范围。
LangChoiceBench:测量与解释大语言模型中的编程语言选择
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究推出LangChoiceBench基准,评估25种LLMs的代码语言选择,发现其普遍过度选择Python、一致性低,小开放模型偏好更强,还揭示了模型的虚假证据等失败模式。
Comments 19 pages, 9 tables, 2 figures
视觉感知不等于决策:多模态大语言模型能成为有效的首席执行官吗?
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究构建C-SUITEBENCH多模态基准,评估9个前沿模型作为CEO的决策能力,发现多模态输入可提升证据推理但会损害受限资源分配,揭示多模态智能体的视觉感知与受限行动是可分离瓶颈。
Comments 25 pages
利用层级推理和话语级目标奖励增强大型语言模型的社交智能
机构 * Alibaba Group(阿里巴巴集团) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究针对LLMs社交互动不足的问题,提出TSR框架与LHRL-VGR算法,微调Qwen2.5-7B智能体后在SOTOPIA基准上超过GPT-4o基线7.32%,实现多智能体社交谈判的最优性能。
当智能体AI遇上集成感知与通信
机构 * University of Luxembourg(卢森堡大学) ; CSIRO(联邦科学与工业研究组织) ; Qassim University(卡西姆大学) ; Edith Cowan University(伊迪丝·考恩大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本综述提出智能体AI与集成感知通信结合的AISAC范式,构建六阶段闭环框架与五成熟度等级,梳理相关领域进展,分析交叉需求,发现现有系统智能体成熟度不足,并指出多方面开放挑战。
Comments 35 pages, 132 references, 10 tables, 9 figures
C³PO:评估全模态模型中的跨模态组合与反事实性能
机构 * Microsoft Research India(微软研究院印度分院) ; IIIT Hyderabad(印度国际信息技术研究院(海得拉巴))
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究推出C³PO基准数据集,评估全模态模型的跨模态组合与反事实性能,发现模型存在模态主导问题,需改进架构以支持持续跨模态注意力。
SearchAuditor:长程搜索智能体失败的审计与归因
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本研究针对长程搜索智能体的失败诊断难题,构建SearchAuditBench基准,提出多视角审计框架SearchAuditor,其端到端通过率达32.3%,优于基线模型,可助力智能体从错误中恢复。
当提示词成为像素:面向多模态推理的提示词-区域定位
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对多模态大语言模型在视觉化任务语义场景下的准确率下降问题,提出提示词-区域定位方法,有效提升了基准测试准确率且无需OCR或区域元数据。
EmpaAva:开源智能体式3D化身共情实时聊天机器人
机构 * National University of Singapore(新加坡国立大学) ; Tsinghua University(清华大学) ; University of Oxford(牛津大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL
AI总结 该研究提出首个开源智能体式3D化身共情聊天机器人EmpaAva,通过三智能体架构实现闭环多模态交互,在评估中优于多款基准模型,将开源并提供在线演示。
Comments Project&Demo: https://empaava.top/
面向表格到多模态报告生成的蒙特卡洛树搜索
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 针对表格到多模态报告生成的现有方法缺陷,本文提出基于MCTS的MCTS-Report框架,通过分解原子动作与多维奖励函数优化,在自建的MMRBench基准上取得优于基线的77.9总体得分。
多语言多智能体规划失败的可操作诊断
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL
AI总结 本研究针对多语言多智能体系统在非英语场景下的规划失败问题,提出规划-接地失败分类法,开发TART方法,在多语言任务中显著提升了现有系统的性能。
Comments 22 pages, 11 figures
能动人工智能:面向复杂系统的以决策为中心的架构
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究提出能动人工智能框架,通过组织世界、站点世界等四个角色构建以决策为中心的架构,拓展AI前沿,为企业与工业复杂系统的可靠AI部署提供新方向。
基准测试基准:测试常识基准的预测有效性
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL
AI总结 该研究评估了23种模型在多类常识基准、对照任务及下游推理任务上的表现,发现常识基准仅对少数下游任务有一致预测性,修改基准未提升预测能力,其仅提供任务相关的下游常识能力证据。
BAP-SQL:面向智能体Text-to-SQL的预算感知观测规划
机构 * Microsoft(微软公司) ; Carnegie Mellon University(卡内基梅隆大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 推理与问题求解 :SFT(abstract,abstract_cn);分类 cs.AI
AI总结 BAP-SQL是面向智能体Text-to-SQL的预算感知观测规划方法,通过将观测形成作为预算控制阶段,在紧预算下提升了SQL生成成功率,同时减少了token使用量。
Comments 10 pages, 3 figures
将量子电路与经典大语言模型分离
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究证明了低深度量子计算与经典大语言模型架构在分布和功能上的无条件分离,为大语言模型时代量子优势的研究奠定了基础。
Comments 60 pages, 6 figures
MechGeo:在Lean 4中自动形式化与证明欧几里得几何
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 MechGeo是基于Mathlib的智能体框架,可在Lean 4中自动形式化欧几里得几何问题并构造认证证明,在43道IMO几何题及Lean-IMO-Bbench上取得显著成果,为可信形式几何提供实用基础。
Comments 43 pages
AdaThinkV:面向令牌高效视频推理的自适应思维
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究提出AdaThinkV自适应视频推理框架,通过ThinkGain与VRPO解决CoT推理的令牌浪费问题,在视频推理任务中以更少令牌实现优于最强自适应基线的准确率。
DeepVoyager-VL:为长视野多模态智能体激励视觉在环搜索
机构 * PKU(北京大学) ; HKUST(GZ)(香港科技大学(广州)) ; NUDT(中国人民解放军国防科技大学) ; OUC(中国海洋大学) ; HITSZ(哈尔滨工业大学(深圳)) ; Huawei Cloud BU(华为云业务部)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对现有多模态深度搜索忽视视觉中间推理作用的局限,提出DeepVoyager-VL框架,构建多模态事件图合成数据,设计智能体框架实现主动视觉获取,经10个基准实验验证其有效性。
FAU参加2026年ImageCLEF多模态推理任务:鲁棒候选评分与简洁多语种视觉问答
机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔兰根-纽伦堡大学)
专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.LG
AI总结 FAU提交的多模态推理系统,未做任务特定模型训练,在2026年ImageCLEF竞赛中,获Visual MCQ第三名、Visual OpenQA第一名,凸显推理工程的实用价值。
Comments 16 pages, 3 figures, 7 tables. CLEF 2026 Working Notes, ImageCLEF 2026 Multimodal Reasoning Task
HopRefusalBench:面向多跳推理的搜索增强智能体的弃权失败诊断基准
机构 * Ant Group(蚂蚁集团) ; NLPR, MAIS, CASIA(中国科学院自动化研究所模式识别国家重点实验室、多模态人工智能系统实验室)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究针对多跳搜索增强智能体的弃权问题,构建首个可控基准HopRefusalBench,经实验发现前沿模型弃权能力存在显著不足,为相关可靠性改进提供基础。
Comments 20 pages
开放数字孪生生态中可验证AI智能体的神经符号参与治理
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对开放数字孪生生态中AI智能体的验证需求,提出神经符号去中心化治理框架,结合神经推理与制度治理,通过区块链智能合约实现可审计参与,经原型验证可管控开销下保障合规协作。
Comments Accepted at the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC 2026), Bellevue, WA, USA, October 4-7, 2026. 7 pages, 1 figure, 5 tables. Code: https://github.com/weicaiuw/verigov-ai (DOI: 10.5281/zenodo.21706699)
逃离置信陷阱:扩散大语言模型数学推理的进化解码
机构 * Australian National University(澳大利亚国立大学) ; Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; Amazon(亚马逊) ; University of Technology Sydney(悉尼科技大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对扩散大语言模型数学推理的置信陷阱,提出无训练的进化解码框架,通过逐步选择与分块变异提升LLaDA 2.0的数学推理可靠性。
何时该放弃:诊断与训练大语言模型以中止无效推理
机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Weixin AI, Tencent Inc(腾讯微信人工智能)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究针对大语言模型在超能力任务上产生无效推理的问题,提出CaRL方法对齐模型行为与能力边界,实验验证其可减少无效推理且不牺牲任务性能。
MANTA:面向自演进多智能体系统的多智能体网络拓扑自适应框架
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究提出MANTA框架,使多智能体系统通信拓扑可在推理阶段自演进,在五类基准测试中平均得分74.0,较最强基线高5.8个百分点,验证了推理阶段自改进可延伸至协作架构。
BlueprintRepair:面向失败的Lean证明蓝图的类型化局部编辑
机构 * Lomonosov Moscow State University(莫斯科罗蒙诺索夫大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本研究提出BlueprintRepair修复接口,构建含142个案例的BlueprintTrace基准,对比三种修复方式,发现类型化修复成本最低且在有限令牌内覆盖率最高。
Comments 19 pages, 4 figures, 7 tables
并非所有 token 都应获得同等权重:面向长思维链(Long-CoT)推理的反事实敏感性权重重分配
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学现代软件技术国家重点实验室) ; Institute of Wireless Communications Technology, Shanghai Jiao Tong University(上海交通大学无线通信技术研究所)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对长思维链推理中均匀分配 token 权重的缺陷,提出反事实敏感性权重重分配方法,在数学推理基准上优于 GRPO,验证了特权诱导方向不可靠的诊断。
Comments 20 pages, 6 figures, 11 tables