arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-25 至 2026-08-25 共收录 140 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 13 篇

2608.21614 2026-08-25 cs.AI cs.DC 新提交 90%

SAEM: Stage-Aware Expert Management for Memory-Efficient MoE Inference in Chain-of-Thought Reasoning

SAEM:面向思维链推理的内存高效混合专家模型推理的阶段感知型专家管理

Yujie Zhang, Bin Gao, Tulika Mitra

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 针对思维链推理中MoE模型的内存与延迟问题,提出SAEM阶段感知型专家管理运行时,通过阶段感知缓存等技术提升吞吐量,在受限GPU内存下平均实现1.33倍的性能提升。

Comments Extended version of the paper accepted at DAC 2026. Extends the conference version with evaluations on AIME 2024 and GPQA-Diamond and a prediction-oracle upper-bound analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22126 2026-08-25 cs.LG cs.CL 新提交 81%

Decoupled Physical Modeling and Execution for Physics Reasoning

用于物理推理的解耦物理建模与执行

Ye Zhang, Xuehang Guo, Rui Pan, Pengfei Yu, Denghui Zhang, Manling Li, Qingyun Wang

机构 * University of Pennsylvania(宾夕法尼亚大学) William & Mary(威廉玛丽学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司) Stevens Institute of Technology(史蒂文斯理工学院) Northwestern University(西北大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究提出解耦物理建模与执行的统一框架,通过两阶段后训练策略提升小型大语言模型物理推理性能,在多个基准上实现约3%的平均性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23493 2026-08-25 cs.AI 新提交 79%

SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning

SRPO:用于长程推理的自反思策略优化

Jialong Liu, Yuling Shi, Ning Yang, Xiaodong Gu, Zuchao Li

机构 * School of artificial intelligence, Wuhan University(武汉大学人工智能学院) School of computer science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出 SRPO 框架,将人类的自反思能力内化到 LLMs 中,无需额外模型即可将稀疏监督转化为密集训练信号,在数学推理等基准上以高数据效率取得了最先进性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22048 2026-08-25 cs.AI 新提交 79%

More Accurate or More Efficient? Evaluating Locally Deployed Compact Open-Weight Language Models for Mathematical Reasoning

更准确还是更高效?评估用于数学推理的本地部署紧凑型开放权重语言模型

Orion Powers, Daniella Seum, Khaled Slhoub

机构 * Florida Institute of Technology(佛罗里达理工学院) College of Engineering and Science(工程与科学学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种用于评估本地部署语言模型数学推理性能的受控流程,研究三款紧凑型开放权重模型后发现,无单一模型占优,仅靠准确性不足以选择本地模型。

Comments 8 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23200 2026-08-25 cs.CL 新提交 70%

LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks

LongWoF-Bench:评估用于可验证长工作流任务的EvoMap基因

Xiao Zhang, Qumeng Sun, Jihao Li, Yiming Ren, Xiang Liu, Haoyang Zhang, Junjie Wang

机构 * EvoMap Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 该研究提出LongWoF-Bench基准,发现通过EvoMap将验证的执行轨迹转化为可复用的Gene,能显著提升多模型在长工作流任务上的表现,且优于Skill和参考蒸馏的Gene。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23566 2026-08-25 cs.LG cs.AI cs.CL 新提交 67%

How to Train a Critic Stably and Efficiently

如何稳定且高效地训练评价模型

Penghui Qi, Xiangxin Zhou, Wee Sun Lee

机构 * National University of Singapore(新加坡国立大学) Tencent Hunyuan(腾讯混元)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22138 2026-08-25 cs.AI cs.CL 新提交 62%

Measuring Stability and Failure Behavior in Language Models Under Structured Perturbations

结构化扰动下语言模型的稳定性与失效行为测量

Samira Golsefid

机构 * NeuroLoft(神经 loft(或:神经实验室))

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出分级多类别失效感知框架,在四类模型上测试七种结构化扰动,发现模型失效层级因类别而异,冲突指令与不可能前提问题是所有模型共有的弱点,此类失效无法被标准准确率检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23311 2026-08-25 cs.CL 新提交 57%

Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization

超越稳定性-探索困境:面向大语言模型策略优化的环境正则化方法

Xianlei Zhou, Xiangdi Meng, Yu He, Tianyu Qi, Shuyan Guan, Xianli Zhang, Jian Zhang, Xin Li, Qika Lin, Jun Liu

机构 * Alibaba Group(阿里巴巴集团) Beijing Normal University(北京师范大学) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对大语言模型策略优化的稳定性-探索困境,提出ERPO方法,通过查询KL散度正则化输入侧分布,接入现有策略优化流水线,在数学推理基准上实现了更强准确率与更稳定行为。

Comments Accepted to EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22806 2026-08-25 cs.CL 新提交 57%

DIAG: Diagnostic Iterative Alignment and Generation for Data-Efficient Mathematical Preference Distillation

DIAG:面向数据高效数学偏好蒸馏的诊断式迭代对齐与生成

Guhan Chen, Songtao Tian, Bohan Li, Hejin Wang, YeXin Xie, Zixiong Yu

机构 * Tsinghua University(清华大学) Kyoto University(京都大学) Nanjing University(南京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 DIAG是一种自适应调整训练分布的框架,通过诊断偏好对产出与生成针对性训练数据,提升数学推理任务中偏好监督的信息价值,在同等训练预算下增强模型性能。

Comments Accepted by EMNLP 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22646 2026-08-25 cs.AI 新提交 57%

CAI-DLLM: Convergence Aware Inference for Diffusion Language Models

CAI-DLLM:面向扩散语言模型的感知收敛推理

Farhana Amin, Sabiha Afroz, Dimitrios S. Nikolopoulos

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 CAI-DLLM 是一种无需训练的扩散语言模型推理方法,通过利用第一步置信度调整解码策略,在多类任务上实现显著推理加速,同时保持较高准确率并降低能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21496 2026-08-25 cs.LG math.ST stat.ML 新提交 57%

The geometry of AI validation: Exact certification limits for iid best-of-N search

AI验证的几何:独立同分布N选最优搜索的精确认证极限

Ricardo Fitas

机构 * Technical University of Darmstadt(达姆施塔特工业大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究针对独立同分布N选最优搜索推导了精确认证极限,提出双门审计规则,其在数学推理和代码选择的回顾性分析中可降低保留误差。

Comments 32 pages, 4 figures; includes Supporting Information. Code and processed data are available at this https URL (https://github.com/rfitas-lab/geometry-of-ai-validation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23268 2026-08-25 cs.CV 新提交 50%

Dual-Grained Agent Memory and Shapley Context Attribution for Multimodal Agentic Learner

面向多模态智能体学习者的双粒度智能体记忆与Shapley上下文归因

Jieke Wang, Tiancheng Shen, Yibo Yang, Ming-Hsuan Yang

机构 * UC Merced(加州大学默塞德分校) Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(abstract)

AI总结 针对多模态大模型推理不足的问题,提出双粒度智能体记忆框架DG-Mem,结合Shapley上下文归因,在多个数学多模态推理数据集上实现性能提升,且无需参数更新即可适配各类骨干模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21595 2026-08-25 cs.CV 新提交 50%

Perturb the Thought, Not the Pixels: Latent-Space Rollout Diversification for Reinforcement Learning of Vision-Language Models

扰动思路而非像素:用于视觉语言模型强化学习的潜在空间展开多样化

Michael Jerge, Joseph Pelczar, Justin Downes

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 数学推理 :reasoning(abstract)

AI总结 该研究提出 NC-GRPO 方法,通过在 VLM 潜在空间注入噪声实现展开多样化,提升了其数学推理与幻觉鲁棒性,且仅需少量代码修改即可整合进 RLVR 流程。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 3 篇

2608.21516 2026-08-25 cs.SE cs.PL 新提交 78%

Neuro-Formal Verification: Agentic Language-Agnostic Formal Program Reasoning

神经形式化验证:智能体的语言无关形式化程序推理

Shuvendu K. Lahiri

专题命中 代码与定理证明 :reasoning(title);verifier(abstract)

AI总结 该研究提出神经形式化验证(NFV),让AI编码智能体与成熟验证器结合,为主流语言开发者实现一键式程序验证,在Python编程问题数据集上取得了良好的验证效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22630 2026-08-25 cs.PL 新提交 50%

VeGo: Direct Deductive Formal Verification of Go Programs for Computer Science Education

VeGo:面向计算机科学教育的Go程序直接演绎形式化验证

Tina Massoudi, Chris Dutchyn

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 该研究提出面向计算机科学教育的VeGo系统,可直接验证标准Go程序,整合多种形式化验证技术,对比其他语言论证Go的优势,经教育教材评估并规划了形式并发规约的路线图。

Comments 13 pages + 2 pages of references, 5 code displays, ancillary reference manual for VeGo

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22135 2026-08-25 cs.IR 新提交 50%

GrOIL: Graph-Grounded Domain Ontology Induction with Constrained LLM Mediation

GrOIL:基于图的领域本体归纳与受限大语言模型调解

Maruf Ahmed Mridul, Abid Talukder, Oshani Seneviratne

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 该研究提出GrOIL流程,以受限LLM调解的七阶段图基方法构建可审计OWL TBox,在人寿保险领域的基准测试中,其CQ覆盖率等指标优于LLM基线,可生成稳定领域表示。

Comments 12 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 8 篇

2608.22472 2026-08-25 cs.AI cs.CL 新提交 81%

Small Reasoning Models are Instruction Followers in Function Calling

小型推理模型是函数调用中的指令跟随者

Yalda Taheri, Mohammad Hassan Heydari, Erfan Naaman, Afsaneh Fatemi

机构 * Islamic Azad University(伊斯兰阿扎德大学) University of Isfahan(伊斯法罕大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出指令跟随式函数调用(IFFC)框架,将函数调用逻辑与主大语言模型解耦,交由专用小型模型处理,其性能优于原生和基于提示的函数调用基线,可高效部署于边缘计算场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21897 2026-08-25 cs.AI 新提交 79%

From Solver Feedback to Faithful Plans: Multi-Role Reinforcement Learning for Symbolic Planning

从求解器反馈到可信规划:用于符号规划的多角色强化学习

Chenghao Zhang, Yikai Mao, Shanqi Liu, Haoyu Gao, SaiSai Hu, Dan Roth

机构 * University of Pennsylvania(宾夕法尼亚大学) Georgia Institute of Technology(佐治亚理工学院) Pace University(佩斯大学)

专题命中 逻辑推理 :planning(title,abstract);分类 cs.AI

AI总结 该研究提出基于求解器的多角色强化学习框架,仅用求解器反馈实现无人工演示的自然语言转PDDL,在PlanBench上显著提升规划成功率与可信性,降低语义漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21431 2026-08-25 cs.CV cs.MM 新提交 78%

Boosting Knowledge-based Visual Question Answering with Structured Context Reasoning

基于结构化上下文推理提升基于知识的视觉问答性能

Qiyou Liu, Yong Zhang, Jianjie Luo, Zhenguo Yang, Yi Yu

机构 * School of Computer Science, Guangdong University of Technology(广东工业大学计算机学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Graduate School of Advanced Science and Engineering, Hiroshima University(广岛大学先进科学与工程研究生院)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文提出SCoRe框架,通过上下文获取、选择、压缩三阶段处理多模态知识,在OK-VQA和A-OKVQA基准上性能优于现有最优方法,提升了基于知识的视觉问答效果。

Comments Accepted by ICME 2026. Source code is available at this https URL (https://github.com/WISLab-GDUT/SCoRe)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21364 2026-08-25 cs.CL cs.AI cs.MM 新提交 62%

Distinguishing Revision and Delayed Elaboration in Incremental Narrative Interpretation

增量叙事理解中修订与延迟阐释的区分

Yi-Chun Chen

机构 * National Cheng Kung University(成功大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究区分增量叙事理解中的修订与延迟阐释两种更新算子,以视觉叙事为域验证结构化表征可支持二者,其结构差异对增量推理及混合符号-神经系统具重要意义。

Comments Accepted as a full paper for presentation at the 2026 Workshop on Computational Models of Narrative (CMN 2026). This preprint corresponds to the workshop version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23543 2026-08-25 cs.AI 新提交 57%

How AI Assistance Affects Human Skill Development: A Study of Learning with Logic Puzzles

AI辅助如何影响人类技能发展:一项基于逻辑谜题学习的研究

Shang Wu, Catarina G Belem, Shuyuan Fu, Mark Steyvers, Padhraic Smyth

机构 * University of California, Irvine(加利福尼亚大学欧文分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究通过逻辑谜题实验发现,AI辅助会削弱人类长期技能发展,独立问题解决努力对技能提升更关键,低AI请求成本会增加AI使用频率且降低后续无辅助表现。

Comments Accepted at Human-AI Complementarity and Alignment (HCOMP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21827 2026-08-25 cs.CL 新提交 57%

Do Large Language Models Perform Well on Comprehending Poetic Logic in Modern Chinese Poetry?

大型语言模型在理解现代汉诗的诗意逻辑方面表现良好吗?

Tian Lan, Shanshan Wang, Zehua Duo, Jiang Li, Guanglai Gao, Derek F. Wong, Xiangdong Su

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究科) University of Macau(澳门大学) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对当前LLMs在现代汉诗诗意逻辑理解评估上的缺口,构建首个基准Peony,评估发现主流LLMs存在相关理解局限,验证了Peony的有效性与必要性。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21796 2026-08-25 cs.CV cs.AI 新提交 57%

SAFE-G: Structure-aware Faithful Evidence-guided Generation for Knowledge-based Visual Question Answering

SAFE-G:面向基于知识的视觉问答的结构感知忠实证据引导生成

Long Shu, Shuochen Liu, Wei Chen, Junda Lin, Zhi Zheng, Huijun Hou, Tong Xu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) NIO(蔚来)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 针对KB-VQA现有方法难以捕捉结构关联、推理不忠实的问题,提出SAFE-G框架,通过混合搜索、图检索与证据对齐RL策略,在两个基准上准确率优于现有方法8.9%、3.5%。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21719 2026-08-25 cs.DC 新提交 50%

PowerSlider: Exploiting Phase Asymmetry for LLM Serving under Demand Response

PowerSlider:利用相位不对称性实现需求响应下的大语言模型服务

Yueying Li, Jiayang Chen, Yuanfan Chen, Leo Han, Haoran Qiu, Esha Choukse, Rodrigo Fonseca, Udit Gupta

专题命中 逻辑推理 :reasoning(abstract)

AI总结 PowerSlider通过分解大语言模型服务阶段并结合KKT在线求解器,在电网需求响应的时变功率上限下,显著提升了服务吞吐量与延迟性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 30 篇

2608.22971 2026-08-25 cs.AI cs.CV 新提交 85%

ParallelWorld: Test-Time Scaling for Embodied Reasoning

ParallelWorld:具身推理的测试时缩放方法

Min Chen, Shengjun Zhang, Yuxin Li, Zhang Zhang, Xin Fei, Chong Xia, Yueqi Duan

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文针对具身推理现有方法缺乏长程规划的局限,提出ParallelWorld多步测试时缩放框架,通过验证器引导的树搜索实现并行多步轨迹模拟,在ESI-Bench上显著提升了主动感知与推理性能。

Comments Project Page: this https URL (https://chen-min-22.github.io/ParallelWorld-page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21871 2026-08-25 cs.CL cs.LG 新提交 84%

The Chase Is the Curriculum, the Capture Anchors the Credit: Pursuit-Evasion Self-Play for Zero-Data LLM Reasoning

追逐即课程,捕获锚定信用:用于零数据大语言模型推理的追逃自博弈

Jing Yu, Shengchao Chen, Yiyun Tan

专题命中 规划推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出LURE框架,将零数据自博弈转化为追逃博弈,通过捕获锚定信用机制,在三类推理环境和主干模型上,实现优于先进基线的零数据LLM推理性能。

Comments 9 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21440 2026-08-25 cs.RO cs.AI 新提交 83%

Geo-VLA: Geometry-Aware Vision-Language-Action Planning via Internalization of Map Semantics

Geo-VLA:通过内化地图语义实现几何感知的视觉-语言-动作规划

Ran Chen, Jiaxing Ren, Zhikun Zhang, Yunhao Hou, Junbao Zhuo, Bochao Zou

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 该研究针对VLA模型在复杂驾驶场景中规划性能不足的问题,提出可即插即用的Geo-VLA框架,结合自研Geo-QA数据集,在NAVSIM v1上实现单目VLA规划器的新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23047 2026-08-25 cs.CL cs.AI 新提交 81%

Beyond Verdicts: A Graph-Based Analysis of Human and LLM Reasoning in Scientific Fact-Checking

超越裁决:科学事实核查中人类与大语言模型推理的基于图的分析

Abdul Ghafoor, Muhammad Arslan Manzoor, Yufang Hou

机构 * Interdisciplinary Transformation University Austria (ITU)(奥地利跨学科转型大学(ITU))

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出类型化推理图框架,用于对比科学事实核查中人类与LLM的推理路径,基于MISSCIPLUS数据集评估GPT-5等模型,发现各模型在裁决性能与人类对齐度上存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22839 2026-08-25 cs.LG cs.AI 新提交 81%

Hierarchy-Aware Supervised Uncertainty Estimation for Black-box LLM Taxonomic Reasoning

面向黑盒大语言模型分类推理的层级感知监督式不确定性估计

Shuting Xie, Nathaniel Lesperance, Graham W. Taylor

机构 * Vector Institute for AI(向量人工智能研究所) University of Guelph(圭尔夫大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 针对黑盒LLM在生物多样性监测分类推理中置信度估计难的问题,提出层级感知监督估计器,提升了微AUROC,验证了层级结构对弃权规则的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22132 2026-08-25 cs.CL cs.AI cs.CE 新提交 81%

SSE-Bio: A Structured Self-Evolving Agent with Agentic Retrieval Policy for Multi-Hop Biomedical Reasoning

SSE-Bio:面向多跳生物医学推理的、具备智能体式检索策略的结构化自进化智能体

Zhaohan Meng, Zaiqiao Meng, Siwei Liu, Hao Xu, Ke Yuan, Iadh Ounis

机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算科学学院) Brigham and Women’s Hospital, Harvard Medical School, Harvard University(哈佛大学医学院附属布莱根妇女医院) Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) School of Natural and Computing Science, University of Aberdeen(阿伯丁大学自然与计算科学学院) School of Cancer Sciences, University of Glasgow(格拉斯哥大学癌症科学学院) Cancer Research UK Scotland Institute(英国癌症研究苏格兰研究所)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究针对生物医学多跳问答的指令漂移问题,提出SSE-Bio结构化自进化智能体,通过代理策略选择性检索、细粒度模板编辑及组相对策略优化,在三个基准上实现优于现有基线的性能,BioHopR上提升6.56绝对点。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏