arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-09-01 至 2026-09-01 共收录 368 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 27 篇

2608.28666 2026-09-01 cs.CV 新提交 78%

Improving Spatial-Temporal Reasoning in Video-Language Models with Structured Video Prompting

通过结构化视频提示提升视频-语言模型的时空推理能力

Sadegh Mohammadian

机构 * Sharif University of Technology(谢里夫理工大学)

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 该研究提出无需训练的结构化视频提示方法,在推理时通过为视频添加时空结构锚点,提升视频-语言模型在时空推理任务上的性能,为改进视频理解提供了实用方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04363 2026-09-01 cs.LG cs.CL 版本更新 73%

Amortizing intractable inference in large language models

摊销大型语言模型中难以处理的推理

Edward J. Hu, Moksh Jain, Eric Elmoznino, Younesse Kaddar, Guillaume Lajoie, Yoshua Bengio, Esmeralda S. Whitammer

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对大型语言模型的难以处理后验分布采样问题,提出用生成流网络(GFlowNets)的摊销贝叶斯推理方法微调LLM,可替代最大似然训练,还能高效适配需多步推理和工具使用的任务。

Comments ICLR 2024; 23 pages; code: https://github.com/GFNOrg/gfn-lm-tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30713 2026-09-01 cs.SD 新提交 67%

Closing the Verification Loop: Self-Check Captioning for Long-Paragraph Detailed Audio Captioning

闭合验证循环:用于长段落详细音频字幕的自检查字幕生成

Fengji Ma, Yan Rong, Xu Li, Chen Zhang, Pengfei Wan, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Kuaishou Technology(快手科技)

专题命中 测试时计算 :verifier(abstract,abstract_cn)

AI总结 本研究针对长段落详细音频字幕的未解决问题,提出SCC框架,构建LACap-50k语料库与LC-SFT方法,使系统在开源字幕生成器中达最优性能。

Comments EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20621 2026-09-01 cs.AI cs.CL cs.LG cs.MA stat.ML 版本更新 67%

PEAR: Permutation-Equivariant Adaptive Routing Multi-Agent Debate

PEAR: 置换等变自适应路由多智能体辩论

Yang Feng, Ziwei Xu, Xia Hu, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PEAR协议,通过动态重配置通信角色和稀疏拓扑,消除固定拓扑中的位置偏差,提升多智能体辩论的准确性和鲁棒性。

Comments Published in the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP) as a Main Conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26872 2026-09-01 cs.LG cs.AI cs.CL 版本更新 67%

When the Strongest Teacher Is Not the Best Teacher: Student-Centric Answer Selection

最强的教师并不总是最好的教师:以学生为中心的答案选择

Zhengyu Hu, Zheyuan Xiao, Linxin Song, Fengqing Jiang, Yuetai Li, Zhihan Xiong, Yue Liu, Junhao Lin, Yao Su, Lijie Hu, Kaize Ding, Teng Xiao, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Southern California(南加州大学) Independent Researcher(独立研究者) National University of Singapore(新加坡国立大学) Microsoft(微软) Google(谷歌) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Northwestern University(西北大学) Allen Institute for AI (AI2)(人工智能研究院(AI2))

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出以学生为中心的答案采样(SCAS)框架,通过估计学生中心的学习成本选择教师生成的答案,从而提升学生模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24564 2026-09-01 cs.AI cs.CE cs.LG 版本更新 62%

Summoning the Oracle to Slay It: Mitigating Look-Ahead Bias in Financial Backtesting with Large Language Models

召唤神谕以屠之:利用大语言模型缓解金融回测中的前瞻偏差

Weixian Waylon Li, Mengyu Wang, Tiejun Ma

机构 * University of Edinburgh(爱丁堡大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出FinCAD方法,通过对抗性偏差发现和实体日期自适应规则,在不重新训练的情况下抑制大语言模型对历史结果的记忆,从而缓解金融回测中的参数化前瞻偏差。

Comments EMNLP 2026, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17251 2026-09-01 cs.LG cs.AI 版本更新 62%

Training-free LLM Verification via Recycling Few-shot Examples

利用回收少样本示例实现无需训练的大语言模型验证

Dongseok Lee, Jimyung Hong, Dongyoung Kim, Jaehyung Kim

机构 * Yonsei University(延世大学) KAIST(韩国科学技术院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM推理随机性与结论不一致的问题,提出无需训练的ReFeri框架,结合前向置信得分与后向重构惩罚,在7项任务上使3种LLM准确率平均提升8.2%。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30528 2026-09-01 cs.LG 新提交 57%

PAC: Progress-Augmented Advantage Curriculum for Multi-Task Reinforcement Learning of LLMs

PAC:面向大语言模型多任务强化学习的进度增强优势课程

Yuanqiang Yu, Yanzhao Zheng, Zhentao Zhang, Tianze Xu, Chao Ma, Jihuai Zhu, Jiashun Liu, Xinle Deng, Baohua Dong, Hangcheng Zhu, Ruohui Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 该研究针对LLM多任务RL后训练的任务分配问题,提出PAC方法结合优势与奖励增益信号,经多场景验证可提升样本效率与最终性能。

Comments Accepted at EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30252 2026-09-01 cs.LG 新提交 57%

Strong Drafts Need Compact Memories: Long-Context Speculative Decoding with Compressed KV Cache

强草稿需要紧凑记忆:带压缩KV缓存的长上下文推测解码

Tong Yuan, Chengxi Liao, Zeyi Wen

机构 * Data Science and Analytics Thrust, Information Hub(数据科学与分析方向、信息枢纽) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 本文提出记忆增强草稿技术,为长上下文推测解码配备压缩KV记忆,可降低70%以上草稿侧内存,使Llama~3.1-8B和70B模型分别实现最高2.08倍、3.33倍解码加速,同时保持推测解码的无损保证。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30091 2026-09-01 cs.AI 新提交 57%

VERA: Authority-Preserving Edge Revocation for Federated AI-Agent Workflows

VERA:联邦AI智能体工作流中保留权限的边撤销机制

Lifei Liu, Haoran Yu, Xiaochong Jiang

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 针对联邦AI智能体工作流的权限一致性问题,提出VERA可验证边撤销机制,解决树级联过度撤销与部署者级联欠撤销问题,在LangGraph等框架中验证了其有效性与模式可移植性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28931 2026-09-01 cs.IR cs.LG 新提交 57%

MERIT: Mitigating Exposure Bias in Generative XMC for User-Interest Propensity Modeling

MERIT:缓解生成式极端多标签分类(XMC)中用户兴趣倾向建模的曝光偏差

Abhinav Mahajan, Arindam Sarkar, Prakash Mandayam Comar

专题命中 测试时计算 :self-correction(abstract);分类 cs.LG

AI总结 针对电商用户兴趣匹配的曝光偏差问题,提出MERIT框架,通过自校正目标缓解偏差,在25万+兴趣类数据集上提升召回率等指标,生产中用户转化率提升0.26%。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28726 2026-09-01 cs.AI 新提交 57%

Pro-Router: Token-Aware Progressive Model Routing with Adaptive Edge-Cloud Collaboration for Efficient Multimodal LLM Inference

Pro-Router:面向高效多模态大语言模型推理的、具备自适应边云协作的令牌感知渐进式模型路由方法

Xinyuan Gui, Shaowen Wang, Sheng Sun, Zijian Wang, Zishu Yu, Zheming Yang

机构 * Anyscale(安尼斯科尔公司) Mississippi State University(密西西比州立大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院产业人工智能研究院)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 针对多模态大语言模型推理开销大的问题,提出具备自适应边云协作的Pro-Router方法,通过两阶段渐进式决策机制提升路由准确率与速度,端到端吞吐量显著优于现有方案。

Comments 9 pages, 7 figures, 2 tables. Code: https://github.com/xinyuangui2/pro-router

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27955 2026-09-01 cs.PL cs.CL 版本更新 57%

Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents

技能即伪代码:将技能库重构为面向LLM智能体的伪代码

Xinze Li, Yuhang Zang, Yixin Cao, Aixin Sun

机构 * Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 提出Skill-as-Pseudocode (SaP)方法,自动将Markdown技能库转换为带类型伪代码,通过确定性质量检查解决LLM智能体在检索技能时产生的混淆循环问题,在ALFWorld任务上显著优于基线。

Comments EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27186 2026-09-01 cs.CL 版本更新 57%

MAIGO: Mitigating Lost-in-Conversation with History-Cleaned On-Policy Self-Distillation

MAIGO: 通过历史清理的在线策略自蒸馏缓解对话丢失

Haoyu Zheng, Yun Zhu, Shu Yuan, Shangming Chen, Qing Wang, Wenqiao Zhang, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) Fuzhou University(福州大学) Tencent(腾讯)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 针对大语言模型在多轮对话中性能下降(对话丢失)的问题,提出MAIGO方法,通过在线策略自蒸馏和清理历史助手回复来减少自污染,无需验证器或推理时辅助,显著提升多轮对话准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23443 2026-09-01 cs.CL 版本更新 57%

Revisiting Greedy Decoding for Visual Question Answering: A Calibration Perspective

重新审视视觉问答中的贪婪解码:一种校准视角

Boqi Chen, Xudong Liu, Yunke Ao, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) University of Toronto(多伦多大学) MBZUAI(穆桑比克人工智能研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 针对视觉问答任务,从校准角度理论证明贪婪解码优于随机采样,并提出适用于推理模型的贪婪解码方法,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04865 2026-09-01 cs.LG cs.PL 版本更新 57%

Agnostics: Learning to Code in Any Programming Language via Reinforcement with a Universal Learning Environment

Agnostics: 通过通用学习环境的强化学习实现任何编程语言的代码学习

Aleksander Boruch-Gruszecki, Yangtian Zi, Zixuan Wu, Tejas Oberoi, Carolyn Jane Anderson, Joydeep Biswas, Arjun Guha

机构 * Northeastern University(东北大学) University of Texas(德克萨斯大学) Wellesley College(韦尔斯利学院)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 Agnostics通过通用学习环境的强化学习,实现任何编程语言的代码学习,提升低资源语言模型性能并简化训练流程。

Comments 30 pages, 19 figures. Accepted at ICLR 2026. For data, code, artifacts, see https://agnostics.abgru.me

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13551 2026-09-01 cs.CL 版本更新 57%

Small Reward Models via Backward Inference

通过反向推理的小奖励模型

Yike Wang, Faeze Brahman, Shangbin Feng, Teng Xiao, Hannaneh Hajishirzi, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 FLIP通过反向推理实现无需参考和评分标准的奖励建模,在多个领域中显著提升性能并增强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30387 2026-09-01 cs.CR 新提交 50%

Attesting Outputs and Delegation Ancestry in Multi-Agent AI Systems

多智能体AI系统中的输出证明与委托谱系

Lifei Liu, Haoran Yu

专题命中 测试时计算 :verifier(abstract)

AI总结 该研究针对多智能体AI系统的输出与委托谱系验证问题,提出两层证明设计,对比三种方案,经测试其验证效率满足多服务部署需求,可解决跨部署者的授权与溯源难题。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 复杂问题求解 30 篇

2608.29623 2026-09-01 cs.CL cs.AI 新提交 91%

MI-Distillation: Selecting from Model-Interpolated Instruct-Reasoning Data Spectrum for Chain-of-Thought Distillation

MI-Distillation:从模型插值的指令推理数据频谱中选择以进行思维链蒸馏

Yangsong Lan, Renkai Hu, HongKai Zheng, Bo Zhang, Renzhi Wang, Hongliang Dai, Piji Li

机构 * The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education(教育部脑机智能技术重点实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究提出MI-Distillation框架,通过模型插值构建指令推理数据频谱,引入SeqLSS选择合适轨迹,在推理基准上显著提升了小模型的思维链蒸馏效果。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16782 2026-09-01 cs.CL 版本更新 90%

Reasoning Beyond Language: A Comprehensive Survey on Latent Chain-of-Thought Reasoning

超越语言的推理:潜在思维链推理综合综述

Xinghao Chen, Anhao Zhao, Heming Xia, Xuan Lu, Hanlin Wang, Yanjun Chen, Wei Zhang, Jian Wang, Wenjie Li, Xiaoyu Shen

机构 * Department of Computing, The Hong Kong Polytechnic University(计算机系,香港理工大学) Ningbo Digital Twin Institute, Eastern Institute of Technology(宁波数字孪生研究院,东部技术研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 本文综述潜在思维链推理这一新兴LLM推理范式,建立系统分类,分析其方法、设计原则、应用与挑战,为该领域发展提供结构化基础。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28008 2026-09-01 cs.AI cs.LG 版本更新 90%

Zipping the Thought: When and How Compressed Reasoning Data Works in LLM Post-Training

压缩思维:压缩推理数据在LLM后训练中何时以及如何发挥作用

Kohsei Matsutani, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 复杂问题求解 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文通过分类显式、组合和隐式思维链,在合成组合推理任务上实验,发现粗粒度CoT需要更多SFT数据,组合和隐式CoT从数据缩放中获益更多但隐式CoT易导致记忆,后续RLVR会分解压缩步骤,且单向CoT顺序在长序列任务上泛化更强。

Comments Findings of EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11573 2026-09-01 cs.CL cs.AI 版本更新 88%

Reinforcing Step-level Reasoning for Effective Self-Correction in LLMs

强化步骤级推理以实现大语言模型的有效自校正

Vu Duc Anh, Nhat M. Hoang, Do Xuan Long, Cong-Duy Nguyen, Ponhvoan Srey, Luu Anh Tuan

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) VinUniversity Institute for Infocomm Research (IR), A*STAR(新加坡科技研究局信息通信研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型自校正的核心挑战,提出SFS-DPO及教师辅助变体SFS-DPO-R框架,经多模型多域评估,其性能优于现有步骤级训练基线,可提升自校正频率与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23172 2026-09-01 cs.CL cs.CV 版本更新 85%

CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension

CaRGo-T:因果推理思维图提升多模态幽默理解能力

Abhilash Nandy, Rahul Seetharaman, Aman Bansal, Rounak Saha, Manav Nitin Kapadnis, Millon Madhur Das, Pawan Goyal, Niloy Ganguly

机构 * Microsoft Research India(微软研究院印度分部) LinkedIn(领英公司) Nutanix(Nutanix公司) Indian Institute of Science(印度科学学院) Apple(苹果公司) Fujitsu Research India(富士通印度研究院) Indian Institute of Technology Kharagpur(印度克勒格布尔印度理工学院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究提出CaRGo-T因果推理思维图框架,在四类含讽刺等喜剧内容的数据集上,提升VLMs的幽默理解与检测性能,相关代码已公开。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14602 2026-09-01 cs.CL cs.AI cs.LG 版本更新 85%

PA3: Policy-Aware Agent Alignment through Chain-of-Thought

PA3: 通过链式推理实现政策感知的智能体对齐

Shubhashis Roy Dipta, Daniel Bis, Kun Zhou, Lichao Wang, Benjamin Z. Yao, Chenlei Guo, Ruhi Sarikaya

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) Amazon Alexa AI(亚马逊Alexa AI)

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种多阶段对齐方法,通过链式推理让模型在推理时回忆并应用相关业务政策,无需在上下文中包含完整政策,同时引入PolicyRecall奖励和hallucination惩罚,提升性能并减少字数。

Comments Accepted to EMNLP 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07518 2026-09-01 cs.CL 版本更新 83%

Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs

分解、观察与推理:用于视觉语言模型的强化潜在推理

Mengdan Zhu, Senhao Cheng, Liang Zhao

机构 * Emory University(埃默里大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出DLR框架,通过动态分解查询、提取连续视觉潜在表示和基于 grounded rationales 推理,提升视觉语言模型在复杂视觉推理中的表现,实验表明其优于现有基线方法。

Comments Accepted to the EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31082 2026-09-01 cs.AI cs.CL cs.DB 新提交 81%

Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data

通过非结构化数据的自适应结构化实现 token 高效的数据推理智能体

Milad Rezaei Hajidehi, Qitong Wang, Stratos Idreos

机构 * Harvard University(哈佛大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出智能体数据拆解方法,通过自适应推测性结构化非结构化数据,降低 LLM 智能体推理成本,在 FanOutQA 基准上实现 53% 的成本削减且保持准确率,为智能体推理数据基础设施提供了初步方案。

Comments 7 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22479 2026-09-01 cs.CL cs.LG 版本更新 81%

GTA-RAG: Graph-Trajectory-Augmented Reinforcement Learning for Multi-Turn Retrieval-Augmented Reasoning

GTA-RAG:用于多轮检索增强推理的图轨迹增强强化学习

Jun Chen, Yongchao Liu, Pengyu Qiu, Jiajun Zheng, Juelu Zhang, Yujie Zeng, Qin Zhang, Ziyue Qiao, Xiao Luo

机构 * Shenzhen University(深圳大学) Great Bay University(大湾区大学) Ant Group(蚂蚁集团)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 GTA-RAG是一种图轨迹增强强化学习框架,通过轨迹级监督优化检索策略,在多跳和简单问答基准上,相比RL-based RAG基线提升了性能与证据链覆盖率。

Comments 12 pages, 5 figures. Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30250 2026-09-01 cs.AI 新提交 79%

Generating Workflow DAGs from Natural Language with Non-Reasoning LLMs

用非推理型大语言模型从自然语言生成工作流有向无环图(DAG)

Anand Iyer, Bhanu Khetharpal, Srinivas Upadhya, Ramkumar Rajagopal

机构 * Microsoft(微软公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文针对企业联络中心自然语言路由转工作流DAG问题,用神经符号分解结合确定性编译器,提升非推理LLM生成质量,在GPT-5.3-chat上与推理模型质量统计等价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29622 2026-09-01 cs.MA cs.AI 新提交 79%

AgenticRag-R1: Agentic Reinforcement Learning with Stack Memory for Multi-Step Reasoning, Retrieval and Memorizing

AgenticRag-R1:用于多步推理、检索与记忆的带栈式记忆的智能体强化学习

Xinke Jiang, Yue Fang, Zhibang Yang, Jiaran Gao, Zhixin Zhang, Tao Feng, Rihong Qiu, Wentao Zhang, Hongxin Ding, Ruizhe Zhang, Yongxin Xu, Yuheng Huang, Xu Chu, Junfeng Zhao, Yasha Wang

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 针对现有智能体RAG方法的奖励分配弱、偏向短程推理等问题,提出AgenticRag-R1框架,通过记忆栈等实现长程学习,在多类基准上性能优于强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31378 2026-09-01 cs.CL 版本更新 79%

Unlocking Fine-Grained Translation Quality Estimation in LRMs through Mutually Boosting Implicit and Explicit Reasoning

解锁大型推理模型中细粒度翻译质量评估:通过协同演化隐式和显式推理

Renfei Dang, Xinye Wang, Zhejian Lai, Weilu Xu, Shimin Tao, Daimeng Wei, Min Zhang, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Huawei Translation Services Center, Beijing, China(北京华为翻译服务中心)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 针对大型推理模型在细粒度翻译质量评估上的困难,提出RIEQE两阶段训练框架,通过非思考监督微调(隐式推理)和思考强化学习(显式推理)协同演化,在WMT测试集上超越基线。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏