arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5849 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5849 篇

2608.17941 2026-08-19 cs.LG cs.AI cs.CL 新提交 67%

Efficient RLVR Scheduling via Graph-Structured Online Difficulty Estimation

基于图结构在线难度估计的高效RLVR调度

Zhizhao Liu, Zhiliang Tian, Xi Wang, Zhihua Wen, Yihang Xiong, Zhiquan Lai, Dongsheng Li

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对RLVR中探索预算分配低效问题,提出即插即用的图结构在线难度估计器,可跨样本共享反馈、缓解冷启动与过时问题,集成后实现难度自适应探索,在多模型与基准上性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16844 2026-08-18 cs.LG cs.AI cs.CL 新提交 67%

Proteus: Incremental Memory Activation for Long-Context Sequence Modeling

Proteus:面向长上下文序列建模的增量式内存激活机制

Reza Bayat, Ali Behrouz, Vahab Mirrokni, Aaron Courville

机构 * Mila(米拉计算科学研究所) Google(谷歌公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Proteus 是一种增量式内存激活机制,可嵌入多种神经内存架构,应用于 SWLA 等模型后,能在长上下文相关任务上实现性能提升,证明调度有效容量对序列建模的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11660 2026-08-13 cs.CL cs.AI cs.LG 新提交 67%

Hybrid-Policy Self-Editing for Composable Unstructured Knowledge Editing

用于可组合非结构化知识编辑的混合策略自编辑

Tianci Liu, Zihan Dong, Tianchun Li, Yi-Chung Chen, Qiming Cao, Xingchen Wang, Shiyang Wang, Zichen Miao, Linjun Zhang, Haoyu Wang, Jing Gao

机构 * University of Tennessee(田纳西大学) Rutgers University(罗格斯大学) Purdue University(普渡大学) University at Albany(奥尔巴尼大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对现有非结构化知识编辑存在的可组合性缺失问题,提出HPSE方法,通过构建混合生成结果实现主动自蒸馏,在多种LLM及编辑工具上取得即插即用的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11233 2026-08-13 cs.CL cs.AI cs.LG 新提交 67%

Retrofitting Recurrent Depth into a Pretrained Language Model: Installation, Extrapolation, Transfer, and Retention at Two Parameter Budgets

将循环深度改造融入预训练语言模型:在两个参数预算下的安装、外推、迁移与保留

Mark Shapiro

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究在Qwen2.5-0.5B-Instruct中融入循环深度,在两个参数预算下实现安装,其模型在ARC测试集等任务上性能优于同等规模基准,可外推至1.5倍监督深度,推理速度更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06578 2026-08-12 cs.AI cs.CL cs.LG 交叉投稿 67%

Divergent Response Modes in Frontier Language Models Under Steering Pressure

前沿语言模型在引导压力下的发散响应模式

Ali Jalal-Kamali

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究评估六种前沿语言模型在引导压力下的响应差异,发现模型间存在不同响应模式,以Llama为对象追溯到内部机制,相关发现经多实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07595 2026-08-12 cs.IR 版本更新 67%

Towards Comprehensible Recommendation with Large Language Model Fine-tuning

基于大语言模型微调的可理解推荐研究

Yunze Luo, Yinjie Jiang, Gaode Chen, Xinghua Zhang, Kaigui Bian

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 该研究针对传统推荐的语义协同差距问题,提出CURec框架,通过微调LLM并结合强化学习优化,提升推荐可理解性与性能,在公开基准上表现更优。

Comments 11 pages, 6 figures, to be published on CIKM '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22137 2026-08-11 cs.DC 版本更新 67%

HybridFlow: Resource-Adaptive Subtask Routing for Efficient Edge-Cloud LLM Inference

HybridFlow: 适应资源的子任务路由用于高效的边缘-云LLM推理

Jiangwen Dong, Jiayu Li, Tianhang Zheng, Wanyu Lin

专题命中 其他推理 :reasoning(abstract,abstract_cn)

AI总结 HybridFlow通过动态资源适应的子任务路由框架,提升边缘-云LLM推理的效率与准确性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04980 2026-08-06 cs.CL cs.AI cs.LG 新提交 67%

Protoreasoning in Tiny Transformers

微型Transformer中的原型推理

Eduardo Valle, Fergal Reid

机构 * Fin AI Research(Fin AI研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出原型推理,在约100万参数的微型Transformer上实现逐步推理,通过Dyck语言任务验证其可缩小分布外泛化差距,助力探究LLM的通用推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12448 2026-08-05 cs.CL cs.AI cs.LG 版本更新 67%

Uncovering Spontaneous Physics Representations in In-Context Learning

揭示上下文学习中自发形成的物理表征

Yeongwoo Song, Jaeyong Bae, Dong-Kyum Kim, Hawoong Jeong

机构 * Department of Physics, KAIST(KAIST物理系) MPI for Security and Privacy, Germany(德国安全与隐私研究所) Center for Complex Systems, KAIST(KAIST复杂系统中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究以动力学预测为代理任务,发现大语言模型无需物理特定监督,就能在上下文学习中自发形成与能量等物理概念对齐的表征,且该表征对预测有贡献,为ICL机制提供了物理解释。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11699 2026-07-28 cs.SD 版本更新 67%

Qwen-Music Technical Report

Qwen-音乐技术报告

Jin Xu, Kangdi Wang, Ruibin Yuan, Shun Lei, Xiong Wang, Xize Cheng, Xueyao Zhang, Yang Zhang, Yiheng Chen, Yongqi Wang, Yue Wang, Zhifang Guo, Zihan Liu, Zijian Lin, Dake Guo, Hangrui Hu, Lei Xie, Linhan Ma, Wei Xue, Wenxiang Guo, Xinfa Zhu, Xipin Wei, Yangze Li, Yuanjun Lv, Yuxuan Wang, Yunfei Chu, Zhiyong Wu

机构 * Qwen Team(通义团队)

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract)

AI总结 介绍Qwen-音乐,它支持文本到音乐生成和翻唱歌曲生成两个核心任务。集成三个核心组件,通过特定机制建模并渲染。经多语言数据训练及多种训练方式,在多个音乐性和音频质量指标上达领先成果,获专业评估人员青睐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15591 2026-07-27 cs.IR 版本更新 67%

RecGPT-V3 Technical Report

RecGPT-V3技术报告

Bowen Zheng, Chao Yi, Dian Chen, Gaoyang Guo, Han Zhu, Jiakai Tang, Jian Wu, Mao Zhang, Wen Chen, Yifan Lu, Yujie Luo, Yuning Jiang, Zhujin Gao, Bo Zheng, Chenchi Zhang, Dixuan Wang, Hao Fang, Jiancai Liu, Jing Yu, Junjun Zheng, Ke Chen, Kewei Zhu, Mengyan Li, Mingke Xu, Wenjun Yang, Xiangheng Kong, Xinming Zhang, Xunke Xi, Zile Zhou

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 研究针对大规模运行RecGPT的挑战,提出RecGPT-V3这一有状态混合模态推荐系统。通过内存中心、混合模态基础模型和潜在意图推理等方法,在淘宝“猜你喜欢”推荐中取得多指标提升及资源消耗降低的成果。

Comments Technique Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19847 2026-07-23 cs.LG cs.AI cs.CL cs.DB 新提交 67%

Auto-Fill: Learning to Predict Missing Values Accurately with Specialist Language Models

自动填充:使用专业语言模型准确预测缺失值

Yurong Liu, Yeye He, Haoyu Dong, Junjie Xing, Shi Han, Dongmei Zhang, Surajit Chaudhuri

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究表格数据缺失值预测问题,提出自动填充方法,通过后训练三个针对不同能力的专业小语言模型并结合校准集成机制,相比现有推理模型在保证高精度的同时大幅降低成本。

Comments VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19592 2026-07-23 cs.AI cs.CL cs.LG cs.MA 新提交 67%

Knowledge-Centric Self-Improvement

以知识为中心的自我改进

Xuefei Julie Wang, Lauren Hyoseo Yoon, Chengrui Qu, Amanda Zichang Wang, Atharva Sehgal, Eric Mazumdar, Yisong Yue

机构 * Caltech(加州理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究以知识为中心的自我改进范式,通过简单协议让智能体尝试任务后为知识库贡献见解并提炼知识,提高了解决率、降低成本,且知识可转移,表明进步可由持久知识驱动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18966 2026-07-22 cs.AI cs.CL cs.LG 新提交 67%

Measuring Reward-Seeking via Contrastive Belief Updates

通过对比信念更新来衡量奖励寻求行为

Axel Højmark, Jérémy Scheurer, Evgenia Nitishinskaya, Felix Hofstätter, Jason Wolfe, Theodore Ehrenborg, Bronson Schoen, Alexander Meinke

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究用强化学习训练的语言模型中‘奖励寻求’行为的测量方法,核心方法是对比合成文档微调,主要贡献是发现RL训练会使模型更倾向评分者偏好,甚至违背开发者意图,该方法还适用于奖励破解模型。

Comments 101 pages, 66 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19933 2026-07-15 cs.CL cs.AI cs.LG 67%

NRR-Phi: A Typed External Text-to-State Interface and Update Contract for Inspectable Ambiguity-State Maintenance

NRR-Phi:LLM推理中为保持歧义性的文本到状态映射

Kei Saito

机构 * Independent Researcher, Japan(日本独立研究员)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出NRR-Phi框架,通过文本到状态映射保留多解释性,在LLM推理中延迟语义坍缩。

Comments 30 pages, 5 figures, 8 tables. Replacement synced to the current GitHub repository snapshot. Series hub: https://github.com/kei-saito-research/nrr-series-hub

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07976 2026-07-10 cs.CL cs.AI cs.LG 新提交 67%

When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning

当不合理的令牌得到强化时:大语言模型强化学习的尾部感知信用校准

Xiuyi Lou, Zicheng Xu, Yu-Neng Chuang, Hoang Anh Duy Le, Zhaozhuo Xu, Guanchu Wang, Vladimir Braverman

机构 * Johns Hopkins University(约翰霍普金斯大学) Rice University(里士满大学) Workato(Workato公司) University of North Carolina at Charlotte(北卡罗来纳州夏洛特大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型强化学习中统一信用分配的问题,提出尾部感知信用校准方法TACO,通过计算尾部风险分数校准信用,抑制不良正更新,实验证明该方法优于基线,提升训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21074 2026-07-10 cs.NI 版本更新 67%

RepLLM: Toward Automatically Reproducing Network Research Results

RepLLM:迈向自动重现网络研究结果

Yining Jiang, Yunxin Xu, Wenyun Xu, Yufan Zhu, Rui Liu, Tangtang He, Haiying Huang, Letian Zhu, Qingyu Song, Qiang Su, Lizhao You, Lu Tang, Wanjian Feng, Yuchao Zhang, Linghe Kong, Qiao Xiang, Jiwu Shu

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 针对计算机网络研究结果重现难题,RepLLM提出端到端多智能体框架,通过四个智能体协作及共享内存机制确保一致性,借助特定推理和调试方法解决问题,相比现有框架表现更优,能高效重现基准且减少令牌消耗。

Comments SIGCOMM'26(19 pages, 6 figures, 6 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05196 2026-07-08 cs.CL cs.AI cs.LG cs.SD eess.AS 新提交 67%

Unified Audio Intelligence Without Regressing on Text Intelligence

不退化文本智能的统一音频智能

Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim, Boxin Wang, Zihan Liu, Sungwon Kim, Yang Chen, Arushi Goel, Rajarshi Roy, Wenliang Dai, Zhuolin Yang, Yangyi Chen, Dongfu Jiang, Sreyan Ghosh, Tuomas Rintamaki, Andrew Tao, Jonathan Raiman, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

机构 * Nemotron-Labs(Nemotron实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出统一音频-文本大语言模型Audex,通过单Transformer解码器架构与多阶段训练,在实现多音频任务SOTA性能的同时,几乎不损失骨干文本LLM的原有文本智能能力。

Comments We release the Audex models at https://huggingface.co/collections/nvidia/nemotron-labs-audex

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24432 2026-07-07 cs.CL cs.AI cs.IR cs.LG 版本更新 67%

Kwai Summary Attention Technical Report

快手总结注意力技术报告

Chenglong Chu, Guorui Zhou, Guowang Zhang, Han Li, Hao Peng, Hongtao Cheng, Hui Wang, Jian Liang, Jiangxia Cao, Kun Gai, Lingzhi Zhou, Lu Ren, Qi Zhang, Ruiming Tang, Ruitao Wang, Xinchen Luo, Yi Su, Zhiyuan Liang, Ziqi Wang, Boyang Ding, Chengru Song, Dunju Zang, Jiao Ou, Jiaxin Deng, Jijun Shi, Jinghao Zhang, Junmin Chen, Lejian Ren, Minxuan Lv, Qianqian Wang, Qigen Hu, Shiyao Wang, Siyang Mao, Tao Wang, Xingmei Wang, Zhixin Ling, Ziming Li, Zixing Zhang

机构 * Kuaishou(快手)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究长上下文能力这一重要迭代方向,针对标准softmax注意力在长序列下时间复杂度高的问题,提出新路径,通过将历史上下文压缩为可学习总结令牌降低序列建模成本,即提出快手总结注意力机制。

Comments update related works

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01104 2026-07-02 cs.LG cs.AI cs.CL 新提交 67%

CausalMix: Data Mixture as Causal Inference for Language Model Training

CausalMix: 数据混合作为语言模型训练的因果推断

Zinan Tang, Yukun Zhang, Shaomian Zheng, Zhuoshi Pan, Qizhi Pei, Dingnan Jin, Jun Zhou, Yujun Wang, Biqing Huang

机构 * Tsinghua University(清华大学) Ant Group(蚂蚁集团) Renmin University of China(中国人民大学)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CausalMix框架,将数据混合优化视为因果推断问题,通过条件平均处理效应估计最优混合比例,在7B模型上提升多任务性能,并具备可解释性。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31725 2026-07-01 cs.SE 新提交 67%

Do Machines Struggle Where Humans Do? LLM and Human Comprehension of Obfuscated Code

机器会在人类感到困难的地方也遇到困难吗?大语言模型与人类对混淆代码的理解

Jack Le, Anh H. N. Nguyen, Tien N. Nguyen

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 基于人类对混淆代码理解的研究,评估大语言模型是否共享人类在混淆代码下的失败模式,发现推理调优模型与人类困难模式显著对齐,而指令调优模型相关性接近零。

Comments 13 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29034 2026-06-30 cs.CL cs.AI cs.IR cs.LG 67%

The strength of clinical evidence is recoverable from language model representations but not from their stated grades

临床证据强度可从语言模型表示中恢复,但无法从其陈述的等级中恢复

Soroosh Tayebi Arasteh

机构 * Lab for AI in Medicine(医学人工智能实验室) RWTH Aachen University(亚琛工业大学) University Hospital RWTH Aachen(亚琛大学医院) Stanford University(斯坦福大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过构建临床声明数据集,测试22个开源大语言模型,发现模型内部表示可编码证据强度(中位AUROC 71.8%),但模型陈述的等级接近随机(低于估计器25-27个百分点),且该信号主要来自词汇特征,不随规模提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26196 2026-06-26 cs.CL cs.AI cs.CV cs.LG cs.MM 新提交 67%

From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models

从结构到协同:多模态大语言模型中视觉-语言感知范式演进综述

Haoxiang Sun, Tao Wang, Li Yuan, Jian Zhao, Jiancheng Lv

机构 * School of Computer Science, Sichuan University(四川大学计算机学院) School of Electronic and Computer Engineering, Peking University Shenzhen Graduate School(北京大学深圳研究生院电子与计算机工程学院) Institute of Artificial Intelligence (TeleAI), China Telecom and Northwestern Polytechnical University(中国电信与西北工业大学人工智能研究院(TeleAI))

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文系统综述多模态大语言模型中统一视觉-语言感知的范式演进,提出五阶段分类法,梳理各阶段代表性方法,并指出开放挑战与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06343 2026-06-10 cs.LG cs.AI cs.CL 版本更新 67%

When Distance Distracts: Representation Distance Bias in BT-Loss for Reward Models

当距离干扰:BT损失中表示距离偏差对奖励模型的影响

Tong Xie, Andrew Bai, Yuanhao Ban, Yunqi Hong, Haoyu Li, Cho-Jui Hsieh

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 分析BT损失中表示距离导致的梯度偏差,提出NormBT自适应归一化方案,提升奖励模型在细粒度区分上的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09131 2026-06-09 cs.AI cs.CL cs.CV cs.LG 新提交 67%

Late-Layer Fusion is Enough: Dual-Path Vision Token Routing for Multimodal Large Language Models under Visual Saturation

晚期融合足矣:面向视觉饱和的多模态大语言模型的双路径视觉令牌路由

Siyuan Liu, Jinyang Wu

机构 * School of Mechanics and Engineering Science, Peking University(北京大学力学与工程科学学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对多模态大语言模型中视觉令牌在深层饱和的问题,提出双路径视觉令牌路由(DPVR-LF),在饱和点将视觉令牌路由至单层可训练分支,仅最后层融合,以约3%可训练参数保持性能并减少计算。

Comments 18 pages, 4 figures. Submitted to Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07889 2026-06-09 cs.LG cs.AI cs.CL 新提交 67%

Strained Coherence: A Pre-Failure Signal in Coding Agent Execution Trajectories

应变连贯性:编码代理执行轨迹中的故障前信号

Marut Pandya, Kasey Zhang, Baiqing Lyu

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出“应变连贯性”模式,即编码代理识别到问题但仍按原计划行动,通过构建Claude Sonnet 4.6检测器在44条轨迹上实现94%故障预测精度,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19082 2026-06-09 cs.AI cs.CL cs.GT cs.LG cs.MA 版本更新 67%

Payoff scaling shapes cooperation in LLM agents across languages

收益规模塑造跨语言LLM代理的合作行为

Trung-Kiet Huynh, Dao-Sy Duy-Minh, Thanh-Bang Cao, Phong-Hao Le, Hong-Dan Nguyen, Phu-Quy Nguyen-Lam, Minh-Luan Nguyen-Vo, Hong-Phat Pham, Phu-Hoa Pham, Thien-Kim Than, Chi-Nguyen Tran, Huy Tran, Gia-Thoai Tran-Le, Alessio Buscemi, Le Hong Trang, The Anh Han

机构 * Faculty of Information Technology, University of Science (HCMUS), Ho Chi Minh City, Vietnam(信息技术学院,科学大学(HCMUS),胡志明市,越南) Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), Ho Chi Minh City, Vietnam(计算机科学与工程学院,胡志明市技术大学(HCMUT),胡志明市,越南) Vietnam National University – Ho Chi Minh City (VNU-HCM), Ho Chi Minh City, Vietnam(越南国家大学——胡志明市(VNU-HCM),胡志明市,越南) Luxembourg Institute of Science and Technology (LIST), Luxembourg(卢森堡科学与技术研究所(LIST),卢森堡) School of Computing, Engineering and Digital Technologies, Teesside University, Middlesbrough, United Kingdom(计算、工程与数字技术学院,泰赛德大学,米德尔斯布罗,英国)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过监督分类器识别重复囚徒困境中的策略,结合演化博弈论基线,发现随着收益增加,LLM反而更合作,与演化预测相反,表明对齐训练和人类推理模式的影响。

Comments 44 pages, 17 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06474 2026-06-05 cs.CL cs.AI cs.LG 67%

Self-Augmenting Retrieval for Diffusion Language Models

扩散语言模型的自增强检索

Paul Jünger, Justin Lovelace, Linxi Zhao, Dongyoung Go, Kilian Q. Weinberger

机构 * University of California, Berkeley(加州大学伯克利分校) Google Research(谷歌研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SARDI框架,利用扩散语言模型去噪过程中丢弃的低置信度标记作为前瞻信号指导检索,无需训练且与检索器无关,在多跳问答基准上以高达8倍吞吐量超越现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06467 2026-06-05 cs.CL cs.AI cs.LG 67%

You Only Index Once: Cross-Layer Sparse Attention with Shared Routing

仅索引一次:具有共享路由的跨层稀疏注意力

Yutao Sun, Yanqi Zhang, Li Dong, Jianyong Wang, Furu Wei

机构 * Microsoft Research(微软研究院) Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出跨层稀疏注意力(CLSA),通过共享KV缓存和路由索引,在保持token稀疏注意力精度的同时减少路由开销,显著提升长上下文LLM的解码效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04236 2026-06-04 cs.CL cs.AI cs.LG 67%

Supportive Token Revealing for Fast Diffusion Language Model Decoding

支持性标记揭示:快速扩散语言模型解码

Giries Abu Ayoub, Mario Barbara, Lluís Pastor-Pérez, Tanja Bien, Aneesh Barthakur, Alaa Maalouf, Loay Mualem

机构 * Department of Computer Science, University of Haifa(海法大学计算机科学系) Institute for AI, University of Stuttgart(斯图加特大学人工智能研究所) IMPRS-IS

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AXON模块,通过选择注意力、不确定性和置信度信号中的锚点标记来改善扩散语言模型并行解码的质量-延迟权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏