LLM Capability Limits: Static Emergence and Dynamic Boundary Control
涌现不变性:从符号化思维到结构控制
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 该研究形式化了语言为核心的智能的限制,提出动态边界控制框架,通过DeepSeek V4-Flash实验验证其可提升大语言模型的推理性能,组织了大语言模型的涌现限制。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
涌现不变性:从符号化思维到结构控制
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 该研究形式化了语言为核心的智能的限制,提出动态边界控制框架,通过DeepSeek V4-Flash实验验证其可提升大语言模型的推理性能,组织了大语言模型的涌现限制。
从序列到结构:面向大语言模型智能体的关系型不确定性传播
机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究针对现有LLM智能体不确定性量化方法忽略长程依赖的问题,提出RUPA框架,通过建模轨迹图的关系依赖传播不确定性,在多个基准上实现更优性能。
Bactrainus:为多跳复杂问答任务优化大型语言模型
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究针对多跳问答的证据瓶颈,提出模块化选择器-阅读器框架Bactrainus,经实验验证其在HotpotQA任务中表现优异,为该领域提供了可审计的证据接口方案。
能源盲点:NVIDIA 旗舰边缘 AI 硬件无法支持进程级能源归因
机构 * Independent Researcher(独立研究者) ; Texas A&M University(德克萨斯农工大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文审计了 ASUS Ascent GX10 (GB10 SoC) 平台的能源可观测性,发现其缺乏 CPU 能源计数器等关键接口,导致无法像 x86 的 RAPL 那样进行进程级能源归因,并提出通过外部直流计量和 GPU 减法进行校准的临时方案,呼吁将能源可观测性作为硬件的一等要求。
Comments 5 pages, 0 figures. Accepted at the 2nd International Workshop on Low Carbon Computing (LOCO 2026), Lancaster University, United Kingdom, 10-11 September 2026. Part of the LOCO 2026 proceedings, arXiv:2608.02072
LORA-CRAFT:通过冻结预训练注意力权重的跨层秩适应进行Tucker分解
机构 * University of Central Florida(中央佛罗里达大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 LORA-CRAFT通过冻结预训练注意力权重的Tucker分解实现跨层秩适应,以轻量级可训练变换调整模型,在GLUE基准测试中达到与现有方法相当的性能,仅需41K参数。
学习面向延迟的并行多智能体系统编排
机构 * University of Central Florida(中央佛罗里达大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出LAMaS框架,通过显式优化关键路径降低多智能体系统并行执行的延迟,提升效率和性能。
Comments Preprint. Previously this version appeared as arXiv:2607.13359 which was submitted as a new work by accident
VDC-Agent:当视频详细描述器通过代理自我反思而自我进化
机构 * Xi’an Jiaotong University(西安交通大学) ; Kuaishou Technology(快手科技) ; Shenzhen University of Advanced Technology(深圳先进技术大学)
专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 VDC-Agent通过自我反思机制实现视频详细描述的自我进化,利用自动生成的(描述,评分)对提升描述准确性与评分表现。
Comments Accepted to ECCV 2026. Project Page: https://vdcagent.github.io
DRIFT: 基于难度路由的自我蒸馏与节奏门控探索及成功缓冲训练
机构 * Tsinghua University(清华大学) ; ENS Paris-Saclay(巴黎-萨克雷大学) ; Beike Language and Intelligence(贝克语言与智能)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出DRIFT框架,通过难度路由和节奏门控动态分配自蒸馏与强化学习信号,结合成功缓冲和两阶段课程学习,提升大模型在复杂推理任务中的自我进化稳定性,在五个基准上平均得分79.5%,超越GRPO和SDPO。
LF²AR:考虑分层动态以改进语言模型的多模态适配
机构 * Université de Toulon, Aix-Marseille Université, CNRS, LIS, France(法国图卢兹大学、马赛大学、CNRS、LIS) ; Department of Engineering, University of Cambridge, UK(剑桥大学工程系) ; Mitsubishi Electric Research Laboratories (MERL), Cambridge, MA, USA(三菱电机研究实验室(MERL)) ; LIA, Avignon Université, France(法国阿维尼翁大学LIA) ; LIUM, Le Mans Université, France(法国勒芒大学LIUM) ; Zenidoc, Marseille, France(法国马赛Zenidoc)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出LF²AR架构,通过分层抽象-细化动态设计适配机制,在文本转图像、语音模态上提升语言模型性能,支持1.9倍生成加速。
Comments Published as a conference paper at COLM 2026
Kimi K3:开放前沿智能
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 介绍Kimi K3这一2.8T参数的专家混合模型,基于Kimi Delta Attention等构建,结合多种方法使缩放效率提升约2.5倍。经训练后在多领域强化学习表现出色,虽整体性能略逊最强专有模型,但在多项任务中达前沿水平且优于其他模型,还发布模型权重助力研究。
Comments K3 tech report
OpenForgeRL:在任何环境中训练原生利用工具的智能体
机构 * Columbia University(哥伦比亚大学) ; Dartmouth College(达特茅斯学院) ; Microsoft Research(微软研究院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究针对现代AI智能体依赖复杂推理工具难端到端训练的问题,提出OpenForgeRL框架,通过轻量级代理和Kubernetes编排器,在多环境下对基于工具的智能体端到端训练,验证了框架效果并分析了工具选择和RL对智能体行为的影响。
Comments added github link
SphUnc:通过信息几何的超球面不确定性分解与因果识别
机构 * University of Macau(澳门大学) ; Fudan University(复旦大学) ; Hangzhou Dianzi University(杭州电子科技大学) ; Renmin University of China(中国人民大学) ; Hanyang University(翰阳大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; University of Liverpool(利物浦大学) ; Southeast University(东南大学) ; Central South University(中南大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 SphUnc结合超球面表示学习与结构因果建模,通过信息几何融合分解不确定性为epistemic和aleatoric成分,并通过样本模拟实现因果识别,提升多智能体系统中的预测准确性和不确定性校准能力。
Comments 22 pages, 15 figures
用于延迟和模型大小优化的大语言模型多目标结构化剪枝
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型在边缘计算环境部署的挑战,提出硬件感知多目标结构化剪枝框架,分两阶段优化,粗粒度移除模块,细粒度搜索最优剪枝率,实验证明能降低模型复杂度,在多方面实现良好权衡,适合边缘部署。
Comments Submitted to the ICTAI 2026 (under review)
courtroom 风格多智能体辩论与渐进式 RAG 和角色切换用于争议性主张验证
机构 * Systems and Software Lab (SSL), Department of Computer Science and Engineering(系统与软件实验室(SSL),计算机科学与工程系)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出 PROClaim 框架,通过结构化对抗辩论和角色切换提升争议性主张验证的可靠性,实验显示其在 Check-COVID 数据集上准确率达 81.7%。
Comments Under review, 29 pages, 7 figures, 17 tables
ExperienceWeaver: 优化基于 LLM 的临床文本改进的小样本经验学习
机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 ExperienceWeaver 通过经验学习优化小样本下 LLM 的临床文本改进,通过提炼反馈知识提升模型修订能力。
人工矫正:为什么大语言模型过度使用一种古典修辞格,以及如何缓解这一问题
专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型过度使用矫正格修辞格的问题,基于模型与人类修辞风格差异及相关分类,提出用矫正格指数评分,通过测量发现校准错误,给出以LoRA适配器为中心的缓解技术、指令及适配器效果,强调校准到人类比率而非消除的重要性。
Comments 18 pages, 7 tables. v2: corrections to the classical sources (Quintilian, Cicero) and to several cited figures, and Appendix B corpus statistics aligned to the delivered dataset; measurements, results and conclusions unchanged. Data, code, and the trained LoRA adapter: https://federicoboggia.binatomy.com/pubblicazioni/
CHERRY: 具有循环表示收益的压缩层次专家
机构 * TeamSparta Inc.(TeamSparta公司)
专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.AI
AI总结 提出三种互补技术训练计算高效语言模型:选择性监督与每令牌效率、深度压缩与循环恢复、压缩专家融合,在CHERRY-1.8B韩语模型上验证,实现参数减少2.5倍且性能接近。
Comments 64pp, LaTeX. v2 rebuilds arXiv:2606.31796 into a full report: matched-compute discrimination/generation dissociation, recurrent-yield compression (48->6)+MoEE, pre-registered 1B->13.7B H-PRESERVE, sovereign Korean tokenizer (+9.2% vs Gemma-4), government HLE(Ko) column lead, cyber specialization. Recurrent compression cited by Loopie (arXiv:2607.16051). Tables incl.; v1 in history
WebCoach:具有跨会话记忆引导的自我进化网络代理
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Amazon(亚马逊)
专题命中 复杂问题求解 :planning(abstract);分类 cs.CL、cs.AI
AI总结 研究针对网页代理跨会话学习不足问题,提出WebCoach框架,通过三个关键组件赋予代理跨会话记忆,可长期规划与自我进化,在WebVoyager基准测试中提升了不同LLM backbone的代理性能。
Comments 18 pages
以学生为中心的蒸馏缩小了小型和大型语言模型之间的智能差距
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究旨在缩小大小语言模型智能差距,提出SCoRe框架,让学生生成训练轨迹,教师纠正最早错误,经微调与短视距强化学习,提升学生解决问题能力,在12个基准测试中,70亿参数学生模型缩小了与720亿参数教师模型的性能差距
Comments Accepted to ICML 2026. The title has been changed from "From Correction to Mastery: Reinforced Distillation of Large Language Model Agents" to "Student-Centered Distillation Narrows the Agentic Gap Between Small and Large LLMs"; the camera-ready version has been uploaded
减少复杂问答中的幻觉:使用基于简单图的检索增强生成(长版)
机构 * National Innovation Centre for Data(数据创新研究中心)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出一种轻量级图结构支持的检索增强生成系统,通过结合向量搜索和图查询工具,在复杂问答任务中将幻觉答案数量减半,并显著提升事实正确性的精确率和召回率。
Comments 25 pages; expanded limitations section, corrected typos throughout and missing values in appendix table 1
AEVAL:从轶事性到确定性的智能体技能工作流测试
机构 * nvidia(NVIDIA公司)
专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI、cs.LG
AI总结 研究针对智能体技能工作流测试缺乏确定性和可重复性的问题,提出AEVAL框架,通过执行器与评分器分离等方法,实现确定性、可重复的测试,给出分层修复建议,能将虚假通过率转换为可重复失败信号并记录修复过程。
Comments 8 pages, 1 figure, 1 table, accepted at the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems
LinguistAgent: 一个用于自动化语言标注的反思多模型平台
机构 * University of Birmingham(伯明翰大学)
专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 LinguistAgent通过反思多模型架构实现自动化语言标注,采用双代理工作流程模拟同行评审,支持多种标注范式并提供实时评估。
突破扩散语言模型的分解障碍
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 CoDD通过引入轻量级概率推理层,突破扩散语言模型的分解障碍,实现高效且连贯的生成性能。
在多专家编排中解耦内在重要性与涌现结构
机构 * Yardi School of Artificial Intelligence(亚里学校人工智能学院) ; Indian Institute of Technology Delhi(印度德里理工学院) ; Department of Electrical Engineering(电气工程系) ; DRDO Young Scientist Laboratory – Artificial Intelligence(DRDO年轻科学家实验室–人工智能) ; Defence Research and Development Organisation, India(印度国防研究与发展组织)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出INFORM方法,通过解耦专家交互结构、执行顺序和功能归因,揭示路由主导性不能反映功能必要性,稀疏路由专家可能具有结构关键性。
Comments Accepted by Transactions on Machine Learning Research (TMLR)
代理检索增强生成用于财务文档问答
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出FinAgent-RAG框架,通过迭代检索-推理循环和自我验证,提升金融文档问答的精度。引入对比金融检索器、程序化思维模块和自适应策略路由,实验表明在三个基准数据集上均取得显著效果,准确率提升5.62-9.32个百分点。
Comments This paper is withdrawn due to significant methodological errors in the experimental design that fundamentally affect the validity of the results. The errors are not correctable within the current framework, and the conclusions can no longer be supported. We apologize for any inconvenience caused to readers
自我监督的目标达成促成多智能体合作与探索
机构 * Princeton University(普林斯顿大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究多智能体有效协调探索所需最少要素,通过自我监督目标达成,以访问目标状态可能性最大化代替奖励最大化,实证表明该方法在多智能体基准测试中表现优且更稳健。
Comments Project website with code and videos: https://chirayu-n.github.io/gcmarl
基于组合概念的深度强化学习神经元级可解释性
机构 * School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出一种自动将神经元激活与逻辑公式对齐的概念解释框架,通过值敏感离散化将连续状态转化为可解释原子概念,为深度强化学习模型提供细粒度神经元级解释。
Comments 12 pages, 5 figures. Accepted by PAKDD 2026. The final authenticated version is available online at Springer
Journal ref Data Science: Foundations and Applications. PAKDD 2026. Lecture Notes in Computer Science, vol 16117, pp. 52-64. Springer, Singapore (2026)
超越文本到SQL:一个面向受控企业分析API的代理LLM系统
机构 * Dialpad Inc.(Dialpad公司)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Analytic Agent,一个基于LLM的代理系统,能够将自然语言意图安全地转换为与企业分析API的交互,解决传统文本到SQL系统在企业环境中面临的可靠性与合规性问题。
Comments Accepted to the Enterprise AI Agents Workshop @ KDD 2026. The first four authors contributed equally to this work
建模复杂行为:视觉语言模型中的多人格组合与动态切换
机构 * Xi'an Jiaotong University(西安交通大学) ; Beihang University(北京航空航天大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究在视觉语言模型中引入显式人格条件,建立包括单人格、多人格和人格切换的系统评估框架,发现人格提示可提升图像描述但损害精确推理任务,并观察到多特质组合与动态切换中的平衡与残留效应。
Comments 16 pages, 4 figures, 10 tables
TAME: 一种可信的智能体记忆测试时演化与系统化基准测试
机构 * East China Normal University(东华师范大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Key Laboratory of Computer Software Evaluating and Testing(上海计算机软件评测与测试重点实验室) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出TAME框架,通过执行器-评估器循环实现记忆的可信演化,解决良性任务演化中智能体可信度下降问题,在GPT-5.2 AIME上准确率提升14.6个百分点。