Think before you speak: Training Language Models With Pause Tokens
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published at ICLR 2024
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published at ICLR 2024
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to ICLR 2024
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at NeurIPS 2023 (Spotlight). Project page: https://github.com/IBM/Dromedary
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS 2023 (23 pages, 12 figures). Our code is available at https://github.com/swarnaHub/ExplanationIntervention
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
Comments To appear in proceedings of EMNLP2023 (findings)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Advances in Neural Information Processing Systems (NeurIPS 2023). 10 pages main text
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS 2022. code: https://github.com/qkaren/COLD_decoding
教它停止,而不仅仅是点击
机构 * Cabal AI ; Para AI
专题命中 测试时计算 :verifier(abstract,comments);分类 cs.AI、cs.LG
AI总结 研究智能体计算机使用强化学习中单次运行结果的误导性,通过验证器引导修复35B智能体,发现成功率受上游方差主导,修复能力分两层,框架级修复有条件,还发现自身过度断言,发布库用于k种子报告,首次进行多模态分段聚合策略内自蒸馏更新。
Comments 15 pages, 3 figures. Reliability protocol and library (cua_reliability), completion verifier, and leakage-free held-out plus bootstrap evaluation harness are open-source
RoBoN: 基于路由的在线最佳-n方法用于多LLM测试时间扩展
机构 * Kempner Institute for the Study of Natural & Artificial Intelligence(自然与人工智能研究 institute)
专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.AI、cs.LG
AI总结 RoBoN通过在线路由多LLM生成过程,提高测试时间扩展性能,无需额外训练,有效提升准确率。
Comments 20 pages, 3 figures. 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Foundations of Reasoning in Language Models
编辑1个神经元能修复LLM中的重复循环吗?
机构 * Edgerunner AI
专题命中 测试时计算 :self-correction(abstract);分类 cs.AI、cs.LG
AI总结 本文发现Gemma 4模型在长事实列举任务中高达95%的概率陷入重复循环,通过逐层消融和逐神经元归因定位到少量MLP神经元,并用静态权重编辑(小至单个神经元符号反转)消除循环,但无法解决因知识缺失导致的“末日循环”。
SaliMory: 为对话代理编排认知记忆
机构 * Meta Reality Labs(Meta现实实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出SALIMORY框架,通过层级阶段过程奖励和奖励分解对比优化,端到端训练单一语言模型管理认知结构记忆,显著降低记忆相关错误并提升个性化表现。
Prime Agent:一种自改进的RLM管控框架
机构 * Princeton University(普林斯顿大学) ; MIT(麻省理工学院) ; Prime Intellect
专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.AI
AI总结 Prime Agent是一款开源RLM管控框架,通过标准化流程提升模型长周期能力,在ARC-AGI-3等任务中大幅提升性能,支持编码等工作流与并行化任务。
Comments 16 pages, 10 figures. Technical report. Code: https://github.com/PrimeIntellect-ai/prime-agent
HIRA:面向受监管行业文档分类的人在回路检索增强级联模型
机构 * Standard Chartered Bank(渣打银行) ; OCBC(华侨银行)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 HIRA是面向受监管行业的无训练本地检索增强级联文档分类模型,结合多模态检索与本地LLM及人工审核,仅需少量人工修正即可大幅提升Macro-F1,减少LLM调用,性能接近全标注神谕模型。
Comments CIKM 2026
从测试时缩放的视角理解在线策略蒸馏
机构 * Hong Kong Baptist University(香港浸会大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Ant Group(蚂蚁集团)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 该研究从测试时缩放视角分析OPD,发现其主要提升采样效率而非扩展推理能力边界,属于“虚假蒸馏”。
Comments 15 pages, 8 figures
利用算子链实现上下文算子学习
机构 * Department of Mathematics, Shanghai Normal University(上海师范大学数学系) ; Department of Mathematics, National University of Singapore(新加坡国立大学数学系)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出Chain of Operators (CHOP)框架,通过构造显式初等变换与冻结ICON的算子链,无需微调即可提升上下文算子网络在分布外算子任务上的泛化能力,在标量守恒律和平均场控制问题中降低推理误差。
DPRM: 一种用于扩散语言模型的即插即用Doob h变换诱导的令牌排序模块
机构 * City University of Hong Kong(香港城市大学) ; The Institute of Statistical Mathematics(统计数学研究所) ; University of Sydney(悉尼大学) ; Nanyang Technological University(南洋理工大学) ; The University of Tokyo(东京大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出DPRM模块,通过在线估计从置信度驱动排序逐步过渡到过程奖励引导排序,改进扩散语言模型的令牌排序策略,在九种任务中提升性能。
Comments Extended Version of ICML 2026 Fogen (Oral)
MetaSICL: 通过元语音上下文学习适应听觉大语言模型
机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tsinghua University(清华大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出MetaSICL方法,利用高资源语音数据通过元学习增强听觉大语言模型的上下文学习能力,在低资源场景下优于直接微调。
SEISMO:通过轨迹感知的LLM代理提高分子优化的样本效率
机构 * Technical University of Munich, Germany(慕尼黑技术大学,德国) ; TUM School of Computation, Information(TUM计算、信息学院) ; Technology, Department of Mathematics(技术学院,数学系) ; Helmholtz Munich – German Research Center for Environmental Health (GmbH), Institute of Structural Biology, Molecular Targets(海德堡慕尼黑德国环境健康研究所以及结构生物学研究所,分子靶点) ; Therapeutics Center, 85764 Neuherberg, Germany(治疗中心,德国新赫尔伯格85764) ; Machine Learning Research(机器学习研究)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 SEISMO通过轨迹感知的LLM代理实现高效的分子优化,利用结构化反馈提升样本效率。
Comments Fabian P. Krüger and Andrea Hunklinger contributed equally to this work
打断循环:周期性主体变化提升基础语言模型的惊讶度与关联度
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI
AI总结 本研究探究基础语言模型的长文本生成特性,发现周期性注入新主体的打断操作可提升模型生成文本的惊讶度与关联度,还提出了长文本生成的评估方案。
Comments 48 pages including appendix; code, data pipeline and lab notebook at https://github.com/RobertoOno/interrupting-the-loop
基于跨难度优化动力学的大语言模型课程学习理解
机构 * Fudan University(复旦大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文通过分析不同课程调度的优化动力学,提出衡量跨难度知识迁移的Relative Transfer指标,据此推导TDCS方法,经多推理基准实验证明其性能优于代表性调度策略,为课程学习提供统一优化解释。
LZ惩罚:一种用于自回归语言模型的信息论重复惩罚项
机构 * Salesforce AI Research(Salesforce人工智能研究)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出LZ惩罚,基于LZ77压缩算法,可让开源推理模型用贪婪解码时无退化重复,优于现有频率、重复惩罚。
Comments Post-publication corrections (minor calculation mistakes)
面向质量多样性的Web智能体模仿的推测性回滚修正
机构 * Beihang University(北京航空航天大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; The Hong Kong University of Science and Technology(香港科技大学) ; Northwestern Polytechnical University(西北工业大学) ; Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Peking University(北京大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 提出推测性回滚修正(SRC)框架,通过固定视野分支审查和回滚机制,在减少教师查询的同时保持轨迹多样性,在WebArena-Infinity上收集了977条通过验证的轨迹和9183个下一步动作示例。
长视界终端任务的递归合成
机构 * Tencent HY LLM Frontier(腾讯HY大模型前沿团队) ; University of Georgia(佐治亚大学) ; University of Maryland, College Park(马里兰大学帕克分校) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Minnesota, Twin Cities(明尼苏达大学双城分校) ; Indiana University(印第安纳大学) ; National University of Singapore(新加坡国立大学) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RST递归合成框架,低成本规模化生成3.7万余个长视界终端任务,经微调或PPO优化后,多款Qwen模型在多个终端基准任务上性能显著提升,且递归过程无明显上限。
渐进式代码切换作为大语言模型推理时的跨语言表征对齐
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型跨语言性能不均衡问题,提出推理时的代码切换上下文学习机制,经多模型、多语言、多数据集验证,可显著提升目标及未见语言任务性能,尤其在低资源场景表现突出。
Comments COLM 2026
社会思维链:一种基于医学鉴别诊断方法论的多智能体架构
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于医学鉴别诊断方法论的多智能体架构SCoT,通过多轮专家协作提升复杂病例诊断召回率,其优势无法通过单一推理实现。
Comments 14 pages, 9 figures, 6 tables
提示驱动的探索
机构 * Massachusetts Institute of Technology(麻省理工学院) ; MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) ; Improbable AI Lab(英普罗巴布尔人工智能实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究针对强化学习中探索难的问题,提出提示驱动的探索策略(PDE),利用视觉-语言模型对轨迹视频推理,从弱策略轨迹中优化提示,实现后验采样,能让强化学习从零奖励起步学习成功策略并提升样本效率。
如何验证概率断言的一致性
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对概率预测器答案的自洽性验证问题,基于Nilsson的工作构造交互式PCP,为概率预测器自洽性证明提供复杂性理论基础,是训练模型证明自身一致性的第一步。
POISE:面向LLM智能体的位置感知不可检测技能注入攻击
机构 * University of Illinois at Chicago(伊利诺伊大学香槟分校) ; University of Queensland(昆士兰大学) ; Tulane University(路易斯安那州立大学) ; Rutgers University(罗格斯大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI
AI总结 提出POISE攻击方法,通过位置感知将恶意指令压缩为单一良性指令嵌入技能正文,在保持隐蔽性的同时实现89.3%的攻击成功率,比随机位置基线高28.0个百分点。
Comments Title changed from "POISE: Position-Aware Undetectable Skill Injection on LLM Agents" to "Poise: Position-Aware One-Instruction Skill Injection for Silent Execution on LLM Agents"; the manuscript, figures, appendices, and reproducibility details have been updated. 15 pages, 2 figures, 4 tables