Logarithmic-time Schedules for Scaling Language Models with Momentum
用于大规模语言模型的对数时间调度
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.LG
AI总结 ADANA通过引入对数时间调度和阻尼机制,在大规模语言模型训练中提升性能和效率。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
用于大规模语言模型的对数时间调度
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.LG
AI总结 ADANA通过引入对数时间调度和阻尼机制,在大规模语言模型训练中提升性能和效率。
遗忘遗忘:在充足记忆世界中的持续学习
机构 * New York University(纽约大学) ; Seoul National University(首尔国立大学)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种轻量级方法,通过权重空间巩固在充足内存环境下提升持续学习性能,挑战传统假设并提供低计算成本的替代方案。
Comments 26 pages, 11 figures
针对对齐:提取对齐LLM的安全分类器
机构 * 2 Department of Computer Science Virginia Tech Blacksburg, VA, USA
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出了一种提取对齐LLM安全分类器的方法,通过构建候选分类器并评估其在对抗性攻击中的有效性,展示了替代分类器在提高攻击成功率方面的优势。
Comments This work has been accepted for publication at the IEEE Conference on Secure and Trustworthy Machine Learning (SaTML). The final version will be available on IEEE Xplore
人工智能代理社会中社会化是否会出现?Moltbook案例研究
机构 * University of Maryland(马里兰大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 Moltbook研究揭示AI代理社会在规模和交互密度下难以形成稳定结构和共识,表明社会化需要更复杂的机制。
增强型快速权重与下序列预测
专题命中 长上下文与记忆 :language model(abstract);post-training(abstract);分类 cs.CL
AI总结 REFINE通过强化学习框架在下序列预测目标下训练快速权重模型,提升长上下文建模性能。
CAST:基于角色和场景的事件记忆用于智能体
机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学)
专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL
AI总结 CAST通过构建3D场景和角色档案,结合图结构语义记忆,提升智能体对连贯事件的回忆能力,实验结果显示在多个数据集上性能显著提升。
多轮对话中的视觉记忆注入攻击
机构 * Tübingen AI Center, University of Tübingen, Germany(图宾根人工智能中心,图宾根大学,德国)
专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG
AI总结 本文提出一种多轮对话中的视觉记忆注入攻击,通过操控用户输入实现隐蔽的信息操控,展示了对大视觉-语言模型的安全威胁。
BPP: 通过聚焦关键历史帧实现长上下文机器人模仿学习
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Google DeepMind(谷歌DeepMind)
专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG
AI总结 BPP通过聚焦关键历史帧,提升机器人模仿学习在长上下文任务中的表现,成功率达70%。
MMA:多模态记忆代理
机构 * School of Computer Science, Peking University(北京大学计算机学院)
专题命中 长上下文与记忆 :foundation model(abstract)
AI总结 MMA通过动态可靠性评分和冲突感知网络共识,提升多模态代理在长horizon任务中的记忆检索与决策能力,同时在多个基准测试中展现优越性能。
玩转AI:当前最先进的大语言模型在1977年文本冒险游戏Zork中的表现如何?
机构 * University of Twente(特文特大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文评估了当前最先进的大语言模型在1977年文本冒险游戏Zork中的表现,发现其在问题解决和推理能力上存在显著局限。
Comments 18 pages, 1 figure
状态设计至关重要:表示如何塑造大语言模型中的动态推理
机构 * Leiden Institute of Advanced Computer Science(莱顿先进计算机科学研究所) ; Leiden University(莱顿大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 研究探讨了大语言模型中状态表示设计对动态推理的影响,发现自然语言表示和空间编码对性能至关重要,但长期任务仍面临挑战。
GPSBench: 大型语言模型是否理解GPS坐标?
机构 * University of Melbourne(墨尔本大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 GPSBench通过评估14种LLMs在地理空间推理中的表现,揭示了其在GPS坐标理解和现实地理推理上的挑战与差异。
不是例子,而是过程:如何自动生成的例子增强LLM推理
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; Applied Artificial Intelligence, Sungkyunkwan University(成均馆大学应用人工智能系)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本研究通过对比不同提示策略,发现自动生成例子的过程增强了LLM推理性能,而非例子本身。
Comments Presented at AACL-IJCNLP 2025
从像素到政策:为内容感知布局设计增强语言模型的空间推理能力
机构 * Virginia Tech(弗吉尼亚理工学院) ; Adobe Research(Adobe研究)
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
AI总结 LaySPA通过强化学习框架增强语言模型的空间推理能力,实现内容感知布局设计,提升布局结构有效性与视觉质量,同时减少标注样本需求和延迟。
无需标签的进化语言模型:多数驱动选择,新颖性促进变异
机构 * Tencent AI Lab(腾讯AI实验室) ; University of Notre Dame(圣母大学) ; University of Virginia(弗吉尼亚大学)
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG
AI总结 EVOL-RL通过结合多数稳定性与新颖性探索,实现无需标签的自我改进语言模型,提升推理能力和领域外泛化能力。
基于经验的知识修正以实现Minecraft中的鲁棒规划
机构 * Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系) ; Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院)
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 XENON通过经验修正知识,提升Minecraft中的鲁棒规划能力,优于现有方法。
Comments ICLR 2026
EconEvals: 用于LLM代理经济决策的基准测试和litmus测试
机构 * Harvard University(哈佛大学) ; Penn State University(宾夕法尼亚州立大学)
专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI
AI总结 EconEvals提出了一种用于评估LLM经济决策能力的基准测试和litmus测试框架,通过多个冲突目标任务量化LLM的权衡响应和可靠性,为经济决策中的LLM评估提供了新方法。
Comments v3 was a major revision with updated experiments and analysis; v4 consists of minor edits
每一点帮助都有价值:通过细粒度可迁移多模态标记构建知识图谱基础模型
机构 * Zhejiang University, Zhejiang, China(浙江大学)
专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.CL
AI总结 本文提出TOFU模型,通过细粒度可迁移多模态标记提升多模态知识图谱推理的跨图谱迁移能力。
Comments Work in progress
Earth AI:利用基础模型和跨模态推理解锁地理空间洞察
机构 * Google Research(谷歌研究) ; Google X(谷歌X) ; Google Cloud(谷歌云)
专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI
AI总结 Earth AI通过基础模型和跨模态推理,提升地理空间数据分析能力,实现对地球的深入洞察。
通过多听众软执行平衡忠实与性能
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 REMUL通过多听众强化学习方法提升推理忠实性与性能,改进多个基准的忠实性指标和准确性。
Comments Code: https://github.com/nsivaku/remul
困惑性悖论:为什么代码在LLM提示中比数学压缩得更好
机构 * Bona Opera Studios(博纳歌剧工作室)
专题命中 推理与问题求解 :LLM(title,comments);分类 cs.CL、cs.AI
AI总结 本文揭示代码在LLM提示中比数学压缩更有效的原因,并提出TAAC算法实现更高效的压缩。
Comments 19 pages, 5 figures, 4 tables. Second paper in TAAC research series. Code and data at https://github.com/micoverde/taac-llm-compression
SPARC:面向自动化C单元测试生成的场景规划与推理
机构 * Bangladesh University of Engineering and Technology(孟加拉工程科技大学) ; National Taiwan University(台湾国立大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 SPARC通过神经符号方法和场景规划,提升C语言单元测试生成的覆盖率和代码质量,显著优于传统方法。
Comments 9 pages, 6 figures, 4 tables
ReasonNavi: 人类启发的全局地图推理用于零样本具身导航
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; Dartmouth College(达特茅斯学院)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 ReasonNavi通过结合多模态大语言模型与确定性规划器,实现人类启发的全局地图推理,提供无需微调的零样本具身导航解决方案。
Comments 18 pages, 6 figures, Project page: https://reasonnavi.github.io/
通过社会元学习学习语言反馈
机构 * Google DeepMind(谷歌DeepMind)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出通过社会元学习方法,使大型语言模型在对话中更有效地学习和利用语言反馈。
ReaCritic: 基于推理的变压器DRL批评模型扩展用于无线网络
机构 * Department of Electrical and Electronic Engineering, University of Hong Kong(香港大学电子与电气工程系)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 ReaCritic通过引入基于推理的变压器结构,提升DRL在无线网络中的适应性和性能表现。
通过自然语言反馈提升交互式上下文学习
机构 * Google DeepMind(谷歌DeepMind)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究提出一种框架,通过自然语言反馈提升模型交互式上下文学习能力,使模型在多轮交互中表现更优,并具备自我纠正能力。
EarthSpatialBench: 多模态大语言模型在地球影像上空间推理能力的基准测试
机构 * University of Florida(佛罗里达大学) ; Indiana University Bloomington(印第安纳大学布卢明顿分校)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 EarthSpatialBench是一个用于评估多模态大语言模型在地球影像上空间推理能力的综合基准测试,涵盖空间距离、方向、拓扑关系及复杂几何查询。
多跳问答的MultiCube-RAG
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Korea University(韩国大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 MultiCube-RAG通过多维立方体结构实现多跳问答的高效推理与检索,提升响应准确率并增强可解释性。
Comments 12 pages
VDLM: 通过鲁棒的潜在到文本渲染实现变量扩散语言模型
机构 * Stanford University(斯坦福大学)
专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.CL
AI总结 VDLM通过分离语义规划与文本渲染,利用嵌入空间后训练和鲁棒解码技术,在扩散语言模型中实现更高效的多步推理和长形式生成。
通过协同推理与自适应融合进行多源异构公共意见分析:一种系统整合方法
机构 * Yi Liu School of Software Xi’an Jiaotong University(刘毅 软件学院 西安交通大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出CRAF框架,通过协同推理与自适应融合整合传统方法与LLMs,提升多源异构公共意见分析的跨平台适应性与性能
Comments 13 pages, 11 figures