SeeSE3: Emergence of 3D Space in Vision Features
SeeSE3:视觉特征中3D空间的出现
机构 * Google DeepMind(谷歌DeepMind)
专题命中 指令微调 :foundation model(abstract);分类 cs.AI
AI总结 研究视觉基础模型构建的表征与3D欧几里得空间内在属性的关系,提出从拓扑和几何角度评估的探测器,发现自监督视觉模型有相关潜在子空间,并基于此提出“潜在空间导航”技术用于视觉里程计和定位。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
SeeSE3:视觉特征中3D空间的出现
机构 * Google DeepMind(谷歌DeepMind)
专题命中 指令微调 :foundation model(abstract);分类 cs.AI
AI总结 研究视觉基础模型构建的表征与3D欧几里得空间内在属性的关系,提出从拓扑和几何角度评估的探测器,发现自监督视觉模型有相关潜在子空间,并基于此提出“潜在空间导航”技术用于视觉里程计和定位。
接种适配器:以更少的意外后门改进能力的选择性泛化
机构 * Center on Long-term Risk(长期风险中心)
专题命中 指令微调 :prompting(abstract);分类 cs.AI
AI总结 提出接种适配器(IA)方法,通过三步训练抑制不良特征,比接种提示更有效且引入更少后门,但保留期望特征仍具挑战。
Comments Preprint, v0.2
WorkDrive:自动驾驶的道路施工因果链
机构 * Peking University(北京大学) ; Xiaomi EV(小米电动汽车)
专题命中 指令微调 :language model(abstract)
AI总结 针对自动驾驶视觉语言模型在道路施工区域的难题,提出WorkDrive框架,通过自动化多任务感知管道提取场景事实,经监督微调与强化学习,在ROADWork数据集上降低轨迹平均位移误差,实现渐进改进。
二维MoS2中大规模协同硫空位动力学研究
专题命中 指令微调 :foundation model(abstract)
AI总结 本研究通过机器学习互原子势模拟揭示了二维MoS2中大规模协同硫空位传输机制,解释了实验观测到的辐照诱导空位模式,并对比了两种MLIP框架的性能。
Comments 17 pages, 9 figures
分支策略优化:沙盒原生语言智能体强化学习
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; McGill Univeristy(麦吉尔大学) ; City University of Hong Kong(香港城市大学)
专题命中 后训练与偏好优化 :language agent(title);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 研究基于可执行沙盒的大语言模型智能体强化学习,提出分支策略优化(BPO)算法,利用沙盒特性构建新展开拓扑,通过自适应快照、分叉动作等方式计算优势,实验验证该算法能提升成功率、降低方差并减少策略更新。
Comments Accepted by WAIC Academic 2026
停止思考,开始观察:通过无推理对齐实现多模态文档问答的高效训练后优化
专题命中 后训练与偏好优化 :post-training(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 研究多模态文档问答中高效训练后优化问题,提出感知 - RFT 框架,用组相对策略优化绕过推理令牌直接对齐视觉与基础输出,通过构建变体评估推理必要性,发现启用推理模型有优势,还识别基础差异,表明早期转换可减少训练数据并保持精度。
Comments Accepted at ICML 2026, Workshop on Efficient Multimodal Question Answering (EMM-QA)
社会模拟中生成式智能体的步骤级偏好学习
机构 * Shanghai Qi Zhi Institute(上海期智研究院) ; Xiongan AI Institute(雄安人工智能研究院) ; Tsinghua University(清华大学) ; CUHK-Shenzhen(香港中文大学(深圳)) ; USTC(中国科学技术大学) ; Sun Yat-sen University(中山大学)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 研究基于大语言模型的生成式智能体模拟人类行为时中间步骤注释稀缺问题,引入交互式模拟界面收集步骤级人类偏好监督,经监督微调算法和直接偏好优化方法进行步骤级偏好学习,提升模拟效果,证明步骤级人类监督是有效训练信号。
Comments WAICA2026
力,永不嫌迟:通过反应式力注入加速视觉-语言-动作模型的训练后优化
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Southern University of Science and Technology(南方科技大学) ; Noematrix Ltd.(诺玛矩阵有限公司)
专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG
AI总结 研究针对预训练VLA策略在接触状态下表现不佳的问题,提出LIFT框架,通过嫁接反应式动作专家、注入力及结合在线DAgger循环,提升其在富含接触操作任务中的性能,且证明相关组件对稳健操作很重要。
Comments Project page: https://lift-policy.github.io/
ToolAnchor:锚定反事实上下文以提升智能体工具使用能力
机构 * Fudan University(复旦大学) ; Nanyang Technological University(南洋理工大学) ; MIT(麻省理工学院)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 研究针对工具增强大语言模型智能体在工具集扩展时的问题,提出ToolAnchor框架,通过在关键决策点注入反事实锚定上下文打破行为惯性,经教师模型假设、学生展开验证及智能体后训练,提升其在扩展工具集下的性能,为智能体强化学习开辟新路径。
用于微调离散扩散模型的连续时间强化学习框架
机构 * Columbia University(哥伦比亚大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG
AI总结 该研究提出连续时间强化学习框架,推导策略梯度方法得到PPO和GRPO的连续时间变体。以此开发框架微调离散扩散模型,无需奖励信号可微,能纳入中间奖励或优势信号,还为MDM提供统一视角,用轨迹子采样技术降低计算成本,在相关任务中验证了方法有效性。
Comments 36 pages, 5 figures
SD-MAR:通过合成数据和强化学习进行多图像分析推理
机构 * Stevens Institute of Technology(史蒂文斯理工学院) ; AGI Foundations for AWS(AWS的通用人工智能基金会) ; Amazon Web Services (AWS)(亚马逊网络服务公司)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL
AI总结 研究针对视觉语言模型在多图像分析推理任务中的局限,提出SD-MAR框架,通过合成数据和强化学习训练评估模型。该框架构建场景生成任务,采用GRPO-lite与BDA训练。实验表明能提升域内准确率,保持或提高域外泛化能力,还改进了模型逻辑连贯性和解释质量。
循环变压器内部状态中的关系偏好编码
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 研究循环变压器如何编码人类偏好,通过提取内部迭代状态训练轻量评估头,发现偏好关系性编码优于非线性方法,提出翻转测试作为必要诊断。
MemTrace:大型语言模型记忆系统中的错误追踪与归因
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出MemTrace框架,通过构建可执行的记忆演化图实现细粒度错误追踪,并利用自动归因方法定位根因,进而优化提示词提升下游任务性能。
Comments Ongoing work
InfoFlow KV:面向长上下文的信息流感知KV重计算
机构 * New York University(纽约大学) ; Duke University(杜克大学)
专题命中 长上下文与记忆 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出将选择性KV重计算建模为信息流问题,利用查询的注意力范数信号识别语义相关且结构上能传播信息的token,并引入信息流引导的块重排序策略,在LLM和VLM基准上优于现有方法。
Comments In proceedings of the 43rd International Conference on Machine Learning (ICML 2026). Project page: https://infoflow-kv.github.io
Nous:一种用于长期智能体记忆的预测世界模型
机构 * Indian Institute of Technology Ropar(印度理工学院罗巴尔分校)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出Nous记忆架构,基于知识即预测而非存储的原则,通过贝叶斯更新维护概率分布,以信息论惊喜度评分并记录信念变化,在LoCoMo基准上取得优于对比方法的F1分数。
Comments Preprint. 10 pages, 1 figure, 6 tables
一举实现更智能与更廉价:字节精确的键值缓存嫁接将冻结的小模型转变为经过验证的知识飞轮
机构 * Corbenic AI(Corbenic人工智能公司)
专题命中 长上下文与记忆 :language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究提出通过字节精确的键值缓存嫁接,在不改变权重的情况下让冻结小语言模型更强大且廉价。此方法能精确恢复知识,提升模型性能,如在AIME 2025上提高准确率,还能扩展可用上下文,减少能耗,且可验证评分。
Comments 18 pages, 4 figures
MemPoison:揭示大语言模型智能体中持久内存威胁和结构盲点
机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) ; NARI Group Corporation/State Grid Electric Power Research Institute, China(国网电力研究院/国电电力集团)
专题命中 长上下文与记忆 :LLM(title);分类 cs.AI
AI总结 研究大语言模型智能体持久内存安全漏洞,提出MemPoison框架,含1227个案例,涵盖多种攻击类型等并评估多个模型系列。引入分类法,揭示防御边界及盲点,主张转向自适应、上下文敏感的内存防御策略。
RoboTTT:机器人策略的上下文扩展
机构 * NVIDIA(英伟达公司) ; Stanford University(斯坦福大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 长上下文与记忆 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 研究提出RoboTTT,将测试时训练集成到机器人基础模型,通过序列动作强制和截断反向传播扩展视觉运动上下文到8K时间步长,解锁新能力,提升多任务性能,证明上下文长度是机器人基础模型新扩展轴。
Comments Project website: http://research.nvidia.com/labs/gear/robottt/
CatalogAgent:一种由监督者介导的自学习系统,实现生成式人工智能模型的上下文工程
机构 * Amazon(亚马逊)
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 研究电商产品目录结构化属性缺失值预测问题,提出CatalogAgent系统,通过监督者调解冲突、记忆库和汇总器实现自学习,经上下文工程将监督者能力转移到生成器和评估器,有效提升其性能。
xHC:扩展超连接
机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; Dots Studio, Xiaohongshu Inc.(小红书公司点点工作室) ; University of Science and Technology of China(中国科学技术大学) ; School of CS, Peking University(北京大学计算机科学学院) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.LG
AI总结 研究针对超连接(HC)扩展残差流时的性能瓶颈,提出xHC方法,结合时间特征增强与稀疏残差流架构,实现超越N = 4的有效扩展,在MoE模型上有下游改进,还介绍xHC - Flash减少内存流量,让大N残差流扩展用于语言模型预训练更有效实用。
Comments Technical report. Project page: https://github.com/aHapBean/xHC
MemoHarness:从经验中学习的智能体控制层
机构 * University of Notre Dame(圣母大学) ; LMU Munich(慕尼黑大学) ; University of Southern California(南加州大学)
专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 研究针对智能体控制层设计影响行为但改进方法窄且多重用单一全局控制层的问题,提出自适应框架MemoHarness,通过分解控制层、存储经验并检索应用,在多基准测试中优于固定控制层,证明执行经验可构建更具适应性的控制层。
ME-IQA: 通过重新排序增强的记忆图像质量评估
机构 * City University of Hong Kong(香港城市大学) ; ByteDance Inc.(字节跳动公司)
专题命中 长上下文与记忆 :language model(abstract)
AI总结 ME-IQA通过构建记忆库和利用推理摘要检索语义和感知对齐的邻居,将VLM重构为概率比较器,并通过门控反思和记忆巩固提升未来决策,从而实现更密集的失真敏感预测,缓解离散崩溃问题。
Comments Published as a conference paper at ECCV 2026
通过消息序列图实现LLM代理的可证明协调
机构 * Université Paris-Saclay, CNRS, ENS Paris-Saclay, LMF, Gif-sur-Yvette, France(巴黎萨克雷大学、法国国家科学研究中心、巴黎萨克雷高等师范学院、LMF、法国吉夫-sur-耶vette) ; Institut Universitaire de France, Paris, France(法国国家科学院、巴黎,法国)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出基于消息序列图的领域特定语言,用于规范LLM代理协调,解决死锁和消息类型不匹配等问题,通过语法引导投影生成无死锁的局部代理程序,并展示如何在LLM非确定性基础上建立协调属性。
Comments 42 pages; accepted at ISoLA 2026
通过知识图谱基础增强小型语言模型推理
机构 * Institute of Informatics and Telecommunications, National Center for Scientific Research “Demokritos(信息与电信研究所,国家科学研究中心“德谟克利特”)
专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)
AI总结 研究利用神经符号智能框架增强小型语言模型推理能力,通过特定工具调用转变模型,在两种场景下评估,发现虽提示提升性能,但受提取瓶颈等限制,还存在“干扰效应”,刻画了挑战并提供迭代验证路线图。
Comments Presented at the 2nd Causal Neuro-symbolic Artificial Intelligence (Causal NeSy): Toward Agentic LLMs with Neuro-Symbolic and Graph Based Reasoning Workshop @ ESWC2026
CoEvoT:用于图语言模型推理的协同进化思维链提示
机构 * Sun Yat-Sen University(中山大学) ; The Chinese University of Hong Kong(香港中文大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; National University of Singapore(新加坡国立大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Beijing University of Posts and Telecommunieations(北京邮电大学) ; Singapore Management University(新加坡管理大学)
专题命中 推理与问题求解 :LLM(title,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究分布转移下的图学习问题,提出CoEvoT框架,通过文本到图令牌重写与图到文本推理指导的闭环协同进化,实现逐步的、状态感知的证据细化,在八个数据集实验中性能优于现有基准模型。
Comments Under review
用于闭环1型糖尿病控制的可解释语言模型
专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对1型糖尿病控制中人工胰腺系统“黑箱”问题,提出LLM-T1D方法,结合强化学习与大语言模型,训练专家RL系统并提炼知识到模型,开发出可解释且性能优的胰岛素泵控制器,在模拟器测试中血糖控制良好且能防幻觉。
Comments Accepted at the 2026 IEEE 22nd International Conference on Automation Science and Engineering conference (IEEE CASE 2026)
网络社会实验中多语言模型智能体的协作空间学习
机构 * Virginia Tech(弗吉尼亚理工大学) ; Advanced Research Computing, Virginia Tech(弗吉尼亚理工大学高级研究计算中心)
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究一组大语言模型智能体在梅森-瓦茨实验中的网络效率效应,开发机械贝叶斯优化智能体作比较。计算实验表明,指示LLM智能体随机化首轮选择有显著网络效率效应,贝叶斯优化智能体收益更高,还比较了智能体多方面行为。
Comments Accepted at ASONAM 2026; to appear in the Springer proceedings
迈向可靠的人工智能辅助模拟设计:用于逐次逼近寄存器型模数转换器生成的模板约束大语言模型智能体
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究针对大语言模型在模拟电子设计自动化应用的瓶颈,提出端到端多步骤的ATLAS框架,利用专家知识结合模板约束生成,能生成成功通过仿真验证的SAR ADC,为集成LLMs到可靠模拟设计方法奠定基础。
答案条件思维链降低大语言模型中的可验证推理蒸馏
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 研究发现大语言模型推理能力蒸馏中,答案条件思维链会降低训练数据质量,导致可验证推理准确性下降,损失随难度增加,机制是从答案反向合理化,危害是数据属性,建议盲目生成答案。
Comments 13 pages, 4 figures, 14 tables. Code: https://github.com/js-lee-AI/answer-leakage
大语言模型中逻辑一致性的可控重新表述测试
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型在逻辑等价问题表面形式改变时的逻辑一致性,提出CRTBench基准,评估多个前沿LLMs,发现存在准确率 - 一致性差距,揭示失败集中在逻辑非平凡变换,表明仅靠准确率无法评估LLMs的逻辑推理。
Comments 10 pages