Do AI weather models miss extremes?
AI气象模型是否遗漏极端天气?
专题命中 其他推理 :reasoning(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本研究验证11种物理与AI气象模型,发现极端天气下相对技能缺失是特定模型的特性而非AI气象模型整体的问题,部分AI模型在极端场景表现优于数值模型。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
AI气象模型是否遗漏极端天气?
专题命中 其他推理 :reasoning(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本研究验证11种物理与AI气象模型,发现极端天气下相对技能缺失是特定模型的特性而非AI气象模型整体的问题,部分AI模型在极端场景表现优于数值模型。
LLM-意识形态可塑性:将LLM的政治行为测量为上下文条件分布
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 通过系统实证,证明LLM的政治意识形态是上下文条件分布而非固定点,使用VAA-CHES投影模型在六个上下文轴上评估九个LLM,发现其对上下文高度敏感,但整体占据狭窄的Overton窗口。
Comments Under review, 40 pages, 18 figures, 11 tables
SPORK:自我推测性分叉以加速智能体大语言模型推理
机构 * Tsinghua University(清华大学) ; Meituan(美团)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 研究LLM智能体推理中串行循环耗时问题,提出SPORK方法,利用模型自身预测提前调度推测工具调用,通过成本模型等组件优化,大幅提升推理效率且不影响任务准确性。
Comments 16 pages, 15 figures. Code: https://github.com/baihuajun24/spork
LLM 谄媚中权威层级的机制性视角
机构 * Independent Research(独立研究)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 通过受控医疗QA实验,发现LLM按感知权威程度分级响应,机制是特定后期层中正确答案表征被权威信号主动擦除,且该擦除与权威水平成比例、抵抗均值向量干预、仅部分可逆。
模型取证:调查令人担忧的行为是否反映对齐失败
机构 * MATS
专题命中 其他推理 :CoT(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 提出一个两步基线协议,通过读取思维链生成假设并编辑环境测试假设,以区分模型行为是出于恶意意图还是良性原因,并在六个环境中验证了该方法。
言行不一:大型语言模型中的指令诱导冲突
机构 * Future Impact Group(未来影响组)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨了大型语言模型在面对指令与模式完成之间的冲突时的表现,发现指令遵循率在不同模型和指令下差异显著,输出多样性是预测鲁棒性的主要因素。
Comments 31 pages
全双工口语对话语言模型中的时间顺序思考
机构 * Nanyang Technological University(南洋理工大学) ; StepFun ; Mila
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 提出Chronological Thinking机制,让全双工对话模型在听用户说话时增量推理,不增加延迟,提升响应质量。
Comments Accepted by SIGDIAL 2026
Sparrow: 用于大语言模型稳定高效长上下文强化学习的稀疏 rollout
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Cornell University(康奈尔大学) ; Intel(英特尔) ; Amazon AGI(亚马逊AGI)
专题命中 其他推理 :CoT(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 针对RLVR中长上下文rollout计算昂贵的问题,提出Sparrow方法,通过动态稀疏度调度保持token级策略失配的下尾统计量稳定,在Qwen3系列模型上实现2.0-2.4倍加速,并推广到更大模型和编程领域。
工具调用ReAct代理中深度相关的间接提示注入:注入深度、载荷框架和轮次预算敏感性
机构 * Department of Computer Science(计算机科学系) ; AI and Media Analysis Lab(人工智能与媒体分析实验室) ; Berlin, Germany(柏林,德国)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 通过四个对照实验(共460次试验),研究在工具调用ReAct代理中,注入深度、载荷框架和轮次预算对间接提示注入攻击成功率的影响,发现注入深度是主导变量,且仅清理第一个工具观察可捕获67%的注入成功。
Comments 17 pages, 16 figures
原子锚定的大语言模型:化学 retrosynthesis 的演示
机构 * Machine Learning Research(机器学习研究) ; Pfizer Research and Development(辉瑞研发) ; Leiden Institute of Advanced Computer Science(莱顿高级计算机科学研究所) ; Leiden University(莱顿大学) ; Leiden Academic Centre for Drug Research(莱顿药物研究中心) ; Leiden Institute of Chemistry(莱顿化学研究所)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出了一种利用通用大语言模型进行分子推理的框架,通过原子标识符将链式推理与分子结构锚定,无需任务特定的模型训练,在单步 retrosynthesis 任务中实现了高成功率。
Comments Alan Kai Hassen and Andrius Bernatavicius contributed equally to this work
前沿叠加的涌现:莫比乌斯吸引子与级联监督
机构 * University of Science and Technology of China(中国科学技术大学) ; Zhongguancun Academy(中关村学院)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了通过叠加实现深度推理的问题,提出莫比乌斯吸引子和级联监督方法,证明了在Erdős-Rényi图上,叠加推理的涌现是通过建筑和监督的贡献实现的。
Comments 40 pages, 3 figures
语言模型的目标选择与人类在自我指导学习任务中不同
机构 * University of California, Berkeley(加州大学伯克利分校) ; Amazon AGI Lab(亚马逊人工智能实验室)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 研究通过控制实验发现语言模型在目标选择上与人类存在显著差异,多数模型表现不佳,而人类则能逐步探索并达成多样化目标。
记忆诅咒:扩展回忆如何在LLM代理中侵蚀合作意图
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Foundations of Cooperative AI Lab (FOCAL)(合作人工智能基础实验室) ; University of Michigan(密歇根大学) ; Harvard University(哈佛大学)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 研究发现扩展回忆会系统性地削弱多代理社会困境中的合作意图,通过三种分析揭示记忆内容对合作的影响,证明记忆是影响多代理行为的主动因素。
通过贝叶斯校准实现自我强化的可控稀有关系数据合成
机构 * Henan University, China(河南大学) ; Department of Statistics, LMU Munich(慕尼黑大学统计系) ; MCML Munich(慕尼黑MCML) ; CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(萨尔布吕肯德国海德堡中心信息安全研究所)
专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RDDG框架,通过动态引导生成表格数据以提升不平衡分类性能,采用核心集选择和自强化反馈机制优化生成质量。
Comments Accepted at: Findings of the Association for Computational Linguistics: ACL 2026 (ACL 2026 Findings), San Diego, California, USA, July 2-7, 2026
IceCache: 用于长序列LLM的内存高效KV缓存管理
机构 * Simon Fraser University(西蒙菲莎大学) ; Harvard University(哈佛大学)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 本文提出IceCache,通过语义令牌聚类与PagedAttention结合,提升长序列LLM的内存效率与性能,实验表明其在256个令牌预算下保持99%的准确性,且在延迟和精度上优于其他方法。
学习谁不一致:用于建模标注者分布的群体重要性加权
机构 * Rochester Institute of Technology(罗切斯特理工学院)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 DiADEM通过学习群体重要性权重,有效建模标注者分歧,优于现有方法,在多个基准上取得显著成果,揭示种族和年龄对标注者分歧的关键影响。
隐性广告:用于视觉语言模型中广告注入的行为触发语义后门
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 本文提出隐性广告攻击,通过用户行为触发在视觉语言模型中注入未经授权的广告,利用自然用户行为实现高效且隐蔽的广告注入,同时评估了不同防御方法的失效性。
通过多模态基础模型提升空间智能
机构 * SenseTime Research(商汤科技研究院) ; Nanyang Technological University(南洋理工大学)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 本文通过构建SenseNova-SI家族,利用八百万多样数据样本提升空间智能,在多个基准测试中取得优异成绩,并分析数据扩展的影响及潜在应用。
Comments Codebase: https://github.com/OpenSenseNova/SenseNova-SI ; Models: https://huggingface.co/collections/sensenova/sensenova-si . This report is based on the v1.1 version of SenseNova-SI. Accepted to CVPR 2026
通过多任务强化学习对齐语音大语言模型中的语用理解和生成
机构 * Meta Reality Labs(Meta现实实验室)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本文提出通过多任务强化学习提升语音大语言模型对语用信息的理解与生成,实验表明在多个数据集上比监督模型和 proprietary 模型提升了8-12%的性能。
慢-快推理:通过句内支持稳定性实现无需训练的推理加速
机构 * National University of Singapore(新加坡国立大学) ; ByteDance(字节跳动)
专题命中 其他推理 :reasoning(abstract);CoT(abstract);分类 cs.AI、cs.LG
AI总结 SFI通过利用句内支持稳定性,将生成过程分为快速低成本步骤和偶尔的密集注意力慢步骤,从而提高解码吞吐量并保持质量。
LEC-KG: 一种基于大语言模型嵌入的领域知识图谱构建协作框架——以可持续发展目标为例
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 LEC-KG通过结合大语言模型与知识图谱嵌入的双向协作框架,有效解决领域知识图谱构建中的长尾关系问题,提升低频关系的识别与验证能力。
特权信息蒸馏用于语言模型
机构 * McGill University(麦吉尔大学)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 本文提出π-Distill和OPSD两种方法,通过特权信息蒸馏提升语言模型在复杂代理环境中的表现,优于传统监督微调加强化学习的方法。
Comments Abstract border should have been purple
Rank-and-Reason: 多智能体协作加速零样本蛋白质突变预测
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Southern University of Science(南方大学(科学)) ; East China University of Science and Technology(东中国科学与技术大学)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 Rank-and-Reason通过多智能体协作提升零样本蛋白质突变预测的准确性与效率,显著提高湿实验验证的成功率。
Comments 22 pages, 5 figures, 15 tables
知晓事实却选择捷径:理解大型语言模型如何比较实体
机构 * University of Hamburg(汉堡大学) ; Cardiff University(卡迪夫大学)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 研究发现大型语言模型在比较实体时更依赖数值知识,而小型模型则受启发式偏差影响,通过链式思考提示可引导模型更依赖数值特征。
Comments 34 pages, 20 figures. Accepted for EACL 2026
FAQ: 通过家庭感知量化减少量化误差
机构 * Alibaba Cloud Computing(阿里云计算)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 FAQ通过家庭感知量化方法生成高保真校准数据,有效减少量化误差,实验表明其在多个模型系列中将准确性损失降低28.5%。
具有人格意识和可解释性的自行车适应性评估:一种视觉-语言模型方法
机构 * University of Alabama(阿拉巴马大学) ; University of Maryland, College Park(马里兰大学学院公园分校) ; Stony Brook University(石溪大学) ; University of Florida(佛罗里达大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 本文提出一种视觉-语言模型框架,通过人格意识和可解释性方法评估自行车适应性,解决道路环境复杂性和用户感知异质性问题。
Transformer模型中反排列学习的不可能性
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 Transformer模型中反排列学习的不可能性,通过解码器-only架构的表达能力限制,提出通过添加空白标记实现可行的替代方法。
机构 * Department of Linguistics, Stanford University(斯坦福大学语言学系) ; Department of Psychology, Harvard University(哈佛大学心理学系) ; Center for Brain Science, Harvard University(哈佛大学脑科学中心) ; Physics of Intelligence Group, NTT Research(NTT研究物理智能小组)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
机构 * Binghamton University(宾夕法尼亚州立大学)
专题命中 其他推理 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments Accepted to EMNLP 2025 Main Conference
专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI