Sparse Video Generation Propels Real-World Beyond-the-View Vision-Language Navigation
稀疏视频生成推动现实世界超越视界视觉语言导航
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文提出SparseVideoNav,通过稀疏视频生成实现现实世界超越视界导航,显著提升导航效率和成功率。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
稀疏视频生成推动现实世界超越视界视觉语言导航
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文提出SparseVideoNav,通过稀疏视频生成实现现实世界超越视界导航,显著提升导航效率和成功率。
混合门控流(HGF):通过选择性低秩校正稳定1.58位LLM
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 混合门控流(HGF)通过选择性低秩校正技术,在1.58位LLM中实现内存效率与模型质量的平衡,恢复了与FP16基线的55%质量差距。
Comments 21 pages, 4 figures, 6 tables. Code and models will be released at opencores.ai
基于偏好强化学习的多选项扩展:多个选项的好处
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出M-AUPO算法,通过多选项选择提升偏好强化学习的样本效率,并证明其理论性能界。
Comments Accepted at NeurIPS 2025
对检索增强生成进行最小推理图剪枝以提高效率
机构 * Cornell University(康奈尔大学) ; University of Cambridge(剑桥大学) ; The University of Hong Kong(香港大学) ; HKUST(香港科技大学) ; University of British Columbia(不列颠哥伦比亚大学)
专题命中 效率与部署 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.LG
AI总结 AutoPrunedRetriever通过最小推理图剪枝提升检索增强生成效率,实现更高效的知识密集型任务处理。
正交模型融合
机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 正交模型融合通过在正交群流形上进行融合操作,有效保留模型权重的几何结构,减少灾难性遗忘并提升多任务性能。
Comments Technical report (18 pages, 9 figures, project page: https://spherelab.ai/OrthoMerge/)
代码世界模型的双重生命:通过执行轨迹证明性地揭示恶意行为
机构 * Berkeley AI Safety Initiative (BASIS) UC Berkeley(伯克利人工智能安全倡议(BASIS)加州大学伯克利分校)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 通过语义轨道分析,CTVP验证代码生成模型的恶意行为,引入ARQ量化验证成本,理论证明对抗鲁棒性非游戏化。
Comments 13 Pages, A Preprint
注意性能差距:特征引导中的能力-行为权衡
机构 * BAISH, Universidad de Buenos Aires, Argentina(BAISH,布宜诺斯艾利斯大学,阿根廷) ; AISAR, AI Safety Argentina(AISAR,人工智能安全阿根廷) ; Instituto de Investigación en Informática LIDI, Universidad Nacional de La Plata, Argentina(信息研究所LIDI,拉普拉塔国立大学,阿根廷) ; FAIR, IALAB UBA, Universidad de Buenos Aires, Argentina(FAIR,IALAB UBA,布宜诺斯艾利斯大学,阿根廷) ; Università degli Studi di Genova, Italy(热那亚大学,意大利)
专题命中 效率与部署 :LLM(abstract);prompting(abstract);分类 cs.LG
AI总结 研究发现特征引导方法在控制行为时显著降低模型性能,揭示了能力与行为之间的权衡问题。
Comments 12 pages, 5 figures
TempoPFN:合成预训练线性RNN用于零样本时间序列预测
专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 TempoPFN通过合成预训练线性RNN,实现高效零样本时间序列预测,超越现有方法并提供可重复的研究基础。
Comments 38 pages, 22 figures, 17 tables
位置:能力控制应是与对齐分开的目标
机构 * University of Cambridge(剑桥大学) ; Google DeepMind(谷歌DeepMind) ; University of Montreal(蒙特利尔大学) ; The Alan Turing Institute(艾伦·图灵研究所)
专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 本文主张将能力控制视为与对齐不同的目标,提出分层的控制机制以应对模型的潜在滥用和失败。
AP-OOD:用于分布外检测的注意力池化
机构 * Institute for Machine Learning, JKU LIT SAL IWS Lab(机器学习研究所) ; Silicon Austria Labs, JKU LIT SAL IWS Lab(Silicon Austria实验室) ; Interdisciplinary Transformation University Austria(跨学科转型大学) ; ELLIS Unit, LIT AI Lab, Institute for Machine Learning, JKU Linz(ELLIS单元)
专题命中 效率与部署 :language model(abstract);分类 cs.LG
AI总结 AP-OOD通过利用token级信息,提出了一种新的分布外检测方法,有效提升了文本数据的检测性能。
Comments Accepted at ICLR 2026
基于阻塞机制的高效RAG实体匹配方法:一种成本高效的RAG架构
机构 * Aalborg University(奥尔堡大学) ; University of Amsterdam(阿姆斯特丹大学) ; Bowling Green State University, USA(布林茅尔州立大学) ; Aalborg University, Denmark(奥尔堡大学)
专题命中 效率与部署 :LLM(abstract);分类 cs.CL
AI总结 CE-RAG4EM通过阻塞机制降低计算开销,实现高效实体匹配,提升运行效率并优化性能与开销的平衡。
一种用于加速隐私保护联邦学习的选性同态加密方法
机构 * A. Korkmaz Dept. of Electrical Engineering \& Computer Science, The University of Missouri, Columbia, USA P. Rao Dept. of Electrical Engineering \& Computer Science, The University of Missouri, Columbia, USA
专题命中 效率与部署 :pretraining(abstract);分类 cs.LG
AI总结 FAS通过结合选择性同态加密、差分隐私和位操作,实现高效安全的联邦学习,比传统FHE快90%并提升实用性。
Comments 18 pages, 18 figures
Journal ref Proceedings of the IEEE Consumer Communications & Networking Conference (CCNC), 2026
VGGT-Motion:具有运动感知的校准自由单目SLAM用于长距离一致性
机构 * National Key Laboratory of Science and Technology on Multi-spectral Information Processing(科学与技术多光谱信息处理国家重点实验室) ; Huazhong University of Science and Technology(华中科技大学) ; College of Computing and Data Science(计算与数据科学学院) ; Nanyang Technological University(南洋理工大学)
专题命中 效率与部署 :foundation model(abstract)
AI总结 VGGT-Motion通过运动感知子地图构造和锚点驱动的直接Sim(3)对齐策略,实现了高效且稳健的校准自由单目SLAM,提升了长距离轨迹的精度和效率。
RFS: 通过残差流引导的强化学习用于灵巧操作
机构 * University of Washington, Paul G. Allen School of Computer Science & Engineering(华盛顿大学,保罗·G·艾伦计算机科学与工程学院) ; Amazon Frontier AI & Robotics(亚马逊前沿人工智能与机器人)
专题命中 效率与部署 :pretraining(abstract)
AI总结 RFS通过残差流引导强化学习,实现高效适应预训练生成策略,提升灵巧操作任务的性能
通过块级嵌入和Top-k交互细化实现高效的长文档重排序
专题命中 效率与部署 :LLM(abstract)
AI总结 本文提出基于块级嵌入和Top-k交互细化的高效长文档重排序方法,通过块级表示和轻量级模块提升重排序效果并保持低延迟。
医学基于大语言模型聊天机器人在眼科患者查询中的临床验证与基于LLM的评估
专题命中 领域大模型 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本研究评估了四个医疗LLM在回答眼科患者问题中的表现,发现Meerkat-7B表现最佳,而MedLLaMA3-v20存在大量误导内容,GPT-4-Turbo评分与临床评分一致,表明基于LLM的评估在大规模基准测试中的可行性。
在图论中解决和未解决的问题上评估大语言模型:对计算教育的启示
机构 * Department of Computer Science(计算机科学系) ; Ball State University(巴尔的摩州立大学) ; School of Artificial Intelligence and Data Science(人工智能与数据科学学院) ; Jio Institute(乔研究所)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
AI总结 本研究评估了大语言模型在图论已解决和未解决问题上的表现,发现其在已有知识探索上有效,但在需要创新数学洞察的任务中存在局限,对计算教育有重要启示。
跨语言实证评估大型语言模型在阿拉伯语医疗任务中的表现
机构 * New York University Abu Dhabi(纽约大学阿布扎赫德分校)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG
AI总结 本研究通过跨语言实证分析,揭示了阿拉伯语和英语在医疗问答任务中LLM性能的差异,指出语言驱动的性能差距随任务复杂性增加而加剧,强调了语言意识在医疗任务LLM设计中的重要性。
Comments Accepted to HeaLing-EACL 2026
从文献到实验室:通过领域知识引导的LLM实现钙钛矿太阳能电池的闭环进步
专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出通过领域知识引导的LLM框架,实现钙钛矿太阳能电池的闭环进步,自主设计出高效配方并接近世界纪录。
迈向集体人工智能的科学:基于LLM的多智能体系统需要从盲目试错转向严谨的科学
机构 * Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; Tsinghua University(清华大学) ; King’s College London(伦敦大学国王学院) ; Peng Cheng Laboratory(鹏城实验室)
专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出通过建立协作收益度量(Γ)和因素归因范式,推动多智能体系统从盲目试错向严谨科学转变。
Speech-XL: 向大语言模型中的长形式语音理解迈进
机构 * TMCC, College of Computer Science, Nankai University, Tianjin, China(TMCC,计算机科学学院,南开大学,天津,中国) ; Alibaba International Digital Commerce(阿里巴巴国际数字商业) ; University of Exeter, Exeter, United Kingdom(埃克塞特大学,埃克塞特,英国)
专题命中 领域大模型 :language model(title,abstract);large language model(abstract)
AI总结 Speech-XL通过引入语音摘要标记和课程学习策略,实现长形式语音压缩,提升大语言模型在长音频理解中的性能。
基于时间序列基础模型的外生数据电力需求预测评估
专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文评估了不同基础模型在电力需求预测中的表现,发现基础模型在某些情况下不如简单基线,强调了模型架构和地理环境对预测效果的影响。
Comments 9 pages, 1 Figure and 3 Tables. Accepted to AI4TS Workshop @ AAAI'26 as an oral presentation (see https://ai4ts.github.io/aaai2026)
基础模型在脑电图分析中是否有用的特征提取器?
机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich(人工智能在医疗与健康中的研究所,慕尼黑技术大学) ; Department of Neurology, Technical University of Munich(神经病学系,慕尼黑技术大学) ; Center for Interdisciplinary Pain Medicine, Technical University of Munich(跨学科疼痛医学中心,慕尼黑技术大学) ; Munich Center for Machine Learning, Munich, Germany(慕尼黑机器学习中心,德国慕尼黑) ; Department of Computing, Imperial College London(计算系,伦敦帝国学院)
专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究了基础模型在脑电图分析中的有效性,发现通用时间序列模型在特征提取上具有竞争力,能有效捕捉生物标志物特征,减少对大规模数据集的依赖。
SemPipes -- 可优化的语义数据运算符用于表格机器学习流水线
专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 SemPipes通过LLM驱动的语义数据运算符提升表格机器学习流水线的预测性能和效率。
依赖大语言模型:计算机科学教育中学生实践与教师规范正在发生变化
专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文研究了计算机科学教育中学生与LLMs的互动,发现学生实践与教师规范存在不同程度的冲突,并提出了LLMs设计指南以促进学习。
Comments 25 pages, 1 figure
长文本生成中hallucinated实体的实时检测
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种廉价且可扩展的方法,用于实时检测长文本生成中的幻觉实体,通过网络搜索标注数据集训练高效分类器,并在多个模型家族上实现了优于基线的检测效果。
人工智能聊天机器人与人类医疗专业人员:关于患者护理中同理心的系统综述和荟萃分析
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文通过系统综述和荟萃分析,发现AI聊天机器人在文本场景中普遍被感知为比人类医疗专业人员更具同理心。
Comments Open Access Invited Review. Systematic review and meta analysis of 15 studies 2023-2024. Published 20 October 2025
Journal ref British Medical Bulletin, Volume 156, Issue 1, December 2025, ldaf017
在测试时间学习以发现
机构 * Stanford University(斯坦福大学) ; NVIDIA(英伟达) ; Astera Institute(Astera研究院) ; UC San Diego(加州大学圣地亚哥分校) ; Together AI
专题命中 领域大模型 :LLM(abstract);prompting(abstract);分类 cs.AI、cs.LG
AI总结 通过在测试时间进行强化学习,TTT-Discover方法在多个科学领域实现了新的前沿状态,利用开放模型和公开代码实现高效解决方案。
Comments Code: https://github.com/test-time-training/discover
精英同行评审中的复合欺骗:100个2025年NeurIPS伪造引用的失败模式分类
机构 * School of Computing and Engineering Sciences University of Chester(计算与工程科学学院 英国切斯特大学)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究分析了NeurIPS 2025中100个伪造引用的失败模式,发现所有幻觉均表现出复合失败模式,揭示同行评审在验证引用时的不足,并提出强制自动引用验证的解决方案。
MedErrBench: 一种细粒度多语言基准,用于医疗错误检测与修正,带有临床专家注释
机构 * New York University Abu Dhabi(纽约大学阿布扎赫尔分校) ; New York University(纽约大学) ; University of Birmingham(伯明翰大学) ; Cleveland Clinic Abu Dhabi(克利夫兰医学中心阿布扎赫尔分校)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 MedErrBench是一个多语言医疗错误检测与修正基准,通过临床专家注释评估各类语言模型性能,揭示非英语环境中的性能差距,推动多语言临床NLP发展。