Linear Scaling Video VLMs for Long Video Understanding
面向长视频理解的线性缩放视频视觉语言模型
机构 * Stanford University(斯坦福大学)
专题命中 效率与部署 :language model(abstract)
AI总结 提出StateKV方法,通过固定容量的重要性驱动循环状态实现线性时间视频预填充,在保持接近全自注意力性能的同时显著降低计算成本。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
面向长视频理解的线性缩放视频视觉语言模型
机构 * Stanford University(斯坦福大学)
专题命中 效率与部署 :language model(abstract)
AI总结 提出StateKV方法,通过固定容量的重要性驱动循环状态实现线性时间视频预填充,在保持接近全自注意力性能的同时显著降低计算成本。
设备端机器人规划:消除推理冗余以实现高效决策
机构 * School of Integrated Technology, College of Computing, Yonsei University(延世大学整合技术学院,计算学院) ; Department of Hyperscale AI SoC Research Section, ETRI(ETRI超大规模AI SoC研究部) ; EECS - Electrical and Computer Engineering, University of Michigan(密歇根大学电气与计算机工程学院)
专题命中 效率与部署 :language model(abstract)
AI总结 提出REIS框架,通过场景门控、KV引导的affordance路由和审慎推理减少推理冗余,在保持语义适应性的同时加速机器人控制。
Comments 19 pages
面向流式同步空间音频生成的自回归扩散Transformer
机构 * Zhejiang University, China(浙江大学)
专题命中 效率与部署 :preference optimization(abstract)
AI总结 提出SwanSphere统一流式框架,通过因果自回归扩散Transformer、空间视频-音频对比学习及多目标在线直接偏好优化,实现从全景视频和文本提示生成高保真空间音频,并开发自动化标注管道缓解数据稀缺。
Comments Accepted by ICML 2026
FOSTER: 基于一阶数据集蒸馏的文本序列推荐
专题命中 效率与部署 :language model(abstract)
AI总结 针对文本序列推荐系统训练成本高的问题,提出一阶数据集蒸馏方法FOSTER,通过随机物品子集采样、轨迹锚定参数重置和语义共现正则化,实现高效且有效的合成数据集生成。
面向受监管网络安全运营的组织范围LLM代理运行时架构
机构 * Innov-Acts Ltd(Innov-Acts有限公司) ; Dept. of Digital Systems University of Piraeus(数字系统系希腊比雷埃克斯大学) ; Harokopio University(哈罗基奥大学) ; Dept. of Informatics and Telematics(信息学与电信系)
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出一种组织范围的LLM代理运行时架构,通过类型化安全上下文、运行时核心、专业子代理、受控工具适配层和分层人机回环,实现检索、工具调用、内存、发现、报告和审计的全局强制,并保持模型无关和本地部署。
Comments 8 pages, 3 figures
既非替代品也非万能药:比较基于LLM的对话式与图形化决策支持在工业任务中的应用
机构 * Department of Computer Science, University of Pisa(比萨大学计算机科学系) ; Department of Computer Science, Brunel University of London(伦敦布鲁内尔大学计算机科学系)
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 通过混合因子实验,比较基于LLM的对话式界面与仪表盘在工业决策支持中的效果,发现对话界面在低复杂度任务中降低认知负荷和加快完成时间,但优势随任务复杂度增加而消失,且未提高决策准确性。
MedFact:大型语言模型在中文医学文本上的事实核查能力基准测试
机构 * Xunfei Healthcare Technology Co., Ltd.(讯飞医疗科技有限公司)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI
AI总结 为评估LLM在中文医学文本中的事实核查能力,构建了包含2116个专家标注实例的MedFact基准,涵盖13个专科、8种错误类型等,并发现模型在错误定位上表现不足,存在“过度批评”现象。
Comments Accepted to The Fifth Workshop on Generation, Evaluation, and Metrics (GEM) at ACL 2026
特殊教育的强化学习:通过残疾适应性训练使LLM导师适应多样化学习者
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 提出Special-R1框架,通过二维自适应系统提示和基于残疾特征的思维奖励,将强化学习扩展到特殊教育,显著提升对残疾学习者的适配性和帮助性。
错误的架构:从普遍不可能到局部补丁的LLM可靠性
机构 * Independent Researcher(独立研究者) ; Palo Alto Networks(帕洛阿尔托网络)
专题命中 领域大模型 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过两个命题和一个推论,形式化地论证了通用LLM可靠性在无限域上不可实现,但在操作有界的局部补丁中可通过目录发现和干预覆盖实现可靠性。
Comments 25 pages, no figures
工业自动化中使用大语言模型的梯形图逻辑翻译
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(title);language model(title)
AI总结 针对PLC厂商切换中梯形图翻译的语义不一致问题,提出基于LLM的数学建模与工程化流水线,实现Rockwell到Siemens S7的高语义一致性自动翻译。
基于LLM的对话式与图形化界面在工业决策任务中的比较:一项探索性混合方法研究
机构 * Department of Computer Science(计算机科学系) ; University of Pisa(比萨大学) ; Department(部门) ; San Matteo Hospital(圣玛泰奥医院) ; Brunel University of London(伦敦布鲁内尔大学)
专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI
AI总结 通过混合方法研究,比较了基于LLM的对话式界面与图形化仪表盘在工业决策任务中的表现,发现对话式界面可减少交互努力,但仪表盘在概览和验证方面仍有价值。
MLIPilot:面向机器学习原子间势的LLM驱动自动研究
机构 * PsiQuantum
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出MLIPilot框架,利用大语言模型自动提出假设、编辑训练代码并基于物理约束评分卡优化机器学习原子间势,在QM7和Cu EMT数据集上验证了其有效性。
ClimAgent:基于大语言模型的自主开放式气候科学分析智能体
专题命中 领域大模型 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出ClimAgent框架,通过统一工具使用环境和严格推理协议,实现端到端建模与分析,在ClimaBench基准上相比原始LLM方案提升40.21%。
Comments It was submitted without the full consent of all co-authors
基于混合专家知识图谱检索增强生成的多智能体LLM推荐系统
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出MixRAGRec框架,通过混合专家检索、知识偏好对齐和对比学习增强推荐,解决KG-RAG中检索粒度单一、结构信息丢失和端到端学习困难问题。
Comments Accepted by KDD 2026 Research Track
EvoGens:一种基于种群的启发式搜索框架用于科学思想生成
机构 * Southwest Petroleum University(西南石油大学) ; Sichuan Police College(四川警察学院)
专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对现有LLM方法生成科学思想时语义趋同、多样性和新颖性不足的问题,提出EvoGens框架,通过进化搜索(变异、交叉、选择)增强思想探索,显著提升新颖性和多样性。
Comments 21 pages, 6 figures
通用嵌入还是特定嵌入,哪个更好?非英语语言临床编码搜索的实证研究
机构 * TietAI
专题命中 领域大模型 :LLM(abstract,abstract_cn);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过使用大型生成语言模型生成的合成数据微调双语编码器,构建两阶段检索器,解决了非英语语言临床编码检索中召回率下降的问题,并在多语言基准上取得了优于BioBERT-ST的性能。
Comments 24 pages, 12 figures, 6 tables
KnowledgeGain: 评估和优化面向读者学习的科学新闻生成
机构 * Old Dominion University(旧 Dominion 大学) ; University of Notre Dame(诺特大学)
专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 提出KnowledgeGain指标,通过测量读者知识增益来评估科学新闻质量,并利用LLM模拟器优化生成,提升读者学习效果。
同一患者,不同措辞,不同诊断?评估临床大语言模型中的语义稳定性
机构 * Department of Computer Science and Engineering, College of Engineering, Qatar University(卡塔尔大学计算机科学与工程系) ; College of Science and Engineering, Hamad Bin Khalifa University (HBKU)(哈马德·本·卡伊夫大学(HBKU)理学院) ; Primary Health Care Corporation (PHCC)(初级卫生保健公司) ; Birmingham City University(伯明翰城市大学)
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对临床大语言模型对语义等价但措辞不同的提示敏感的问题,提出基于自然语言推理的语义验证框架和三个量化指标,评估16个开源通用与医学模型,发现领域专业化并不一致地提升或降低鲁棒性。
Comments 14 pages, 5 figures
完全开放的Meditron:临床大语言模型的可审计流水线
机构 * EPFL(苏黎世联邦理工学院)
专题命中 领域大模型 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出首个完全开放的临床大语言模型构建流水线Fully Open Meditron,通过可审计的数据集、可复现的训练框架和对齐评估协议,在不牺牲可审计性和可复现性的前提下实现了领域最新性能。
Comments Preprint. 31 pages, 10 figures. Code, models, and data: https://github.com/EPFLiGHT/FullyOpenMeditron
谁背书了它?测量语言模型中跨专业水平的权威偏差
机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) ; Independent Research(独立研究)
专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.LG
AI总结 研究语言模型在推理任务中是否因背书来源的专业水平而产生系统性偏差,发现模型对高权威来源的错误背书更易受影响,导致准确率下降和错误答案置信度增加,但可通过机制干预减轻偏差。
SafeRx-Agent: 基于知识的多智能体框架用于安全且可解释的药物推荐
机构 * McGill University(麦吉尔大学) ; McMaster University(麦马斯特大学) ; University of Toronto(多伦多大学) ; Ohio University(俄亥俄大学)
专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出SafeRx-Agent,一种基于知识的多智能体框架,通过患者上下文、外部临床知识和安全验证来推荐可追溯的药物集合,在MIMIC-III和MIMIC-IV数据集上提高了细粒度药物预测准确性,同时控制了药物相互作用、禁忌症和药物集合大小。
德国法律文本的分块处理
机构 * Technical University of Munich(慕尼黑技术大学)
专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 研究针对德国成文法,以德国民法典为基准语料库,比较多种分块策略在检索增强生成中的性能,发现基于法律固有结构(如章节、小节)的分块方法在召回率和计算效率上优于语义增强方法。
Comments Accepted at the Eigth Workshop on Automated Semantic Analysis of Information in Legal Texts co-located with the 21th International Conference on Artificial Intelligence and Law (ICAIL 2026)
SEMA-RAG: 面向医学推理的自演化多智能体检索增强生成框架
机构 * CSE, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) ; Wuhan University of Technology(武汉理工大学)
专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 针对医学问答中单轮静态检索与临床推理多阶段过程不匹配的问题,提出SEMA-RAG框架,通过任务解耦和动态多轮探索,由三个专业智能体分别负责临床解释、自演化检索和证据裁决,在多个基准上平均提升准确率6.46个百分点。
Comments Accepted to Findings of ACL 2026
来自临床叙述的可靠多语言骨科决策支持:语言感知适应与验证引导的延迟
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; School of Software, Nanjing University of Information Science and Technology (NUIST)(南京信息工程大学软件学院) ; Department of Orthopedic, Bahawal Victoria Hospital(巴哈瓦尔维多利亚医院骨科部门)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对低资源医疗环境中的多语言骨科决策支持,提出结合语言感知适配编码器IndicBERT-HPA和确定性选择性验证层的可靠性框架,在英语、印地语和旁遮普语临床文本分类中取得最优性能。
基于最小充分表示学习的大语言模型领域特定数据合成
机构 * vivo AI Lab(vivo人工智能实验室) ; Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出DOMINO框架,通过对比解耦学习最小充分领域表示,指导生成领域对齐的合成数据,在隐式领域定义下提升微调性能。
Comments Accepted by KDD 2026
组织对生成式人工智能在网络安全中的适应
机构 * Independent Researcher, United States(美国独立研究者)
专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本研究通过分析2022至2025年的25项研究,采用定性方法探讨组织如何通过修改框架和混合操作流程适应生成式AI,发现成熟基础设施、监管压力和人力资本投资是成功的关键,同时指出攻防能力不平衡等挑战。
Comments 38 pages, 1 table, 1 figure Revised title, abstract, and formatting for journal submission, corrected heading numbers, no substantive changes in content
在纠缠的人机交互中提升元认知以应对认知行为漂移
专题命中 领域大模型 :LLM(abstract,abstract_cn)
AI总结 提出一个基于人类认知不变特征和元认知的框架,通过识别纠缠、漂移和元认知干预点,解决AI对话代理引发的认知行为漂移问题。
生成报告还是重复模板?测量和缓解三维CT报告生成中的模板崩溃
机构 * Technical University of Munich (TUM)(慕尼黑技术大学) ; TUM Hospital(TUM医院) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.AI
AI总结 针对三维CT报告生成中模型输出多样性低、病理检测能力差的模板崩溃问题,提出解耦框架CLarGen,通过分离临床检测与语言合成,显著提升临床准确性并保持报告流畅性。
OmniMatBench:跨19个材料科学子领域的人类校准多模态推理基准
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Southeast University(东南大学) ; Nanjing University(南京大学) ; Suzhou Laboratory(苏州实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 领域大模型 :language model(abstract);分类 cs.AI
AI总结 针对现有基准忽视从材料知识到应用的推理过程,提出OmniMatBench,包含3171个专家策划的问答与计算问题,覆盖19个子领域,评估13个多模态大模型,最佳模型仅得0.372分,揭示当前模型在材料科学推理中的显著差距。
Comments 22 Pages
解码手术场景:手术中场景图的范围综述
机构 * School of Computation, Information and Technology, Technical University of Munich(计算信息学院,慕尼黑技术大学) ; Klinik und Poliklinik für Augenheilkunde, TUM University Hospital(眼科诊所,TUM大学医院) ; Computer Aided Medical Procedures, Technical University of Munich(医学辅助程序,慕尼黑技术大学) ; Department of Biomedical Engineering, University of Alberta(生物医学工程系,阿尔伯塔大学)
专题命中 领域大模型 :foundation model(abstract)
AI总结 本文通过PRISMA-ScR指导的范围综述,系统梳理了手术中场景图(SG)的研究现状,分析了52项研究,揭示了从图神经网络向基础模型和生成式AI的方法论转变,并提出了“验证三位一体”评估框架以弥合临床转化差距。
Comments Submitted and accepted to Medical Image Analysis (DOI: 10.1016/j.media.2026.104083). An interactive version of the summary tables is available at: osf.io/fruq8
Journal ref Medical Image Analysis (2026)