Renaissance: Investigating the Pretraining of Vision-Language Encoders
文艺复兴:探究视觉语言编码器的预训练
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 文艺复兴通过元分析探究视觉语言编码器预训练的最佳实践,展示冻结大部分模型可节省计算资源,同时探讨基于视觉或文本模型构建变压器的影响。
Comments 9 pages
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
文艺复兴:探究视觉语言编码器的预训练
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 文艺复兴通过元分析探究视觉语言编码器预训练的最佳实践,展示冻结大部分模型可节省计算资源,同时探讨基于视觉或文本模型构建变压器的影响。
Comments 9 pages
SSL4EO-S12 v1.1:一种用于预训练的多模态、多季节数据集,更新版
机构 * IBM Research Europe(IBM欧洲研究中心) ; German Aerospace Center(德国航空航天中心) ; Julich Supercomputing Centre University of Iceland(朱利奇超级计算中心爱沙尼亚大学)
专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)
AI总结 SSL4EO-S12 v1.1通过增加多模态数据和改进数据结构,为预训练大规模基础模型提供了更高效、更全面的地球观测数据集。
统一多种基础模型以推进高级计算病理学
机构 * Shanghai Jiao Tong University(上海交通大学) ; Washington University in St. Louis(华盛顿大学) ; University of Science and Technology Beijing(北京科技大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Department of Surgical Oncology and General Surgery, Key Laboratory of Precision Diagnosis and Treatment of Gastrointestinal Tumours, Ministry of Education, The First Hospital of China Medical University(外科肿瘤科和普通外科,国家教育委员会胃肠道肿瘤精准诊断与治疗重点实验室,中国医科大学第一医院) ; Shanghai Innovation Institute(上海创新研究院) ; Sensetime Research(商汤科技研究院)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)
AI总结 Shazam通过在线整合多个预训练病理基础模型,实现高效且可扩展的计算病理学应用,优于单个模型性能。
Comments 50 pages, 5 main figures
EchoJEPA:一种用于超声心动图的潜在预测基础模型
机构 * University Health Network(大学健康网络) ; University of Toronto(多伦多大学) ; University of Chicago(芝加哥大学) ; University of California, San Francisco(加州大学旧金山分校) ; Vector Institute(向量研究所) ; Cohere Labs(Cohere实验室)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)
AI总结 EchoJEPA通过潜在预测方法在超声心动图中实现鲁棒且可推广的医学AI,显著提升心室功能和压力估计的准确性。
视觉渲染能否绕过分词?探究基于像素的语言模型中脚本-分词器不一致问题
机构 * Monash University Indonesia(墨尔本大学印尼分校) ; MBZUAI ; Boston University(波士顿大学) ; University of Edinburgh(爱丁堡大学)
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究探讨了基于像素的语言模型中视觉渲染是否能绕过分词约束,发现重新引入文本分词器加剧了分词不一致问题,自定义分词器在性能上表现更优。
Comments Submitted to ARR January
基于脑网络表示的自监督基础模型系统综述:使用脑电图
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)
AI总结 本文综述了基于脑电图的自监督基础模型,探讨了其预训练方法、模型架构及下游任务应用,指出需更多多样化数据和标准化评估以提升模型通用性。
Comments 19 pages, 1 figure, 3 tables
超越开放词汇:面向遥感图像的目标检测多模态提示
机构 * School of Computer Science and Engineering, Beihang University, Beijing, China(计算机科学与工程学院,北京航空航天大学,中国)
专题命中 预训练与数据 :prompting(title,abstract);pretraining(abstract)
AI总结 RS-MPOD提出了一种多模态开放词汇检测框架,通过整合视觉和文本提示提升遥感图像中目标检测的稳定性与准确性。
TMU系统用于XACLE挑战:利用CLAP伪标签训练大型音频语言模型
机构 * Tokyo Metropolitan University(东京 Metropolitan 大学)
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract)
AI总结 TMU系统通过CLAP伪标签预训练,在XACLE挑战中实现0.632的SRCC成绩,优于基线系统并获得第三名。
Comments 3 pages; 2 figures; 2 tables; Accepted at ICASSP 2026 Workshop (SP Grand Challenges, GC-12: XACLE)
Omni-fMRI:一种无图谱的fMRI基础模型
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)
AI总结 Omni-fMRI提出了一种无需图谱的fMRI基础模型,通过动态拼接机制实现高效预训练,提升了脑表示学习的可扩展性和可重复性。
将语言模型训练从黑箱转变为沙盒
专题命中 预训练与数据 :language model(title,abstract);prompting(abstract)
AI总结 通过让学生直接训练语言模型,研究发现可视化训练过程能显著提升学生对AI数据驱动本质的理解。
Comments 4 pages, 2 figures, WIP, accepted to IEEE conference
VISTA-PATH: 一种交互式的基础模型用于计算病理学中病理图像分割和定量分析
机构 * Department of Pathology and Laboratory Medicine, University of Pennsylvania(病理学与实验室医学系,宾夕法尼亚大学) ; Department of Electrical and System Engineering, University of Pennsylvania(电气与系统工程系,宾夕法尼亚大学) ; Department of Biomedical Engineering, Georgia Institute of Technology and Emory University(生物医学工程系,佐治亚理工学院和埃默里大学) ; NVIDIA Corporation(NVIDIA公司) ; Department of Biostatistics, Epidemiology and Informatics, University of Pennsylvania(生物统计学、流行病学与信息学系,宾夕法尼亚大学)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)
AI总结 VISTA-PATH是一种交互式基础模型,通过整合专家反馈和多类分割,提升病理图像分割的临床应用价值。
视觉-语言模型的空间盲区
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract)
AI总结 本文提出通过改进图像编码器和2D位置编码来提升视觉-语言模型的空间推理能力,以解决其在空间关系捕捉上的不足。
Comments Work done as part of the EleutherAI SOAR Program
语言模型能否发现扩展定律?
专题命中 预训练与数据 :language model(title);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出SLDAgent,一种基于进化的代理,能够自动发现比人类衍生定律更准确的扩展定律,展示了AI在科学发现中的潜力。
地理空间基础模型的扩展规律:以PhilEO基准测试为例
机构 * 1. European Space Agency (ESA), -lab. 2. Leonardo Labs, Italy. 3. VITO. 4. IRISA, Université Bretagne Sud. 5. European Commission (EC)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)
AI总结 本文研究地理空间基础模型的扩展规律,通过不同数据集和架构的实验,发现CNN在低样本下表现优异,ViT-UPerNet在大规模数据上表现最佳,Mamba模型展现出效率优势但需进一步训练。
Comments 11 pages, 12 figures, 3 tables, Submitted
本体感知增强视觉语言模型在为机器人任务生成描述和子任务分割中的应用
机构 * Faculty of Science and Engineering, Waseda University(工学部,早稻田大学) ; Artificial Intelligence Laboratory, Fujitsu Limited(Fujitsu 人工智能实验室) ; National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院)
专题命中 预训练与数据 :language model(title,abstract);foundation model(abstract)
AI总结 本研究通过引入本体感知数据,提升视觉语言模型在机器人任务描述和子任务分割中的性能,以增强机器人模仿学习效率。
TURNA:一种用于增强理解和生成的土耳其编码器-解码器语言模型
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 TURNA是一种专为土耳其语设计的编码器-解码器语言模型,通过预训练在低资源环境下实现了对自然语言理解和生成任务的提升。
Journal ref Findings of the Association for Computational Linguistics: ACL 2024
MoIIE:多模态专家的混合模型用于大视觉语言模型
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institut(上海创新研究院) ; University of Southern California(南加州大学) ; Huawei Technologies Co., Ltd(华为技术有限公司) ; Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin, EIT(宁波空间智能与数字衍生关键实验室,数字孪生研究院,EIT)
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract)
AI总结 本文提出MoIIE模型,通过混合内模态和跨模态专家提升大视觉语言模型的效率和性能。
从生产语言模型中提取书籍
机构 * Stanford University(斯坦福大学) ; Yale University(耶鲁大学)
专题命中 预训练与数据 :language model(title);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过两阶段方法测试从生产LLM中提取书籍的可行性,发现部分模型可提取受版权保护文本,但需不同劫持策略,揭示生产LLM存在训练数据泄露风险。
Comments We ran experiments from mid-August to mid-September 2025, notified affected providers shortly after, and now make our findings public after a 90-day disclosure window
基于视觉语言模型的弱监督瞬时沟壑遥感图像检测
机构 * Vision Guided and Intelligent Robotics Laboratory (ViGIR)(视觉引导与智能机器人实验室) ; EECS Dept.(电子工程与计算机科学系) ; Division of Plant Science and Technology(植物科学与技术系)
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract)
AI总结 本文提出基于视觉语言模型的弱监督瞬时沟壑检测方法,通过半监督学习和噪声感知损失函数提升遥感图像检测性能。
GraphTracer: LLM代理中基于图的故障追踪以实现鲁棒多轮深度搜索
专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract)
AI总结 GraphTracer通过信息流分析和依赖图构建,提升多代理系统在多轮深度搜索中的故障归因准确性与鲁棒性。
Comments This submission has been withdrawn by the authors due to a fundamental error in the methodology that affects the validity of the main results
Chorus:多教师预训练用于整体3D高斯场景编码
机构 * University of Amsterdam(阿姆斯特丹大学) ; ETH Zürich(苏黎世联邦理工学院) ; University of Trento(特伦托大学)
专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)
AI总结 Chorus通过多教师预训练方法,实现对3D高斯场景的高效编码,提升多任务表现并实现数据高效监督。
Any-Optical-Model: 一种通用的光学遥感基础模型
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)
AI总结 Any-Optical-Model提出了一种通用的光学遥感基础模型,能够适应任意波段配置、传感器类型和分辨率尺度,通过多尺度自适应补丁嵌入和语义对齐机制实现光谱-空间关系建模,有效提升遥感任务的泛化能力和实际应用性能。
Comments Accepted by AAAI2026
可重用的理论表示用于对撞机:SMEFT基础模型的演示
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)
AI总结 本研究提出了一种基于对比表示的SMEFT基础模型,用于高能对撞机中对新物理的探索,通过训练编码器网络生成低维潜在流形,以捕捉SMEFT引起的Drell-Yan光谱变形的几何结构。
Comments 39 pages, 12 figures, 2 tables
ExpShield: 保护网络文本免受未经授权的爬虫和大语言模型利用
专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract)
AI总结 ExpShield通过不可见扰动减轻大语言模型对网络文本的记忆化,同时保持可读性,并通过实例利用指标和优化方法有效防御数据泄露风险。
Comments 18 pages
通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练
机构 * Peking University(北京大学) ; Renmin University of China(中国人民大学) ; BeingBeyond
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract)
AI总结 通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练,提升机器人任务的稳健性和通用性。
从节目到数据:设计一种工作流,通过语言模型使表演艺术的临时性资料可访问
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract)
AI总结 本文提出利用多模态语言模型和本体推理模型,将戏剧节目转化为结构化数据,以提升文化遗产资料的可访问性和分析能力。
Comments 19 pages, 8 figures, 5 tables, 17 references
PixCell:数字病理图像的生成基础模型
机构 * Stony Brook University(石溪大学) ; Argonne National Laboratory(阿贡国家实验室) ; The University of Chicago(芝加哥大学) ; University of Utah(犹他大学)
专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract)
AI总结 PixCell是首个针对数字病理图像的生成基础模型,通过扩散模型在大规模数据集上训练,实现隐私保护的数据生成和虚拟染色任务,提升病理学研究效率。
Comments Project page - https://histodiffusion.github.io/docs/projects/pixcell
提升自监督学习以改进手术基础模型
机构 * Department of Electrical Engineering, Video Coding \& Architectures, Eindhoven University of Technology, Eindhoven, The Netherlands ; Department of Biomedical Engineering, Medical Image Analysis, Eindhoven University of Technology, Eindhoven, The Netherlands ; Department of Surgery, University Medical Center Utrecht, Utrecht, The Netherlands ; Department of Oncological Urology, University Medical Center Utrecht, Utrecht, The Netherlands ; Department of Urology, Catharina Hospital, Eindhoven, The Netherlands
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)
AI总结 本研究提出SurgeNetXL,通过大规模预训练提升手术计算机视觉性能,实现多个任务上的显著改进。
Journal ref Medical Image Analysis, 2025
电力线:大规模预训练中权重衰减和批量大小的缩放定律
机构 * Cerebras Systems(Cerebras系统)
专题命中 预训练与数据 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了大规模语言模型预训练中权重衰减和批量大小的缩放定律,揭示了超参数在不同训练设置下的优化规律,并提出了基于令牌数比的精确预测方法。
Comments NeurIPS 2025
机构 * School of Geographical Sciences and Urban Planning(地理科学与城市规划学院) ; Arizona State University(亚利桑那州立大学) ; School of Computing and Augmented Intelligence(计算与增强智能学院) ; NASA Marshall Space Flight Center(国家航空航天局马歇尔航天飞行中心)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)