Data, Not Model: Explaining Bias toward LLM Texts in Neural Retrievers
数据,而非模型:解释神经检索器对LLM文本的偏见
专题命中 预训练与数据 :LLM(title,abstract)
AI总结 研究指出神经检索器对LLM文本的偏见源于训练数据中的监督偏差,而非模型本身,通过减少数据偏差和调整向量投影降低偏见。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
数据,而非模型:解释神经检索器对LLM文本的偏见
专题命中 预训练与数据 :LLM(title,abstract)
AI总结 研究指出神经检索器对LLM文本的偏见源于训练数据中的监督偏差,而非模型本身,通过减少数据偏差和调整向量投影降低偏见。
手势感知预训练与标记融合用于3D手姿态估计
机构 * George Mason University(乔治梅森大学)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 本文提出基于手势语义的预训练方法,通过InterHand2.6M数据集的粗细标签学习信息嵌入空间,并结合Transformer进行关节回归,提升单手姿态估计精度。
Comments 6 pages, 6 figures
具有拓扑引导预训练的层次网格变换器用于脑结构形态学分析
机构 * Arizona State University(亚利桑那州立大学) ; University of Southern California(南加州大学) ; Banner Health(班纳健康) ; Barrow Neurological Institute(巴罗神经学研究所)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 本文提出一种层次变压器框架,用于异构网格分析,通过自监督预训练实现跨模态和多尺度的高效注意力机制,用于脑结构形态学分析。
基于大语言模型的列表级重排序在位置偏见影响下的应用
专题命中 预训练与数据 :LLM(title,abstract)
AI总结 本文提出DebiasFirst方法,通过位置校准和位置感知的数据增强缓解大语言模型在列表级重排序中的位置偏见问题,提升排序效果和鲁棒性。
隐式神经表示中噪声预训练的意外有效性
机构 * Rice University(莱斯大学) ; University of California, Riverside(加州大学河滨分校)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 本文通过噪声预训练探索隐式神经表示的特性,发现无结构噪声预训练显著提升信号拟合能力,但对去噪效果不佳,而经典自然图像频谱结构的噪声则在信号拟合与逆向成像间取得平衡。
Comments Accepted to CVPR 2026. Project page: https://kushalvyas.github.io/noisepretraining.html
InternVideo-Next:无需视频-文本监督的通用视频基础模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Shenzhen Institutes of Advanced Technology, China(中国科学院深圳先进技术研究院) ; Nanjing University(南京大学)
专题命中 预训练与数据 :foundation model(title);pretraining(abstract)
AI总结 本文提出InternVideo-Next,通过解耦传统编码器-解码器设计为Encoder-Predictor-Decoder框架,解决像素重建与语义冲突问题,构建语义一致且细节保留的潜在空间,提升视频基础模型的通用性。
Journal ref CVPR2026
缩小预训练差距:领域对齐的基于文本的人检索
机构 * Xi’an Jiaotong University(西安交通大学) ; Hefei University of Technology(合肥工业大学) ; University of Macau(澳门大学)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 本文提出双层级策略,通过领域感知扩散和多粒度关系对齐,解决光照、颜色和视角变化导致的领域差距,提升CUHK-PEDES等数据集上的性能。
图像与文本学习的极限:视觉语言模型与具身场景理解
机构 * Barnard College, Columbia University(哥伦比亚大学巴纳德学院) ; Colgate University(科尔盖特大学)
专题命中 预训练与数据 :language model(title,abstract)
AI总结 研究探讨图像与文本学习在人类场景理解中的局限性,通过对比18个视觉语言模型与2000名人类观察者在15项任务中的表现,发现模型在具身认知任务中存在显著缺陷,表明分布学习不足以实现基于 affordance 的场景理解。
Comments 7 figures, 5 tables
THFM:一种用于4D人体感知及更广泛领域的统一视频基础模型
专题命中 预训练与数据 :foundation model(title,abstract)
AI总结 THFM是一种统一的视频基础模型,能够同时处理密集任务和稀疏任务,其基于预训练的文本到视频扩散模型,并通过可学习的标记增强稀疏预测能力,且在合成数据上表现优异。
PP-OCRv5:一个专门针对OCR任务的500万参数模型,其性能可与百亿参数的视觉-语言模型相抗衡
机构 * PaddlePaddle Team(PaddlePaddle团队) ; Baidu Inc(百度公司)
专题命中 预训练与数据 :language model(title,abstract)
AI总结 本文提出PP-OCRv5,一个轻量级OCR系统,通过数据驱动的方法在OCR基准上实现了与百亿参数VLMs相当的性能,同时提升了文本定位精度并减少了幻觉。
GARP-EFM:利用揭示偏好结构改进基础模型
专题命中 预训练与数据 :foundation model(title,abstract)
AI总结 本文通过利用揭示偏好结构改进基础模型,利用Afriat定理生成合成数据,提升时间序列预测性能。
一种用于从模拟图像生成程序化植物建筑表示的视觉语言模型
机构 * Biological and Agricultural Engineering(生物与农业工程系) ; Department of Plant Sciences(植物科学系) ; Viticulture and Enology(葡萄栽培与酿酒系) ; Wageningen University & Research(瓦赫宁根大学与研究学院)
专题命中 预训练与数据 :language model(title,abstract)
AI总结 本文提出一种视觉语言模型,通过合成图像生成3D植物建筑模型,提取器官级参数,验证了从图像数据中提取植物建筑参数的可能性。
MagicSeg: 通过反事实扩散模型自动生成实现开放世界分割预训练
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; PengCheng Laboratory(鹏城实验室) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 MagicSeg通过反事实扩散模型自动生成数据集,提升开放世界语义分割性能,实验在PASCAL VOC等数据集上取得SOTA结果。
Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence 2026
基于模板的对象检测使用基础模型
机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学) ; e.solutions GmbH(e.solutions公司)
专题命中 预训练与数据 :foundation model(title,abstract)
AI总结 本文提出一种无需训练数据的模板基于对象检测方法,通过分割基础模型和简单特征分类结合,实现快速检测与分类,适用于自动化界面测试场景。
具有人口统计学意识的自监督异常检测预训练用于公平的罕见心脏诊断
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; National University of Defense Technology(国防科技大学) ; Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(瑞金医院,上海交通大学医学院) ; Renji Hospital, Shanghai Jiao Tong University School of Medicine(仁济医院,上海交通大学医学院)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 本文提出一种两阶段ECG框架,结合自监督异常检测与人口统计学意识表征学习,提升罕见心脏异常检测的灵敏度并确保公平性,实验显示在超过一百万临床ECG数据上,方法在罕见异常检测中达到94.7%的AUROC,并缩小了常见-罕见性能差距。
为跨模态和任务提供具有实用保障的视觉-语言模型去偏方法
机构 * King’s College London(伦敦国王学院) ; Queen Mary University of London(伦敦女王学院)
专题命中 预训练与数据 :language model(title,abstract)
AI总结 本文提出一种无需标注数据的训练自由去偏方法,在跨模态空间中获得帕累托最优公平性,同时保持有限的实用性损失,实验显示其在多种公平度量和任务中优于现有方法。
双曲多视角预训练用于机器人操作
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 本文提出HyperMVP,一种基于双曲空间的多视角自监督预训练框架,通过GeoLink编码器学习结构化嵌入,提升机器人操作任务的性能。
Comments This paper was submitted to CVPR 2026 and was recommended for Findings, but the authors have withdrawn it and are currently adding more content to submit it elsewhere
FG-CLTP: 用于机器人操作的细粒度对比语言触觉预训练
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 FG-CLTP通过细粒度对比学习提升机器人触觉感知,实现高精度分类和控制,减少误差并增强跨传感器泛化能力。
Comments 9 pages, 6 figures
基于人类感知的对比语言-音频预训练:Human-CLAP
机构 * The University of Tokyo, Japan(东京大学) ; Ritsumeikan University, Japan(立命馆大学)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 Human-CLAP通过引入人类主观评价分数提升CLAPScore与人类评价的相关性
Comments Submitted to APSIPA ASC 2025
MedKCO:通过知识驱动的认知协调进行医学视觉-语言预训练
机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) ; Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education, China(教育部新一代人工智能技术及其交叉应用重点实验室) ; School of Computer Science and Engineering, Nanjing University of Science and Technology, China(南京理工大学计算机科学与工程学院)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 MedKCO通过知识驱动的认知协调优化医学视觉-语言预训练,提升模型在分布偏移下的泛化能力。
Comments CVPR2026
FOMO-3D:利用视觉基础模型进行长尾3D目标检测
机构 * Waabi ; University of Toronto(多伦多大学)
专题命中 预训练与数据 :foundation model(title,abstract)
AI总结 FOMO-3D通过利用视觉基础模型的丰富先验知识和多模态融合设计,提升长尾3D目标检测的性能。
Comments Published at 9th Annual Conference on Robot Learning (CoRL 2025)
预训练有限元法:通过物理信息神经算子实现的PDEs预训练和热启动框架
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 该研究提出预训练有限元法,通过物理信息神经算子结合FEM,提升PDEs求解效率与精度。
重新审视极化形变在视觉基础模型时代的应用
机构 * Sony Semiconductor Solutions Corporation(索尼半导体解决方案公司)
专题命中 预训练与数据 :foundation model(title,abstract)
AI总结 本研究通过极化线索和改进的数据增强方法,在少量训练数据下实现了优于传统RGB模型的表面法线估计性能。
学习驾驶是免费礼物:从未经处理的现实视频中进行大规模无标签自主性预训练
机构 * Applied Intuition ; Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校)
专题命中 预训练与数据 :pretraining(title);foundation model(abstract)
AI总结 本文提出一种无标签、教师引导的框架,通过未经处理的现实视频学习自动驾驶表示,无需姿态、标签或LiDAR,实现高效的自动驾驶感知和规划。
Comments Accepted at CVPR 2026
重新审视基础模型在小像素病理图像细胞级分析中的作用——在小补丁约束下训练数据规模和模糊扰动对CNN和视觉变换器的影响
机构 * Division of Gastrointestinal Surgery, Department of Surgery, Kobe University Graduate School of Medicine(Kobe大学医学研究院外科部胃肠外科部) ; Association of Medical Artificial Intelligence Curation(医学人工智能 curation协会) ; Center for Medical Education and Clinical Training, Kindai University Faculty of Medicine(Kindai大学医学部医学教育与临床培训中心) ; Department of Biophysics, Kobe University Graduate School of Health Sciences(Kobe大学健康科学研究院生物物理学部)
专题命中 预训练与数据 :foundation model(title,abstract)
AI总结 本研究探讨了在小补丁约束下,基础模型与任务特定架构在细胞级病理图像分析中的性能差异,发现任务特定架构在数据充足时表现更优。
NeighborMAE: 利用邻近遥感图像间的空间依赖性在掩码自编码器预训练中进行建模
机构 * KU Leuven(卢森堡大学) ; ESA Φ \Phi -lab(欧洲航天局Φ实验室) ; HKUST(GZ)(香港科技大学(珠海)) ; KTH(皇家理工学院)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 NeighborMAE通过联合重建邻近遥感图像,利用空间依赖性提升掩码自编码器在遥感图像预训练中的性能。
通过语言枢轴预训练统一异构多模态遥感检测
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 BabelRS通过语言枢轴预训练框架统一异构多模态遥感检测,解耦模态对齐与任务学习,提升训练稳定性与检测性能。
TokenCom: 一种用于多模态和多任务令牌通信的视觉-语言模型
机构 * Hunan Provincial Key Laboratory of Intelligent Computing and Language Information Processing, Hunan Normal University(湖南省级智能计算与语言信息处理重点实验室,湖南师范大学) ; School of Information Science and Engineering, Hunan Normal University(信息科学与工程学院,湖南师范大学) ; Changsha Social Laboratory of Artificial Intelligence, Hunan University of Technology and Business(长沙人工智能社会实验室,湖南工业大学) ; School of Computer Science, Hunan University of Technology and Business(计算机科学学院,湖南工业大学) ; Department of Computer Science, Brunel University London(伦敦布鲁内尔大学计算机科学系) ; National Mobile Communications Research Laboratory, Southeast University(东南大学国家移动通信研究中心) ; Department of Electrical and Computer Engineering, University of Houston(电子与计算机工程系,休斯顿大学)
专题命中 预训练与数据 :language model(title,abstract)
AI总结 TokenCom提出了一种新的视觉-语言模型框架TaiChi,通过双视觉分词器和双向注意力网络提升多模态和多任务令牌通信的性能。
基于变换器的自监督预训练的动物行为分析与神经编码
机构 * Columbia University(哥伦比亚大学) ; International Brain Laboratory(国际脑实验室)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 BEAST通过自监督预训练的变换器框架,提升动物行为分析和神经编码的性能,适用于多种神经行为任务。
PPT:基于伪标签轨迹的运动预测预训练
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 PPT通过利用伪标签轨迹进行预训练,提升运动预测的泛化能力和在低数据环境下的性能。
Comments 8 pages, 6 figures, accepted to ICRA 2026