arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138791 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2606.20418 2026-06-19 cs.SD 新提交 78%

MixProLAP: Mixture-Induced Uncertainty Modeling for Probabilistic Language-Audio Pretraining

MixProLAP:混合诱导的不确定性建模用于概率性语言-音频预训练

Yu Nakagome, Jaesong Lee, Soo-Whan Chung

机构 * LINE WORKS Corporation(LINE WORKS公司) NAVER Cloud Corporation(NAVER Cloud公司)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出概率性音频-语言预训练框架MixProLAP,通过混合音频-文本对模拟重叠声音,建模多对多对应不确定性,并引入多级包含损失,在音频-文本检索中优于确定性基线。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06899 2026-06-19 cs.CR 版本更新 78%

Patronus: Identifying and Mitigating Transferable Backdoors in Pre-trained Language Models

Patronus: 识别和缓解预训练语言模型中的可迁移后门

Tianhang Zhao, Haodong Zhao, Wei Du, Pengzhou Cheng, Junxian Li, Sufeng Duan, Haojin Zhu, Gongshen Liu

专题命中 预训练与数据 :language model(title,abstract)

AI总结 针对预训练语言模型供应链中可迁移后门的安全威胁,提出Patronus防御框架,通过输入侧不变性检测和双阶段缓解策略,在15个模型和9个任务上实现≥98.3%后门检测召回率。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17200 2026-06-17 cs.RO 新提交 78%

ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining

ACE-Ego-0:统一第一人称人类与机器人数据用于VLA预训练

Hao Li, Ganlong Zhao, Yufei Liu, Haotian Hou, Guoquan Ye, Tongyan Fang, Chunxiao Liu, Siyuan Huang, Jianbo Liu, Xiaogang Wang, Hongsheng Li

机构 * ACE Robotics CUHK MMLab(香港中文大学多媒体实验室) CUHK, Shenzhen(香港中文大学(深圳)) SJTU(上海交通大学) THU(清华大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出ACE-EGO-0框架,通过可扩展的第一人称视频到动作管道和可靠性感知训练目标,统一人类与机器人数据用于VLA预训练,在多个基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17160 2026-06-17 cs.SD 新提交 78%

Transductive Zero-Shot Audio Classification with Audio-Language Models

基于音频-语言模型的直推式零样本音频分类

Jingwen Zhou, Mingzhe Wang

机构 * Xidian University, Xi'an, China(西安电子科技大学)

专题命中 预训练与数据 :language model(title);pretraining(abstract)

AI总结 提出一种文本锚定的球面高斯混合EM算法,利用测试批次音频嵌入统计信息改进零样本后验,无需标签和梯度,在三个数据集上提升4.6-9.2个点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15202 2026-06-16 cs.CV 新提交 78%

Comparing Human Gaze and Vision-Language Model Attention in Safety-Relevant Environments

安全相关环境中的人类注视与视觉语言模型注意力的比较

Marta Vallejo, Siwen Wang

机构 * Heriot-Watt University(赫瑞-瓦特大学)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 本研究通过眼动追踪实验和GPT-4o等视觉语言模型,比较了人类与模型在安全相关场景中的注意力分布,发现模型无需训练数据即可近似人类注视模式。

Comments 30 pages, 33 figures. Submitted as a preprint. Code and data available upon reasonable request

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18428 2026-06-16 cs.RO cs.CV 版本更新 78%

Latent Action Pretraining Through World Modeling

通过世界建模的潜在动作预训练

Bahey Tharwat, Yara Nasser, Ali Abouzeid, Ian Reid

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) Alexandria University(亚历山大大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出LAWM框架,通过世界建模从无标签视频中学习潜在动作表征,实现跨任务、环境和本体的迁移学习,在LIBERO基准和真实场景中优于使用真实动作预训练的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17148 2026-06-16 cs.CV 版本更新 78%

MixTeX: Data-Efficient LaTeX OCR via Synthetic Pretraining and Limited Fine-Tuning

MixTeX: 通过合成预训练和有限微调实现数据高效的LaTeX OCR

Yuhan Xu, Yijun Zhao, Renqing Luo, Gary M. Weiss

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出MixTeX,通过合成预训练(无需真实LaTeX源)和少量真实样本微调,实现数据高效的LaTeX OCR,在英中印刷和手写基准上优于依赖大数据集的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09511 2026-06-09 cs.CV 新提交 78%

Securing Self-supervised Data Curation for Foundation Models Robustness

保障基础模型鲁棒性的自监督数据筛选

Sandeep Gupta, Roberto Passerone

机构 * Queen's University Belfast(贝尔法斯特女王大学) University of Trento(特伦托大学)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 针对自监督数据筛选面临的数据投毒风险,提出基于ImageBind和传统分类器的主动防御机制PDD,在多种攻击下有效检测中毒数据,SVM-PDD表现最优。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14639 2026-06-09 cs.CV 78%

SLAM-AGS: Slide-Label Aware Multi-Task Pretraining Using Adaptive Gradient Surgery in Computational Cytology

SLAM-AGS:基于滑片标签的多任务预训练方法:利用自适应梯度手术的计算细胞学

Marco Acerbis, Swarnadip Chatterjee, Christophe Avenel, Joakim Lindblad

机构 * University of Cambridge(剑桥大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 SLAM-AGS通过联合优化弱监督相似性和自监督对比性目标,提升下游任务性能,并利用自适应梯度手术解决任务梯度冲突,实现在低见证率下的稳定预训练和更优表现。

Comments 5 pages, 2 figures, Submitted to ISBI2026

Journal ref 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06194 2026-06-05 cs.RO cs.CV 78%

ActiveMimic: Egocentric Video Pretraining with Active Perception

ActiveMimic: 基于主动感知的自我中心视频预训练

Xingyao Lin, Guojin Zhong, Tianyi Lu, Ziyi Ye, Yichen Zhu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Current Robotics NeoteAI

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出ActiveMimic框架,从自我中心人类视频中恢复同步的相机和手腕轨迹,将相机运动建模为视角动作,联合学习主动感知和操作技能,使预训练模型在机器人任务上达到与机器人数据预训练相当的性能。

Comments Project Page: https://activemimic.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05515 2026-06-05 cs.CV 78%

BRepCLIP: Contrastive Multimodal Pretraining on BRep Primitives for CAD Understanding

BRepCLIP: 面向CAD理解的BRep基元对比多模态预训练

Muhammad Usama, Didier Stricker, Mohammad Sadil Khan, Muhammad Zeshan Afzal

机构 * DFKI, Germany(德意志联邦共和国DFKI) RPTU Kaiserslautern-Landau, Germany(德国凯撒斯劳滕-兰道大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出BRepCLIP框架,通过对比预训练对齐CAD边界表示(BRep)几何与语言/图像嵌入,显著提升检索和零样本分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24698 2026-06-04 cs.RO 78%

Dynamic Policy Learning for Legged Robot with Simplified Model Pretraining and Model-Homotopy-Inspired Transfer

基于简化模型预训练与模型同伦启发迁移的足式机器人动态策略学习

Dongyun Kang, Min-Gyu Kim, Tae-Gyu Song, Hajun Kim, Sehoon Ha, Hae-Won Park

机构 * Department of Mechanical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(机械工程系,韩国科学技术院(KAIST)) School of Interactive Computing, Georgia Institute of Technology(交互计算学院,佐治亚理工学院)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出一种延续学习框架,结合简化模型预训练和模型同伦启发迁移,高效生成和优化足式机器人的复杂动态行为,并在真实四足机器人上验证了翻转和墙面辅助等动态任务。

Comments 8 pages

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 7, pp. 8068-8075, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03508 2026-06-03 cs.CV 78%

Structure-Guided Mixed Masked Pretraining and Spatial Continuity Regularization for Printed Circuit Board Defect Detection

结构引导混合掩码预训练与空间连续性正则化用于印刷电路板缺陷检测

Peitong Wang, Nuo Wang, Enxin Qin, Chengjin Yu, Hanyu Xuan, Yuanting Yan

机构 * Ahu.edu.cn(安徽大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出两阶段PCB缺陷检测框架,通过结构引导混合掩码预训练学习PCB结构先验,并在微调阶段引入空间连续性正则化提升细长缺陷定位紧凑性,在DsPCBSD+数据集上达到85.5% mAP0.5。

Comments Preprint. 38 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18838 2026-06-02 cs.LG cs.AI cs.CL 78%

Lying Is Just a Phase: The Hidden Alignment Transition in Language Model Scaling

说谎只是一个阶段:语言模型扩展中的隐藏对齐转变

Adil Amin

机构 * ZEHEN Labs(ZEHEN实验室)

专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 通过分析63个基础模型,发现语言模型在特定规模阈值下,推理能力与真实性从反相关转变为正相关,并揭示了输出投影瓶颈和零竞争注意力头等内部机制。

Comments 15 pages, 8 figures, 2 tables. Companion paper: "The Growing Pains of Frontier Models: When Leaderboards Stop Separating and What to Measure Next." ( https://doi.org/10.48550/arXiv.2605.18840). Code: https://github.com/adilamin89/cape-scaling. Dashboard: https://zehenlabs.com/cape/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31329 2026-06-01 eess.AS 78%

Improving acoustic drone detection generalization through pretraining and data augmentation

通过预训练和数据增强提高声学无人机检测的泛化能力

Paul M. Reuter, Mattes Ohlenbusch, Christian Rollwage

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 针对声学无人机检测泛化挑战,提出基于预训练和在线数据增强的紧凑型DNN检测器,显著提升跨域检测性能。

Comments Accepted to Quiet Drones 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25262 2026-05-26 cs.CV 78%

Semantics-Guided Multimodal Masked Autoencoder Pretraining for 3D BEV Object Detection

语义引导的多模态掩码自编码器预训练用于3D BEV目标检测

Prabuddhi Wariyapperuma, Rajitha de Silva, Marc Hanheide, Thomas Bohné, Leonardo Guevara

机构 * University of Lincoln, Lincoln Centre for Autonomous Systems(林肯大学,林肯自主系统中心) University of Cambridge, Institute for Manufacturing, Department of Engineering(剑桥大学,制造研究所,工程系)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出语义引导的多模态掩码自编码器框架,通过语义引导的LiDAR体素掩码和辅助点语义解码分支,在预训练中注入语义信息,提升3D BEV目标检测性能。

Comments Accepted at the ICRA 2026 Workshop on Semantics for Reliable Robot Autonomy (SRRA) as a lightning talk and poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24642 2026-05-26 cs.CV cs.RO 78%

Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models

理解几何基础模型对视觉-语言-动作模型的影响

Yurou Yang, Muyuan Lin, Roberto Martin-Martin, Martin Labrie, Shreekant Gayaka, Cheng-Hao Kuo, Luca Carlone

机构 * Amazon Personal Robotics Group(亚马逊个人机器人小组) University of Texas at Austin(德克萨斯大学奥斯汀分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本文通过线性探测分析量化了视觉-语言-动作模型(VLA)与几何基础模型(GFM)之间的“几何差距”,比较了三种注入几何信息的架构,并研究了非架构因素对几何VLA性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22651 2026-05-22 cs.CV 78%

What Does the Caption Really Say? Counterfactual Phrase Intervention for Compositional Data Selection in Vision-Language Pretraining

图中标签真的在说些什么?用于视觉语言预训练中组合数据选择的反事实短语干预

Hyejin Go, Semi Lee, Hyesong Choi

机构 * Soongsil University(顺斯尔大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文研究了在视觉语言预训练中如何通过反事实短语干预来改进组合数据选择,提出了CPI方法以解决现有方法中全局过滤信号失效的问题,从而提升模型在关系识别任务上的表现。

Comments 11 pages, 2 figures, 4 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18491 2026-05-19 cs.CV 78%

Benchmarking transferability of SSL pretraining to same and different modality segmentation tasks

对SSL预训练在相同和不同模态分割任务中转移性的基准测试

Jue Jiang, Harini Veeraraghavan

机构 * Department of Medical Physics, Memorial Sloan Kettering Cancer Center(医学物理系,纪念斯隆凯特勒癌症中心)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文通过九种SSL方法在相同和不同模态的分割任务中进行基准测试,评估了预训练模型的迁移能力和效率,发现自蒸馏masked image transformer在分割精度、收敛速度和少量样本到大量样本的性能差距方面表现最佳。

Comments Paper submitted to Medical Physics for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17957 2026-05-19 cs.SE 78%

Contextualized Code Pretraining for Code Generation

基于上下文的代码预训练用于代码生成

Chen Liu, Qingyuan Liang, Hanwen Zhang, Zeyu Sun, Yakun Zhang, Lu Zhang

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出了一种基于上下文的代码预训练方法,通过整合调用上下文来改进代码生成模型的训练和评估,实验表明该方法在代码生成任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10239 2026-05-19 cs.CV 78%

AdaptSplat: Adapting Vision Foundation Models for Feed-Forward 3D Gaussian Splatting

AdaptSplat: 为前馈3D高斯点划法适应视觉基础模型

Mingwei Xing, Xinliang Wang, Yifeng Shi

机构 * Ke Holdings Inc.(凯控股公司)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本文提出AdaptSplat,通过在通用架构中引入一个仅含1.5M参数的轻量级适配器,有效提升了前馈3D高斯点划法在跨领域泛化和高频几何保真度方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03639 2026-05-12 cs.CV 78%

Diffusion Masked Pretraining for Dynamic Point Cloud

动态点云的扩散掩码预训练

Zhuoyue Zhang, Jihua Zhu, Chaowei Fang, Jian Liu, Ajmal Saeed Mian

机构 * Xi’an Jiaotong University(西安交通大学) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) University of Western Australia(西澳大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出DiMP框架,通过引入扩散建模解决动态点云预训练中位置泄露和运动监督问题,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12964 2026-05-05 cs.CV 78%

Cross-Scale Pretraining: Enhancing Self-Supervised Learning for Low-Resolution Satellite Imagery for Semantic Segmentation

跨尺度预训练:增强低分辨率卫星图像的自监督学习以用于语义分割

John Waithaka, Gustave Bwirayesu, Moise Busogi

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出跨尺度预训练方法,利用高分辨率数据提升低分辨率图像的表示学习和分割性能,通过设计空间亲和组件改进自监督学习框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27448 2026-05-01 cs.CV 78%

LA-Pose: Latent Action Pretraining Meets Pose Estimation

LA-Pose:潜在动作预训练与姿态估计

Zhengqing Wang, Saurabh Nair, Prajwal Chidananda, Pujith Kachana, Samuel Li, Matthew Brown, Yasutaka Furukawa

机构 * Wayve Simon Fraser University(西蒙弗雷泽大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文通过自监督预训练视角重新审视相机姿态估计,提出逆动力学预训练作为替代全监督训练的方法。通过逆向和正向动力学模型学习潜在动作表示,将潜在动作特征用于相机姿态估计,实现高精度且可推广的姿态预测。

Comments Project page: https://la-pose.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22958 2026-04-30 cs.CV 78%

Contrastive Heliophysical Image Pretraining for Solar Dynamics Observatory Records

对比学习太阳物理图像预训练用于太阳动力学观测记录

Shiyu Shen, Zhe Gao, Taifeng Chai, Yang Huang, Bin Pan

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出SolarCHIP,通过对比学习预训练视觉骨干网络,解决太阳成像中的多模态传感、弱类间分离性和强类内变化性问题,提升跨模态翻译和日冕闪分类性能。

Comments arXiv admin note: This submission has been withdrawn due to violation of arXiv policies for acceptable submissions

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24044 2026-04-28 cs.CV 78%

CLLAP: Contrastive Learning-based LiDAR-Augmented Pretraining for Enhanced Radar-Camera Fusion

CLLAP:基于对比学习的激光雷达增强预训练用于增强雷达-相机融合

Bingyi Liu, Chuanhui Zhu, Hongfei Xue, Jian Teng, Jipeng Liu, Enshu Wang, Penglin Dai, Pu Wang

机构 * Wuhan University of Technology(武汉理工大学) University of North Carolina at Charlotte(北卡罗来纳州立大学) Wuhan University(武汉大学) Southwest Jiaotong University(西南交通大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 CLLAP通过利用丰富的激光雷达数据生成伪雷达数据,结合双阶段双模态对比学习策略,提升雷达-相机融合模型的特征提取能力,实验证明在NuScenes和Lyft Level 5数据集上显著提升3D目标检测性能。

Comments accepted by 2026 CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23676 2026-04-28 cs.HC 78%

Directional Alignment and Narrative Agency in Human-LLM Co-Writing

方向对齐与人类-大语言模型共写中的叙事自主性

Halfdan Nordahl Fundal, Yuri Bizzoni

专题命中 预训练与数据 :LLM(title,abstract)

AI总结 研究人类-大语言模型共写中的叙事自主性,探讨谁主导故事发展。通过87个共写故事分析,发现人类引入更多语义新颖性,而大语言模型则扩展人类元素,情感层面也呈现双向互动。

Comments 11 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13255 2026-04-27 cs.RO 78%

Policy Contrastive Decoding for Robotic Foundation Models

基于机器人基础模型的策略对比解码

Shihan Wu, Xu Luo, Ji Zhang, Junlin Xie, Jingkuan Song, Heng Tao Shen, Lianli Gao

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Southwest Jiaotong University(西南交通大学) Tongji University(同济大学)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本文提出Policy Contrastive Decoding方法,通过对比原始与物体遮挡的视觉输入,提升机器人策略的泛化能力,实验表明其在仿真和现实环境中均有效。

Comments ICLR 2026. Project website: https://koorye.github.io/PCD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20392 2026-04-23 cs.CV 78%

Self-supervised pretraining for an iterative image size agnostic vision transformer

面向迭代图像尺寸无关视觉变换器的自监督预训练

Nedyalko Prisadnikov, Danda Pani Paudel, Yuqian Fu, Luc Van Gool

机构 * INSAIT, Sofia University "St. Kliment Ohridski", Bulgaria(INSAIT,索菲亚大学"圣克莱门特·奥赫里迪斯",保加利亚)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出基于DINO自蒸馏目标的新型序列到全局自监督学习框架,通过高效积分图像补丁提取方法实现图像尺寸无关的视觉编码器大规模预训练,取得ImageNet-1K和下游分类任务的竞争力表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28178 2026-04-21 cs.CV 78%

ToLL: Topological Layout Learning with Asymmetric Cross-View Structural Distillation for 3D Scene Graph Generation Pretraining

ToLL: 基于非对称跨视图结构蒸馏的拓扑布局学习用于3D场景图生成预训练

Yucheng Huang, Luping Ji, Xiangwei Jiang, Wen Li, Mao Ye

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出ToLL框架,通过拓扑几何推理和结构多视图增强,解决3D场景图生成预训练中的几何捷径问题,提升场景图生成质量。

Comments Under Reivew

详情

展开后加载摘要…

URL PDF HTML 收藏