arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12429 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2406.17148 2026-06-16 cs.CV 版本更新 78%

MixTeX: Data-Efficient LaTeX OCR via Synthetic Pretraining and Limited Fine-Tuning

MixTeX: 通过合成预训练和有限微调实现数据高效的LaTeX OCR

Yuhan Xu, Yijun Zhao, Renqing Luo, Gary M. Weiss

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出MixTeX,通过合成预训练(无需真实LaTeX源)和少量真实样本微调,实现数据高效的LaTeX OCR,在英中印刷和手写基准上优于依赖大数据集的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09511 2026-06-09 cs.CV 新提交 78%

Securing Self-supervised Data Curation for Foundation Models Robustness

保障基础模型鲁棒性的自监督数据筛选

Sandeep Gupta, Roberto Passerone

机构 * Queen's University Belfast(贝尔法斯特女王大学) University of Trento(特伦托大学)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 针对自监督数据筛选面临的数据投毒风险,提出基于ImageBind和传统分类器的主动防御机制PDD,在多种攻击下有效检测中毒数据,SVM-PDD表现最优。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14639 2026-06-09 cs.CV 78%

SLAM-AGS: Slide-Label Aware Multi-Task Pretraining Using Adaptive Gradient Surgery in Computational Cytology

SLAM-AGS:基于滑片标签的多任务预训练方法:利用自适应梯度手术的计算细胞学

Marco Acerbis, Swarnadip Chatterjee, Christophe Avenel, Joakim Lindblad

机构 * University of Cambridge(剑桥大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 SLAM-AGS通过联合优化弱监督相似性和自监督对比性目标,提升下游任务性能,并利用自适应梯度手术解决任务梯度冲突,实现在低见证率下的稳定预训练和更优表现。

Comments 5 pages, 2 figures, Submitted to ISBI2026

Journal ref 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06194 2026-06-05 cs.RO cs.CV 78%

ActiveMimic: Egocentric Video Pretraining with Active Perception

ActiveMimic: 基于主动感知的自我中心视频预训练

Xingyao Lin, Guojin Zhong, Tianyi Lu, Ziyi Ye, Yichen Zhu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Current Robotics NeoteAI

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出ActiveMimic框架,从自我中心人类视频中恢复同步的相机和手腕轨迹,将相机运动建模为视角动作,联合学习主动感知和操作技能,使预训练模型在机器人任务上达到与机器人数据预训练相当的性能。

Comments Project Page: https://activemimic.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05515 2026-06-05 cs.CV 78%

BRepCLIP: Contrastive Multimodal Pretraining on BRep Primitives for CAD Understanding

BRepCLIP: 面向CAD理解的BRep基元对比多模态预训练

Muhammad Usama, Didier Stricker, Mohammad Sadil Khan, Muhammad Zeshan Afzal

机构 * DFKI, Germany(德意志联邦共和国DFKI) RPTU Kaiserslautern-Landau, Germany(德国凯撒斯劳滕-兰道大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出BRepCLIP框架,通过对比预训练对齐CAD边界表示(BRep)几何与语言/图像嵌入,显著提升检索和零样本分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24698 2026-06-04 cs.RO 78%

Dynamic Policy Learning for Legged Robot with Simplified Model Pretraining and Model-Homotopy-Inspired Transfer

基于简化模型预训练与模型同伦启发迁移的足式机器人动态策略学习

Dongyun Kang, Min-Gyu Kim, Tae-Gyu Song, Hajun Kim, Sehoon Ha, Hae-Won Park

机构 * Department of Mechanical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(机械工程系,韩国科学技术院(KAIST)) School of Interactive Computing, Georgia Institute of Technology(交互计算学院,佐治亚理工学院)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出一种延续学习框架,结合简化模型预训练和模型同伦启发迁移,高效生成和优化足式机器人的复杂动态行为,并在真实四足机器人上验证了翻转和墙面辅助等动态任务。

Comments 8 pages

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 7, pp. 8068-8075, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03508 2026-06-03 cs.CV 78%

Structure-Guided Mixed Masked Pretraining and Spatial Continuity Regularization for Printed Circuit Board Defect Detection

结构引导混合掩码预训练与空间连续性正则化用于印刷电路板缺陷检测

Peitong Wang, Nuo Wang, Enxin Qin, Chengjin Yu, Hanyu Xuan, Yuanting Yan

机构 * Ahu.edu.cn(安徽大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出两阶段PCB缺陷检测框架,通过结构引导混合掩码预训练学习PCB结构先验,并在微调阶段引入空间连续性正则化提升细长缺陷定位紧凑性,在DsPCBSD+数据集上达到85.5% mAP0.5。

Comments Preprint. 38 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18838 2026-06-02 cs.LG cs.AI cs.CL 78%

Lying Is Just a Phase: The Hidden Alignment Transition in Language Model Scaling

说谎只是一个阶段:语言模型扩展中的隐藏对齐转变

Adil Amin

机构 * ZEHEN Labs(ZEHEN实验室)

专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 通过分析63个基础模型,发现语言模型在特定规模阈值下,推理能力与真实性从反相关转变为正相关,并揭示了输出投影瓶颈和零竞争注意力头等内部机制。

Comments 15 pages, 8 figures, 2 tables. Companion paper: "The Growing Pains of Frontier Models: When Leaderboards Stop Separating and What to Measure Next." ( https://doi.org/10.48550/arXiv.2605.18840). Code: https://github.com/adilamin89/cape-scaling. Dashboard: https://zehenlabs.com/cape/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31329 2026-06-01 eess.AS 78%

Improving acoustic drone detection generalization through pretraining and data augmentation

通过预训练和数据增强提高声学无人机检测的泛化能力

Paul M. Reuter, Mattes Ohlenbusch, Christian Rollwage

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 针对声学无人机检测泛化挑战,提出基于预训练和在线数据增强的紧凑型DNN检测器,显著提升跨域检测性能。

Comments Accepted to Quiet Drones 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25262 2026-05-26 cs.CV 78%

Semantics-Guided Multimodal Masked Autoencoder Pretraining for 3D BEV Object Detection

语义引导的多模态掩码自编码器预训练用于3D BEV目标检测

Prabuddhi Wariyapperuma, Rajitha de Silva, Marc Hanheide, Thomas Bohné, Leonardo Guevara

机构 * University of Lincoln, Lincoln Centre for Autonomous Systems(林肯大学,林肯自主系统中心) University of Cambridge, Institute for Manufacturing, Department of Engineering(剑桥大学,制造研究所,工程系)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出语义引导的多模态掩码自编码器框架,通过语义引导的LiDAR体素掩码和辅助点语义解码分支,在预训练中注入语义信息,提升3D BEV目标检测性能。

Comments Accepted at the ICRA 2026 Workshop on Semantics for Reliable Robot Autonomy (SRRA) as a lightning talk and poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24642 2026-05-26 cs.CV cs.RO 78%

Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models

理解几何基础模型对视觉-语言-动作模型的影响

Yurou Yang, Muyuan Lin, Roberto Martin-Martin, Martin Labrie, Shreekant Gayaka, Cheng-Hao Kuo, Luca Carlone

机构 * Amazon Personal Robotics Group(亚马逊个人机器人小组) University of Texas at Austin(德克萨斯大学奥斯汀分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本文通过线性探测分析量化了视觉-语言-动作模型(VLA)与几何基础模型(GFM)之间的“几何差距”,比较了三种注入几何信息的架构,并研究了非架构因素对几何VLA性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22651 2026-05-22 cs.CV 78%

What Does the Caption Really Say? Counterfactual Phrase Intervention for Compositional Data Selection in Vision-Language Pretraining

图中标签真的在说些什么?用于视觉语言预训练中组合数据选择的反事实短语干预

Hyejin Go, Semi Lee, Hyesong Choi

机构 * Soongsil University(顺斯尔大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文研究了在视觉语言预训练中如何通过反事实短语干预来改进组合数据选择,提出了CPI方法以解决现有方法中全局过滤信号失效的问题,从而提升模型在关系识别任务上的表现。

Comments 11 pages, 2 figures, 4 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18491 2026-05-19 cs.CV 78%

Benchmarking transferability of SSL pretraining to same and different modality segmentation tasks

对SSL预训练在相同和不同模态分割任务中转移性的基准测试

Jue Jiang, Harini Veeraraghavan

机构 * Department of Medical Physics, Memorial Sloan Kettering Cancer Center(医学物理系,纪念斯隆凯特勒癌症中心)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文通过九种SSL方法在相同和不同模态的分割任务中进行基准测试,评估了预训练模型的迁移能力和效率,发现自蒸馏masked image transformer在分割精度、收敛速度和少量样本到大量样本的性能差距方面表现最佳。

Comments Paper submitted to Medical Physics for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17957 2026-05-19 cs.SE 78%

Contextualized Code Pretraining for Code Generation

基于上下文的代码预训练用于代码生成

Chen Liu, Qingyuan Liang, Hanwen Zhang, Zeyu Sun, Yakun Zhang, Lu Zhang

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出了一种基于上下文的代码预训练方法,通过整合调用上下文来改进代码生成模型的训练和评估,实验表明该方法在代码生成任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10239 2026-05-19 cs.CV 78%

AdaptSplat: Adapting Vision Foundation Models for Feed-Forward 3D Gaussian Splatting

AdaptSplat: 为前馈3D高斯点划法适应视觉基础模型

Mingwei Xing, Xinliang Wang, Yifeng Shi

机构 * Ke Holdings Inc.(凯控股公司)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本文提出AdaptSplat,通过在通用架构中引入一个仅含1.5M参数的轻量级适配器,有效提升了前馈3D高斯点划法在跨领域泛化和高频几何保真度方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03639 2026-05-12 cs.CV 78%

Diffusion Masked Pretraining for Dynamic Point Cloud

动态点云的扩散掩码预训练

Zhuoyue Zhang, Jihua Zhu, Chaowei Fang, Jian Liu, Ajmal Saeed Mian

机构 * Xi’an Jiaotong University(西安交通大学) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) University of Western Australia(西澳大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出DiMP框架,通过引入扩散建模解决动态点云预训练中位置泄露和运动监督问题,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12964 2026-05-05 cs.CV 78%

Cross-Scale Pretraining: Enhancing Self-Supervised Learning for Low-Resolution Satellite Imagery for Semantic Segmentation

跨尺度预训练:增强低分辨率卫星图像的自监督学习以用于语义分割

John Waithaka, Gustave Bwirayesu, Moise Busogi

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出跨尺度预训练方法,利用高分辨率数据提升低分辨率图像的表示学习和分割性能,通过设计空间亲和组件改进自监督学习框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27448 2026-05-01 cs.CV 78%

LA-Pose: Latent Action Pretraining Meets Pose Estimation

LA-Pose:潜在动作预训练与姿态估计

Zhengqing Wang, Saurabh Nair, Prajwal Chidananda, Pujith Kachana, Samuel Li, Matthew Brown, Yasutaka Furukawa

机构 * Wayve Simon Fraser University(西蒙弗雷泽大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文通过自监督预训练视角重新审视相机姿态估计,提出逆动力学预训练作为替代全监督训练的方法。通过逆向和正向动力学模型学习潜在动作表示,将潜在动作特征用于相机姿态估计,实现高精度且可推广的姿态预测。

Comments Project page: https://la-pose.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22958 2026-04-30 cs.CV 78%

Contrastive Heliophysical Image Pretraining for Solar Dynamics Observatory Records

对比学习太阳物理图像预训练用于太阳动力学观测记录

Shiyu Shen, Zhe Gao, Taifeng Chai, Yang Huang, Bin Pan

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出SolarCHIP,通过对比学习预训练视觉骨干网络,解决太阳成像中的多模态传感、弱类间分离性和强类内变化性问题,提升跨模态翻译和日冕闪分类性能。

Comments arXiv admin note: This submission has been withdrawn due to violation of arXiv policies for acceptable submissions

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24044 2026-04-28 cs.CV 78%

CLLAP: Contrastive Learning-based LiDAR-Augmented Pretraining for Enhanced Radar-Camera Fusion

CLLAP:基于对比学习的激光雷达增强预训练用于增强雷达-相机融合

Bingyi Liu, Chuanhui Zhu, Hongfei Xue, Jian Teng, Jipeng Liu, Enshu Wang, Penglin Dai, Pu Wang

机构 * Wuhan University of Technology(武汉理工大学) University of North Carolina at Charlotte(北卡罗来纳州立大学) Wuhan University(武汉大学) Southwest Jiaotong University(西南交通大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 CLLAP通过利用丰富的激光雷达数据生成伪雷达数据,结合双阶段双模态对比学习策略,提升雷达-相机融合模型的特征提取能力,实验证明在NuScenes和Lyft Level 5数据集上显著提升3D目标检测性能。

Comments accepted by 2026 CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23676 2026-04-28 cs.HC 78%

Directional Alignment and Narrative Agency in Human-LLM Co-Writing

方向对齐与人类-大语言模型共写中的叙事自主性

Halfdan Nordahl Fundal, Yuri Bizzoni

专题命中 预训练与数据 :LLM(title,abstract)

AI总结 研究人类-大语言模型共写中的叙事自主性,探讨谁主导故事发展。通过87个共写故事分析,发现人类引入更多语义新颖性,而大语言模型则扩展人类元素,情感层面也呈现双向互动。

Comments 11 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13255 2026-04-27 cs.RO 78%

Policy Contrastive Decoding for Robotic Foundation Models

基于机器人基础模型的策略对比解码

Shihan Wu, Xu Luo, Ji Zhang, Junlin Xie, Jingkuan Song, Heng Tao Shen, Lianli Gao

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Southwest Jiaotong University(西南交通大学) Tongji University(同济大学)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本文提出Policy Contrastive Decoding方法,通过对比原始与物体遮挡的视觉输入,提升机器人策略的泛化能力,实验表明其在仿真和现实环境中均有效。

Comments ICLR 2026. Project website: https://koorye.github.io/PCD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20392 2026-04-23 cs.CV 78%

Self-supervised pretraining for an iterative image size agnostic vision transformer

面向迭代图像尺寸无关视觉变换器的自监督预训练

Nedyalko Prisadnikov, Danda Pani Paudel, Yuqian Fu, Luc Van Gool

机构 * INSAIT, Sofia University "St. Kliment Ohridski", Bulgaria(INSAIT,索菲亚大学"圣克莱门特·奥赫里迪斯",保加利亚)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出基于DINO自蒸馏目标的新型序列到全局自监督学习框架,通过高效积分图像补丁提取方法实现图像尺寸无关的视觉编码器大规模预训练,取得ImageNet-1K和下游分类任务的竞争力表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28178 2026-04-21 cs.CV 78%

ToLL: Topological Layout Learning with Asymmetric Cross-View Structural Distillation for 3D Scene Graph Generation Pretraining

ToLL: 基于非对称跨视图结构蒸馏的拓扑布局学习用于3D场景图生成预训练

Yucheng Huang, Luping Ji, Xiangwei Jiang, Wen Li, Mao Ye

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出ToLL框架,通过拓扑几何推理和结构多视图增强,解决3D场景图生成预训练中的几何捷径问题,提升场景图生成质量。

Comments Under Reivew

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16391 2026-04-21 cs.RO cs.CV 78%

Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining

通过分离前向和逆向动力学预训练实现解耦的机器人学习

Wenyao Zhang, Bozhou Zhang, Zekun Qi, Wenjun Zeng, Xin Jin, Li Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究所) Shanghai Innovation Institute(上海创新研究院) Tsinghua University(清华大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出DeFI框架,通过分离前向和逆向动力学预训练,利用不同数据源解决视觉-动作耦合问题,实现端到端微调,实验表明在CALVIN ABC-D和SimplerEnv上取得最佳性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14198 2026-04-17 cs.LG cs.AI cs.CL 78%

MixAtlas: Uncertainty-aware Data Mixture Optimization for Multimodal LLM Midtraining

MixAtlas: 多模态大语言模型中训练过程中的数据混合优化方法

Bingbing Wen, Sirajul Salekin, Feiyang Kang, Bill Howe, Lucy Lu Wang, Javier Movellan, Manjot Bilkhu

机构 * Apple(苹果公司) University of Washington(华盛顿大学) Virginia Tech(弗吉尼亚理工学院)

专题命中 预训练与数据 :LLM(title);分类 cs.CL、cs.AI、cs.LG

AI总结 MixAtlas通过双轴分解训练语料,结合小代理模型与高斯过程代理,优化多模态大语言模型的训练混合策略,提升性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12105 2026-04-15 cs.SE 78%

Automated BPMN Model Generation from Textual Process Descriptions: A Multi-Stage LLM-Driven Approach

从文本过程描述自动生成BPMN模型:一种多阶段大语言模型驱动的方法

Ion Matei, Maksym Zhenirovskyy, Praveen Kumar Menaka Sekar, Hon Yung Wong

专题命中 预训练与数据 :LLM(title,abstract)

AI总结 本文提出一种多阶段大语言模型驱动的方法,通过多语言BPMN XML文件翻译、验证和修复生成可靠数据,从而自动生成可执行的BPMN 2.0模型,实现高相似度的重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10609 2026-04-14 cs.CV q-bio.QM 78%

Self-supervised Pretraining of Cell Segmentation Models

细胞分割模型的自监督预训练

Kaden Stillwagon, Alexandra Dunnum VandeLoo, Benjamin Magondu, Craig R. Forest

机构 * School of Computer Science, Georgia Institute of Technology(佐治亚理工学院计算机科学学院) School of Materials Science and Engineering, Georgia Institute of Technology(佐治亚理工学院材料科学与工程学院) Department of Biomedical Engineering, Georgia Institute of Technology(佐治亚理工学院生物医学工程系) School of Mechanical Engineering, Georgia Institute of Technology(佐治亚理工学院机械工程学院)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出DINOCell,通过自监督学习和微调提升细胞实例分割性能,实验显示其在LIVECell基准上表现优于现有模型。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09782 2026-04-14 cs.CV 78%

Biomarker-Based Pretraining for Chagas Disease Screening in Electrocardiograms

基于生物标志物的预训练用于心电图中的查加斯病筛查

Elias Stenhede, Arian Ranjbar

机构 * Akershus University Hospital(阿克什胡斯大学医院) University of Oslo(奥斯陆大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出基于生物标志物的预训练方法,通过MIMIC-IV-ECG数据集训练ECG特征提取器,再在巴西数据集上微调以检测查加斯病,五模型集成在PhysioNet 2025挑战中取得第5名。

Journal ref Computing in Cardiology 2025; Vol 52

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08709 2026-04-13 eess.AS 78%

Enhancing Conversational TTS with Cascaded Prompting and ICL-Based Online Reinforcement Learning

通过级联提示和基于ICL的在线强化学习增强对话式TTS

Zhicheng Ouyang, Seong-Gyun Leem, Bach Viet Do, Haibin Wu, Ariya Rastrow, Yuzong Liu, Florian Metze

专题命中 预训练与数据 :prompting(title,abstract)

AI总结 本文提出一种级联框架,结合文本风格标记和高质量音频提示,实现单次适应细粒度语音风格和角色声音,并引入基于ICL的在线强化学习策略提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏