arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138791 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2604.16391 2026-04-21 cs.RO cs.CV 78%

Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining

通过分离前向和逆向动力学预训练实现解耦的机器人学习

Wenyao Zhang, Bozhou Zhang, Zekun Qi, Wenjun Zeng, Xin Jin, Li Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究所) Shanghai Innovation Institute(上海创新研究院) Tsinghua University(清华大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出DeFI框架,通过分离前向和逆向动力学预训练,利用不同数据源解决视觉-动作耦合问题,实现端到端微调,实验表明在CALVIN ABC-D和SimplerEnv上取得最佳性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14198 2026-04-17 cs.LG cs.AI cs.CL 78%

MixAtlas: Uncertainty-aware Data Mixture Optimization for Multimodal LLM Midtraining

MixAtlas: 多模态大语言模型中训练过程中的数据混合优化方法

Bingbing Wen, Sirajul Salekin, Feiyang Kang, Bill Howe, Lucy Lu Wang, Javier Movellan, Manjot Bilkhu

机构 * Apple(苹果公司) University of Washington(华盛顿大学) Virginia Tech(弗吉尼亚理工学院)

专题命中 预训练与数据 :LLM(title);分类 cs.CL、cs.AI、cs.LG

AI总结 MixAtlas通过双轴分解训练语料,结合小代理模型与高斯过程代理,优化多模态大语言模型的训练混合策略,提升性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12105 2026-04-15 cs.SE 78%

Automated BPMN Model Generation from Textual Process Descriptions: A Multi-Stage LLM-Driven Approach

从文本过程描述自动生成BPMN模型:一种多阶段大语言模型驱动的方法

Ion Matei, Maksym Zhenirovskyy, Praveen Kumar Menaka Sekar, Hon Yung Wong

专题命中 预训练与数据 :LLM(title,abstract)

AI总结 本文提出一种多阶段大语言模型驱动的方法,通过多语言BPMN XML文件翻译、验证和修复生成可靠数据,从而自动生成可执行的BPMN 2.0模型,实现高相似度的重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10609 2026-04-14 cs.CV q-bio.QM 78%

Self-supervised Pretraining of Cell Segmentation Models

细胞分割模型的自监督预训练

Kaden Stillwagon, Alexandra Dunnum VandeLoo, Benjamin Magondu, Craig R. Forest

机构 * School of Computer Science, Georgia Institute of Technology(佐治亚理工学院计算机科学学院) School of Materials Science and Engineering, Georgia Institute of Technology(佐治亚理工学院材料科学与工程学院) Department of Biomedical Engineering, Georgia Institute of Technology(佐治亚理工学院生物医学工程系) School of Mechanical Engineering, Georgia Institute of Technology(佐治亚理工学院机械工程学院)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出DINOCell,通过自监督学习和微调提升细胞实例分割性能,实验显示其在LIVECell基准上表现优于现有模型。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09782 2026-04-14 cs.CV 78%

Biomarker-Based Pretraining for Chagas Disease Screening in Electrocardiograms

基于生物标志物的预训练用于心电图中的查加斯病筛查

Elias Stenhede, Arian Ranjbar

机构 * Akershus University Hospital(阿克什胡斯大学医院) University of Oslo(奥斯陆大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出基于生物标志物的预训练方法,通过MIMIC-IV-ECG数据集训练ECG特征提取器,再在巴西数据集上微调以检测查加斯病,五模型集成在PhysioNet 2025挑战中取得第5名。

Journal ref Computing in Cardiology 2025; Vol 52

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08709 2026-04-13 eess.AS 78%

Enhancing Conversational TTS with Cascaded Prompting and ICL-Based Online Reinforcement Learning

通过级联提示和基于ICL的在线强化学习增强对话式TTS

Zhicheng Ouyang, Seong-Gyun Leem, Bach Viet Do, Haibin Wu, Ariya Rastrow, Yuzong Liu, Florian Metze

专题命中 预训练与数据 :prompting(title,abstract)

AI总结 本文提出一种级联框架,结合文本风格标记和高质量音频提示,实现单次适应细粒度语音风格和角色声音,并引入基于ICL的在线强化学习策略提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06163 2026-04-08 cs.IR 78%

Data, Not Model: Explaining Bias toward LLM Texts in Neural Retrievers

数据,而非模型:解释神经检索器对LLM文本的偏见

Wei Huang, Keping Bi, Yinqiong Cai, Wei Chen, Jiafeng Guo, Xueqi Cheng

专题命中 预训练与数据 :LLM(title,abstract)

AI总结 研究指出神经检索器对LLM文本的偏见源于训练数据中的监督偏差,而非模型本身,通过减少数据偏差和调整向量投影降低偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17396 2026-04-08 cs.CV 78%

Gesture-Aware Pretraining and Token Fusion for 3D Hand Pose Estimation

手势感知预训练与标记融合用于3D手姿态估计

Rui Hong, Jana Kosecka

机构 * George Mason University(乔治梅森大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出基于手势语义的预训练方法,通过InterHand2.6M数据集的粗细标签学习信息嵌入空间,并结合Transformer进行关节回归,提升单手姿态估计精度。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05215 2026-04-08 cs.CV q-bio.NC 78%

Hierarchical Mesh Transformers with Topology-Guided Pretraining for Morphometric Analysis of Brain Structures

具有拓扑引导预训练的层次网格变换器用于脑结构形态学分析

Yujian Xiong, Mohammad Farazi, Yanxi Chen, Wenhui Zhu, Xuanzhao Dong, Natasha Lepore, Yi Su, Raza Mushtaq, Stephen Foldes, Andrew Yang, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) Banner Health(班纳健康) Barrow Neurological Institute(巴罗神经学研究所)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出一种层次变压器框架,用于异构网格分析,通过自监督预训练实现跨模态和多尺度的高效注意力机制,用于脑结构形态学分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03642 2026-04-07 cs.IR 78%

LLM-based Listwise Reranking under the Effect of Positional Bias

基于大语言模型的列表级重排序在位置偏见影响下的应用

Jingfen Qiao, Jin Huang, Xinyu Ma, Shuaiqiang Wang, Dawei Yin, Evangelos Kanoulas, Andrew Yates

专题命中 预训练与数据 :LLM(title,abstract)

AI总结 本文提出DebiasFirst方法,通过位置校准和位置感知的数据增强缓解大语言模型在列表级重排序中的位置偏见问题,提升排序效果和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29034 2026-04-01 cs.CV eess.IV 78%

The Surprising Effectiveness of Noise Pretraining for Implicit Neural Representations

隐式神经表示中噪声预训练的意外有效性

Kushal Vyas, Alper Kayabasi, Daniel Kim, Vishwanath Saragadam, Ashok Veeraraghavan, Guha Balakrishnan

机构 * Rice University(莱斯大学) University of California, Riverside(加州大学河滨分校)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文通过噪声预训练探索隐式神经表示的特性,发现无结构噪声预训练显著提升信号拟合能力,但对去噪效果不佳,而经典自然图像频谱结构的噪声则在信号拟合与逆向成像间取得平衡。

Comments Accepted to CVPR 2026. Project page: https://kushalvyas.github.io/noisepretraining.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01342 2026-03-31 cs.CV 78%

InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision

InternVideo-Next:无需视频-文本监督的通用视频基础模型

Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, Limin Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shenzhen Institutes of Advanced Technology, China(中国科学院深圳先进技术研究院) Nanjing University(南京大学)

专题命中 预训练与数据 :foundation model(title);pretraining(abstract)

AI总结 本文提出InternVideo-Next,通过解耦传统编码器-解码器设计为Encoder-Predictor-Decoder框架,解决像素重建与语义冲突问题,构建语义一致且细节保留的潜在空间,提升视频基础模型的通用性。

Journal ref CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10195 2026-03-31 cs.CV 78%

Minimizing the Pretraining Gap: Domain-aligned Text-Based Person Retrieval

缩小预训练差距:领域对齐的基于文本的人检索

Shuyu Yang, Yaxiong Wang, Yongrui Li, Li Zhu, Zhedong Zheng

机构 * Xi’an Jiaotong University(西安交通大学) Hefei University of Technology(合肥工业大学) University of Macau(澳门大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出双层级策略,通过领域感知扩散和多粒度关系对齐,解决光照、颜色和视角变化导致的领域差距,提升CUHK-PEDES等数据集上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26589 2026-03-30 cs.CV 78%

The Limits of Learning from Pictures and Text: Vision-Language Models and Embodied Scene Understanding

图像与文本学习的极限:视觉语言模型与具身场景理解

Gillian Rosenberg, Skylar Stadhard, Bruce C. Hansen, Michelle R. Greene

机构 * Barnard College, Columbia University(哥伦比亚大学巴纳德学院) Colgate University(科尔盖特大学)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 研究探讨图像与文本学习在人类场景理解中的局限性,通过对比18个视觉语言模型与2000名人类观察者在15项任务中的表现,发现模型在具身认知任务中存在显著缺陷,表明分布学习不足以实现基于 affordance 的场景理解。

Comments 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25892 2026-03-30 cs.CV 78%

THFM: A Unified Video Foundation Model for 4D Human Perception and Beyond

THFM:一种用于4D人体感知及更广泛领域的统一视频基础模型

Letian Wang, Andrei Zanfir, Eduard Gabriel Bazavan, Misha Andriluka, Cristian Sminchisescu

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 THFM是一种统一的视频基础模型,能够同时处理密集任务和稀疏任务,其基于预训练的文本到视频扩散模型,并通过可学习的标记增强稀疏预测能力,且在合成数据上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24373 2026-03-26 cs.CV 78%

PP-OCRv5: A Specialized 5M-Parameter Model Rivaling Billion-Parameter Vision-Language Models on OCR Tasks

PP-OCRv5:一个专门针对OCR任务的500万参数模型,其性能可与百亿参数的视觉-语言模型相抗衡

Cheng Cui, Yubo Zhang, Ting Sun, Xueqing Wang, Hongen Liu, Manhui Lin, Yue Zhang, Tingquan Gao, Changda Zhou, Jiaxuan Liu, Zelun Zhang, Jing Zhang, Jun Zhang, Yi Liu

机构 * PaddlePaddle Team(PaddlePaddle团队) Baidu Inc(百度公司)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 本文提出PP-OCRv5,一个轻量级OCR系统,通过数据驱动的方法在OCR基准上实现了与百亿参数VLMs相当的性能,同时提升了文本定位精度并减少了幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23993 2026-03-26 econ.EM 78%

GARP-EFM: Improving Foundation Models with Revealed Preference Structure

GARP-EFM:利用揭示偏好结构改进基础模型

Victor H. Aguiar, Nail Kashaev

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本文通过利用揭示偏好结构改进基础模型,利用Afriat定理生成合成数据,提升时间序列预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22622 2026-03-25 cs.CV 78%

A Vision Language Model for Generating Procedural Plant Architecture Representations from Simulated Images

一种用于从模拟图像生成程序化植物建筑表示的视觉语言模型

Heesup Yun, Isaac Kazuo Uyehara, Ioannis Droutsas, Earl Ranario, Christine H. Diepenbrock, Brian N. Bailey, J. Mason Earles

机构 * Biological and Agricultural Engineering(生物与农业工程系) Department of Plant Sciences(植物科学系) Viticulture and Enology(葡萄栽培与酿酒系) Wageningen University & Research(瓦赫宁根大学与研究学院)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 本文提出一种视觉语言模型,通过合成图像生成3D植物建筑模型,提取器官级参数,验证了从图像数据中提取植物建筑参数的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19575 2026-03-24 cs.CV 78%

MagicSeg: Open-World Segmentation Pretraining via Counterfactural Diffusion-Based Auto-Generation

MagicSeg: 通过反事实扩散模型自动生成实现开放世界分割预训练

Kaixin Cai, Pengzhen Ren, Jianhua Han, Yi Zhu, Hang Xu, Jianzhuang Liu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) PengCheng Laboratory(鹏城实验室) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 MagicSeg通过反事实扩散模型自动生成数据集,提升开放世界语义分割性能,实验在PASCAL VOC等数据集上取得SOTA结果。

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19773 2026-03-23 cs.CV 78%

Template-based Object Detection Using a Foundation Model

基于模板的对象检测使用基础模型

Valentin Braeutigam, Matthias Stock, Bernhard Egger

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学) e.solutions GmbH(e.solutions公司)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本文提出一种无需训练数据的模板基于对象检测方法,通过分割基础模型和简单特征分类结合,实现快速检测与分类,适用于自动化界面测试场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19695 2026-03-23 cs.CV 78%

Demographic-Aware Self-Supervised Anomaly Detection Pretraining for Equitable Rare Cardiac Diagnosis

具有人口统计学意识的自监督异常检测预训练用于公平的罕见心脏诊断

Chaoqin Huang, Zi Zeng, Aofan Jiang, Yuchen Xu, Qing Cao, Kang Chen, Chenfei Chi, Yanfeng Wang, Ya Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Defense Technology(国防科技大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(瑞金医院,上海交通大学医学院) Renji Hospital, Shanghai Jiao Tong University School of Medicine(仁济医院,上海交通大学医学院)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出一种两阶段ECG框架,结合自监督异常检测与人口统计学意识表征学习,提升罕见心脏异常检测的灵敏度并确保公平性,实验显示在超过一百万临床ECG数据上,方法在罕见异常检测中达到94.7%的AUROC,并缩小了常见-罕见性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12998 2026-03-16 cs.CV 78%

A Closed-Form Solution for Debiasing Vision-Language Models with Utility Guarantees Across Modalities and Tasks

为跨模态和任务提供具有实用保障的视觉-语言模型去偏方法

Tangzheng Lian, Guanyu Hu, Yijing Ren, Dimitrios Kollias, Oya Celiktutan

机构 * King’s College London(伦敦国王学院) Queen Mary University of London(伦敦女王学院)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 本文提出一种无需标注数据的训练自由去偏方法,在跨模态空间中获得帕累托最优公平性,同时保持有限的实用性损失,实验显示其在多种公平度量和任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04848 2026-03-13 cs.RO 78%

Hyperbolic Multiview Pretraining for Robotic Manipulation

双曲多视角预训练用于机器人操作

Jin Yang, Ping Wei, Yixin Chen, Nanning Zheng

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出HyperMVP,一种基于双曲空间的多视角自监督预训练框架,通过GeoLink编码器学习结构化嵌入,提升机器人操作任务的性能。

Comments This paper was submitted to CVPR 2026 and was recommended for Findings, but the authors have withdrawn it and are currently adding more content to submit it elsewhere

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10871 2026-03-12 cs.RO 78%

FG-CLTP: Fine-Grained Contrastive Language Tactile Pretraining for Robotic Manipulation

FG-CLTP: 用于机器人操作的细粒度对比语言触觉预训练

Wenxuan Ma, Chaofan Zhang, Yinghao Cai, Guocai Yao, Shaowei Cui, Shuo Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 FG-CLTP通过细粒度对比学习提升机器人触觉感知,实现高精度分类和控制,减少误差并增强跨传感器泛化能力。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03930 2026-03-11 cs.CV 78%

N-gram Injection into Transformers for Dynamic Language Model Adaptation in Handwritten Text Recognition

基于N-gram注入的Transformer在手写文本识别中的动态语言模型适应

Florent Meyer, Laurent Guichard, Yann Soullard, Denis Coquenet, Guillaume Gravier, Bertrand Coüasnon

机构 * ANTAI, Rennes, France(ANTAI研究院,法国里昂) Univ Rennes, CNRS, IRISA - UMR 6074, Rennes, France(里昂大学,法国国家科学研究中心,IRISA-UMR 6074,法国里昂)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 本文提出N-gram注入方法,用于在手写文本识别中动态调整Transformer的语言模型,以应对目标语料分布偏移问题,提升识别精度。

Comments Fix order of authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23553 2026-03-11 eess.AS cs.SD 78%

Human-CLAP: Human-perception-based contrastive language-audio pretraining

基于人类感知的对比语言-音频预训练:Human-CLAP

Taisei Takano, Yuki Okamoto, Yusuke Kanamori, Yuki Saito, Ryotaro Nagase, Hiroshi Saruwatari

机构 * The University of Tokyo, Japan(东京大学) Ritsumeikan University, Japan(立命馆大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 Human-CLAP通过引入人类主观评价分数提升CLAPScore与人类评价的相关性

Comments Submitted to APSIPA ASC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09101 2026-03-11 cs.CV 78%

MedKCO: Medical Vision-Language Pretraining via Knowledge-Driven Cognitive Orchestration

MedKCO:通过知识驱动的认知协调进行医学视觉-语言预训练

Chenran Zhang, Ruiqi Wu, Tao Zhou, Yi Zhou

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education, China(教育部新一代人工智能技术及其交叉应用重点实验室) School of Computer Science and Engineering, Nanjing University of Science and Technology, China(南京理工大学计算机科学与工程学院)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 MedKCO通过知识驱动的认知协调优化医学视觉-语言预训练,提升模型在分布偏移下的泛化能力。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08611 2026-03-10 cs.CV cs.RO 78%

FOMO-3D: Using Vision Foundation Models for Long-Tailed 3D Object Detection

FOMO-3D:利用视觉基础模型进行长尾3D目标检测

Anqi Joyce Yang, James Tu, Nikita Dvornik, Enxu Li, Raquel Urtasun

机构 * Waabi University of Toronto(多伦多大学)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 FOMO-3D通过利用视觉基础模型的丰富先验知识和多模态融合设计,提升长尾3D目标检测的性能。

Comments Published at 9th Annual Conference on Robot Learning (CoRL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03086 2026-03-10 math.NA cs.NA 78%

Pretrain Finite Element Method: A Pretraining and Warm-start Framework for PDEs via Physics-Informed Neural Operators

预训练有限元法:通过物理信息神经算子实现的PDEs预训练和热启动框架

Yizheng Wang, Zhongkai Hao, Mohammad Sadegh Eshaghi, Cosmin Anitescu, Xiaoying Zhuang, Timon Rabczuk, Yinghua Liu

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 该研究提出预训练有限元法,通过物理信息神经算子结合FEM,提升PDEs求解效率与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04817 2026-03-06 cs.CV 78%

Revisiting Shape from Polarization in the Era of Vision Foundation Models

重新审视极化形变在视觉基础模型时代的应用

Chenhao Li, Taishi Ono, Takeshi Uemori, Yusuke Moriuchi

机构 * Sony Semiconductor Solutions Corporation(索尼半导体解决方案公司)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本研究通过极化线索和改进的数据增强方法,在少量训练数据下实现了优于传统RGB模型的表面法线估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏