arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2604.09330 2026-04-13 cs.RO cs.CV 67%

VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis

VAG:用于具身数据合成的双流视频-动作生成

Xiaolei Lang, Yang Wang, Yukun Zhou, Chaojun Ni, Kerui Li, Jiagang Zhu, Tianze Liu, Jiajun Lv, Xingxing Zuo, Yun Ye, Guan Huang, Xiaofeng Wang, Zheng Zhu

机构 * GigaAI Zhejiang University(浙江大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 本文提出VAG模型,通过双流框架联合生成视频和动作,提升跨模态一致性,实现高效且准确的视频-动作配对生成,支持轨迹回放并提升下游策略泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08664 2026-04-13 cs.RO 67%

Generative Simulation for Policy Learning in Physical Human-Robot Interaction

生成仿真在物理人机交互中政策学习中的应用

Junxiang Wang, Xinwen Xu, Tiancheng Wu, Julian Millan, Nir Pechuk, Zackory Erickson

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文提出零样本生成仿真框架,通过自然语言提示生成多样化的物理人机交互场景,用于自主收集合成数据并训练基于视觉的模仿学习策略,实现从仿真到现实的零样本迁移。

Comments 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07092 2026-04-10 cs.CV 67%

Location Is All You Need: Continuous Spatiotemporal Neural Representations of Earth Observation Data

位置即一切:连续时空神经表示法用于地球观测数据

Mojgan Madadikhaljan, Jonathan Prexl, Isabelle Wittmann, Conrad M Albrecht, Michael Schmitt

机构 * University of the Bundeswehr Munich(慕尼黑联邦国防军大学) IBM Research – Europe(IBM欧洲研究院) Columbia University(哥伦比亚大学) German Aerospace Center (DLR)(德国航空航天中心)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 本文提出LIANet,通过连续时空神经场建模多时相遥感数据,无需原始数据即可实现卫星影像重建,并在各种下游任务中取得与从头训练或使用现有GFMs相当的性能。

Comments Updated the affiliation of one of the authors, no changes to the technical content

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06376 2026-04-09 cs.CV 67%

MTA-Agent: An Open Recipe for Multimodal Deep Search Agents

MTA-Agent:多模态深度搜索代理的开放配方

Xiangyu Peng, Can Qin, An Yan, Xinyi Yang, Zeyuan Chen, Ran Xu, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce 人工智能研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文提出MTA-Agent,通过构建高质量多跳视觉-语言训练数据,实现多模态深度搜索代理,其在六个基准测试中达到54.63%的平均准确率,优于其他模型,同时降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06236 2026-04-09 cs.DL 67%

LLMs Have Made Failure Worth Publishing

大语言模型让失败变得值得发表

Sungmin Lee

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 大语言模型继承训练数据的正向偏差,面临高质量训练数据短缺,作为研究工具和同行评审的双重角色,其失败数据缺失影响其效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29522 2026-04-01 cs.CL cs.AI cs.LG 67%

Baby Scale: Investigating Models Trained on Individual Children's Language Input

Baby Scale:研究基于个体儿童语言输入训练的模型

Steven Y. Feng, Alvin W. M. Tan, Michael C. Frank

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究基于儿童语言输入训练的模型在不同数据规模下的表现,探讨模型性能与儿童语言发展之间的关系,发现儿童数据在语法任务上表现良好,但在语义和世界知识任务上不如合成数据。

Comments Code and data at https://github.com/styfeng/babyscale-LM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27399 2026-03-31 cs.HC 67%

The Decline of Online Knowledge Communities: Obstacles, Workarounds, and Sustainability

在线知识社区的衰落:障碍、应对方法与可持续性

Ching Christie Pang, Xuetong Wang, Yuk Hang Tsui, Pan Hui

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 研究探讨了生成式AI对在线知识社区的影响,发现用户虽依赖AI但仍需社区解决复杂问题,强调维持社会互动与信任对社区韧性的重要性。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12118 2026-03-27 cs.SE 67%

Do Code LLMs Do Static Analysis?

代码LLM进行静态分析吗?

Chia-Yi Su, Collin McMillan

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract)

AI总结 本文研究代码LLM在代码智能任务中的静态分析能力,发现LLM在静态分析任务中表现不佳,且预训练静态分析任务无法提升代码智能任务性能。

Comments 42 pages, 2 figures, Accepted at Empirical Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23976 2026-03-26 cs.CV 67%

SilLang: Improving Gait Recognition with Silhouette Language Encoding

SilLang: 通过轮廓语言编码提升步态识别

Ruiyi Zhan, Guozhen Peng, Canyu Chen, Jian Lei, Annan Li

机构 * Beihang University(北航大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文提出SilLang模型,通过将二进制轮廓与自然语言结合,改进步态识别性能,利用LLM提取离散特征,提升时间模式建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05302 2026-03-26 cs.SE 67%

When More Retrieval Hurts: Retrieval-Augmented Code Review Generation

更多检索反而有害:基于检索的代码审查生成

Qianru Meng, Xiao Zhang, Zhaochen Ren, Joost Visser

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文提出RARe框架,通过检索历史审查作为上下文示例提升代码审查生成质量,实验表明仅使用top-1检索效果最佳,过多检索反而导致性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06690 2026-03-25 cs.CV 67%

Spectral Gaps and Spatial Priors: Studying Hyperspectral Downstream Adaptation Using TerraMind

光谱间隙与空间先验:利用TerraMind研究高光谱下游适应

Julia Anna Leonardi, Johannes Jakubik, Paolo Fraccaro, Maria Antonia Brovelli

机构 * IBM Research Europe(IBM欧洲研究院)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 本文研究了TerraMind在无高光谱预训练情况下处理高光谱下游任务的适应性,比较了通道适应策略并证明了深度学习模型在处理高光谱数据方面的优势。

Comments Accepted to ICLR 2026 Machine Learning for Remote Sensing (ML4RS) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21776 2026-03-24 cs.SI cs.CY 67%

Asymmetric Dynamics of Partisan Warriors in YouTube Comments

YouTube评论中党派战士的不对称动态

Keyeun Lee, Sang Jung Kim

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 研究分析了YouTube评论中党派战士的行为,发现跨意识形态评论者并不比同阵营者更文明,保守派观众更奖励对异己领导者的攻击,而左派观众则惩罚此类攻击,且保守派频道中党派战士更普遍,其行为受频道层面异质性驱动。

Comments 16 pages, 8 figures, Accepted at ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21501 2026-03-24 cs.SI 67%

Learning Inflation Narratives from Reddit: How Lightweight LLMs Reveal Forward-Looking Economic Signals

从Reddit学习通货膨胀叙事:轻量级大语言模型如何揭示前瞻性的经济信号

Ryuichi Saito, Sho Tsugawa

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文利用轻量级大语言模型分析Reddit数据,提出新的通货膨胀感知测量方法,通过RIS评分与CPI和MICH指标高度相关,揭示了经济叙事中的结构性变化。

Comments 19 pages, accepted at The 20th International AAAI Conference on Web and Social Media (ICWSM'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21051 2026-03-24 cs.RO 67%

Cortical Policy: A Dual-Stream View Transformer for Robotic Manipulation

皮层策略:一种双流视图变换器用于机器人操作

Xuening Zhang, Qi Lv, Xiang Deng, Miao Zhang, Xingbo Liu, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shandong Jianzhu University(山东建筑大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 本文提出Cortical Policy,通过双流视图变换器提升机器人操作中的空间和动态推理能力,实验证明其在复杂任务中的优越性。

Comments Published as a conference paper at ICLR 2026. 10 pages, 4 figures. Appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19157 2026-03-20 cs.CV 67%

ADAPT: Attention Driven Adaptive Prompt Scheduling and InTerpolating Orthogonal Complements for Rare Concepts Generation

ADAPT:基于注意力的自适应提示调度与稀有概念生成的插值正交补集

Kwanyoung Lee, Hyunwoo Oh, SeungJu Cha, Sungho Koh, Dong-Jin Kim

机构 * Hanyang University(翰阳大学)

专题命中 预训练与数据 :LLM(abstract);language model(abstract)

AI总结 ADAPT框架通过确定性提示调度和语义对齐,提升稀有概念生成效果,无需额外训练,在RareBench基准上表现优异。

Comments Accepted in CVPR 2026 (findings). 10 pages, 4 figures; supplementary material included (8 pages, 10 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12108 2026-03-13 cs.CV 67%

EvoTok: A Unified Image Tokenizer via Residual Latent Evolution for Visual Understanding and Generation

EvoTok:通过残差潜在进化实现统一的图像分词器用于视觉理解和生成

Yan Li, Ning Liao, Xiangyu Zhao, Shaofeng Zhang, Xiaoxing Wang, Yifan Yang, Junchi Yan, Xue Yang

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Corporation(微软公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 EvoTok通过残差潜在进化统一图像理解和生成,实现高效视觉表征建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10712 2026-03-12 cs.RO 67%

FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model

FutureVLA: 视觉-运动联合预测用于视觉-语言-动作模型

Xiaoxu Xu, Hao Li, Jinhui Ye, Yilun Chen, Jia Zeng, Xinyi Chen, Linning Xu, Dahua Lin, Weixin Li, Jiangmiao Pang

专题命中 预训练与数据 :pretraining(abstract);post-training(abstract)

AI总结 FutureVLA通过联合视觉-运动预测架构,解决视觉-语言-动作模型中联合建模的挑战,提升时间连续性和视觉监督解耦能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10123 2026-03-12 cs.LG cs.AI cs.CL 67%

Lost in the Middle at Birth: An Exact Theory of Transformer Position Bias

出生时便迷失在中间:变换器位置偏置的精确理论

Borun D Chowdhury

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出变换器位置偏置的精确理论,揭示U形性能曲线源于初始化时因果解码器的几何属性,证明中间上下文检索和训练在结构上具有敌意。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08893 2026-03-11 cs.HC 67%

A Decentralized Frontier AI Architecture Based on Personal Instances, Synthetic Data, and Collective Context Synchronization

基于个人实例、合成数据和集体上下文同步的去中心化前沿AI架构

Jacek Małecki, Alexander Mathiesen-Ohman, Katarzyna Tworek

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文提出基于个人实例、合成数据和集体上下文同步的去中心化AI架构,旨在实现隐私保护的集体学习和可持续的AI发展。

Comments 38 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06449 2026-03-09 cs.CV 67%

CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization

CaTok:通过Mean流平滑均值流以实现一维因果图像标记化

Yitong Chen, Zuxuan Wu, Xipeng Qiu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究所,复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 预训练与数据 :language model(abstract);foundation model(abstract)

AI总结 CaTok 通过 MeanFlow 解码器实现一维因果图像标记化,提升图像生成与重建性能。

Comments Project website is available in https://sharelab-sii.github.io/catok-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00110 2026-03-03 cs.RO 67%

Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation

从预训练视频模型中学习物理:一种多模态连续和序列世界交互模型用于机器人操作

Zijian Song, Qichang Li, Sihan Qin, Yuhao Chen, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 PhysGen通过预训练视频模型学习物理知识,实现机器人操作的连续和序列世界交互,优于现有基线方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08683 2026-02-27 cs.CV 67%

OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence

OneVision-Encoder: 编码对齐的稀疏性作为多模态智能的基础原则

Feilong Tang, Xiang An, Yunyao Yan, Yin Xie, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Chunyuan Li, Shikun Feng, Changrui Chen, Huajie Tan, Ming Hu, Manyuan Zhang, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, Jiankang Deng

机构 * Glint Lab(Glint实验室) AIM for Health Lab(健康人工智能实验室) MVP Lab(MVP实验室)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract)

AI总结 OneVision-Encoder通过编码对齐的稀疏性原则,实现高效的多模态视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27566 2026-02-27 cs.IR 67%

Interact-RAG: Reason and Interact with the Corpus, Beyond Black-Box Retrieval

Interact-RAG: 基于语义交互的检索增强生成,超越黑盒检索

Yulong Hui, Chao Chen, Zhihang Fu, Yihao Liu, Jieping Ye, Huanchen Zhang

专题命中 预训练与数据 :LLM(abstract);SFT(abstract)

AI总结 Interact-RAG通过引入语义交互引擎,使LLM代理能够主动操控检索过程,从而提升复杂信息检索任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22176 2026-02-26 cs.CV 67%

Mixed Magnification Aggregation for Generalizable Region-Level Representations in Computational Pathology

混合放大聚合用于计算病理学中的通用区域级表示

Eric Zimmermann, Julian Viret, Michal Zelechowski, James Brian Hall, Neil Tenenholtz, Adam Casson, George Shaikovski, Eugene Vorontsov, Siqi Liu, Kristen A Severson

机构 * Microsoft Research(微软研究院) Paige

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 本文提出混合放大聚合编码器,通过多分辨率特征捕捉提升计算病理学中区域级表示的通用性和预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10040 2026-02-24 cs.RO 67%

Diffusion Trajectory-guided Policy for Long-horizon Robot Manipulation

用于长时程机器人操作的扩散轨迹引导策略

Shichao Fan, Quantao Yang, Yajie Liu, Kun Wu, Zhengping Che, Qingjie Liu, Min Wan

机构 * School of Mechanical Engineering and Automation, BeiHang University(机械工程与自动化学院,北航) School of Computer Science and Engineering, BeiHang University(计算机科学与工程学院,北航) Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) Division of Robotics, Perception and Learning (RPL), KTH Royal Institute of Technology(机器人、感知与学习 division,皇家理工学院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

AI总结 本文提出DTP框架,通过生成轨迹减少模仿学习中的误差累积,提升长时程机器人任务的性能。

Comments 8 pages, 5 figures, accepted to IEEE Robotics and Automation Letters (RAL)

Journal ref IEEE Robotics and Automation Letters (Volume: 10, Issue: 12, December 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16986 2026-02-23 cs.IR cs.SI 67%

Bending the Scaling Law Curve in Large-Scale Recommendation Systems

在大规模推荐系统中弯曲缩放定律曲线

Qin Ding, Kevin Course, Linjian Ma, Jianhui Sun, Ruochen Liu, Zhao Zhu, Chunxing Yin, Wei Li, Dai Li, Yu Shi, Xuan Cao, Ze Yang, Han Li, Xing Liu, Bi Xue, Hongwei Li, Rui Jian, Daisy Shi He, Jing Qian, Matt Ma, Qunshu Zhang, Rui Li

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 ULTRA-HSTU通过创新的序列设计和稀疏注意机制,在大规模推荐系统中实现了显著的训练和推理效率提升,同时保持高质量的推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10382 2026-02-20 cond-mat.soft 67%

Advanced Manufacturing with Renewable and Bio-based Materials: AI/ML workflows and Process Optimization

先进生物基和可再生材料的制造:AI/ML工作流与工艺优化

Rigoberto Advincula, Jihua Chen

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本研究通过AI/ML工作流和工艺优化,提升生物基和可再生材料在先进制造中的应用效率,促进可持续发展。

Comments 26 pages, 5 figures, and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15766 2026-02-18 cs.SD 67%

TAC: Timestamped Audio Captioning

TAC:带时间戳的音频描述

Sonal Kumar, Prem Seetharaman, Ke Chen, Oriol Nieto, Jiaqi Su, Zhepei Wang, Rithesh Kumar, Dinesh Manocha, Nicholas J. Bryan, Zeyu Jin, Justin Salamon

机构 * University of Maryland, College Park, USA(美国马里兰大学 College Park 分校) Adobe Research, USA(Adobe 研究院) OpenAI, USA (work done while at Adobe)(OpenAI, USA)

专题命中 预训练与数据 :LLM(abstract);language model(abstract)

AI总结 TAC通过生成时间接地的音频描述提升复杂声音场景的理解,结合TAC-V实现音频-视觉语义桥梁,提升文本推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04299 2026-02-18 econ.GN q-fin.EC 67%

Measuring economic outlook in the news

在新闻中衡量经济前景

Elliot Beck, Franziska Eckert, Linus Kühne, Helge Liebert, Rina Rosenblatt-Wisch

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种高效的方法,通过结合文档嵌入和合成数据,在新闻中衡量经济前景,提升了GDP预测准确性并捕捉情绪变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02456 2026-02-17 cs.RO 67%

InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation

InternVLA-A1:统一理解、生成和行动以实现机器人操作

Junhao Cai, Zetao Cai, Jiafei Cao, Yilun Chen, Zeyu He, Lei Jiang, Hang Li, Hengjie Li, Yang Li, Yufei Liu, Yanan Lu, Qi Lv, Haoxiang Ma, Jiangmiao Pang, Yu Qiao, Zherui Qiu, Yanqing Shen, Xu Shi, Yang Tian, Bolun Wang, Hanqing Wang, Jiaheng Wang, Tai Wang, Xueyuan Wei, Chao Wu, Yiman Xie, Boyang Xing, Yuqiang Yang, Yuyin Yang, Qiaojun Yu, Feng Yuan, Jia Zeng, Jingjing Zhang, Shenghan Zhang, Shi Zhang, Zhuoma Zhaxi, Bowen Zhou, Yuanzhen Zhou, Yunsong Zhou, Hongrui Zhu, Yangkun Zhu, Yuchen Zhu

机构 * InternVLA-A1 Team(InternVLA-A1团队)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 InternVLA-A1通过统一的Transformer架构,结合语义理解和动态预测能力,提升了机器人操作任务的性能。

Comments Homepage: https://internrobotics.github.io/internvla-a1.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏