arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-26 至 2026-02-26 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 15 篇

2602.21485 2026-02-26 cs.CL cs.HC 88%

Evaluating the Usage of African-American Vernacular English in Large Language Models

评估大型语言模型中非裔美国人俚语英语的使用情况

Deja Dunlap, R. Thomas McCoy

机构 * Yale University(耶鲁大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究评估了大型语言模型对非裔美国人俚语英语的表示准确性,发现模型在语法使用上存在偏差,并复制了刻板印象,需改进训练数据和公平性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00062 2026-02-26 cs.CV cs.AI cs.LG cs.RO 86%

World Simulation with Video Foundation Models for Physical AI

基于视频基础模型的世界模拟用于物理AI

NVIDIA, :, Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, Prithvijit Chattopadhyay, Mike Chen, Yongxin Chen, Yu Chen, Shuai Cheng, Yin Cui, Jenna Diamond, Yifan Ding, Jiaojiao Fan, Linxi Fan, Liang Feng, Francesco Ferroni, Sanja Fidler, Xiao Fu, Ruiyuan Gao, Yunhao Ge, Jinwei Gu, Aryaman Gupta, Siddharth Gururani, Imad El Hanafi, Ali Hassani, Zekun Hao, Jacob Huffman, Joel Jang, Pooya Jannaty, Jan Kautz, Grace Lam, Xuan Li, Zhaoshuo Li, Maosheng Liao, Chen-Hsuan Lin, Tsung-Yi Lin, Yen-Chen Lin, Huan Ling, Ming-Yu Liu, Xian Liu, Yifan Lu, Alice Luo, Qianli Ma, Hanzi Mao, Kaichun Mo, Seungjun Nah, Yashraj Narang, Abhijeet Panaskar, Lindsey Pavao, Trung Pham, Morteza Ramezanali, Fitsum Reda, Scott Reed, Xuanchi Ren, Haonan Shao, Yue Shen, Stella Shi, Shuran Song, Bartosz Stefaniak, Shangkun Sun, Shitao Tang, Sameena Tasmeen, Lyne Tchapmi, Wei-Cheng Tseng, Jibin Varghese, Andrew Z. Wang, Hao Wang, Haoxiang Wang, Heng Wang, Ting-Chun Wang, Fangyin Wei, Jiashu Xu, Dinghao Yang, Xiaodong Yang, Haotian Ye, Seonghyeon Ye, Xiaohui Zeng, Jing Zhang, Qinsheng Zhang, Kaiwen Zheng, Andrew Zhu, Yuke Zhu

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 Cosmos-Predict2.5和Cosmos-Transfer2.5通过统一生成和增强的模拟能力,推动物理AI领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01077 2026-02-26 cs.NE 85%

Zero-Shot Document-Level Biomedical Relation Extraction via Scenario-based Prompt Design in Two-Stage with LLM

零样本文档级生物医学关系抽取:基于场景的提示设计的两阶段方法与大语言模型

Lei Zhao, Ling Kang, Quan Guo

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出一种基于场景的提示设计的两阶段方法,利用通用LLMs在降低硬件和劳动力成本的同时实现文档级生物医学关系抽取的高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11910 2026-02-26 cs.CV 82%

Seeing the Forest and the Trees: Query-Aware Tokenizer for Long-Video Multimodal Language Models

看清森林与树木:面向长视频多模态语言模型的查询感知分词器

Siyou Li, Huanan Wu, Juexi Shao, Yinghao Ma, Yujian Gan, Yihao Luo, Yuwei Wang, Dong Nie, Lu Wang, Wenqing Wu, Le Zhang, Massimo Poesio, Juntao Yu

机构 * Queen Mary University of London(伦敦女王学院) University of Sheffield(谢菲尔德大学) Imperial College London(伦敦帝国学院) Pengcheng Laboratory(鹏城实验室) Meta Inc(Meta公司) Meituan Inc(美团公司) Nanjing University of Science(南京理工大学) University of Birmingham(伯明翰大学) Utrecht University(乌得勒支大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract)

AI总结 QTSplus是一种轻量高效的视觉token选择模块,通过动态选择重要视觉证据提升长视频多模态语言模型的性能,显著降低计算成本并提高处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06657 2026-02-26 cs.CV cs.AI cs.CL cs.LG 82%

Renaissance: Investigating the Pretraining of Vision-Language Encoders

文艺复兴:探究视觉语言编码器的预训练

Clayton Fields, Casey Kennington

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 文艺复兴通过元分析探究视觉语言编码器预训练的最佳实践,展示冻结大部分模型可节省计算资源,同时探讨基于视觉或文本模型构建变压器的影响。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22037 2026-02-26 cs.CL cs.LG 81%

ATLAS: Adaptive Transfer Scaling Laws for Multilingual Pretraining, Finetuning, and Decoding the Curse of Multilinguality

ATLAS:适应性迁移缩放定律用于多语言预训练、微调和解码的多语言诅咒

Shayne Longpre, Sneha Kudugunta, Niklas Muennighoff, I-Hung Hsu, Isaac Caswell, Alex Pentland, Sercan Arik, Chen-Yu Lee, Sayna Ebrahimi

机构 * MIT(麻省理工学院) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Google Cloud AI(谷歌云人工智能) Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.LG

AI总结 ATLAS提出了一种适应性迁移缩放定律,用于多语言预训练、微调和解码,解决了多语言学习中的性能瓶颈和计算优化问题。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07452 2026-02-26 cs.LG cs.AI cs.CL cs.CY 80%

When Style Breaks Safety: Defending LLMs Against Superficial Style Alignment

当风格破坏安全性:防御大语言模型对抗浅层风格对齐

Yuxin Xiao, Sana Tonekaboni, Walter Gerych, Vinith Suriyakumar, Marzyeh Ghassemi

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了风格对齐对大语言模型安全性的影响,提出 SafeStyle 防御策略有效缓解了浅层风格对齐带来的风险。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22143 2026-02-26 cs.CV 78%

MedTri: A Platform for Structured Medical Report Normalization to Enhance Vision-Language Pretraining

MedTri:一种用于结构化医学报告标准化以增强视觉-语言预训练的平台

Yuetan Chu, Xinhua Ma, Xinran Jin, Gongning Luo, Xin Gao

机构 * King Abdullah University of Science and Technology (KAUST)(卡塔尔国王科技大学) Faculty of Computing, Harbin, China(哈尔滨计算学院)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 MedTri通过结构化医学报告标准化提升视觉-语言预训练效果,提供统一三元组格式并支持模块化增强策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21736 2026-02-26 cs.RO 78%

Joint-Aligned Latent Action: Towards Scalable VLA Pretraining in the Wild

联合对齐的潜在动作:迈向大规模野外VLA预训练

Hao Luo, Ye Wang, Wanpeng Zhang, Haoqi Yuan, Yicheng Feng, Haiweng Xu, Sipeng Zheng, Zongqing Lu

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) BeingBeyond

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 JALA通过联合对齐的潜在动作预训练框架,提升从人类数据中大规模预训练视觉-语言-动作模型的效率与性能。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21669 2026-02-26 cs.CL 70%

DWA-KD: Dual-Space Weighting and Time-Warped Alignment for Cross-Tokenizer Knowledge Distillation

DWA-KD:双空间加权与时间扭曲对齐用于跨分词器知识蒸馏

Duc Trung Vu, Pham Khanh Chi, Dat Phi Van, Linh Ngo Van, Sang Dinh, Trung Le

机构 * Hanoi University of Science and Technology(河内科学技术大学) University of Monash(莫纳什大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DWA-KD通过双空间加权和时间扭曲对齐提升跨分词器知识蒸馏效果,实现更精确的词级和序列级对齐。

Comments EACL Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22176 2026-02-26 cs.CV 67%

Mixed Magnification Aggregation for Generalizable Region-Level Representations in Computational Pathology

混合放大聚合用于计算病理学中的通用区域级表示

Eric Zimmermann, Julian Viret, Michal Zelechowski, James Brian Hall, Neil Tenenholtz, Adam Casson, George Shaikovski, Eugene Vorontsov, Siqi Liu, Kristen A Severson

机构 * Microsoft Research(微软研究院) Paige

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 本文提出混合放大聚合编码器,通过多分辨率特征捕捉提升计算病理学中区域级表示的通用性和预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21543 2026-02-26 cs.CL cs.AI cs.IR 62%

Enhancing Multilingual Embeddings via Multi-Way Parallel Text Alignment

通过多方向平行文本对齐增强多语言嵌入

Barah Fazili, Koustava Goswami

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 通过多方向平行文本对齐提升多语言嵌入,增强跨语言表示性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21824 2026-02-26 cs.LG 57%

DocDjinn: Controllable Synthetic Document Generation with VLMs and Handwriting Diffusion

DocDjinn: 基于VLMs和手写扩散的可控合成文档生成

Marcel Lamott, Saifullah Saifullah, Nauman Riaz, Yves-Noel Weweler, Tobias Alt-Veit, Ahmad Sarmad Ali, Muhammad Armaghan Shakir, Adrian Kalwa, Momina Moetesum, Andreas Dengel, Sheraz Ahmed, Faisal Shafait, Ulrich Schwanecke, Adrian Ulges

机构 * RheinMain University of Applied Sciences(莱茵-美因应用科学大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) DeepReader GmbH(DeepReader公司) Insiders Technologies GmbH(Insiders Technologies公司) National University of Sciences and Technology(国家科学与技术大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 DocDjinn利用VLMs和手写扩散生成可控合成文档,通过聚类和参数化采样从未标注种子生成高质量标注文档,实现隐私保护和高效数据生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11791 2026-02-26 cs.RO cs.LG 57%

Synthetic vs. Real Training Data for Visual Navigation

仿真与真实训练数据用于视觉导航

Lauri Suomela, Sasanka Kuruppu Arachchige, German F. Torres, Harry Edelman, Joni-Kristian Kämäräinen

机构 * Tampere University(塔尔基尔大学) Turku University of Applied Sciences(图尔库应用科学大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出了一种基于预训练视觉表示的导航策略,通过仿真训练提升了视觉导航性能,实验表明其在导航成功率上优于真实数据训练和现有方法。

Comments ICRA2026 Camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22131 2026-02-26 cs.HC 50%

Giving Meaning to Movements: Challenges and Opportunities in Expanding Communication by Pairing Unaided AAC with Speech Generated Messages

为动作赋予意义:通过将无辅助AAC与语音生成信息结合扩展沟通的挑战与机遇

Imran Kabir, Sharon Ann Redmon, Lynn R Elko, Kevin Williams, Mitchell A Case, Dawn J Sowers, Krista Wilkinson, Syed Masum Billah

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出AllyAAC系统,通过结合无辅助AAC与语音生成信息,解决个性化肢体动作识别挑战,提升沟通效率与可理解性。

Comments To appear in Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏