arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-01 至 2026-01-01 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 17 篇

2512.23808 2026-01-01 cs.CL cs.SD eess.AS 85%

MiMo-Audio: Audio Language Models are Few-Shot Learners

MiMo-Audio:音频语言模型是少样本学习者

Core Team, Dong Zhang, Gang Wang, Jinlong Xue, Kai Fang, Liang Zhao, Rui Ma, Shuhuai Ren, Shuo Liu, Tao Guo, Weiji Zhuang, Xin Zhang, Xingchen Song, Yihan Yan, Yongzhe He, Cici, Bowen Shen, Chengxuan Zhu, Chong Ma, Chun Chen, Heyu Chen, Jiawei Li, Lei Li, Menghang Zhu, Peidian Li, Qiying Wang, Sirui Deng, Weimin Xiong, Wenshan Huang, Wenyu Yang, Yilin Jiang, Yixin Yang, Yuanyuan Tian, Yue Ma, Yue Yu, Zihan Zhang, Zihao Yue, Bangjun Xiao, Bingquan Xia, Bofei Gao, Bowen Ye, Can Cai, Chang Liu, Chenhong He, Chunan Li, Dawei Zhu, Duo Zhang, Fengyuan Shi, Guoan Wang, Hailin Zhang, Hanglong Lv, Hanyu Li, Hao Tian, Heng Qu, Hongshen Xu, Houbin Zhang, Huaqiu Liu, Jiangshan Duo, Jianguang Zuo, Jianyu Wei, Jiebao Xiao, Jinhao Dong, Jun Shi, Junhao Hu, Kainan Bao, Kang Zhou, Linghao Zhang, Meng Chen, Nuo Chen, Peng Zhang, Qianli Chen, Qiantong Wang, Rang Li, Shaohui Liu, Shengfan Wang, Shicheng Li, Shihua Yu, Shijie Cao, Shimao Chen, Shuhao Gu, Weikun Wang, Wenhan Ma, Xiangwei Deng, Xing Yong, Xing Zhang, Xu Wang, Yifan Song, Yihao Zhao, Yingbo Zhao, Yizhao Gao, Yu Cheng, Yu Tu, Yudong Wang, Zhaojun Huang, Zhengju Tang, Zhenru Lin, Zhichao Song, Zhipeng Xu, Zhixian Zheng, Zihan Jiang

机构 * Xiaomi(小米)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);post-training(abstract);分类 cs.CL

AI总结 MiMo-Audio通过大规模预训练和指令微调,在音频理解和生成任务中达到开放源代码的最优性能,展示了强大的少样本学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24570 2026-01-01 cs.SE 85%

On the Effectiveness of Training Data Optimization for LLM-based Code Generation: An Empirical Study

在LLM基于代码生成中的训练数据优化有效性研究:一项实证研究

Shiqi Kuang, Zhao Tian, Tao Xiao, Dong Wang, Junjie Chen

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究评估了训练数据优化技术对LLM代码生成效果的影响,发现数据合成在提升功能正确性和减少代码异味方面最有效,而数据合成与重构的组合表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24097 2026-01-01 cs.CV cs.AI cs.CL cs.MM 84%

Factorized Learning for Temporally Grounded Video-Language Models

分解学习用于时间感知的视频-语言模型

Wenzheng Zeng, Difei Gao, Mike Zheng Shou, Hwee Tou Ng

机构 * National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :language model(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出D$^2$VLM框架,通过分解学习方法提升视频-语言模型在时间定位和文本响应任务中的性能,引入证据标记和FPO算法以优化学习过程。

Comments ICCV 2025 paper. This arXiv version updates Figure 1 to include the concurrent work Qwen2.5-VL to ensure consistency with Table 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24231 2026-01-01 cs.CV cs.LG 79%

MotivNet: Evolving Meta-Sapiens into an Emotionally Intelligent Foundation Model

MotivNet: 将元人进化为情感智能基础模型

Rahul Medicharla, Alper Yilmaz

机构 * Photogrammetric Computer Vision Lab(摄影测量计算机视觉实验室) The Ohio State University(俄亥俄州立大学)

专题命中 预训练与数据 :foundation model(title);pretraining(abstract);分类 cs.LG

AI总结 MotivNet通过使用元人作为骨干网络,在不进行跨领域训练的情况下实现了面部情绪识别的泛化能力,验证了其作为Sapiens下游任务的有效性。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24265 2026-01-01 cs.CL cs.LG 79%

Joint Selection for Large-Scale Pre-Training Data via Policy Gradient-based Mask Learning

通过基于策略梯度的掩码学习进行大规模预训练数据的联合选择

Ziqing Fan, Yuqiao Xian, Yan Sun, Li Shen

机构 * Shanghai Jiao Tong University(上海交通大学) University of Sydney(悉尼大学) Sun Yat-sen University Shenzhen Campus(中山大学深圳校区)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 DATAMASK通过联合学习优化质量和多样性度量,显著提升大规模预训练数据选择效率和模型性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23512 2026-01-01 cs.CL cs.AI 79%

UniHetero: Could Generation Enhance Understanding for Vision-Language-Model at Large Data Scale?

UniHetero:生成能否在大规模数据下增强视觉-语言模型的理解?

Fengjiao Chen, Minhao Jing, Weitao Lu, Yan Feng, Xiaoyu Li, Xuezhi Cao

机构 * Meituan, Beijing, China(美团,北京,中国)

专题命中 预训练与数据 :LLM(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 UniHetero通过大规模预训练探索生成对视觉-语言模型理解的增强作用,发现语义层面生成有效,而像素层面生成会导致理解性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23747 2026-01-01 cs.SE cs.AI cs.CL 79%

State-of-the-art Small Language Coder Model: Mify-Coder

最先进的小型语言编码器模型:Mify-Coder

Abhinav Parmar, Abhisek Panigrahi, Abhishek Kumar Dwivedi, Abhishek Bhattacharya, Adarsh Ramachandra, Aditya Choudhary, Aditya Garg, Aditya Raj, Alankrit Bhatt, Alpesh Yadav, Anant Vishnu, Ananthu Pillai, Ankush Kumar, Aryan Patnaik, Aswatha Narayanan S, Avanish Raj Singh, Bhavya Shree Gadda, Brijesh Pankajbhai Kachhadiya, Buggala Jahnavi, Chidurala Nithin Krishna, Chintan Shah, Chunduru Akshaya, Debarshi Banerjee, Debrup Dey, Deepa R., Deepika B G, Faiz ur Rahman, Gagan Gayari, Gudhi Jagadeesh Kumar Naidu, Gursimar Singh, Harshal Tyagi, Harshini K, James Mani Vathalloor, Jayarama Nettar, Jayashree Gajjam, Joe Walter Sugil George, Kamalakara Sri Krishna Tadepalli, Kamalkumar Rathinasamy, Karan Chaurasia, Karthikeyan S, Kashish Arora, Kaushal Desai, Khushboo Buwade, Kiran Manjrekar, Malikireddy Venkata Sai Likhitha, Manjunath A, Mitali Mahavir Bedmutha, Mohammed Rafee Tarafdar, Nikhil Tiwari, Nikitha K Gigi, Pavan Ravikumar, Pendyala Swarnanjali, Piyush Anand, Prakash Chandrasekar, Prasanna Bhalchandra Gawade, Prasanth Sivan, Preeti Khurana, Priyanshi Babbar, Rajab Ali Mondal, Rajesh Kumar Vissapragada, Rajeshwari Ganesan, Rajeswari Koppisetti, Ramjee R., Ramkumar Thiruppathisamy, Rani G. S., S Reka, Samarth Gupta, Sandeep Reddy Kothakota, Sarathy K, Sathyanarayana Sampath Kumar, Saurabh Kumar, Shashank Khasare, Shenbaga Devi Venkatesh Kumar, Shiva Rama Krishna Parvatham, Shoeb Shaikh, Shrishanmathi A, Shubham Pathak, Sree Samhita Koppaka, Sreenivasa Raghavan K S, Sreeram Venkatasubramanian, Suprabha Desai Bojja, Swetha R, Syed Ahmed, Chinmai Harshitha Thota, Tushar Yadav, Veeravelly Kusumitha, V V S S Prasanth Patnaik, Vidya Sri Sesetti, Vijayakeerthi K, Vikram Raj Bakshi, Vinay K K, Vinoth Kumar Loganathan, Vipin Tiwari, Vivek Kumar Shrivastav, V Venkata Sri Datta Charan, Wasim Akhtar Khan

机构 * Infosys AI Research(英矽斯人工智能研究院) Mify Team(Mify团队)

专题命中 预训练与数据 :LLM(abstract);foundation model(abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 Mify-Coder通过高效训练策略和数据优化,在保持高准确性和安全性的同时,实现了比更大模型更优的代码生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23717 2026-01-01 cs.CL cs.AI 79%

HarmTransform: Transforming Explicit Harmful Queries into Stealthy via Multi-Agent Debate

HarmTransform: 通过多智能体辩论将显性有害查询转化为隐蔽形式

Shenzhe Zhu

机构 * University of Toronto(多伦多大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HarmTransform通过多智能体辩论框架,系统地将有害查询转化为隐蔽形式,以提升大型语言模型的安全对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24526 2026-01-01 q-fin.PM cs.AI cs.CE q-fin.CP 77%

Generative AI-enhanced Sector-based Investment Portfolio Construction

生成式AI增强的行业基于投资组合构建

Alina Voronina, Oleksandr Romanko, Ruiwen Cao, Roy H. Kwon, Rafael Mendoza-Arriaga

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了生成式AI在量化行业投资组合构建中的应用,发现其在稳定市场中表现优异,但在波动市场中表现欠佳,强调了混合AI-量化框架的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07666 2026-01-01 cs.LG cs.AI cs.CL cs.CV 75%

Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities

在大语言模型、多模态大语言模型及更广泛的领域中进行模型融合:方法、理论、应用与机遇

Enneng Yang, Li Shen, Guibing Guo, Xingwei Wang, Xiaochun Cao, Jie Zhang, Dacheng Tao

机构 * Shenzhen Campus of Sun Yat-sen University, China(中山大学深圳校区) Northeastern University China(东北大学) Shenzhen Campus of Sun Yat-sen University China(中山大学深圳校区) Nanyang Technological University Singapore(南洋理工大学) Northeastern University(东北大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Nanyang Technological University(南洋理工大学) Institute for Clarity in Documentation Dublin Ohio USA(文档清晰研究所) Inria Paris-Rocquencourt Rocquencourt France(巴黎-罗quentourt研究所) Rajiv Gandhi University Doimukh Arunachal Pradesh India(拉贾·甘地大学) Tsinghua University Haidian Qu Beijing Shi China(清华大学) Palmer Research Laboratories San Antonio Texas USA(帕勒研究中心) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗quentourt研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒研究中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了模型融合的方法、理论、应用及未来方向,提出新的分类方法并探讨其在多个机器学习领域的应用及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24826 2026-01-01 cs.CV cs.AI 70%

Video and Language Alignment in 2D Systems for 3D Multi-object Scenes with Multi-Information Derivative-Free Control

用于多物体3D场景的2D系统中视频与语言对齐的多信息无导数控制

Jason Armitage, Rico Sennnrich

机构 * University of Zurich(苏黎世大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出了一种无导数优化方法,用于在多物体3D场景中实现视频与语言的对齐,通过在线适应物体遮挡和区分特征来提升跨模态任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17221 2026-01-01 cs.CV 67%

DAVE: A VLM Vision Encoder for Document Understanding and Web Agents

DAVE: 一种用于文档理解与网络代理的视觉编码器

Brandon Huang, Hang Hua, Zhuoran Yu, Trevor Darrell, Rogerio Feris, Roei Herzig

机构 * MIT-IBM Watson AI Lab(MIT-IBM Watson AI实验室) UC Berkeley(加州大学伯克利分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

AI总结 DAVE是一种专为文档理解和网络代理设计的视觉编码器,通过自监督和监督预训练结合模型融合策略,提升对文档和网络任务的适应性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24268 2026-01-01 cs.IR 67%

RAGPart & RAGMask: Retrieval-Stage Defenses Against Corpus Poisoning in Retrieval-Augmented Generation

RAGPart & RAGMask:对抗检索增强生成中语料污染的检索阶段防御

Pankayaraj Pathmanathan, Michael-Andrei Panaitescu-Liess, Cho-Yu Jason Chiang, Furong Huang

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文提出RAGPart和RAGMask两种检索阶段防御方法,用于对抗RAG中语料污染攻击,通过文档分区和标记遮蔽技术降低攻击成功率,提升RAG系统的鲁棒性。

Comments Published at AAAI 2026 Workshop on New Frontiers in Information Retrieval [Oral]

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22693 2026-01-01 cs.CV 67%

VADTree: Explainable Training-Free Video Anomaly Detection via Hierarchical Granularity-Aware Tree

VADTree: 通过分层粒度感知树实现可解释的无训练视频异常检测

Wenlong Li, Yifei Xu, Yuan Rao, Zhenhua Wang, Shuiguang Deng

机构 * School of Software, Xi’an Jiaotong University(西安交通大学软件学院) China Railway Xi’an Group(中国铁路西安集团) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 VADTree通过分层粒度感知树结构实现无训练视频异常检测,利用预训练模型知识和多维先验提升异常感知与推理能力。

Comments NeurIPS 2025 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24793 2026-01-01 cs.LG cs.NE 57%

Self-Supervised Neural Architecture Search for Multimodal Deep Neural Networks

多模态深度神经网络的自监督神经架构搜索

Shota Suzuki, Satoshi Ono

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出了一种自监督学习方法,用于多模态深度神经网络的架构搜索,能够在未标记数据上有效设计DNN架构。

Journal ref IEICE Transactions on Information and Systems, Vol.E108.D, No. 6, pp. 640-643, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23986 2026-01-01 cs.CV physics.geo-ph 50%

Anomaly detection in satellite imagery through temporal inpainting

通过时间修复在卫星图像中进行异常检测

Bertrand Rouet-Leduc, Claudia Hulbert

机构 * Disaster Prevention Research Institute, Kyoto University(京都大学灾害预防研究所) Geolabe

专题命中 预训练与数据 :foundation model(abstract)

AI总结 本研究提出了一种基于时间修复的深度学习方法,通过卫星时间序列的冗余性检测地表变化,实现了更高的灵敏度和特异性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22489 2026-01-01 cs.CV 50%

Tracking by Predicting 3-D Gaussians Over Time

通过时间预测三维高斯分布进行跟踪

Tanish Baranwal, Himanshu Gaurav Singh, Jathushan Rajasegaran, Jitendra Malik

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 Video-GMAE通过时间预测三维高斯分布实现自监督视频跟踪,显著提升了Kinetics和Kubric数据集的跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏