arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2512.05103 2025-12-15 cs.LG cs.AI cs.CL cs.CV 67%

TV2TV: A Unified Framework for Interleaved Language and Video Generation

TV2TV:一种用于交错语言和视频生成的统一框架

Xiaochuang Han, Youssef Emad, Melissa Hall, John Nguyen, Karthik Padthe, Liam Robbins, Amir Bar, Delong Chen, Michal Drozdzal, Maha Elbayad, Yushi Hu, Shang-Wen Li, Sreya Dutta Roy, Jakob Verbeek, XuDong Wang, Marjan Ghazvininejad, Luke Zettlemoyer, Emily Dinan

机构 * Meta FAIR

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TV2TV通过统一框架实现语言与视频生成的交错过程,提升视频生成的视觉质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09652 2025-12-11 econ.GN q-fin.EC 67%

Measuring Corruption from Text Data

从文本数据中测量腐败

Arieda Muço

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文提出一种基于词典和主成分分析的自动化腐败指数,通过巴西市政审计报告验证其有效性,并在透明度、成本和可重复性方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01354 2025-12-10 cs.AI cs.CL cs.CY cs.LG q-fin.TR 67%

The Necessity of Imperfection:Reversing Model Collapse via Simulating Cognitive Boundedness

不完美之必要:通过模拟认知局限性逆转模型崩溃

Zhongjie Jiang

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过模拟认知局限性生成具有真实功能增益的合成数据,以解决模型崩溃问题。

Comments 60 pages,9 figures. v3: Major update. Added 3D topological visualization (Figure 1) and independent computational verification of the Adaptive Markets Hypothesis (AMH). Includes comprehensive Supplementary Materials (algorithmic pseudocode, system architecture, and real-time GARCH logs) for technical reproducibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04222 2025-12-05 cs.CV 67%

ReasonX: MLLM-Guided Intrinsic Image Decomposition

ReasonX: 基于多模态大语言模型的内在图像分解

Alara Dirik, Tuanfeng Wang, Duygu Ceylan, Stefanos Zafeiriou, Anna Frühstück

机构 * Imperial College London(伦敦帝国学院) Adobe Research(Adobe研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 ReasonX通过多模态大语言模型提供相对比较监督,提升内在图像分解的泛化能力与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12409 2025-12-04 cs.CV 67%

S5: Scalable Semi-Supervised Semantic Segmentation in Remote Sensing

S5: 远程感知中可扩展的半监督语义分割

Liang Lv, Di Wang, Jing Zhang, Lefei Zhang

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(国家多媒体软件工程研究中心,计算机学院,武汉大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 S5提出了一种可扩展的半监督语义分割框架,通过大规模数据集和预训练范式提升遥感任务的性能。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02643 2025-12-03 cs.CV 67%

Leveraging Large-Scale Pretrained Spatial-Spectral Priors for General Zero-Shot Pansharpening

利用大规模预训练的空间-光谱先验进行通用零样本全色融合

Yongchuan Cui, Peng Liu, Yi Zeng

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 本文提出利用大规模模拟数据预训练空间-光谱先验,提升遥感图像融合在不同传感器和条件下的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02027 2025-12-03 eess.AS cs.AI cs.CL cs.LG 67%

On the Difficulty of Token-Level Modeling of Dysfluency and Fluency Shaping Artifacts

关于对话语流和流畅性塑造特征的令牌级建模难度

Kashaf Gulzar, Dominik Wagner, Sebastian P. Bayerl, Florian Hönig, Tobias Bocklet, Korbinian Riedhammer

机构 * Technische Hochschule Nürnberg Georg Simon Ohm(纽伦堡技术大学乔治·西蒙·奥姆学院) Technische Hochschule Rosenheim(罗森海姆技术大学) KST Institut GmbH(KST研究所)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种轻量级适应方法,用于提升ASR对语流和流畅性修改的识别能力,同时揭示多语言端到端系统在处理德语数据时的局限性。

Comments 6 pages, 1 figure. Accepted to ASRU 2025. This is the arXiv preprint of the accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01312 2025-12-02 cs.CV 67%

IVCR-200K: A Large-Scale Multi-turn Dialogue Benchmark for Interactive Video Corpus Retrieval

IVCR-200K: 一个大规模多轮对话基准数据集用于交互视频语料检索

Ning Han, Yawen Zeng, Shaohua Long, Chengqing Li, Sijie Yang, Dun Tan, Jianfeng Dong, Jingjing Chen

机构 * Xiangtan University(湘潭大学) Hunan University(湖南大学) Zhejiang Gongshang University(浙江工商大学) Fudan University(复旦大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文提出IVCR-200K数据集及基于多模态大语言模型的框架,用于交互视频语料检索,提升多轮对话式交互效果。

Comments Accepted by SIGIR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07299 2025-12-02 cs.LG cs.AI cs.CL q-bio.GN 67%

Life-Code: Central Dogma Modeling with Multi-Omics Sequence Unification

Life-Code: 多组学序列统一下的中心法则建模

Zicheng Liu, Siyuan Li, Zhiyuan Chen, Chang Yu, Qirong Yang, Yucheng Guo, Yujie Yang, Xiaoming Zhang, Stan Z. Li

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Life-Code通过多组学序列统一和中心法则建模,实现对生物分子相互作用的全面理解。

Comments Preprint V3 (10 pages main text)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12336 2025-11-27 cs.CV 67%

Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding

对多模态大语言模型在视频理解中的可信度进行基准测试

Youze Wang, Zijun Chen, Ruoyu Chen, Shishen Gu, Wenbo Hu, Jiayang Liu, Yinpeng Dong, Hang Su, Jun Zhu, Meng Wang, Richang Hong

机构 * Hefei University of Technology(合肥工业大学) Tsinghua University(清华大学) Institute of Science Tokyo(东京科学研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本研究提出Trust-videoLLMs基准,评估23种视频LLMs在真实性、鲁棒性、安全性和隐私等方面的表现,揭示其在动态场景理解及现实风险缓解中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07850 2025-11-27 cs.CL cs.AI cs.DB cs.LG 67%

Bring Your Own KG: Self-Supervised Program Synthesis for Zero-Shot KGQA

自带知识图谱:零样本知识图谱问答的自监督程序合成

Dhruv Agarwal, Rajarshi Das, Sopan Khosla, Rashmi Gangadharaiah

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) AWS AI Labs(AWS人工智能实验室)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BYOKG通过自监督程序合成实现零样本知识图谱问答,利用探索机制和LLM生成查询程序,提升问答准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02973 2025-11-26 cs.CV 67%

InstaDA: Augmenting Instance Segmentation Data with Dual-Agent System

InstaDA: 通过双代理系统增强实例分割数据

Xianbao Hou, Yonghao He, Zeyd Boukhers, John See, Hu Su, Wei Sui, Cong Yang

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 InstaDA通过双代理系统提升实例分割数据质量,实现AP提升和效率优化

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18396 2025-11-25 cs.CV 67%

Exploring Weak-to-Strong Generalization for CLIP-based Classification

探索基于CLIP的分类中的弱到强泛化

Jinhao Li, Sarah M. Erfani, Lei Feng, James Bailey, Feng Liu

机构 * School of Computing and Information Systems University of Melbourne, Australia(墨尔本大学计算机与信息系统学院) School of Computing and Information Systems University of Melbournem, Australia(墨尔本大学计算机与信息系统学院) School of Computer Science and Engineering Southeast University, China(东南大学计算机科学与工程学院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

AI总结 本文提出类别原型学习方法,通过弱监督提升CLIP模型分类性能,实验显示在预训练受限情况下取得显著改进。

Comments TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16567 2025-11-24 cs.CV 67%

POMA-3D: The Point Map Way to 3D Scene Understanding

POMA-3D:点地图方式的3D场景理解

Ye Mao, Weixun Luo, Ranran Huang, Junpeng Jing, Krystian Mikolajczyk

机构 * Imperial College London(伦敦帝国学院)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 POMA-3D通过点地图实现3D场景理解,结合自监督学习和多视角对齐策略,提升3D任务表现。

Comments 11 pages, 6 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05274 2025-11-21 cs.CV 67%

From Play to Replay: Composed Video Retrieval for Temporally Fine-Grained Videos

从游戏到回放:面向时间精细粒度视频的组合视频检索

Animesh Gupta, Jay Parmar, Ishan Rajendrakumar Dave, Mubarak Shah

专题命中 预训练与数据 :LLM(abstract);prompting(abstract)

AI总结 TF-CoVR提出了一种针对时间精细粒度视频检索的框架,通过预训练视频编码器和对比学习提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15145 2025-11-20 eess.AS cs.SD 67%

Auden-Voice: General-Purpose Voice Encoder for Speech and Language Understanding

Mingyue Huo, Wei-Cheng Tseng, Yiwen Shao, Hao Zhang, Dong Yu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) Tencent AI Lab, USA(腾讯AI实验室(美国))

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

Comments Submitted to ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05501 2025-11-19 cs.CV 67%

SMOL-MapSeg: Show Me One Label as prompt

Yunshuang Yuan, Frank Thiemann, Thorsten Dahms, Monika Sester

机构 * IKG

专题命中 预训练与数据 :foundation model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04668 2025-11-17 cs.CV 67%

SIMS-V: Simulated Instruction-Tuning for Spatial Video Understanding

Ellis Brown, Arijit Ray, Ranjay Krishna, Ross Girshick, Rob Fergus, Saining Xie

机构 * New York University(纽约大学) Boston University(波士顿大学) AllenAI Vercept

专题命中 预训练与数据 :LLM(abstract);language model(abstract)

Comments Project page: https://ellisbrown.github.io/sims-v

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04369 2025-11-14 cs.CV 67%

TSPO: Temporal Sampling Policy Optimization for Long-form Video Language Understanding

Canhui Tang, Zifan Han, Hongbo Sun, Sanping Zhou, Xuchong Zhang, Xin Wei, Ye Yuan, Huayu Zhang, Jinglin Xu, Hao Sun

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03505 2025-11-10 cs.LG cs.AI cs.CL 67%

LimiX: Unleashing Structured-Data Modeling Capability for Generalist Intelligence

Xingxuan Zhang, Gang Ren, Han Yu, Hao Yuan, Hui Wang, Jiansheng Li, Jiayun Wu, Lang Mo, Li Mao, Mingchao Hao, Ningbo Dai, Renzhe Xu, Shuyang Li, Tianyang Zhang, Yue He, Yuanrui Wang, Yunjia Zhang, Zijing Xu, Dongzhe Li, Fang Gao, Hao Zou, Jiandong Liu, Jiashuo Liu, Jiawei Xu, Kaijie Cheng, Kehan Li, Linjun Zhou, Qing Li, Shaohua Fan, Xiaoyu Lin, Xinyan Han, Xuanyue Li, Yan Lu, Yuan Xue, Yuanyuan Jiang, Zimu Wang, Zhenlei Wang, Peng Cui

机构 * Stable AI & Tsinghua University(Stable AI 与 清华大学)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 61 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05057 2025-11-10 cs.CV 67%

Role-SynthCLIP: A Role Play Driven Diverse Synthetic Data Approach

Yuanxiang Huangfu, Chaochao Wang, Weilei Wang

机构 * PatSnap Co., LTD.(PatSnap公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03371 2025-11-06 cond-mat.mtrl-sci physics.comp-ph 67%

Enhancing composition-based materials property prediction by cross-modal knowledge transfer

Ivan Rubtsov, Ivan Dudakov, Yuri Kuratov, Vadim Korolev

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

Comments 7 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16495 2025-11-06 cs.CV 67%

ALTo: Adaptive-Length Tokenizer for Autoregressive Mask Generation

Lingfeng Wang, Hualing Lin, Senda Chen, Tao Wang, Changxu Cheng, Yangyang Zhong, Dong Zheng, Wuyue Zhao

机构 * Uni-Ubi Zhejiang University(浙江大学) Tongji University(同济大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00268 2025-11-04 cs.CL cs.AI cs.IR cs.LG 67%

IL-PCSR: Legal Corpus for Prior Case and Statute Retrieval

Shounak Paul, Dhananjay Ghumare, Pawan Goyal, Saptarshi Ghosh, Ashutosh Modi

机构 * IIT Kharagpur(印度克哈格普尔理工学院) IIT Kanpur(印度坎普尔理工学院)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12205 2025-11-04 cs.SE 67%

PredicateFix: Repairing Static Analysis Alerts with Bridging Predicates

Yuan-An Xiao, Weixuan Wang, Dong Liu, Junwei Zhou, Shengyu Cheng, Yingfei Xiong

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

Comments 13 pages, 5 figures; accepted for ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12549 2025-10-31 cs.CL cs.AI cs.LG 67%

Memorization: A Close Look at Books

Iris Ma, Ian Domingo, Alberto Krone-Martins, Pierre Baldi, Cristina V. Lopes

机构 * School of Information and Computer Sciences University of California, Irvine(信息与计算机科学学院 加州大学伊维奇分校)

专题命中 预训练与数据 :prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at ACL 2025 L2M2 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14627 2025-10-28 cs.RO cs.CV 67%

GOPLA: Generalizable Object Placement Learning via Synthetic Augmentation of Human Arrangement

Yao Zhong, Hanzhi Chen, Simon Schaefer, Anran Zhang, Stefan Leutenegger

机构 * Technical University of Munich(慕尼黑技术大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19952 2025-10-24 cs.CY 67%

Synthetic social data: trials and tribulations

Guido Ivetta, Laura Moradbakhti, Rafael A. Calvo

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16320 2025-10-21 cs.CV 67%

Scaling Laws for Deepfake Detection

Wenhao Wang, Longqi Cai, Taihong Xiao, Yuxiao Wang, Ming-Hsuan Yang

机构 * University of Technology Sydney(悉尼技术大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11835 2025-10-15 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

Data or Language Supervision: What Makes CLIP Better than DINO?

Yiming Liu, Yuhui Zhang, Dhruba Ghosh, Ludwig Schmidt, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏