arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-27 至 2025-11-27 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 14 篇

2511.20799 2025-11-27 cs.CL cs.AI cs.CR cs.LG 89%

Memories Retrieved from Many Paths: A Multi-Prefix Framework for Robust Detection of Training Data Leakage in Large Language Models

从多路径中检索的记忆:一种多前缀框架,用于在大型语言模型中稳健检测训练数据泄露

Trung Cuong Dang, David Mohaisen

机构 * Department of Computer Science, University of Central Florida(计算机科学系,中央佛罗里达大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出多前缀框架,通过量化记忆的检索路径多样性,稳健检测大型语言模型中的训练数据泄露问题。

Comments 11 pages, 2 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20872 2025-11-27 cs.CL 85%

Winning with Less for Low Resource Languages: Advantage of Cross-Lingual English_Persian Argument Mining Model over LLM Augmentation

低资源语言中以少胜多:跨语言英语-波斯语论证挖掘模型相对于LLM增强的优势

Ali Jahan, Masood Ghayoomi, Annette Hautli-Janisz

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种跨语言论证挖掘模型,通过零样本迁移、LLM增强和跨语言训练三种方法,证明在低资源语言中,跨语言模型能显著优于基于LLM的增强方法。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19694 2025-11-27 cs.LG cs.AI 81%

TiCT: A Synthetically Pre-Trained Foundation Model for Time Series Classification

TiCT:一种合成预训练的时间序列分类基础模型

Chin-Chia Michael Yeh, Uday Singh Saini, Junpeng Wang, Xin Dai, Xiran Fan, Jiarui Sun, Yujie Fan, Yan Zheng

机构 * Visa Research(Visa研究)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 TiCT是一种基于Transformer的时间序列分类基础模型,通过合成数据预训练实现无需微调的上下文学习,有效提升时间序列分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19386 2025-11-27 cs.CV cs.AI 80%

Force Prompting: Video Generation Models Can Learn and Generalize Physics-based Control Signals

力提示:视频生成模型可以学习并泛化基于物理的控制信号

Nate Gillman, Charles Herrmann, Michael Freeman, Daksh Aggarwal, Evan Luo, Deqing Sun, Chen Sun

机构 * Brown University(布朗大学) Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :prompting(title,abstract);分类 cs.AI

AI总结 本文提出力提示方法,通过物理力信号生成逼真视频,利用视觉和运动先验实现物理控制信号的泛化,提升世界模型的物理真实性。

Comments Camera ready version (NeurIPS 2025). Code and interactive demos at https://force-prompting.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20704 2025-11-27 cs.LG stat.ML 79%

Pretraining Transformer-Based Models on Diffusion-Generated Synthetic Graphs for Alzheimer's Disease Prediction

基于扩散生成合成图的Transformer模型预训练用于阿尔茨海默病预测

Abolfazl Moslemi, Hossein Peyvandi

机构 * Sharif University of Technology(谢里夫理工学院) Pasargad Institute for Advanced Innovative Solutions(帕萨尔加德先进创新解决方案研究所)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 本研究提出基于扩散生成合成图的Transformer模型,通过预训练提升阿尔茨海默病预测的准确性和泛化能力。

Comments 14 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08805 2025-11-27 cs.CV cs.LG 79%

Filter Like You Test: Data-Driven Data Filtering for CLIP Pretraining

像测试一样过滤:基于数据的数据驱动数据过滤用于CLIP预训练

Mikey Shechter, Yair Carmon

机构 * Tel Aviv University, Israel(特拉维夫大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 FLYT通过数据驱动的方法提升CLIP预训练效果,实现DataComp基准上的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04619 2025-11-27 cs.LG stat.ML 79%

CTSyn: A Foundation Model for Cross Tabular Data Generation

CTSyn:跨表格数据生成的基准模型

Xiaofeng Lin, Chenheng Xu, Matthew Yang, Guang Cheng

机构 * Department of Statistics and Data Science, University of California Los Angeles(统计与数据科学系,加州大学洛杉矶分校) Department of Computer Science, University of California Los Angeles(计算机科学系,加州大学洛杉矶分校)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 CTSyn提出了一种基于扩散的生成性基准模型,用于跨表格数据生成,通过统一潜在空间和条件潜在扩散模型提升表格合成的实用性和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16397 2025-11-27 cs.CL 77%

AICC: Parse HTML Finer, Make Models Better -- A 7.3T AI-Ready Corpus Built by a Model-Based HTML Parser

AICC:解析HTML更精细,使模型更优秀——通过基于模型的HTML解析器构建的7.3T AI-ready语料库

Ren Ma, Jiantao Qiu, Chao Xu, Pei Chu, Kaiwen Liu, Pengli Ren, Yuan Qu, Jiahui Peng, Linfeng Hou, Mengjie Liu, Lindong Lu, Wenchang Ning, Jia Yu, Rui Min, Jin Shi, Haojiong Chen, Peng Zhang, Wenjian Zhang, Qian Jiang, Zengjie Hu, Guoqiang Yang, Zhenxiang Li, Fukai Shang, Runyuan Ma, Chenlin Su, Zhongying Tu, Wentao Zhang, Dahua Lin, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 AICC通过基于模型的HTML解析器构建,显著提升了网络数据提取质量,从而在多个基准测试中优于现有方法,证明提取质量对模型性能的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21191 2025-11-27 cs.CV 75%

Scenes as Tokens: Multi-Scale Normal Distributions Transform Tokenizer for General 3D Vision-Language Understanding

场景作为标记:多尺度正常分布变换标记器用于通用3D视觉-语言理解

Yutao Tang, Cheng Zhao, Gaurav Mittal, Rohith Kukkala, Rama Chellappa, Cheng Peng, Mei Chen

机构 * Johns Hopkins University(约翰霍普金斯大学) Microsoft(微软公司)

专题命中 预训练与数据 :LLM(abstract);language model(abstract);prompting(abstract)

AI总结 NDTokenizer3D通过多尺度NDT表示和解码器实现通用3D视觉-语言理解,提升3D场景任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05326 2025-11-27 cs.CL 70%

A Psychology-based Unified Dynamic Framework for Curriculum Learning

基于心理学的统一动态框架用于课程学习

Guangyu Meng, Qingkai Zeng, John P. Lalor, Hong Yu

机构 * University of Notre Dame, Department of Computer Science and Engineering(诺丁汉大学计算机科学与工程系) Nankai University, College of Computer Science(南开大学计算机学院) University of Notre Dame, Department of IT, Analytics, and Operations(诺丁汉大学信息技术、分析与运营系) VA Bedford Healthcare System, Center for Health Optimization and Implementation Research(美国退伍军人事务部贝福德医疗系统健康优化与实施研究中心) University of Massachusetts Amherst, Manning College of Information and Computer Sciences(马萨诸塞大学阿姆赫斯特分校曼宁信息与计算机科学学院) University of Massachusetts Lowell, Miner School of Computer and Information Sciences(马萨诸塞大学洛威分校米纳尔计算机与信息科学学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于心理学的统一动态框架用于课程学习,通过项目反应理论量化训练数据难度并优化数据选择,提升模型训练效率和准确性。

Comments Accepted for publication in Computational Linguistics. This is a pre-MIT Press publication version. Code available at https://github.com/nd-ball/cl-irt

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12336 2025-11-27 cs.CV 67%

Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding

对多模态大语言模型在视频理解中的可信度进行基准测试

Youze Wang, Zijun Chen, Ruoyu Chen, Shishen Gu, Wenbo Hu, Jiayang Liu, Yinpeng Dong, Hang Su, Jun Zhu, Meng Wang, Richang Hong

机构 * Hefei University of Technology(合肥工业大学) Tsinghua University(清华大学) Institute of Science Tokyo(东京科学研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本研究提出Trust-videoLLMs基准,评估23种视频LLMs在真实性、鲁棒性、安全性和隐私等方面的表现,揭示其在动态场景理解及现实风险缓解中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07850 2025-11-27 cs.CL cs.AI cs.DB cs.LG 67%

Bring Your Own KG: Self-Supervised Program Synthesis for Zero-Shot KGQA

自带知识图谱:零样本知识图谱问答的自监督程序合成

Dhruv Agarwal, Rajarshi Das, Sopan Khosla, Rashmi Gangadharaiah

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) AWS AI Labs(AWS人工智能实验室)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BYOKG通过自监督程序合成实现零样本知识图谱问答,利用探索机制和LLM生成查询程序,提升问答准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15703 2025-11-27 cs.CV cs.AI cs.CL 62%

Think Visually, Reason Textually: Vision-Language Synergy in ARC

视觉优先,文本推理:ARC中的视觉-语言协同

Beichen Zhang, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Haodong Duan, Dahua Lin, Jiaqi Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出视觉-语言协同推理和模态切换自我纠正策略,通过结合视觉抽象与语言推理提升ARC-AGI任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21690 2025-11-27 cs.RO cs.CV cs.LG 57%

TraceGen: World Modeling in 3D Trace Space Enables Learning from Cross-Embodiment Videos

TraceGen:在3D轨迹空间中进行世界建模,实现跨躯体视频的学习

Seungjae Lee, Yoonkyo Jung, Inkook Chun, Yao-Chih Lee, Zikui Cai, Hongjia Huang, Aayush Talreja, Tan Dat Dao, Yongyuan Liang, Jia-Bin Huang, Furong Huang

机构 * University of Maryland, College Park(马里兰大学 College Park分校)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 TraceGen通过3D轨迹空间实现跨躯体视频学习,利用紧凑的轨迹表示提升机器人任务学习效率与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏