arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-07 至 2026-01-07 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 11 篇

2508.01491 2026-01-07 cs.CL 88%

The Homogenizing Effect of Large Language Models on Human Expression and Thought

大语言模型对人类表达与思维的同质化效应

Zhivar Sourati, Alireza S. Ziabari, Morteza Dehghani

机构 * Department of Computer Science(计算机科学系) Center for Computational Language Sciences(计算语言学中心) Department of Psychology, University of Southern California(心理学系,南加州大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 大语言模型通过标准化语言和推理,加剧了人类认知多样性的同质化效应,影响集体智慧和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17103 2026-01-07 cs.CL cs.AI 87%

Forging Time Series with Language: A Large Language Model Approach to Synthetic Data Generation

用语言锻造时间序列:一种基于大语言模型的合成数据生成方法

Cécile Rousseau, Tobia Boschi, Giandomenico Cornacchia, Dhaval Salwala, Alessandra Pascale, Juan Bernabe Moreno

机构 * IBM Research Europe(IBM欧洲研究院)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 SDForger通过大语言模型生成高质量多变量时间序列,利用文本条件化实现高效合成数据生成及多模态建模。

Journal ref NeurIPS 2025, https://openreview.net/forum?id=A2pmvkqOgp

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02671 2026-01-07 cs.CL cs.AI cs.LG 82%

Extracting books from production language models

从生产语言模型中提取书籍

Ahmed Ahmed, A. Feder Cooper, Sanmi Koyejo, Percy Liang

机构 * Stanford University(斯坦福大学) Yale University(耶鲁大学)

专题命中 预训练与数据 :language model(title);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过两阶段方法测试从生产LLM中提取书籍的可行性,发现部分模型可提取受版权保护文本,但需不同劫持策略,揭示生产LLM存在训练数据泄露风险。

Comments We ran experiments from mid-August to mid-September 2025, notified affected providers shortly after, and now make our findings public after a 90-day disclosure window

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02683 2026-01-07 cs.AI 81%

Learning from Prompt itself: the Hierarchical Attribution Prompt Optimization

从提示本身学习:层次归因提示优化

Dongyu Chen, Jian Ma, Xianpeng Zhang, Lei Zhang, Haonan Lu, Chen Chen, Chuangchuang Wang, Kai Tang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 HAPO框架通过动态归因机制、语义单元优化和多模态支持,提升提示优化效率,适用于多任务场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15674 2026-01-07 cs.CL cs.AI cs.LG 80%

Activation Oracles: Training and Evaluating LLMs as General-Purpose Activation Explainers

激活 oracle:训练和评估 LLM 作为通用目的激活解释器

Adam Karvonen, James Chua, Clément Dumas, Kit Fraser-Taliente, Subhash Kantamneni, Julian Minder, Euan Ong, Arnab Sen Sharma, Daniel Wen, Owain Evans, Samuel Marks

机构 * MATS Truthful AI EPFL(瑞士联邦理工学院) ENS Paris-Saclay(巴黎-萨克雷大学) Northeastern University(东北大学) Anthropic

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种通用的 LLM 激活解释器,通过多样化训练在多个下游任务中表现出色,能恢复模型内部信息。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10069 2026-01-07 cs.AI cs.MM 79%

SyncLipMAE: Contrastive Masked Pretraining for Audio-Visual Talking-Face Representation

SyncLipMAE:用于音频视觉谈话面部表示的对比掩码预训练

Zeyu Ling, Xiaodong Gu, Jiangnan Tang, Changqing Zou

机构 * State Key Laboratory of CAD&CG(CAD与CG国家重点实验室) ByteDance(字节跳动)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 SyncLipMAE通过对比掩码预训练实现音频视觉谈话面部的同步感知表示,适用于多下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02578 2026-01-07 cs.CL cs.IR 70%

DataParasite Enables Scalable and Repurposable Online Data Curation

DataParasite 实现可扩展和可复用的在线数据整理

Mengyi Sun

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DataParasite通过轻量级配置和自然语言指令实现高效、可复用的在线数据收集,显著降低数据整理成本与技术门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02994 2026-01-07 cs.RO cs.AI cs.LG 62%

Learning to Act Robustly with View-Invariant Latent Actions

通过视图不变的潜在动作学习鲁棒性

Youngjoon Jeong, Junha Chun, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Department of Electrical and Computer Engineering, Seoul National University(电气与计算机工程系,首尔国立大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 VILA通过建模基于物理动态的视图不变潜在动作,提升机器人策略在不同视角下的鲁棒性和泛化能力。

Comments Website: https://joon-stack.github.io/VILA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03250 2026-01-07 cs.CV 50%

A Versatile Multimodal Agent for Multimedia Content Generation

多功能多模态代理用于多媒体内容生成

Daoan Zhang, Wenlin Yao, Xiaoyang Wang, Yebowen Hu, Jiebo Luo, Dong Yu

机构 * University of Rochester(罗切斯特大学) Tencent AI Lab, Bellevue(腾讯AI实验室) University of Central Florida(中央佛罗里达大学)

专题命中 预训练与数据 :preference optimization(abstract)

AI总结 本文提出了一种多功能多模态代理,通过技能获取理论和两阶段相关策略,实现复杂多媒体内容生成任务的自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02881 2026-01-07 cs.CV 50%

Towards Agnostic and Holistic Universal Image Segmentation with Bit Diffusion

面向无偏和整体通用图像分割的位差分扩散

Jakob Lønborg Christensen, Morten Rieger Hannemose, Anders Bjorholm Dahl, Vedrana Andersen Dahl

机构 * Technical University of Denmark(丹麦技术大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出了一种基于扩散的通用图像分割框架,通过位置感知调色板和tanh激活函数提升性能,缩小了与基于掩码方法的性能差距,并引入了原理化的模糊建模能力。

Comments Accepted at NLDL 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15002 2026-01-07 cs.CV 50%

How Many Images Does It Take? Estimating Imitation Thresholds in Text-to-Image Models

需要多少张图片?文本到图像模型中模仿阈值的估计

Sahil Verma, Royi Rassin, Arnav Das, Gantavya Bhatt, Preethi Seshadri, Chirag Shah, Jeff Bilmes, Hannaneh Hajishirzi, Yanai Elazar

机构 * University of Washington, Seattle(华盛顿大学) Bar-Ilan University(巴伊兰大学) University of California, Irvine(加州大学伊文斯顿分校) Allen Institute of AI(人工智能研究院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究通过评估文本到图像模型的模仿阈值,探讨其在版权和隐私合规中的应用。

Comments Accepted at TMLR 2025, ATTRIB, RegML, and SafeGenAI workshops at NeurIPS 2024 and NLLP Workshop 2024. https://openreview.net/forum?id=x0qJo7SPhs

详情

展开后加载摘要…

URL PDF HTML 收藏