arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-23 至 2025-12-23 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 22 篇

2511.07044 2025-12-23 cs.CL 91%

Evaluating Large Language Models for Anxiety, Depression, and Stress Detection: Insights into Prompting Strategies and Synthetic Data

评估大型语言模型用于焦虑、抑郁和压力检测:提示策略和合成数据的见解

Mihael Arcan, David-Paul Niland

机构 * Lua Health(Lua健康)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL

AI总结 本研究评估了大型语言模型在焦虑、抑郁和压力检测中的性能,发现Distil-RoBERTa和XLNet在不同任务中表现优异,合成数据有效缓解类别不平衡,但需注意精度校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13274 2025-12-23 cs.LG cs.CL 90%

AdaLRS: Loss-Guided Adaptive Learning Rate Search for Efficient Foundation Model Pretraining

AdaLRS: 基于损失的自适应学习率搜索用于高效基础模型预训练

Hongyuan Dong, Dingkang Yang, Xiao Liang, Chao Feng, Jiao Ran

机构 * ByteDance Inc.(字节跳动公司)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 AdaLRS通过优化损失下降速度实现高效基础模型预训练,无需大量超参数调优,显著提升模型性能和鲁棒性。

Comments NeurIPS 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14757 2025-12-23 cs.SE cs.AI 89%

SWE-Synth: Synthesizing Verifiable Bug-Fix Data to Enable Large Language Models in Resolving Real-World Bugs

SWE-Synth:合成可验证的bug修复数据以使大语言模型能够解决现实中的bug

Minh V. T. Pham, Huy N. Phan, Hoang N. Phan, Cuong Le Chi, Tien N. Nguyen, Nghi D. Q. Bui

机构 * FPT Software AI Center, Viet Nam(越南FPT软件AI中心) Nanyang Technological University, Singapore(新加坡南洋理工大学) University of Texas at Dallas, US(美国德克萨斯大学达拉斯分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 SWE-Synth通过合成可验证的bug修复数据集,提升大语言模型在解决现实bug中的性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12608 2025-12-23 cs.CL cs.AI 88%

Human-Inspired Learning for Large Language Models via Obvious Record and Maximum-Entropy Method Discovery

通过明显记录和最大熵方法发现实现大语言模型的人类启发式学习

Hong Su

机构 * School of Computer Science, Chengdu University of Information Technology(计算机科学学院,成都信息科技学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种人类启发式学习框架,通过明显记录和最大熵方法发现,提升大语言模型在罕见场景下的学习能力和方法多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18027 2025-12-23 cs.CL cs.CY cs.SI 88%

CoPE: A Small Language Model for Steerable and Scalable Content Labeling

CoPE:一种可调节且可扩展的内容标注小语言模型

Samidh Chakrabarti, David Willner, Kevin Klyman, Tiffany Saade, Emily Capstick, Sabina Nong

机构 * Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);分类 cs.CL

AI总结 CoPE是一种可调节且可扩展的内容标注小语言模型,通过矛盾示例训练和双目标注方法,实现高效准确的内容标注,并在小规模下达到与前沿模型相当的性能。

Comments 21 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18730 2025-12-23 cs.LG 85%

A Theoretical Lens for RL-Tuned Language Models via Energy-Based Models

通过能量模型的理论视角提升强化学习调优语言模型

Zhiquan Tan, Yinrong Hong

机构 * Tsinghua University(清华大学) Beihang University(北航)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文通过能量模型视角,揭示了强化学习调优语言模型的理论基础,证明了其在指令遵循和推理任务中的稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18360 2025-12-23 cs.CL cs.AI 84%

LLM Agents Implement an NLG System from Scratch: Building Interpretable Rule-Based RDF-to-Text Generators

LLM Agents 实现从零构建 NLG 系统:构建可解释的基于规则的 RDF-to-Text 生成器

Mateusz Lango, Ondřej Dušek

机构 * Charles University, Faculty of Mathematics and Physics(查理大学数学与物理系)

专题命中 预训练与数据 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于 LLM agent 的神经符号框架,通过协作交互生成可解释的 RDF-to-Text 生成器,减少幻觉并提升生成效率。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18231 2025-12-23 cs.CV cs.CL 83%

Investigating Spatial Attention Bias in Vision-Language Models

探究视觉-语言模型中的空间注意力偏差

Aryan Chaudhary, Sanchit Goyal, Pratik Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani, India(比拉理工学院和科学研究院,帕利尼,印度)

专题命中 预训练与数据 :language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文研究了视觉-语言模型在处理水平拼接图像时存在的系统性空间注意力偏差,发现模型倾向于优先描述左位置内容,且该偏差在不同架构和语言训练下均存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10581 2025-12-23 cs.GR 82%

GraphTracer: Graph-Guided Failure Tracing in LLM Agents for Robust Multi-Turn Deep Search

GraphTracer: LLM代理中基于图的故障追踪以实现鲁棒多轮深度搜索

Heng Zhang, Yuling Shi, Xiaodong Gu, Haochen You, Zijian Zhang, Lubin Gan, Yilei Yuan, Jin Huang

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract)

AI总结 GraphTracer通过信息流分析和依赖图构建,提升多代理系统在多轮深度搜索中的故障归因准确性与鲁棒性。

Comments This submission has been withdrawn by the authors due to a fundamental error in the methodology that affects the validity of the main results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17817 2025-12-23 cs.CV 82%

Chorus: Multi-Teacher Pretraining for Holistic 3D Gaussian Scene Encoding

Chorus:多教师预训练用于整体3D高斯场景编码

Yue Li, Qi Ma, Runyi Yang, Mengjiao Ma, Bin Ren, Nikola Popovic, Nicu Sebe, Theo Gevers, Luc Van Gool, Danda Pani Paudel, Martin R. Oswald

机构 * University of Amsterdam(阿姆斯特丹大学) ETH Zürich(苏黎世联邦理工学院) University of Trento(特伦托大学)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)

AI总结 Chorus通过多教师预训练方法,实现对3D高斯场景的高效编码,提升多任务表现并实现数据高效监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18803 2025-12-23 cs.CY cs.MA 78%

Quantifying the Lifelong Impact of Resilience Interventions via Agent-Based LLM Simulation

通过基于代理的LLM模拟量化韧性干预的终身影响

Vivienne L'Ecuyer Ming

专题命中 预训练与数据 :LLM(title,abstract)

AI总结 本文提出LALS框架,通过基于代理的LLM模拟量化韧性干预的终身影响,揭示早期干预对财富积累的显著正向作用。

Comments 31 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10729 2025-12-23 cs.LG 77%

Using LLMs for Late Multimodal Sensor Fusion for Activity Recognition

利用大语言模型进行晚阶段多模态传感器融合以进行活动识别

Ilker Demirel, Karan Thakkar, Benjamin Elizalde, Miquel Espi Marques, Aditya Sarathy, Yang Bai, Umamahesh Srinivas, Jiajie Xu, Shirley Ren, Jaya Narain

机构 * Apple(苹果公司) MIT(麻省理工学院) Johns Hopkins(约翰霍普金斯大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 利用大语言模型进行晚阶段多模态融合,实现零样本和单样本活动分类,无需特定任务训练。

Comments NeurIPS Workshop on Learning from Time Series for Health

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00887 2025-12-23 cs.IR 75%

On Listwise Reranking for Corpus Feedback

基于语料反馈的列表级重排序

Soyoung Yoon, Jongho Kim, Daeyong Kwon, Avishek Anand, Seung-won Hwang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 L2G通过隐式诱导文档图实现高效基于图的检索,无需显式图计算开销,且在效果上与基于oracle的图方法相当。

Comments Accepted for WSDM 2026 (short)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07576 2025-12-23 cs.CV 75%

Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding

超级编码网络:多模态编码器的递归关联用于视频理解

Boyu Chen, Siran Chen, Kunchang Li, Qinglin Xu, Yu Qiao, Yali Wang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) the School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);prompting(abstract)

AI总结 本文提出超级编码网络,通过递归关联多模态编码器提升视频理解性能,显著提升跟踪、识别、聊天和编辑等任务效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19609 2025-12-23 cs.CV cs.AI 70%

MapTrace: Scalable Data Generation for Route Tracing on Maps

MapTrace: 用于地图路线追踪的可扩展数据生成

Artemis Panagopoulou, Aveek Purohit, Achin Kulshrestha, Soroosh Yazdani, Mohit Goyal

机构 * Google XR(谷歌XR) University of Pennsylvania(宾夕法尼亚大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MapTrace通过合成数据生成提升地图路线追踪性能,微调模型使成功率提升6.4个百分点,减少路径追踪误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17126 2025-12-23 q-bio.GN 67%

DNAMotifTokenizer: Towards Biologically Informed Tokenization of Genomic Sequences

DNAMotifTokenizer: 向生物信息学导向的基因组序列分词迈进

Xiaoxiao Zhou, Zihan Wang, Jingbo Shang, Yang E. Li

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

AI总结 DNAMotifTokenizer通过整合DNA序列模因的生物知识,提升了基因组序列分词的性能和可解释性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18634 2025-12-23 cs.LG stat.ML 57%

From Shortcut to Induction Head: How Data Diversity Shapes Algorithm Selection in Transformers

从捷径到归纳头:数据多样性如何影响Transformer中的算法选择

Ryotaro Kawata, Yujin Song, Alberto Bietti, Naoki Nishikawa, Taiji Suzuki, Samuel Vaiter, Denny Wu

机构 * The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Flatiron Institute(Flatiron研究所) CNRS(法国国家科学研究中心) Université Côte d’Azur(蔚蓝海岸大学) New York University(纽约大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本研究探讨了数据多样性如何影响Transformer算法选择,证明输入多样性可使模型实现归纳头并泛化,而低多样性则导致位置捷径失效,同时揭示了预训练上下文长度与泛化能力的权衡。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18998 2025-12-23 cs.CL 57%

Mirage of Mastery: Memorization Tricks LLMs into Artificially Inflated Self-Knowledge

幻象的精通:LLMs将记忆技巧误认为是人工提升的自我认知

Sahil Kale

机构 * Pune, India(印度浦那)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 本文研究LLMs将记忆误认为智能的问题,揭示其自我认知的不一致性和缺陷,提出需改进模型自我认知的平衡与一致性以提升AI可信度。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03198 2025-12-23 q-bio.NC cs.LG 57%

SimSort: A Data-Driven Framework for Spike Sorting by Large-Scale Electrophysiology Simulation

SimSort:一种基于大规模电生理模拟的尖峰分拣数据驱动框架

Yimu Zhang, Dongqi Han, Yansen Wang, Zhenning Lv, Yu Gu, Dongsheng Li

机构 * Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 SimSort通过大规模电生理模拟数据预训练,实现了在真实尖峰分拣任务中的零样本泛化,提升了尖峰分拣的鲁棒性和可扩展性。

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16504 2025-12-23 cs.CV 50%

Skeleton-Snippet Contrastive Learning with Multiscale Feature Fusion for Action Localization

基于多尺度特征融合的骨骼-片段对比学习用于动作定位

Qiushuo Cheng, Jingjing Liu, Catherine Morgan, Alan Whone, Majid Mirmehdi

机构 * School of Computer Science, University of Bristol North Bristol NHS Trust(布里斯托大学计算机科学学院、北布里斯托国家健康服务信托)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出基于多尺度特征融合的骨骼-片段对比学习方法,用于改进动作定位的自监督预训练,通过对比学习增强特征区分能力,并在多个数据集上取得优异效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08930 2025-12-23 cs.CV cs.GR 50%

Selfi: Self Improving Reconstruction Engine via 3D Geometric Feature Alignment

Selfi: 通过3D几何特征对齐实现自改进的重建引擎

Youming Deng, Songyou Peng, Junyi Zhang, Kathryn Heal, Tiancheng Sun, John Flynn, Steve Marschner, Lucy Chai

机构 * Cornell University(康奈尔大学) Google(谷歌) UC Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 Selfi通过特征对齐提升3D重建精度,利用VGGT输出作为伪地面真实值,实现NVS和姿态估计的高性能表现。

Comments Project Page: https://denghilbert.github.io/selfi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01701 2025-12-23 cs.CV 50%

SSR: Semantic and Spatial Rectification for CLIP-based Weakly Supervised Segmentation

SSR:基于CLIP的弱监督分割的语义与空间校正

Xiuli Bi, Die Xiao, Junchao Fan, Bin Xiao

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出SSR方法,通过语义与空间校正提升CLIP在弱监督分割中的性能,实现更高的mIoU分数。

Comments Accepted in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏