arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-19 至 2025-12-19 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 10 篇

2403.00964 2025-12-19 cs.CL cs.LG 86%

MALTO at SemEval-2024 Task 6: Leveraging Synthetic Data for LLM Hallucination Detection

MALTO在SemEval-2024任务6:利用合成数据进行LLM幻觉检测

Federico Borra, Claudio Savelli, Giacomo Rosso, Alkis Koudounas, Flavio Giobergia

机构 * Politecnico di Torino(托尼诺理工学院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 MALTO通过合成数据增强和投票集成方法,提升LLM幻觉检测的准确性与鲁棒性。

Comments Under revision at SemEval 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15862 2025-12-19 hep-ph 82%

Reusable theory representations for colliders: a demonstrator SMEFT foundation model

可重用的理论表示用于对撞机:SMEFT基础模型的演示

Supratim Das Bakshi, T. J. Hobbs, Brandon Kriesten

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本研究提出了一种基于对比表示的SMEFT基础模型,用于高能对撞机中对新物理的探索,通过训练编码器网络生成低维潜在流形,以捕捉SMEFT引起的Drell-Yan光谱变形的几何结构。

Comments 39 pages, 12 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16581 2025-12-19 cs.LG cs.IR 79%

Abacus: Self-Supervised Event Counting-Aligned Distributional Pretraining for Sequential User Modeling

Abacus: 为序列用户建模的自监督事件计数对齐分布预训练

Sullivan Castro, Artem Betlei, Thomas Di Martino, Nadir El Manouzi

机构 * Criteo AI Lab(Criteo人工智能实验室)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 Abacus通过自监督预训练方法提升序列用户建模,结合事件计数统计与序列学习目标,提高下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15830 2025-12-19 cs.SD cs.CL q-bio.NC 79%

From Minutes to Days: Scaling Intracranial Speech Decoding with Supervised Pretraining

从分钟到天:通过监督预训练扩展颅内语音解码

Linnea Evanson, Mingfang Zhang, Hubert Banville, Saarang Panchavati, Pierre Bourdillon, Jean-Rémi King

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL

AI总结 通过监督预训练扩展颅内语音解码,利用长期数据提升解码性能并解决跨天变化问题。

Comments Linnea Evanson* and Mingfang (Lucy) Zhang* are joint first authors. Pierre Bourdillon** and Jean-Rémi King** are joint last authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15781 2025-12-19 cs.CR 78%

Detecting Malicious Entra OAuth Apps with LLM-Based Permission Risk Scoring

基于LLM的权限风险评分检测恶意Entra OAuth应用

Ashim Mahara

专题命中 预训练与数据 :LLM(title,abstract)

AI总结 本文提出基于LLM的权限风险评分方法,用于实时检测恶意Entra OAuth应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01218 2025-12-19 cs.RO cs.AI cs.CV cs.LG 76%

Provable Ordering and Continuity in Vision-Language Pretraining for Generalizable Embodied Agents

可证明的视觉-语言排序与连续性在通用化具身体验代理中的预训练

Zhizhen Zhang, Lei Zhu, Zhen Fang, Zi Huang, Yadan Luo

机构 * The University of Queensland(昆士兰大学) Tongji University(同济大学) University of Technology Sydney(悉尼科技大学)

专题命中 预训练与数据 :pretraining(title);分类 cs.AI、cs.LG

AI总结 本文提出AcTOL方法,通过对比帧间语义差异和局部布朗桥约束,实现有序且连续的视觉-语言表示,提升具身体验代理在不同指令风格下的鲁棒性。

Comments NeurIPS 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16901 2025-12-19 cs.LG cs.AI cs.CL cs.CY 75%

Impacts of Racial Bias in Historical Training Data for News AI

历史训练数据中的种族偏见对新闻AI的影响

Rahul Bhargava, Malene Hornstrup Jespersen, Emily Boardman Ndulue, Vivica Dsouza

机构 * Northeastern University(东北大学) University of Copenhagen(哥本哈根大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了基于历史训练数据的新闻AI中种族偏见的影响,发现'blacks'标签在某些群体中作为种族歧视检测器,但对现代案例表现不佳,揭示了新闻室在采用AI工具时需平衡效率与偏见风险的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03634 2025-12-19 cs.LG 70%

nanoTabPFN: A Lightweight and Educational Reimplementation of TabPFN

nanoTabPFN:一种轻量级且教育性的TabPFN重实现

Alexander Pfefferle, Johannes Hog, Lennart Purucker, Frank Hutter

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) University of Freiburg(弗赖堡大学) Prior Labs(Prior实验室)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 nanoTabPFN通过轻量级实现和预生成训练数据,使表格基础模型更易于教育使用,预训练速度比TabPFN v2快160,000倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16147 2025-12-19 cs.CL cs.AI 62%

Decoding Fake Narratives in Spreading Hateful Stories: A Dual-Head RoBERTa Model with Multi-Task Learning

在传播仇恨言论中解码虚假叙述:一种带有多任务学习的双头RoBERTa模型

Yash Bhaskar, Sankalp Bahad, Parameswari Krishnamurthy

机构 * IIIT Hyderabad(IIIT海得拉巴)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种双头RoBERTa模型,通过多任务学习检测社交媒体中的虚假叙述驱动的仇恨言论,并实现目标和严重性预测。

Comments Accepted Paper, Anthology ID: 2024.icon-fauxhate.3, 4 pages, 1 figure, 1 table

Journal ref Proceedings of the 21st International Conference on Natural Language Processing (ICON), pages 12-15, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04919 2025-12-19 cs.CL 57%

The Emergence of Chunking Structures with Hierarchical RNN

具有层次递归神经网络的分块结构涌现

Zijun Wu, Anup Anand Deshmukh, Yongkang Wu, Jimmy Lin, Lili Mou

机构 * University of Alberta/Amii(阿尔伯塔大学/Amii) University of Waterloo(滑铁卢大学) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所(Amii)) Huawei Poisson Lab(华为Poisson实验室)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL

AI总结 本文提出一种无监督分块方法,利用层次递归神经网络建模词与分块的层次结构,通过预训练和微调提升分块性能,揭示分块结构在训练过程中的短暂性。

Comments Published in Computational Linguistics

Journal ref Computational Linguistics, vol. 51, no. 3, pp. 815-841, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏