arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12486 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2608.13695 2026-08-17 cs.CY cs.LG 新提交 70%

Language-Specific Gaps in AI Safety Training Datasets

AI安全训练数据集中的语言特定缺口

Chialuka Prisca-Mary Onuoha, Bright Etornam Sunu, Rashidat Sikiru

机构 * Black in AI Safety & Ethics (BASE)(黑人AI安全与伦理(BASE))

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究审计多语言AI安全训练数据集的语言缺口,发现其与资源层级不完全相关,豪萨语翻译质量未达阈值,非洲语言缺乏特定危害类别覆盖,提出切片级审计方法及建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03966 2026-08-17 cs.CL 版本更新 70%

HalluTruthQA-4K: A Fine-Grained Corpus and Annotation Process for Arabic Hallucination Detection and Truth Verification

HalluTruthQA-4K:面向阿拉伯语幻觉检测与事实验证的细粒度语料库及标注流程

Salah Eddine Bekhouche, Abdessalam Bouchekif, Hichem Telli, Mohammed-En-Nadhir Zighem, Abdenour Hadid

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出HalluTruthQA-4K,这一含4000个阿拉伯语问答实例的细粒度语料库,用于阿拉伯语幻觉检测等任务,为HalluScoring 2026共享任务提供官方数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12574 2026-08-14 cs.AI cs.FL 新提交 70%

Trie Automata for Constrained Decoding over Large Finite Sets

用于大有限集上约束解码的Trie自动机

Xingzi Xu, Karim Bouyarmane

机构 * Amazon(亚马逊公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大型语言模型有限集约束解码的速度瓶颈,提出Trie自动机机制,通过预计算token掩码实现高效解码,在批量服务中吞吐量较XGrammar提升29倍,且编译与计算效率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09526 2026-08-11 cs.CR cs.AI 新提交 70%

RangeFactory: Scalable Construction of Multi-Hop Cyber Ranges

RangeFactory:可扩展多跳网络靶场构建框架

Hanlin Jiang, Puyi Wang, Jiandong Jin, Shaofei Li, Zhan Shen, Pengli Wang, Ziming Wang, Yifeng Cai, Ning Jia, Yuxin Ren, Peng Jiang, Yao Guo, Ding Li

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 RangeFactory是自动化网络靶场编排框架,可规模化构建多跳靶场;其构建的RangeBench含1148个靶场实例,发现智能体存在持续入侵差距,还生成了攻击轨迹语料库。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09049 2026-08-11 cs.CL 新提交 70%

Security and Privacy Taxonomy Generation from Mobile App Reviews

从移动应用评论生成安全与隐私分类体系

Moghis Fereidouni, Vinaik Chhetri, Umar Farooq, A. B. Siddique

机构 * University of Kentucky(肯塔基大学) Louisiana State University(路易斯安那州立大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对现有安全隐私分类体系手工构建、无法适配海量应用评论的问题,提出TaxoScale流程,筛选60万条相关评论构建语料库,其在多指标上优于基线且发现新分支。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07540 2026-08-11 cs.AI 新提交 70%

TREAT: Evaluating Access to Formal Knowledge across Equivalent Mathematical Representations

TREAT:评估等价数学表示下的形式知识获取能力

Fateme Mazdarani, Carlos Toxtli

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出基准TREAT,测试大型语言模型从保等价数学变换中识别定理身份的能力,发现模型表现不佳且存在多种失败模式,凸显形式知识表示鲁棒性的重要性。

Comments Accepted at 28th International Symposium on Symbolic and Numeric Algorithms for Scientific Computing (SYNASC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19766 2026-08-11 cs.CL 版本更新 70%

PAM: Training Policy-Aligned Moderation Filters at Scale

PAM:在大规模上训练策略对齐的 moderation 过滤器

Masoomali Fatehkia, Enes Altinisik, Mohamed Osman, Husrev Taha Sencar

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PAM 提出了一种灵活的框架,用于训练基于用户定义策略的定制 moderation 过滤器,能够在大规模上实现更广泛的对齐需求,并在多个基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06196 2026-08-07 cs.AI 新提交 70%

Comparative Approaches to Agent Retrieval over Large Skill Libraries

基于大型技能库的智能体检索方法的比较研究

Indivara Kolluru, Nathan Sportsman

机构 * Praetorian

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究对比了混合排名器与类型化知识图谱在690个技能库的117个真实查询上的检索效果,发现添加结构无法提升强排名器的检索性能,明确了结构优化的适用条件。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06115 2026-08-07 cs.AI 新提交 70%

Mind the Gaps: Mixture-of-Minds for Human Simulation

关注差距:用于人类模拟的思维混合模型

Pranav Dahiya

机构 * Semilattice(半格)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Anacreon受众模拟模型,基于Gemma 4 12B构建思维混合模型,通过聚类个体、情感链等技术,在个体层面序数对齐达0.775,缩小了群体与个体模拟的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05759 2026-08-07 cs.CL 新提交 70%

How to Recognize New Words: A Comparison Between Context Biasing Methods and Speech LLMs

如何识别生词:上下文偏置方法与语音大语言模型的对比

Christian Huber, Alexander Waibel

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究对比了基于Whisper的上下文偏置方法与语音LLMs在识别ASR中生词的性能,发现前者可大幅降低偏置词错误率,后者在朗读语音上表现好但泛化性差,最终为方法选择提供了权衡依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16278 2026-08-07 cs.CV cs.AI 版本更新 70%

RealityBridge: Bridging Editable 3D Gaussian Splatting Driving Simulations and Real-World Videos

RealityBridge: 连接可编辑3D高斯泼溅驾驶模拟与现实世界视频

Zhenhua Wu, Yun Pang, Mingkun Chang, Yuwei Ning, Liangzhi Wang, Yi Xiao, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education(教育部机器智能与先进计算重点实验室)

专题命中 预训练与数据 :foundation model(abstract);post-training(abstract);分类 cs.AI

AI总结 提出RealityBridge框架,利用多模态控制和轻量级GateNet,结合自回归长视频训练与奖励引导后训练,缩小编辑后3DGS驾驶视频的Sim-to-Real差距,提升视觉真实感和时间一致性。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05088 2026-08-06 cs.LG 新提交 70%

MALT: Lightweight Curvature-Aware Muon via Diagonal Preconditioning

MALT:通过对角预条件化实现的轻量曲率感知Muon

Tongle Wu, Huanyu Dong, Ying Sun, Ziye Ma

机构 * School of Electrical Engineering and Computer Science, The Pennsylvania State University(宾夕法尼亚州立大学电气工程与计算机科学学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 针对Muon未考虑损失景观曲率几何的问题,提出轻量曲率感知优化方法MALT及MALTER,在GPT-2系列预训练上性能优于Muon且开销相近。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03585 2026-08-05 cs.AI cs.CY 新提交 70%

From Social Coding to Agentic Coding: Productivity and Relational Reconfiguration in Open-Source Communities

从社交编码到智能体编码:开源社区中的生产力与关系重构

Mengying Zhou, Yongjie Yin, Yang Chen

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究基于含1084名开发者的GitHub数据模拟发现,编码智能体(CA)可提升开源社区生产力,但采用率低且收益集中于活跃开发者,还会减少人类直接交互、降低公共知识实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00705 2026-08-04 cs.IR cs.CL 新提交 70%

A Triple-Robustness Analysis of Retrieval-Augmented Generation for Multi-Hop Requirements Traceability

检索增强生成在多跳需求可追溯性中的三重鲁棒性分析

Meftun Akarsu, Burak Özdemir, Doğancan Büyükçolak, Recep Kaan Karaman

机构 * Turkish Aerospace Industries(土耳其航空航天工业公司) Technical University of Munich(慕尼黑工业大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文针对多跳需求可追溯性,开展三重鲁棒性分析,对比不同RAG架构、嵌入器等的表现,发现现有结论分歧的原因,提出需按该鲁棒性标准验证RAG架构主张。

Comments 6 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00452 2026-08-04 cs.IR cs.AI 新提交 70%

CeQe: Grounding Lexical Retrieval in Semantic Evidence

CeQe:在语义证据中实现词汇检索

Adam Kahirov, Umesh Deshpande, Swaminathan Sundararaman

机构 * IBM Research(IBM研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对BM25的语义词汇鸿沟问题,本文提出CE-QE方法,利用交叉编码器的语义检索结果扩展BM25查询,在多个BEIR数据集上显著提升检索性能且不修改底层索引。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29065 2026-08-03 cs.CL 新提交 70%

Tokenizer-Agnostic Engram Module

与分词器无关的恩格拉姆模块(Tokenizer-Agnostic Engram Module)

Jia Peng Lim, Hai Leong Chieu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对Deepseek Engram模块与分词器耦合的问题,通过替换哈希方式构建联合嵌入空间,实现了分词器无关性,同时保持了相当的性能。

Comments Preprint, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29019 2026-08-03 cs.CR cs.CL cs.IR 新提交 70%

GoldenRetriever: Non-Interactive Homomorphic Encrypted Retrieval for Privacy-Preserving RAG

GoldenRetriever:用于隐私保护RAG的非交互式同态加密检索

Yang Gao, Gang Quan, Scott Piersall, Qian Lou, Dongdong Wang, Liqiang Wang

机构 * University of Central Florida(中佛罗里达大学) Florida International University(佛罗里达国际大学) University of Florida(佛罗里达大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有隐私保护RAG检索方案延迟高、易泄露的问题,提出基于阈值选择的非交互式同态加密检索框架,通过CKKS同态计算与掩码极化方法实现高效安全的检索,性能优于排名式加密方法。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28528 2026-07-31 cs.CL 新提交 70%

AI systems and the reproduction of (standard) language ideologies in World Englishes

AI系统与世界英语中(标准)语言意识形态的再生产

Kingsley Ugwuanyi

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨AI系统如何再生产世界英语领域的(标准)语言意识形态,以“标准化悖论”为例分析争议,主张采用更具包容性的AI设计方法。

Comments 13 pages, 0 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27928 2026-07-31 cs.LG 新提交 70%

Harnessing the Potential of Optimizing Data Mixtures via Bayesian Domain Reweighting

利用贝叶斯域重加权优化数据混合的潜力

Xiang Yuan, Kaiqing Lei, Zhenyu Jin, Jun Shu, Deyu Meng, Zongben Xu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出贝叶斯域加权方法,引入Gamma先验从狄利克雷分布推断权重,实现稳定高效的域权重学习,以更少数据识别最优数据混合,适用于大规模应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26249 2026-07-30 cs.CL cs.CY cs.SD stat.AP 新提交 70%

A large-scale corpus of religious radio broadcast transcripts from webstream recordings in the United States

美国网络流录音的宗教广播文字转写大规模语料库

Samuel Bestvater, Athena Chapekis, Skyler Seets, Anna Lieb, Sono Shah, Aaron Smith

机构 * Pew Research Center(皮尤研究中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究构建了2025年7月美国宗教广播网络流录音的大规模文字转写语料库,可用于宗教传播、社会议题分析及语音处理等相关领域研究。

Comments Presented at IC2S2 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25184 2026-07-29 cs.CL 新提交 70%

A scaling law of contextual persistence in human language

人类语言中上下文持久性的标度律

Elan Barenholtz

机构 * Florida Atlantic University(佛罗里达大西洋大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究人类语言中单词顺序排列的规律,用大语言模型测量上下文持久性函数P(d),发现其在多个语料库中按1/d衰减,建立了人类语言中上下文持久性的标度律。

Comments 21 pages, 5 figures (plus 1 supplementary figure); Supplementary Information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24516 2026-07-28 cs.CV cs.AI 新提交 70%

DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes

DecoupleMix:用于可扩展视觉语言模型数据配方的解耦比率搜索和凸分配

Jiahao Xie, Zhongbin Guo, Qianle Wang, Ruiqi Lu, Dongling Xiao, Wanxuan Sun, Cheng Yang

机构 * ByteDance(字节跳动)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 该研究针对视觉语言模型数据构建缺乏原则性标准的问题,提出DecoupleMix框架,将其解耦为类间比率搜索和类内凸分配两个子问题,实验证明该方法优于启发式基线,且最优比率可跨规模转移,提升了VLM竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17931 2026-07-28 cs.AI 版本更新 70%

LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research Agent

LiteResearcher:一种用于深度研究代理的可扩展代理强化学习训练框架

Bince Qu, Wanli Li, Bo Pan, Jianyu Zhang, Zheng Liu, Pan Zhang, Wei Chen, Bo Zhang

机构 * Zhejiang University(浙江大学) Simplex AI The Hong Kong Polytechnic University(香港理工大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 LiteResearcher通过构建轻量虚拟世界提升代理强化学习的可扩展性,使小规模搜索代理在GAIA和Xbench等基准上取得state-of-the-art结果。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22376 2026-07-27 cs.CL 新提交 70%

A Factorial Study of Synthetic Data Generation for Low-Resource Machine Translation using Grammar Books

使用语法书进行低资源机器翻译合成数据生成的析因研究

Varun Ghat Ravikumar, Sina Ahmadi, Lena Jäger, Rico Sennrich

机构 * University of Zurich(苏黎世大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对濒危语言机器翻译缺平行数据问题,利用大语言模型从语法书提取内容生成合成语料库微调,经三种低资源语言验证,通过析因研究确定增益因素组合,证明可将静态语言文档用于机器翻译微调,为资源匮乏语言提供翻译工具路径。

Comments Accepted at CLiC-it 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22351 2026-07-27 cs.LG physics.med-ph 新提交 70%

IQ-JEPA: A Joint-Embedding Predictive Architecture with a Hermitian Vision Transformer for Sound Speed and Attenuation Estimation from Ultrasound IQ Data

IQ-JEPA:一种带有厄米特视觉变换器的联合嵌入预测架构,用于从超声 IQ 数据估计声速和衰减

Masashi Sode, Gianmarco Pinton

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 研究利用超声 IQ 数据估计声速和衰减的难题,提出 IQ-JEPA 架构,先无标签预训练编码器预测 IQ 区域潜在表示,再微调。实验表明该方法提高标签效率,自监督是主导因素,为定量超声基础模型迈出第一步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09635 2026-07-24 cs.CL 版本更新 70%

K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs

K12-KGraph:一种对齐课程的图谱用于基准测试和训练教育大语言模型

Hao Liang, Qihan Lin, Zhaoyang Han, Xiaochen Ma, Zhen Hao Wong, Meiyi Qiang, Linzhuang Sun, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research(先进算法研究所) OriginHub Technology(OriginHub技术) Zhongguancun Academy(中关村学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出K12-KGraph,基于中小学教材构建的课程对齐知识图谱,用于构建多选基准测试K12-Bench和训练数据集K12-Train,验证课程结构监督在教育模型训练中的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27396 2026-07-23 cs.SE cs.LG 版本更新 70%

Test-Input Generation for Tensor Programs: What Actually Finds Kernel Bugs

张量程序测试输入生成:什么真正发现内核错误

Dipankar Sarkar

机构 * Arizona State University(亚利桑那州立大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 通过GPU模拟器模糊测试,比较七种测试生成策略在26个操作上的效果,发现边界形状采样在错误召回率(78%)和假阳性率(0%)上表现最佳。

Comments 8 pages, 1 figure, LNCS format. Companion paper: arXiv:2606.20128

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10216 2026-07-23 cs.CL 版本更新 70%

The Impact of Editorial Intervention on Detecting Native Language Traces

编辑干预对检测母语痕迹的影响

Ahmet Yavuz Uluslu, Mark Gales, Kate Knill, Gerold Schneider

机构 * University of Cambridge(剑桥大学) University of Zurich(苏黎世大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了编辑干预对母语识别鲁棒性的影响,发现深层母语特征在轻微编辑中仍能保持,而流畅性编辑和改写会显著降低识别性能。

Comments KONVENS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16228 2026-07-22 cs.LG cs.MS 版本更新 70%

Operator-Aware Mixed-Precision Tolerance Calibration for Tensor Kernels

张量内核的算子感知混合精度容差校准

Dipankar Sarkar

机构 * Arizona State University(亚利桑那州立大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究张量内核正确性测试的容差校准问题,通过挖掘测试用例误差分布提出新容差,经实验,对特定错误变体校准容差提高了错误检测召回率,虽有少量误报增加,但整体提升了检测效果。

Comments 8 pages, 1 figure, LNCS format. Companion paper: arXiv:2606.20128 (P1)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07055 2026-07-22 cs.AI 版本更新 70%

Dr. Zero: Self-Evolving Search Agents without Training Data

零博士:无需训练数据的自我进化搜索智能体

Zhenrui Yue, Kartikeya Upasani, Xianjun Yang, Suyu Ge, Shaoliang Nie, Yuning Mao, Zhe Liu, Dong Wang

机构 * Meta Superintelligence Labs(Meta超级智能实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究在高质量数据难获取时智能体自我进化问题,提出零博士框架,通过自我进化反馈循环和HRPO方法,使搜索智能体无需训练数据自我进化,在问答基准测试中表现出色,证明可仅通过自我进化实现强大智能搜索和推理。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏