arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139914 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12460 篇

2608.16053 2026-08-25 cs.CL eess.AS 版本更新 70%

Agentic-DuplexGen: Decoupling Content, Timing, and Acoustics for Synthetic Dialogue Speech

DuplexGen:为合成对话语音解耦内容、时序与声学

Pengcheng Wang, Sheng Li, Jiyi Li, Takahiro Shinozaki

机构 * Institute of Science Tokyo(科学东京大学) Hokkaido University(北海道大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 DuplexGen框架通过解耦对话的内容、时序与声学,生成更贴近真实对话的合成语音,构建了带多类标注的医患对话语料库,性能优于传统拼接式合成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09737 2026-08-25 cs.LG 版本更新 70%

System-Prompt Anchoring with Cross-Attention Layers

CALYREX:跨注意力层扩展变换器用于系统提示锚定

Li Lixing

机构 * Cornell University(康奈尔大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 CALYREX通过跨注意力机制在系统提示和输入之间建立结构隔离,提升模型在指令遵循和多轮指令遵守任务中的性能,同时降低 jailbreaking 攻击成功率。

Comments Preprint. 14 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08793 2026-08-25 cs.CL cs.DB 版本更新 70%

LakeHopper: Knowledge-Aware Adaptation of Column Type Annotators across Data Lakes

LakeHopper: 通过模型适应实现跨数据湖列类型注释

Yushi Sun, Xujia Li, Nan Tang, Quanqing Xu, Chuanhui Yang, Lei Chen

机构 * HKUST(香港科技大学) HKUST(GZ)(香港科技大学(广州)) Ant Group(蚂蚁集团) HKUST(GZ)/HKUST(香港科技大学(广州)/香港科技大学)

专题命中 预训练与数据 :LLM(abstract);language model(abstract);分类 cs.CL

AI总结 LakeHopper通过模型适应技术,有效解决跨数据湖列类型注释问题,减少注释需求并提升适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20186 2026-08-21 cs.LG q-bio.NC 新提交 70%

Decoding silent reading from non-invasive EEG

从无创脑电图解码默读内容

Ingo Marquardt, Anthilia Alchanat, Priyanka Jain

机构 * nubrain

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究以默读为替代任务,用CLIP式对比训练的卷积EEG编码器结合因果Transformer,从EEG中成功解码开放词汇单词级信息,发现解码受数据限制而非饱和。

Comments 45 pages (including 12 pages of Supplementary Material), 11 figures (including 2 in Supplementary Material)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19376 2026-08-21 cs.CV cs.AI 新提交 70%

Does Marginal Coverage Guarantee Class-Conditional Safety for Zero-Shot VLMs Under Shift?

在分布偏移下,边际覆盖率能否保证零样本视觉语言模型(VLM)的类条件安全性?

Jai Kumar Sharma, Amartya Dutta

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 该研究针对CLIP等零样本VLM,发现边际共形覆盖率无法保证类条件安全性,源域校准无法迁移,目标域类别校准可改善尾部但需类别标签,指出其仅为平均可靠性统计量。

Comments Accepted at the ECCV 2026 Workshop on Uncertainty Quantification for Computer Vision (UNCV). 34 pages (16 main + 18 supplementary), 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18613 2026-08-20 cs.AI cs.CR 新提交 70%

CTIFoundry: An Agent-Native Corpus Scaffold for Cyber Threat Intelligence

CTIFoundry:用于网络威胁情报的智能体原生语料库支架

Yutong Cheng, Changze Li, Qian Cui, Wei Ding, Lingzhi Wang, Yan Chen, Peng Gao

机构 * Virginia Tech(弗吉尼亚理工大学) Amazon(亚马逊公司) Northwestern University(西北大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 CTIFoundry是用于网络威胁情报的智能体原生语料库支架,在CTIConnect基准测试中可使智能体F1提升0.19至0.28,小型模型在其上表现优于旗舰模型,且无需增加搜索工作量。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17286 2026-08-19 cs.LG 新提交 70%

Abra: Scaling Diffusion Image Training

Abra:扩散图像训练的规模化

Kyle Chickering, Wei-An Lin, Swayam Bhanded, Dan Saunders, Akshat Tripathi, Jiaming Song, Shyamal Buch, Xinchen Yan

专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);分类 cs.LG

AI总结 本研究针对文本到图像扩散模型开展系统缩放定律研究,提出Abra模型,发现其缩放规律可预测且需更多数据,相关规律可延伸至生成质量等多方面指标。

Comments 25 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16978 2026-08-19 cs.RO cs.LG 新提交 70%

VLCP: Vision Language Control Policy Closed-Loop Code Replanning for Robot Manipulation

VLCP:用于机器人操纵的视觉语言控制策略闭环代码重规划

Dhia Naouali, Minghan Wu, Claudia Wong, Abhinav Puthran, Omar G. Younis

机构 * University of Monastir(莫纳斯提尔大学) St. Mildred’s-Lightbourn School(圣米尔德雷德-莱特本学校) Cornell University(康奈尔大学) Carnegie Mellon University(卡内基梅隆大学) Silverstream AI(银流人工智能公司) Mila -- Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 VLCP是一种无需训练的机器人操纵策略,通过在单回合内每K步由VLM重写控制代码闭合循环,在57项任务的评估中综合成功率达35.1%,较开环策略提升十倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30025 2026-08-19 cs.CL 版本更新 70%

ContextClaim: A Context-Driven Paradigm for Verifiable Claim Detection

ContextClaim: 一种基于上下文的可验证声明检测范式

Yufeng Li, Rrubaa Panchendrarajan, Arkaitz Zubiaga

机构 * School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦玛丽女王大学电子工程与计算机科学学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ContextClaim范式,通过提取实体、检索维基知识并生成上下文摘要,提升可验证声明检测的可靠性,验证其在不同领域和模型设置下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16071 2026-08-18 cs.CL cs.IR 新提交 70%

Skill2Query: Exploiting Skill Structure to Generate Pseudo-Queries for Agent Skill Retrieval

Skill2Query:利用技能结构生成智能体技能检索的伪查询

Lihui Ding, Zihan Guo, Bingwei Lu, Chenyu Zhou, Yuanjian Zhou, Weinan Zhang, Jianghao Lin, Dongdong Ge

机构 * Fudan University(复旦大学) Sun Yat-sen University(中山大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 Skill2Query是利用技能知识图谱生成伪查询的框架,可提升多类检索性能,生成的训练数据表现最优,还能提高智能体任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14585 2026-08-18 cs.AI 新提交 70%

Euclid-Omni : A Unified Neuro-Symbolic Framework for Plane Geometry

Euclid-Omni:面向平面几何的统一神经符号框架

Zhaoyu Li, Hangrui Bi, Youyuan Zhang, Wenjie Ma, Zenan Li, Zhaolei Zhang, Xujie Si, Kaiyu Yang

机构 * Apodex University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校) ETH Zürich(苏黎世联邦理工学院) Meta FAIR

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Euclid-Omni统一神经符号框架,结合形式几何系统与LLMs、VLMs,核心为符号几何求解器Euclidea,生成合成数据训练模型,在竞赛级几何问题上性能优异且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04155 2026-08-18 cs.HC cs.CL cs.CY 版本更新 70%

SocialCoach: Personalized Social Skill Learning with Agentic Tutoring and Practice

SocialCoach: 基于强化学习的智能辅导与练习的个性化社交技能学习

Tianfu Wang, Max Xiong, Jianxun Lian, Hongyuan Zhu, Zhengyu Hu, Yuxuan Lei, Linxiao Gong, Dapeng Hu, Xiaofang Li, Peiting Tsai, Nicholas Jing Yuan, Qi Zhang

机构 * HKUST (GZ)(香港科技大学(广州)) Duke University(杜克大学) MSRA Beijing(微软研究院北京) Microsoft Beijing(微软北京)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出SocialCoach系统,利用多智能体管道构建知识语料库、强化学习优化自适应练习调度,并结合沉浸式实践与反思辅导,以解决社交技能学习中专家辅导稀缺和知行差距问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07372 2026-08-18 cs.SE cs.AI 版本更新 70%

Self-Bootstrapping Automated Program Repair: Using LLMs to Generate and Evaluate Synthetic Training Data for Bug Repair

自bootstrap自动程序修复:利用LLMs生成和评估合成训练数据以修复bug

David de-Fitero-Dominguez, Antonio Garcia-Cabot, Eva Garcia-Lopez

机构 * Departamento de Ciencias de la Computación, Universidad de Alcalá(阿尔卡拉大学计算机科学系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种利用LLMs生成合成数据提升自动程序修复的方法,通过生成和评估代码bug与修复代码的配对示例,提升修复准确率,实验显示在VulRepair数据集上Top@1和Top@5表现显著提升。

Comments Final published version in the Expert Systems with Applications journal. Volume 319, 5 July 2026, 132154. DOI: https://doi.org/10.1016/j.eswa.2026.132154

Journal ref Expert Systems with Applications (5 July 2026), Volume 319, 132154

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20923 2026-08-18 cs.CL 70%

KaLM-Embedding-V2: Superior Training Techniques and Data Inspire A Versatile Embedding Model

Xinping Zhao, Xinshuo Hu, Zifei Shan, Shouzheng Huang, Yao Zhou, Xin Zhang, Zetian Sun, Zhenyu Liu, Dongfang Li, Xinyuan Wei, Youcheng Pan, Yang Xiang, Meishan Zhang, Haofen Wang, Jun Yu, Baotian Hu, Min Zhang

机构 * Shenzhen Loop Area Institute (SLAI)(深圳环湖区研究所) Tencent(腾讯)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13695 2026-08-17 cs.CY cs.LG 新提交 70%

Language-Specific Gaps in AI Safety Training Datasets

AI安全训练数据集中的语言特定缺口

Chialuka Prisca-Mary Onuoha, Bright Etornam Sunu, Rashidat Sikiru

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究审计多语言AI安全训练数据集的语言缺口,发现其与资源层级不完全相关,豪萨语翻译质量未达阈值,非洲语言缺乏特定危害类别覆盖,提出切片级审计方法及建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03966 2026-08-17 cs.CL 版本更新 70%

HalluTruthQA-4K: A Fine-Grained Corpus and Annotation Process for Arabic Hallucination Detection and Truth Verification

HalluTruthQA-4K:面向阿拉伯语幻觉检测与事实验证的细粒度语料库及标注流程

Salah Eddine Bekhouche, Abdessalam Bouchekif, Hichem Telli, Mohammed-En-Nadhir Zighem, Abdenour Hadid

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出HalluTruthQA-4K,这一含4000个阿拉伯语问答实例的细粒度语料库,用于阿拉伯语幻觉检测等任务,为HalluScoring 2026共享任务提供官方数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12574 2026-08-14 cs.AI cs.FL 新提交 70%

Trie Automata for Constrained Decoding over Large Finite Sets

用于大有限集上约束解码的Trie自动机

Xingzi Xu, Karim Bouyarmane

机构 * Amazon(亚马逊公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大型语言模型有限集约束解码的速度瓶颈,提出Trie自动机机制,通过预计算token掩码实现高效解码,在批量服务中吞吐量较XGrammar提升29倍,且编译与计算效率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09526 2026-08-11 cs.CR cs.AI 新提交 70%

RangeFactory: Scalable Construction of Multi-Hop Cyber Ranges

RangeFactory:可扩展多跳网络靶场构建框架

Hanlin Jiang, Puyi Wang, Jiandong Jin, Shaofei Li, Zhan Shen, Pengli Wang, Ziming Wang, Yifeng Cai, Ning Jia, Yuxin Ren, Peng Jiang, Yao Guo, Ding Li

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 RangeFactory是自动化网络靶场编排框架,可规模化构建多跳靶场;其构建的RangeBench含1148个靶场实例,发现智能体存在持续入侵差距,还生成了攻击轨迹语料库。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09049 2026-08-11 cs.CL 新提交 70%

Security and Privacy Taxonomy Generation from Mobile App Reviews

从移动应用评论生成安全与隐私分类体系

Moghis Fereidouni, Vinaik Chhetri, Umar Farooq, A. B. Siddique

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对现有安全隐私分类体系手工构建、无法适配海量应用评论的问题,提出TaxoScale流程,筛选60万条相关评论构建语料库,其在多指标上优于基线且发现新分支。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07540 2026-08-11 cs.AI 新提交 70%

TREAT: Evaluating Access to Formal Knowledge across Equivalent Mathematical Representations

TREAT:评估等价数学表示下的形式知识获取能力

Fateme Mazdarani, Carlos Toxtli

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出基准TREAT,测试大型语言模型从保等价数学变换中识别定理身份的能力,发现模型表现不佳且存在多种失败模式,凸显形式知识表示鲁棒性的重要性。

Comments Accepted at 28th International Symposium on Symbolic and Numeric Algorithms for Scientific Computing (SYNASC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19766 2026-08-11 cs.CL 版本更新 70%

PAM: Training Policy-Aligned Moderation Filters at Scale

PAM:在大规模上训练策略对齐的 moderation 过滤器

Masoomali Fatehkia, Enes Altinisik, Mohamed Osman, Husrev Taha Sencar

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PAM 提出了一种灵活的框架,用于训练基于用户定义策略的定制 moderation 过滤器,能够在大规模上实现更广泛的对齐需求,并在多个基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06196 2026-08-07 cs.AI 新提交 70%

Comparative Approaches to Agent Retrieval over Large Skill Libraries

基于大型技能库的智能体检索方法的比较研究

Indivara Kolluru, Nathan Sportsman

机构 * Praetorian

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究对比了混合排名器与类型化知识图谱在690个技能库的117个真实查询上的检索效果,发现添加结构无法提升强排名器的检索性能,明确了结构优化的适用条件。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06115 2026-08-07 cs.AI 新提交 70%

Mind the Gaps: Mixture-of-Minds for Human Simulation

关注差距:用于人类模拟的思维混合模型

Pranav Dahiya

机构 * Semilattice(半格)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Anacreon受众模拟模型,基于Gemma 4 12B构建思维混合模型,通过聚类个体、情感链等技术,在个体层面序数对齐达0.775,缩小了群体与个体模拟的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05759 2026-08-07 cs.CL 新提交 70%

How to Recognize New Words: A Comparison Between Context Biasing Methods and Speech LLMs

如何识别生词:上下文偏置方法与语音大语言模型的对比

Christian Huber, Alexander Waibel

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究对比了基于Whisper的上下文偏置方法与语音LLMs在识别ASR中生词的性能,发现前者可大幅降低偏置词错误率,后者在朗读语音上表现好但泛化性差,最终为方法选择提供了权衡依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16278 2026-08-07 cs.CV cs.AI 版本更新 70%

RealityBridge: Bridging Editable 3D Gaussian Splatting Driving Simulations and Real-World Videos

RealityBridge: 连接可编辑3D高斯泼溅驾驶模拟与现实世界视频

Zhenhua Wu, Yun Pang, Mingkun Chang, Yuwei Ning, Liangzhi Wang, Yi Xiao, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education(教育部机器智能与先进计算重点实验室)

专题命中 预训练与数据 :foundation model(abstract);post-training(abstract);分类 cs.AI

AI总结 提出RealityBridge框架,利用多模态控制和轻量级GateNet,结合自回归长视频训练与奖励引导后训练,缩小编辑后3DGS驾驶视频的Sim-to-Real差距,提升视觉真实感和时间一致性。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05088 2026-08-06 cs.LG 新提交 70%

MALT: Lightweight Curvature-Aware Muon via Diagonal Preconditioning

MALT:通过对角预条件化实现的轻量曲率感知Muon

Tongle Wu, Huanyu Dong, Ying Sun, Ziye Ma

机构 * School of Electrical Engineering and Computer Science, The Pennsylvania State University(宾夕法尼亚州立大学电气工程与计算机科学学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 针对Muon未考虑损失景观曲率几何的问题,提出轻量曲率感知优化方法MALT及MALTER,在GPT-2系列预训练上性能优于Muon且开销相近。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03585 2026-08-05 cs.AI cs.CY 新提交 70%

From Social Coding to Agentic Coding: Productivity and Relational Reconfiguration in Open-Source Communities

从社交编码到智能体编码:开源社区中的生产力与关系重构

Mengying Zhou, Yongjie Yin, Yang Chen

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究基于含1084名开发者的GitHub数据模拟发现,编码智能体(CA)可提升开源社区生产力,但采用率低且收益集中于活跃开发者,还会减少人类直接交互、降低公共知识实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00705 2026-08-04 cs.IR cs.CL 新提交 70%

A Triple-Robustness Analysis of Retrieval-Augmented Generation for Multi-Hop Requirements Traceability

检索增强生成在多跳需求可追溯性中的三重鲁棒性分析

Meftun Akarsu, Burak Özdemir, Doğancan Büyükçolak, Recep Kaan Karaman

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文针对多跳需求可追溯性,开展三重鲁棒性分析,对比不同RAG架构、嵌入器等的表现,发现现有结论分歧的原因,提出需按该鲁棒性标准验证RAG架构主张。

Comments 6 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00452 2026-08-04 cs.IR cs.AI 新提交 70%

CeQe: Grounding Lexical Retrieval in Semantic Evidence

CeQe:在语义证据中实现词汇检索

Adam Kahirov, Umesh Deshpande, Swaminathan Sundararaman

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对BM25的语义词汇鸿沟问题,本文提出CE-QE方法,利用交叉编码器的语义检索结果扩展BM25查询,在多个BEIR数据集上显著提升检索性能且不修改底层索引。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29065 2026-08-03 cs.CL 新提交 70%

Tokenizer-Agnostic Engram Module

与分词器无关的恩格拉姆模块(Tokenizer-Agnostic Engram Module)

Jia Peng Lim, Hai Leong Chieu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对Deepseek Engram模块与分词器耦合的问题,通过替换哈希方式构建联合嵌入空间,实现了分词器无关性,同时保持了相当的性能。

Comments Preprint, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏