arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12486 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2602.17655 2026-06-23 cs.CL 版本更新 70%

What Language is This? Ask Your Tokenizer

这是什么语言?问你的分词器

Clara Meister, Ahmetcan Yavuz, Pietro Lesci, Tiago Pimentel

机构 * EPFL(苏黎世联邦理工学院) University of Cambridge(剑桥大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出基于UnigramLM分词算法的UniLID方法,通过比较字符串在各语言单字分布下的似然进行语言识别,在低资源和细粒度方言场景下显著提升样本效率。

Comments In Proceedings of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17377 2026-06-23 cs.CL 版本更新 70%

Corpus Prevalence of Multiple-Choice Question Options

多项选择题选项的语料普遍性

Leonidas Zotos, Hedderik van Rijn, Malvina Nissim

机构 * Center for Language and Cognition, University of Groningen(语言与认知中心,格罗宁根大学) Department of Experimental Psychology, University of Groningen(实验心理学系,格罗宁根大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究多项选择题中正确选项在语料库中更常见的问题,提出基于文本嵌入的计算方法,发现正确选项普遍性显著高于错误选项,最高比随机基线高9.0%。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20400 2026-06-19 cs.LG 新提交 70%

The Significance of Style Diversity in Annotation-Free Synthetic Data Generation

无标注合成数据生成中风格多样性的重要性

Zahra Abbasiantaeb, Zeno Belligoli, Omar Essam, Mohammad Aliannejadi

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出无需人工标注的对话生成框架,利用主题和风格属性增强多样性,并设计两种后处理风格化模型,实验表明风格多样性比主题多样性更关键,性能可达人工标注数据的93.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26891 2026-06-19 cs.CL 版本更新 70%

Telenor Nordics Customer Service self-help corpus

Telenor Nordics 客户服务自助语料库

Mike Riess

机构 * Research and Innovation, Telenor Group(Telenor集团研究与创新)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文构建了一个包含芬兰语、丹麦语、挪威语和瑞典语的多语言客户服务自助语料库,共1122篇文档,用于支持北欧NLP和信息检索研究。

Comments 8 pages, 2 figures, 5 tables. Submitted to Nordic Machine Intelligence. Dataset: https://zenodo.org/records/19493152

Journal ref Nordic Machine Intelligence 6(1), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11171 2026-06-19 cs.CV cs.AI 版本更新 70%

TerraMind: Large-Scale Generative Multimodality for Earth Observation

TerraMind:面向地球观测的大规模生成式多模态模型

Johannes Jakubik, Felix Yang, Benedikt Blumenstiel, Erik Scheurer, Rocco Sedona, Stefano Maurogiovanni, Jente Bosmans, Nikolaos Dionelis, Valerio Marsocci, Niklas Kopp, Rahul Ramachandran, Paolo Fraccaro, Thomas Brunschwiler, Gabriele Cavallaro, Juan Bernabe-Moreno, Nicolas Longépé

机构 * IBM Research – Europe(IBM欧洲研究院) ETH Zurich(苏黎世联邦理工学院) Forschungszentrum Jülich(尤利希研究中心) European Space Agency(欧洲航天局) Φ \Phi -Lab(Φ实验室) NASA IMPACT University of Iceland(爱沙尼亚大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 提出首个任意到任意生成式多模态基础模型TerraMind,通过双尺度表示(token级和像素级)预训练,实现零样本/少样本应用,并引入“模态思考”能力,在PANGAEA等基准上达到领先性能。

Comments Accepted at ICCV'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18780 2026-06-18 cs.CV cs.CL cs.MM 新提交 70%

SAMA: Semantic Anchor-aligned Augmentation for Unified Low-Resource Multimodal Information Extraction

SAMA:面向统一低资源多模态信息抽取的语义锚定对齐增强

Quanjiang Guo, Chong Mu, Jiazhou Pan, Ming Jia, Ling Tian, Hui Gao, Zhao Kang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出语义锚定对齐增强框架SAMA,通过构建结构化语义锚引导多专家多模态大模型生成高保真文本,并利用锚保留扩散机制合成图像,结合双约束过滤模块,在低资源多模态信息抽取任务中显著提升性能。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07022 2026-06-18 cs.LG 版本更新 70%

Self-Driving Datasets: From 20 Million Papers to Nuanced Biomedical Knowledge at Scale

自主驾驶数据集:从2000万篇论文到大规模精细化生物医学知识

Haydn Jones, Yimeng Zeng, Alden Rose, Li S. Yifei, Yining Huang, Kaiwen Wu, Jiaming Liang, Maggie Ziyu Huan, Yoseph Barash, Cesar de la Fuente-Nunez, Osbert Bastani, Zachary Ives, Mark Yatskar, Jacob R. Gardner

机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) Department of Genetics, University of Pennsylvania(宾夕法尼亚大学遗传学系) Departments of Bioengineering and Chemical and Biomolecular Engineering, University of Pennsylvania(宾夕法尼亚大学生物工程与化学与生物分子工程系)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出通过PubMed自动生成结构化数据集,实现更大规模、更精细和更准确的生物医学知识,展示Starling系统在多个任务中生成大规模数据集并提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18222 2026-06-17 cs.CL cs.DL 新提交 70%

Darshana Graph: A Parallel Commentary Corpus for Comparative Indian Philosophy, with Stylometric and Exploratory Graph Analyses

Darshana Graph:用于比较印度哲学的平行注释语料库,附文体计量与探索性图分析

Joy Bose

机构 * Independent Researcher(独立研究者) Bangalore, India(印度班加罗尔)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 构建包含超12.5万条记录的印度哲学平行注释语料库,其中约8500条记录实现跨18位注释者的根颂对齐,通过文体计量和约束大语言模型管道分析论证风格与概念关系,揭示学派间分歧模式。

Comments 12 pages, 1 figure. Open Source Code available at https://github.com/joyboseroy/darshana-graph and dataset at https://huggingface.co/datasets/joyboseroy/darshana-graph

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11616 2026-06-17 cs.LG cs.IR 新提交 70%

DeMix: Debugging Training Data with Mixed Data Error Types by Investigating Influence Vectors

DeMix: 通过影响向量调试包含混合错误类型的训练数据

Jiale Deng, Yanyan Shen, Xiaogang Shi, Junjun Chai

机构 * Shanghai Jiao Tong University(上海交通大学) ByteDance Inc.(字节跳动) Tiktok

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出DeMix框架,利用影响向量捕捉不同错误类型对模型行为的独特模式,将数据调试转化为多标签分类问题,并引入基于干预的学习策略,在11个任务上显著提升调试F1分数和修复后模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14257 2026-06-15 cs.CL 新提交 70%

The Linguistics Olympiads: Towards a New Corpus for Linguistics Research?

语言学奥林匹克:语言学研究的语料库新方向?

Vlad A. Neacsu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨语言学奥林匹克问题作为语言学语料库的潜力,分析其优势与局限,并提出在学术研究中负责任使用的标准。

Comments Accepted for publication in LingBaW. Linguistics Beyond and Within (Volume 12, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13507 2026-06-12 cs.CL 新提交 70%

Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data

利用音频大语言模型过滤语音到语音训练数据

Qixu Chen, Satoshi Nakamura

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Rank-to-Distill策略,训练音频大语言模型直接从语音对判断保留/丢弃,过滤噪声数据,提升端到端语音翻译性能。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13289 2026-06-12 cs.CV cs.AI 新提交 70%

HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers

HYDRA-X: 具有整体视觉分词器的原生统一多模态模型

Guozhen Zhang, Xuerui Qiu, Yutao Cui, Tianhui Song, Changlin Li, Junzhe Li, Tao Huang, Xiao Zhang, Yang Li, Jianbing Wu, Miles Yang, Zhao Zhong, Liefeng Bo, Limin Wang

机构 * Nanjing University(南京大学) CASIA(中国科学院自动化研究所) Tencent Hunyuan(腾讯混元) Zhongguancun Academy(中关村学院) Shanghai AI Lab(上海人工智能实验室)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出HYDRA-X,首个在单一ViT中统一图像和视频分词的原生统一多模态模型,通过因果时间注意力和分层时间压缩实现高效重建,并利用轻量化解压缩器注入语义,显著提升编辑一致性和收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13051 2026-06-12 cs.AI 新提交 70%

AAbAAC: An Annotated Corpus for Autoimmunity Information Extraction

AAbAAC:用于自身免疫信息抽取的标注语料库

Fabien Maury, Solène Grosdidier, Maud de Dieuleveult, Adrien Coulet

机构 * Inserm, Université Paris Cité, U1163 Institut Imagine(法国国家健康与医学研究院、巴黎西岱大学、U1163 想象研究所) Inria, Inserm, Université Paris Cité, U1346 HeKA(法国国家信息与自动化研究所、法国国家健康与医学研究院、巴黎西岱大学、U1346 HeKA) Freelance researcher(自由研究员)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对自身免疫领域信息抽取性能不足,构建了包含115篇PubMed摘要的AAbAAC语料库,手动标注实体和关系,通过微调NER模型验证了其有效性。

Journal ref BioNLP 2026 - 25th Workshop on Biomedical Natural Language Processing, ACL, Jul 2026, San Diego (CA), United States

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11660 2026-06-11 cs.LG 新提交 70%

Bergson: An Open Source Library for Data Attribution

Bergson:一个用于数据归因的开源库

Lucia Quirke, Louis Jaburi, David Johnston, William Z. Li, Gonçalo Paulo, Guillaume Martres, Girish Gupta, Stella Biderman, Nora Belrose

机构 * EleutherAI Independent

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Bergson开源库,支持大规模语言模型和预训练数据集的多种数据归因方法,提供磁盘梯度存储和多节点分布式训练,首次开源实现MAGIC、SOURCE和TrackStar三种方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12058 2026-06-11 stat.ML cond-mat.dis-nn cs.LG 新提交 70%

Phase Transitions in Attention: A Bayesian Theory of Copy Head Emergence

注意力中的相变:复制头涌现的贝叶斯理论

Itay Lavie, Kirsten Fischer, Andrey Lekov, Frederic Van Maele, Zohar Ringel, Moritz Helias

机构 * Racah Institute of Physics, Hebrew University of Jerusalem(拉卡学院物理研究所,耶路撒冷希伯来大学) John A. Paulson School of Engineering and Applied Sciences, Harvard University(约翰·A·保罗森工程与应用科学学校,哈佛大学) Institute for Advanced Simulation (IAS-6), Computational and Systems Neuroscience, Jülich Research Center(高级模拟研究所(IAS-6),计算与系统神经科学,茹里奇研究中心) Institute of AI for Health, Helmholtz Munich(健康人工智能研究所,海德堡-穆恩) RWTH Aachen University(亚琛工业大学) Department of Physics, Faculty 1, RWTH Aachen University(物理系,亚琛工业大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过分析单层softmax注意力网络在复制任务上的训练,提出贝叶斯理论揭示注意力矩阵的后验分布存在相变,并对比线性注意力发现softmax注意力呈现一阶相变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22934 2026-06-11 cs.AI 版本更新 70%

ProGRank: Probe-Gradient Reranking to Defend Dense-Retriever RAG from Corpus Poisoning

ProGRank: 探针梯度重排序以防御密集检索器RAG免受语料投毒攻击

Xiangyu Yin, Yi Qi, Chih-Hong Cheng

机构 * Chalmers University of Technology, Sweden(瑞典查尔姆斯理工大学) University of Leeds, United Kingdom(英国利兹大学) Carl von Ossietzky University of Oldenburg, Germany(德国奥尔登堡卡尔·冯·奥西特齐大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ProGRank,一种无需训练的后处理检索器端防御方法,通过随机扰动下探针梯度提取不稳定信号并重排序,有效防御密集检索器RAG的语料投毒攻击。

Comments accepted by ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11169 2026-06-10 cs.DC cs.AI 新提交 70%

Piper: A Programmable Distributed Training System

Piper: 可编程的分布式训练系统

Megan Frisella, Shubham Tiwari, Andy Ruan, Yi Pan, Parker Gustafson, Mat Jacob, Gilbert Bernstein, Stephanie Wang

机构 * University of Washington(华盛顿大学) University of Washington and Shanghai Jiao Tong University(华盛顿大学和上海交通大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 提出Piper系统,通过解耦策略与运行时实现,允许用户用少量注解和调度指令声明分布式训练策略,并编译为设备执行计划,支持常见策略并实现组合策略的联合调度优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28093 2026-06-10 cs.CL 版本更新 70%

ConRAG: Consensus-Driven Multi-View Retrieval for Multi-Hop Question Answering

ConRAG: 用于多跳问答的共识驱动多视角检索

Yikai Zhu, Kunfeng Chen, Qihuang Zhong, Juhua Liu, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ConRAG框架,通过共识驱动的多视角检索(关系、实体、文本信号)优化查询和语料库,显著提升多跳问答性能,在MuSiQue上创下新纪录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09664 2026-06-09 cs.LG stat.ML 新提交 70%

In-Context Learning for Latent Space Bayesian Optimization

潜空间贝叶斯优化的上下文学习

Tuan A. Vu, Harri Lähdesmäki, Julien Martinelli

机构 * Aalto University(阿尔托大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 针对潜空间贝叶斯优化中上下文学习模型与优化任务不匹配的问题,提出在分子VAE潜空间上定义合成优化任务进行持续预训练,并引入正则化器保持原始先验,显著提升分子优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09603 2026-06-09 cs.CL 新提交 70%

Automated IEP Generation from Traditional Chinese Parent-Teacher Interviews via Corpus-Grounded Feature Diffusion

基于语料库特征扩散的繁体中文家长会自动化个别化教育计划生成

Kuanlin Chen, Cheng-En Ou

机构 * National University of Singapore(新加坡国立大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对繁体中文个别化教育计划(IEP)生成中数据稀缺和隐私限制问题,提出基于语料库特征扩散(CGFD)的低资源微调流程,通过种子选择、特征扩散和语法约束解码(GCD)生成高质量样本,并发现GCD在繁体中文下适得其反,无GCD路径在可靠性和速度上更优。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08539 2026-06-09 cs.AI 新提交 70%

AgentTrust: A Self-Improving Trust Layer for AI-Agent Actions

AgentTrust: AI代理行为的自改进信任层

Chenglin Yang

机构 * Independent Researcher(独立研究员)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出AgentTrust v2,通过威胁类型分类(词汇/语义)和自学习机制,在代理行为中实现自改进信任决策,显著提升语义威胁检测准确率并降低误拦。

Comments 29 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08512 2026-06-09 cs.CY cs.CL 新提交 70%

Friend or Foe? Language as an ideological switch in open-weight LLMs under Russian disinformation stress

朋友还是敌人?俄罗斯虚假信息压力下开放权重大语言模型中的语言意识形态开关

Anna Małgorzata Kamińska, Tetiana Klynina

机构 * Institute of Culture Studies, University of Silesia in Katowice(文化研究学院,卡托维察大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) National Aviation University(国家航空大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过控制实验发现,针对不同语言社区微调的大语言模型在俄罗斯虚假信息压力下,其抵抗能力与预期文化对齐方向相反,揭示了微调悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07753 2026-06-09 cs.CL 新提交 70%

ReadingMachine: A Computational Methodology for Structured Corpus Reading and Large-Scale Synthesis

ReadingMachine:一种结构化语料库阅读与大规模综合的计算方法

James Morrissey

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ReadingMachine方法,利用大语言模型对文档集合进行有界阅读,通过洞察提取、语义聚类、主题生成和迭代遗漏检测等可检查阶段,实现大规模语料库的覆盖性、可追溯性和分歧保留。

Comments 32 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10016 2026-06-09 cs.IR cs.AI 版本更新 70%

Kunlun: Establishing Scaling Laws for Massive-Scale Recommendation Systems through Unified Architecture Design

Kunlun: 通过统一架构设计建立大规模推荐系统的缩放定律

Bojian Hou, Xiaolong Liu, Xiaoyi Liu, Jiaqi Xu, Yasmine Badr, Mengyue Hang, Sudhanshu Chanpuriya, Junqing Zhou, Yuhang Yang, Han Xu, Qiuling Suo, Laming Chen, Yuxi Hu, Jiasheng Zhang, Huaqing Xiong, Yuzhen Huang, Chao Chen, Yue Dong, Yi Yang, Shuo Chang, Xiaorui Gan, Wenlin Chen, Santanu Kolay, Darren Liu, Jade Nie, Chunzhi Yang, Ellie Wen, Jiyan Yang, Huayu Li

机构 * Meta Platforms, Inc.(Meta平台公司) OpenAI

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大规模推荐系统缺乏可预测缩放定律的问题,提出Kunlun架构,通过低层优化(GDPA、HSP、滑动窗口注意力)和高层创新(CompSkip、事件级个性化)提升模型效率,MFU从17%提升至37%,缩放效率翻倍,已在Meta广告模型部署。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07412 2026-06-08 cs.SE cs.AI 新提交 70%

Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills

Socratic-SWE:通过轨迹衍生智能体技能实现自我进化的编码智能体

Chuan Xiao, Zhengbo Jiao, Shaobo Wang, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang, Lin Qu

机构 * AI Data, Alibaba Group(阿里云数据) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出Socratic-SWE闭环自进化框架,通过将智能体历史求解轨迹蒸馏为结构化技能,生成针对性修复任务,实现编码智能体的持续自我改进。

Comments 21 pages, 5 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06357 2026-06-05 cs.SD cs.AI eess.AS 70%

F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation

F3-Tokenizer: 驯服音频自编码器潜在变量以支持理解与生成

Dinghao Zhou, Xingchen Song, Di Wu, Pengyu Cheng, Shengfan Shen, Sixiang Lv

机构 * Nanjing University, China(南京大学) WeNet Open Source Community(WeNet开源社区)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对连续音频自编码器潜在变量结构弱、自监督编码器不可解码的问题,提出F3-Tokenizer,通过噪声正则化自编码器瓶颈和潜在侧表示编码器,实现统一的理解与生成音频分词器。

Comments Technical report; early work; 9 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05252 2026-06-05 cs.CR cs.AI 70%

From Attack Simulation to SIEM Rule: Deterministic Detection-as-Code Synthesis with Probe-Level Traceability

从攻击模拟到SIEM规则:具有探针级可追溯性的确定性检测即代码合成

Alexandre Cristovão Maiorano

机构 * lumytics.com(lumytics公司)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种确定性合成方法,通过小型模板库将攻击模拟发现映射为Sigma规则,并保持对原始探针的字节级可追溯性,实现了可验证的检测即代码。

Comments 22 pages, 3 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20324 2026-06-05 cs.CR cs.AI 70%

RAG Security and Privacy: Formalizing the Threat Model and Attack Surface

RAG安全与隐私:形式化威胁模型和攻击面

Atousa Arzanipour, Rouzbeh Behnia, Reza Ebrahimi, Kaushik Dutta

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了RAG系统中的安全与隐私问题,提出首个形式化的威胁模型,定义了攻击向量如文档级成员推断和数据中毒,以提升对RAG系统隐私和安全性的理解。

Comments Published at the 5th ICDM Workshop in November 2025

Journal ref 2025 IEEE International Conference on Data Mining Workshops (ICDMW), pp. 1387-1394, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03110 2026-06-04 cs.CL 70%

Coherence Maximization Improves Pluralistic Alignment

一致性最大化改进多元对齐

Taslim Mahbub, Yiding Pei, Shi Feng

机构 * George Washington University(乔治·华盛顿大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 提出内部一致性最大化(ICM)方法,通过最大化标签的互可预测性生成个性化示例,无需人工监督即可将模型与目标群体价值观对齐,并证明示例一致性比单独准确性更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00182 2026-06-04 cs.LG 70%

Towards A Generative Protein Evolution Machine with DPLM-Evo

迈向生成式蛋白质进化机器:DPLM-Evo

Xinyou Wang, Liang Hong, Jiasheng Ye, Zaixiang Zheng, Yu Li, Shujian Huang, Quanquan Gu

机构 * Nanjing University(南京大学) CUHK(香港大学) Fudan University(复旦大学) ByteDance(字节跳动)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 提出DPLM-Evo,一种显式建模替换、插入和删除操作的进化离散扩散框架,在单序列设置下实现蛋白质突变效应预测的最优性能,并支持变长模拟进化与蛋白质编辑优化。

Comments A peer-reviewed version was accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏