arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139914 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12460 篇

2601.22710 2026-07-03 cs.CR cs.CL 版本更新 70%

AlienLM: Alienization of Language for API-Boundary Privacy in Black-Box LLMs

AlienLM: 面向黑盒大语言模型API边界隐私的语言异化

Jaehee Kim, Pilsung Kang

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出AlienLM,通过词汇级双射将文本转化为异化语言,在仅使用API的情况下减少明文暴露,平均保留81%以上的性能,且恢复攻击成功率低于0.22%。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00249 2026-07-02 cs.LG eess.SP 新提交 70%

Device Passport: Enabling Spatio-Temporal Pretrained Models to Generalize Across Input Layouts

设备护照:使时空预训练模型能够跨输入布局泛化

Geeling Chau, Ran Liu, Juri Minxha, Wenhui Cui, Erdrin Azemi, Ellen L. Zippi, Behrooz Mahasseni, Christopher M. Sandino

机构 * California Institute of Technology(加州理工学院) Apple(苹果公司)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 针对新设备布局缺乏大规模数据集的问题,提出Device Passport通道嵌入技术,通过功能活动与元数据混合建模,实现跨布局迁移,在耳部脑电图等任务中优于基线。

Comments Workshop on Structured Data for Health, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23605 2026-07-02 cs.AI 版本更新 70%

SleepLM: Natural-Language Intelligence for Human Sleep

SleepLM:人类睡眠的自然语言智能

Zongzhe Xu, Zitao Shuai, Eideen Mozaffari, Ravi S. Aysola, Rajesh Kumar, Yuzhe Yang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 提出SleepLM系列睡眠语言基础模型,通过多模态对齐实现自然语言驱动的睡眠解释与交互,在零样本/少样本学习、跨模态检索等任务上超越现有方法。

Comments spotlight presentation

Journal ref Proceedings of the 43st International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31325 2026-07-01 cs.AI 新提交 70%

HistoriQA-ThirdRepublic: Multi-Hop Question Answering Corpus for Historical Research, Parliamentary Debates from the French Third Republic (1870-1940)

HistoriQA-ThirdRepublic: 面向历史研究的多跳问答语料库——来自法兰西第三共和国(1870-1940)的议会辩论

Aurélien Pellet, Julien Perez, Marie Puren

机构 * LRE EPITA EPITECH Bpifrance CJM

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一个法语多跳历史问答数据集,基于第三共和国议会辩论和报纸,由历史学家协作构建,涵盖跨源综合、时间推理等复杂推理模式,共1782个问题,用于评估检索增强和大型语言模型在特定领域的效果。

Journal ref LREC 2026: Language Resources and Evaluation Conference, ELRA Language Resources Association, May 2026, Palma de Mallorca, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30905 2026-07-01 cs.CY cs.AI 新提交 70%

How Human Feedback Shapes AI-generated Community Notes

人类反馈如何塑造AI生成的社区笔记

Soham De, Isaac Slaughter, Jiawei Guo, Qiao-Yun Cheng, Jiayuan Yan, Sruti Banerjee, Martin Saveski

机构 * University of Washington(华盛顿大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究分析X平台协作笔记中人类反馈对AI生成草稿的影响,发现事实修正和补充背景的建议最易被采纳,人类反馈提升笔记有用性,但协作笔记达到有用状态的比例低于纯人类或纯AI笔记,且主要补充而非替代它们。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30113 2026-06-30 cs.RO cs.AI 70%

SA-VLA: State-aware tokenizer for improving Vision-Language-Action Models' performance

SA-VLA: 状态感知分词器提升视觉-语言-动作模型性能

Tengyue Jiang, Chunpu Xu, Jiayue Kang, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) East China University of Science and Technology(东华大学) Hong Kong Polytechnic University(香港理工大学) Xi’an University of Electronic Science and Technology(西安电子科技大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出状态感知动作分词器SA-VLA,通过状态条件动作解码减少离散化压缩损失,在12个操作任务上将成功率从0.29提升至0.56。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13073 2026-06-30 cs.SE cs.AI 70%

Structure-Aware Corpus Construction and User-Perception-Aligned Metrics for Large-Language-Model Code Completion

面向结构的语料构建与用户感知对齐的代码补全评估指标

Dengfeng Liu, Jucai Zhai, Xiaoguang Jiang, Ziqun Li, Qianjin Yu, Feng Liu, Rui Ye, Huang Liu, Zhiguo Yang, Yongsheng Du, Fang Tan

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LCP和ROUGE-LCP评估指标,从概率建模角度解决代码补全中用户感知与现有指标的差距问题,并通过SPSR-Graph方法提升模型性能。

Comments 14 pages,8 figures

Journal ref ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14717 2026-06-26 cs.LG 版本更新 70%

Training-Free Generation of Protein Sequences from Small Family Alignments via Stochastic Attention

基于随机注意力的小家族比对无训练蛋白质序列生成

Jeffrey D. Varner

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 提出随机注意力(SA)方法,利用现代Hopfield能量和Langevin动力学从少量序列中无训练生成蛋白质序列,在8个Pfam家族上实现低组成差异、新颖性和结构合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10244 2026-06-26 cs.CV cs.LG 版本更新 70%

Solving Semi-Supervised Few-Shot Learning from an Auto-Annotation Perspective

从自动标注视角解决半监督少样本学习

Tian Liu, Anwesha Basu, James Caverlee, Shu Kong

机构 * Texas A\&M University(德克萨斯A&M大学) University of Macau(澳门大学) Institute of Collaborative Innovation(协同创新研究院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 提出SWIFT方法,通过温度锐化softmax输出和分阶段训练,利用视觉语言模型和开放数据,在半监督少样本学习中显著提升性能,接近监督学习水平。

Comments Accepted to ECCV 2026. Website and code: https://tian1327.github.io/SWIFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10386 2026-06-25 cs.CV cs.AI cs.MM 70%

Handling Missing Modalities in Multimodal Survival Prediction for Non-Small Cell Lung Cancer

多模态生存预测中缺失模态的处理:非小细胞肺癌的应用

Filippo Ruffini, Camillo Maria Caruso, Claudia Tacconi, Lorenzo Nibid, Francesca Miccolis, Marta Lovino, Carlo Greco, Edy Ippolito, Michele Fiore, Alessio Cortellini, Bruno Beomonte Zobel, Giuseppe Perrone, Bruno Vincenzi, Claudio Marrocco, Alessandro Bria, Elisa Ficarra, Sara Ramella, Valerio Guarrasi, Paolo Soda

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering(人工智能与计算机系统单位,工程系) Università Campus Bio-Medico di Roma(罗马生物医学大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering(诊断与介入部门,辐射物理,生物医学工程) Umeå University(乌梅学院) Research Unit of Radiation Oncology, Department of Medicine and Surgery(放射肿瘤研究单位,医学与外科部门) Fondazione Policlinico Universitario Campus Bio-Medico(生物医学大学附属医院基金会) Anatomical Pathology Operative Research Unit(解剖病理学操作研究单位) Research Unit of Anatomical Pathology, Department of Medicine and Surgery(解剖病理学研究单位,医学与外科部门) Department of Medicine and Surgery(医学与外科部门)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出一种缺失感知的多模态生存框架,结合CT、WSI和临床数据,通过基础模型提取特征并融合,提升NSCLC生存预测的准确性与临床适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22984 2026-06-24 cond-mat.dis-nn cond-mat.stat-mech cs.LG 新提交 70%

Scalable Physics-Inspired Transformers for Spin Glasses

可扩展的物理启发式Transformer用于自旋玻璃

Lu Zhong, Wenli Duan, Jing Liu, Pan Zhang, Ying Tang

机构 * Institute of Fundamental and Frontier Sciences, University of Electronic Science and Technology of China(基础与前沿科学研究院,电子科技大学) School of Physical Science and Technology, Beijing University of Posts and Telecommunications(物理科学与技术学院,北京邮电大学) Institute of Theoretical Physics, Chinese Academy of Sciences(理论物理研究所,中国科学院) School of Fundamental Physics and Mathematical Sciences, Hangzhou Institute for Advanced Study, UCAS(基础物理与数学科学学院,杭州先进研究院,UCAS) School of Physics, University of Electronic Science and Technology of China(物理学院,电子科技大学) Key Laboratory of Quantum Physics and Photonic Quantum Information, Ministry of Education, University of Electronic Science and Technology of China(量子物理与光量子信息重点实验室,教育部,电子科技大学) Non-classical Information Science Basic Discipline Research Center of Sichuan Province, University of Electronic Science and Technology of China(四川省非经典信息科学基础学科研究中心,电子科技大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对受阻自旋玻璃中玻尔兹曼分布采样效率低的问题,提出一种具有可解释稀疏注意力和自旋定制位置嵌入的物理启发式Transformer,利用FlashAttention实现并行祖先采样,在单GPU上实现前所未有的系统规模模拟,并解决现有方法在特定温度下的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17110 2026-06-24 cs.CR cs.LG 新提交 70%

Loss Landscape Poisoning: Targeted Extraction of Unseen Training Data from LLMs

损失景观投毒:从大语言模型中定向提取未见训练数据

Md Abdullah Al Mamun, Ngoc Phu Doan, Pedram Zaree, Nael Abu-Ghazaleh, Ihsen Alouani

机构 * Queen's University Belfast(女王大学贝尔法斯特) CSIT, Queen's University Belfast(女王大学贝尔法斯特计算机科学与技术研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出一种通过投毒重塑模型损失景观,迫使模型记忆目标数据并实现高成功率提取的攻击方法,在语言和视觉-语言模型上验证有效性,并发现差分隐私可防御但存在绕过攻击。

Comments Updated author order. No technical changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22883 2026-06-23 cs.AI 新提交 70%

CLI-Universe: Towards Verifiable Task Synthesis Engine for Terminal Agents

CLI-Universe:面向终端代理的可验证任务合成引擎

Zhanbo Hua, Yifan Yao, Weihao Xie, Yongchi Zhao, Minghao Liu, Ruizhi Qiu, Zhewei Huang, Zun Wang, Yiyan Ji, Yunhai Ye, Letian Zhu, Xinping Lei, Han Li, Zhiyuan Ma, Zili Wang, Zhaoxiang Zhang, Jiaheng Liu

机构 * Nanjing University(南京大学) StepFun(阶跃星辰) ZODA Shanghai AI Lab(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出CLI-Universe引擎,通过多维能力分类采样和证据引导研究生成终端代理任务,经多阶段可执行验证流水线筛选,构建高质量数据集CLI-Universe-6K,微调Qwen3-32B在Terminal-Bench 2.0上达到33.4%的SOTA。

Comments 20 pages, 5 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21550 2026-06-23 cs.AI 新提交 70%

AI Alignment From Social Choice Perspectives

从社会选择视角看AI对齐

Daniel Halpern, Evi Micha, Ariel D. Procaccia, Benjamin Schiffer, Itai Shapira, Shirley Zhang

机构 * Google Research(谷歌研究院) University of Southern California(南加州大学) Harvard University(哈佛大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文从社会选择理论视角审视人类反馈对齐中的偏好聚合问题,识别失败模式并揭示处理分歧的广阔设计空间。

Comments Accepted for publication in ACM SIGecom Exchanges

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17655 2026-06-23 cs.CL 版本更新 70%

What Language is This? Ask Your Tokenizer

这是什么语言?问你的分词器

Clara Meister, Ahmetcan Yavuz, Pietro Lesci, Tiago Pimentel

机构 * EPFL(苏黎世联邦理工学院) University of Cambridge(剑桥大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出基于UnigramLM分词算法的UniLID方法,通过比较字符串在各语言单字分布下的似然进行语言识别,在低资源和细粒度方言场景下显著提升样本效率。

Comments In Proceedings of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17377 2026-06-23 cs.CL 版本更新 70%

Corpus Prevalence of Multiple-Choice Question Options

多项选择题选项的语料普遍性

Leonidas Zotos, Hedderik van Rijn, Malvina Nissim

机构 * Center for Language and Cognition, University of Groningen(语言与认知中心,格罗宁根大学) Department of Experimental Psychology, University of Groningen(实验心理学系,格罗宁根大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究多项选择题中正确选项在语料库中更常见的问题,提出基于文本嵌入的计算方法,发现正确选项普遍性显著高于错误选项,最高比随机基线高9.0%。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20400 2026-06-19 cs.LG 新提交 70%

The Significance of Style Diversity in Annotation-Free Synthetic Data Generation

无标注合成数据生成中风格多样性的重要性

Zahra Abbasiantaeb, Zeno Belligoli, Omar Essam, Mohammad Aliannejadi

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出无需人工标注的对话生成框架,利用主题和风格属性增强多样性,并设计两种后处理风格化模型,实验表明风格多样性比主题多样性更关键,性能可达人工标注数据的93.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26891 2026-06-19 cs.CL 版本更新 70%

Telenor Nordics Customer Service self-help corpus

Telenor Nordics 客户服务自助语料库

Mike Riess

机构 * Research and Innovation, Telenor Group(Telenor集团研究与创新)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文构建了一个包含芬兰语、丹麦语、挪威语和瑞典语的多语言客户服务自助语料库,共1122篇文档,用于支持北欧NLP和信息检索研究。

Comments 8 pages, 2 figures, 5 tables. Submitted to Nordic Machine Intelligence. Dataset: https://zenodo.org/records/19493152

Journal ref Nordic Machine Intelligence 6(1), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11171 2026-06-19 cs.CV cs.AI 版本更新 70%

TerraMind: Large-Scale Generative Multimodality for Earth Observation

TerraMind:面向地球观测的大规模生成式多模态模型

Johannes Jakubik, Felix Yang, Benedikt Blumenstiel, Erik Scheurer, Rocco Sedona, Stefano Maurogiovanni, Jente Bosmans, Nikolaos Dionelis, Valerio Marsocci, Niklas Kopp, Rahul Ramachandran, Paolo Fraccaro, Thomas Brunschwiler, Gabriele Cavallaro, Juan Bernabe-Moreno, Nicolas Longépé

机构 * IBM Research – Europe(IBM欧洲研究院) ETH Zurich(苏黎世联邦理工学院) Forschungszentrum Jülich(尤利希研究中心) European Space Agency(欧洲航天局) Φ \Phi -Lab(Φ实验室) NASA IMPACT University of Iceland(爱沙尼亚大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 提出首个任意到任意生成式多模态基础模型TerraMind,通过双尺度表示(token级和像素级)预训练,实现零样本/少样本应用,并引入“模态思考”能力,在PANGAEA等基准上达到领先性能。

Comments Accepted at ICCV'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18780 2026-06-18 cs.CV cs.CL cs.MM 新提交 70%

SAMA: Semantic Anchor-aligned Augmentation for Unified Low-Resource Multimodal Information Extraction

SAMA:面向统一低资源多模态信息抽取的语义锚定对齐增强

Quanjiang Guo, Chong Mu, Jiazhou Pan, Ming Jia, Ling Tian, Hui Gao, Zhao Kang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出语义锚定对齐增强框架SAMA,通过构建结构化语义锚引导多专家多模态大模型生成高保真文本,并利用锚保留扩散机制合成图像,结合双约束过滤模块,在低资源多模态信息抽取任务中显著提升性能。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07022 2026-06-18 cs.LG 版本更新 70%

Self-Driving Datasets: From 20 Million Papers to Nuanced Biomedical Knowledge at Scale

自主驾驶数据集:从2000万篇论文到大规模精细化生物医学知识

Haydn Jones, Yimeng Zeng, Alden Rose, Li S. Yifei, Yining Huang, Kaiwen Wu, Jiaming Liang, Maggie Ziyu Huan, Yoseph Barash, Cesar de la Fuente-Nunez, Osbert Bastani, Zachary Ives, Mark Yatskar, Jacob R. Gardner

机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) Department of Genetics, University of Pennsylvania(宾夕法尼亚大学遗传学系) Departments of Bioengineering and Chemical and Biomolecular Engineering, University of Pennsylvania(宾夕法尼亚大学生物工程与化学与生物分子工程系)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出通过PubMed自动生成结构化数据集,实现更大规模、更精细和更准确的生物医学知识,展示Starling系统在多个任务中生成大规模数据集并提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18222 2026-06-17 cs.CL cs.DL 新提交 70%

Darshana Graph: A Parallel Commentary Corpus for Comparative Indian Philosophy, with Stylometric and Exploratory Graph Analyses

Darshana Graph:用于比较印度哲学的平行注释语料库,附文体计量与探索性图分析

Joy Bose

机构 * Independent Researcher(独立研究者) Bangalore, India(印度班加罗尔)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 构建包含超12.5万条记录的印度哲学平行注释语料库,其中约8500条记录实现跨18位注释者的根颂对齐,通过文体计量和约束大语言模型管道分析论证风格与概念关系,揭示学派间分歧模式。

Comments 12 pages, 1 figure. Open Source Code available at https://github.com/joyboseroy/darshana-graph and dataset at https://huggingface.co/datasets/joyboseroy/darshana-graph

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11616 2026-06-17 cs.LG cs.IR 新提交 70%

DeMix: Debugging Training Data with Mixed Data Error Types by Investigating Influence Vectors

DeMix: 通过影响向量调试包含混合错误类型的训练数据

Jiale Deng, Yanyan Shen, Xiaogang Shi, Junjun Chai

机构 * Shanghai Jiao Tong University(上海交通大学) ByteDance Inc.(字节跳动) Tiktok

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出DeMix框架,利用影响向量捕捉不同错误类型对模型行为的独特模式,将数据调试转化为多标签分类问题,并引入基于干预的学习策略,在11个任务上显著提升调试F1分数和修复后模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14257 2026-06-15 cs.CL 新提交 70%

The Linguistics Olympiads: Towards a New Corpus for Linguistics Research?

语言学奥林匹克:语言学研究的语料库新方向?

Vlad A. Neacsu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨语言学奥林匹克问题作为语言学语料库的潜力,分析其优势与局限,并提出在学术研究中负责任使用的标准。

Comments Accepted for publication in LingBaW. Linguistics Beyond and Within (Volume 12, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13507 2026-06-12 cs.CL 新提交 70%

Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data

利用音频大语言模型过滤语音到语音训练数据

Qixu Chen, Satoshi Nakamura

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Rank-to-Distill策略,训练音频大语言模型直接从语音对判断保留/丢弃,过滤噪声数据,提升端到端语音翻译性能。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13289 2026-06-12 cs.CV cs.AI 新提交 70%

HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers

HYDRA-X: 具有整体视觉分词器的原生统一多模态模型

Guozhen Zhang, Xuerui Qiu, Yutao Cui, Tianhui Song, Changlin Li, Junzhe Li, Tao Huang, Xiao Zhang, Yang Li, Jianbing Wu, Miles Yang, Zhao Zhong, Liefeng Bo, Limin Wang

机构 * Nanjing University(南京大学) CASIA(中国科学院自动化研究所) Tencent Hunyuan(腾讯混元) Zhongguancun Academy(中关村学院) Shanghai AI Lab(上海人工智能实验室)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出HYDRA-X,首个在单一ViT中统一图像和视频分词的原生统一多模态模型,通过因果时间注意力和分层时间压缩实现高效重建,并利用轻量化解压缩器注入语义,显著提升编辑一致性和收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13051 2026-06-12 cs.AI 新提交 70%

AAbAAC: An Annotated Corpus for Autoimmunity Information Extraction

AAbAAC:用于自身免疫信息抽取的标注语料库

Fabien Maury, Solène Grosdidier, Maud de Dieuleveult, Adrien Coulet

机构 * Inserm, Université Paris Cité, U1163 Institut Imagine(法国国家健康与医学研究院、巴黎西岱大学、U1163 想象研究所) Inria, Inserm, Université Paris Cité, U1346 HeKA(法国国家信息与自动化研究所、法国国家健康与医学研究院、巴黎西岱大学、U1346 HeKA) Freelance researcher(自由研究员)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对自身免疫领域信息抽取性能不足,构建了包含115篇PubMed摘要的AAbAAC语料库,手动标注实体和关系,通过微调NER模型验证了其有效性。

Journal ref BioNLP 2026 - 25th Workshop on Biomedical Natural Language Processing, ACL, Jul 2026, San Diego (CA), United States

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11660 2026-06-11 cs.LG 新提交 70%

Bergson: An Open Source Library for Data Attribution

Bergson:一个用于数据归因的开源库

Lucia Quirke, Louis Jaburi, David Johnston, William Z. Li, Gonçalo Paulo, Guillaume Martres, Girish Gupta, Stella Biderman, Nora Belrose

机构 * EleutherAI Independent

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Bergson开源库,支持大规模语言模型和预训练数据集的多种数据归因方法,提供磁盘梯度存储和多节点分布式训练,首次开源实现MAGIC、SOURCE和TrackStar三种方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12058 2026-06-11 stat.ML cond-mat.dis-nn cs.LG 新提交 70%

Phase Transitions in Attention: A Bayesian Theory of Copy Head Emergence

注意力中的相变:复制头涌现的贝叶斯理论

Itay Lavie, Kirsten Fischer, Andrey Lekov, Frederic Van Maele, Zohar Ringel, Moritz Helias

机构 * Racah Institute of Physics, Hebrew University of Jerusalem(拉卡学院物理研究所,耶路撒冷希伯来大学) John A. Paulson School of Engineering and Applied Sciences, Harvard University(约翰·A·保罗森工程与应用科学学校,哈佛大学) Institute for Advanced Simulation (IAS-6), Computational and Systems Neuroscience, Jülich Research Center(高级模拟研究所(IAS-6),计算与系统神经科学,茹里奇研究中心) Institute of AI for Health, Helmholtz Munich(健康人工智能研究所,海德堡-穆恩) RWTH Aachen University(亚琛工业大学) Department of Physics, Faculty 1, RWTH Aachen University(物理系,亚琛工业大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过分析单层softmax注意力网络在复制任务上的训练,提出贝叶斯理论揭示注意力矩阵的后验分布存在相变,并对比线性注意力发现softmax注意力呈现一阶相变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22934 2026-06-11 cs.AI 版本更新 70%

ProGRank: Probe-Gradient Reranking to Defend Dense-Retriever RAG from Corpus Poisoning

ProGRank: 探针梯度重排序以防御密集检索器RAG免受语料投毒攻击

Xiangyu Yin, Yi Qi, Chih-Hong Cheng

机构 * Chalmers University of Technology, Sweden(瑞典查尔姆斯理工大学) University of Leeds, United Kingdom(英国利兹大学) Carl von Ossietzky University of Oldenburg, Germany(德国奥尔登堡卡尔·冯·奥西特齐大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ProGRank,一种无需训练的后处理检索器端防御方法,通过随机扰动下探针梯度提取不稳定信号并重排序,有效防御密集检索器RAG的语料投毒攻击。

Comments accepted by ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏