arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2604.02881 2026-04-06 cs.CL cs.AI 62%

One Model to Translate Them All? A Journey to Mount Doom for Multilingual Model Merging

一个模型来翻译它们全部?多语言模型融合的探索之旅

Baban Gain, Asif Ekbal, Trilok Nath Singh

机构 * Indian Institute of Technology Patna(印度理工学院巴特那分校)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了多语言机器翻译中权重空间模型融合的行为,发现融合会降低性能,尤其在目标语言差异时。通过分析内部表示发现语言特定神经元集中在嵌入层和上层Transformer块,而中间层在多语言间共享。细调使语言选择性重新分布,影响生成层的表示差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10510 2026-04-06 cs.LG cs.AI 62%

f-INE: A Hypothesis Testing Framework for Estimating Influence under Training Randomness

f-INE:一种用于在训练随机性下估计影响的假设检验框架

Subhodip Panda, Dhruv Tarsadiya, Shashwat Sourav, Prathosh A. P, Sai Praneeth Karimireddy

机构 * Indian Institute of Science(印度科学研究所) University of Southern California(南加州大学) Washington University(华盛顿大学)

专题命中 预训练与数据 :instruction tuning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出f-influence框架,通过假设检验解决训练随机性导致的影响估计不稳定问题,并设计高效算法f-INE实现单次训练运行内的影响估计,用于数据清理和模型行为归因。

Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02156 2026-04-03 cs.CL astro-ph.IM cs.IR cs.LG 62%

AstroConcepts: A Large-Scale Multi-Label Classification Corpus for Astrophysics

AstroConcepts: 一个大规模多标签分类语料库用于天文学

Atilla Kaan Alkan, Felix Grezes, Sergi Blanco-Cuaresma, Jennifer Lynn Bartlett, Daniel Chivvis, Anna Kelbert, Kelly Lockhart, Alberto Accomazzi

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出AstroConcepts语料库,包含21702篇天文学论文摘要,标注2367个概念,用于研究极端类别不平衡问题,揭示了词汇受限LLM、领域适应和频率分层评估等关键发现。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01195 2026-04-03 cs.CL cs.AI cs.IR 62%

ORBIT: Scalable and Verifiable Data Generation for Search Agents on a Tight Budget

ORBIT:在有限预算下为搜索代理可扩展且可验证的数据生成

Nandan Thakur, Zijian Chen, Xueguang Ma, Jimmy Lin

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ORBIT数据集,通过低成本框架生成20000个需多步推理的查询,用于训练搜索代理,实验表明其在维基百科问答中表现优异。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01936 2026-04-03 cs.CL cs.AI 62%

Reliable News or Propagandist News? A Neurosymbolic Model Using Genre, Topic, and Persuasion Techniques to Improve Robustness in Classification

可靠新闻还是宣传新闻?一种结合体裁、主题和说服技巧的神经符号模型以提升分类鲁棒性

Géraud Faye, Benjamin Icard, Morgane Casanova, Guillaume Gadek, Guillaume Gravier, Wassila Ouerdane, Céline Hudelot, Sylvain Gatepaille, Paul Égré

机构 * Airbus Defence and Space, France(空中客车防务与航天公司,法国) Université Paris-Saclay, CentraleSupélec, MICS, France(巴黎-萨克雷大学,中央理工-高等电力学院,MICS,法国) LIP6, Sorbonne Université, CNRS, France(LIP6,索邦大学,法国国家科学研究中心,法国) Université de Rennes, CNRS, Inria, IRISA, France(雷恩大学,法国国家科学研究中心,法国国家信息与自动化研究所,IRISA,法国) IRL Crossing, CNRS, Australia(IRL Crossing,法国国家科学研究中心,澳大利亚)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出结合非上下文文本嵌入与符号概念特征的神经符号模型,以提高分类鲁棒性,通过实验验证其在识别宣传新闻方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01683 2026-04-03 cs.LG cs.CL 62%

Coupled Query-Key Dynamics for Attention

注意力的耦合查询-键动态

Barak Gahtan, Alex M. Bronstein

机构 * Technion – Israel Institute of Technology(以色列理工学院) ISTA – Institute of Science and Technology Austria(奥地利科学技术研究所)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出耦合QK动态机制,通过共享学习动态改进语言模型 perplexity 和训练稳定性,在WikiText-103上取得显著提升,且在不同数据集上表现出差异性效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14377 2026-04-02 cs.CL cs.IR cs.LG 62%

PluriHopRAG: Exhaustive, Recall-Sensitive QA Through Corpus-Specific Document Structure Learning

PluriHopRAG: 通过语料库特定文档结构学习实现全面、召回敏感的问答

Mykolas Sveistrys, Richard Kunert

机构 * Turbit Systems GmbH

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出PluriHopRAG,通过学习语料库特定文档结构分解查询,改进多跳问答任务的召回敏感性和全面性,在PluriHopWIND和Loong基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28123 2026-03-31 cs.CY cs.AI cs.CL 62%

Does Claude's Constitution Have a Culture?

克莱因的宪法有文化吗?

Parham Pourdavood

机构 * Independent Researcher(独立研究员)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究克莱因的宪法是否反映特定文化视角,通过评估其在跨文化调查中的表现,发现其价值观与北欧和盎格鲁国家相似,但多数项目超出所有被调查人群范围。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23562 2026-03-31 cs.LG cs.AI 62%

Synthetic Mixed Training: Scaling Parametric Knowledge Acquisition Beyond RAG

合成混合训练:在RAG之上扩展参数化知识获取

Seungju Han, Konwoo Kim, Chanwoo Park, Benjamin Newman, Suhas Kotha, Jaehun Jung, James Zou, Yejin Choi

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院) University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出合成混合训练方法,结合合成问答和文档,通过互补训练信号提升模型性能,在QuaLITY基准上实现4.4%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22300 2026-03-31 cs.LG cs.AI 62%

Scaling Attention via Feature Sparsity

通过特征稀疏性扩展注意力机制

Yan Xie, Tiansheng Wen, Tangda Huang, Bo Chen, Chenyu You, Stefanie Jegelka, Yifei Wang

机构 * School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) Stony Brook University(石溪大学) TUM(慕尼黑工业大学) MIT(麻省理工学院) Amazon AGI SF Lab(亚马逊AGI旧金山实验室)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Sparse Feature Attention (SFA),通过特征稀疏性降低注意力计算成本,提升处理超长上下文的能力,实验表明其在速度和资源消耗上优于现有方法。

Comments 26 pages, 11 figures; Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07554 2026-03-31 cs.CL cs.AI cs.SD 62%

Nwāchā Munā: A Devanagari Speech Corpus and Proximal Transfer Benchmark for Nepal Bhasha ASR

Nwāchā Munā:一个用于尼泊尔语语音识别的达兰萨拉语语音语料库和近邻转移基准

Rishikesh Kumar Sharma, Safal Narshing Shrestha, Jenny Poudel, Rupak Tiwari, Arju Shrestha, Rupak Raj Ghimire, Bal Krishna Bal

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文介绍了一个新的5.39小时手动转录的达兰萨拉语音语料库,并建立首个基于脚本保留的声学建模基准,探讨近邻跨语言转移在低资源ASR中的有效性。

Comments Accepted in CHiPSAL@LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03721 2026-03-31 cs.CV cs.CL cs.CY cs.LG 62%

Person-Centric Annotations of LAION-400M: Auditing Bias and Its Transfer to Models

针对LAION-400M的人为中心标注:审查偏见及其在模型中的转移

Leander Girrbach, Stephan Alaniz, Genevieve Smith, Trevor Darrell, Zeynep Akata

机构 * Technical University of Munich, Munich Center for Machine Learning (MCML), MDSI(慕尼黑工业大学,慕尼黑机器学习中心(MCML),MDSI) LTCI, Télécom Paris, Institut Polytechnique de Paris, France(法国巴黎理工学院,巴黎电信学院,LTCI) Helmholtz Munich(亥姆霍兹慕尼黑中心) University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过创建LAION-400M的人为中心标注,揭示了训练数据中存在的人口统计学偏见,并展示了这些偏见如何转移到视觉-语言模型中。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26821 2026-03-31 cs.LG cs.AI 62%

Epileptic Seizure Prediction Using Patient-Adaptive Transformer Networks

利用患者自适应变换器网络进行癫痫发作预测

Mohamed Mahdi, Asma Baghdadi

机构 * Communication Engineering Department National Engineering School of Tunis Tunis El Manar University REGIM-Lab, University of Sfax, National Engineering School of Sfax (ENIS), BP 1173, Sfax, 3038, Tunisia National Engineering School of Tunis Tunis El Manar University

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种患者自适应变换器框架,通过自监督预训练和患者特定微调实现短时间尺度癫痫发作预测,实验表明方法在TUH EEG数据集上验证准确率超过90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13340 2026-03-24 cs.RO cs.AI cs.LG 62%

Latent Policy Steering with Embodiment-Agnostic Pretrained World Models

基于世界模型的潜在策略引导

Yiqi Wang, Mrinal Verghese, Jeff Schneider

机构 * Robotics Institute, School of Computer Science, Carnegie Mellon University(机器人研究所、计算机科学学院、卡内基梅隆大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文通过预训练世界模型和优化价值函数,提升低数据场景下的视觉运动策略性能,采用光流作为动作表示,实现跨体素的策略优化,实验显示在机器人任务中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18358 2026-03-20 cs.CL cs.AI 62%

From Noise to Signal: When Outliers Seed New Topics

从噪声到信号:当异常值催生新主题

Evangelia Zve, Gauvain Bourgne, Benjamin Icard, Jean-Gabriel Ganascia

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种时间主题分类方法,通过分析文档轨迹识别早期信号,区分预示性异常值与传统主题强化文档,验证了其在氢经济新闻中的有效性。

Comments To appear in the Proceedings of the 15th Language Resources and Evaluation Conference (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03818 2026-03-19 cs.LG cs.AI cs.RO 62%

Pretrained Vision-Language-Action Models are Surprisingly Resistant to Forgetting in Continual Learning

预训练视觉-语言-动作模型在持续学习中出人意料地表现出遗忘抵抗性

Huihan Liu, Changyeon Kim, Bo Liu, Minghuan Liu, Yuke Zhu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft Superintelligence(微软超级智能)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究发现预训练的视觉-语言-动作模型在持续学习中表现出较强的遗忘抵抗性,简单经验回放在这些模型上效果显著,即使数据量小也能实现零遗忘。

Comments Project website: https://continual-vlas.github.io/forget-me-not/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16751 2026-03-18 cs.GT cs.AI cs.LG 62%

Finding Common Ground in a Sea of Alternatives

在众多替代品中寻找共同点

Jay Chooi, Paul Gölz, Ariel D. Procaccia, Benjamin Schiffer, Shirley Zhang

机构 * Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) School of Operations Research and Information Engineering, Cornell University(康奈尔大学运筹学与信息工程学院) Department of Statistics, Harvard University(哈佛大学统计学系)

专题命中 预训练与数据 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文研究在多样偏好下选择能找到共同点的声明问题,提出基于比例否决核心的社会选择模型,并设计高效采样算法以高概率返回近似核心声明,同时证明了查询次数的下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16397 2026-03-18 cs.CL cs.AI 62%

Fanar 2.0: Arabic Generative AI Stack

Fanar 2.0:阿拉伯生成AI堆栈

FANAR TEAM, Ummar Abbas, Mohammad Shahmeer Ahmad, Minhaj Ahmad, Abdulaziz Al-Homaid, Anas Al-Nuaimi, Enes Altinisik, Ehsaneddin Asgari, Sanjay Chawla, Shammur Chowdhury, Fahim Dalvi, Kareem Darwish, Nadir Durrani, Mohamed Elfeky, Ahmed Elmagarmid, Mohamed Eltabakh, Asim Ersoy, Masoomali Fatehkia, Mohammed Qusay Hashim, Majd Hawasly, Mohamed Hefeeda, Mus'ab Husaini, Keivin Isufaj, Soon-Gyo Jung, Houssam Lachemat, Ji Kim Lucas, Abubakr Mohamed, Tasnim Mohiuddin, Basel Mousi, Hamdy Mubarak, Ahmad Musleh, Mourad Ouzzani, Amin Sadeghi, Husrev Taha Sencar, Mohammed Shinoy, Omar Sinan, Yifan Zhang

机构 * Qatar Computing Research Institute (QCRI)(卡塔尔计算研究 institute) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 Fanar 2.0在资源受限条件下实现卓越性能,通过数据质量优先、持续预训练和模型融合,提升阿拉伯语知识、语言、方言及英语能力,同时引入多项新功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03718 2026-03-17 cs.CL cs.AI 62%

Grounded Misunderstandings in Asymmetric Dialogue: A Perspectivist Annotation Scheme for MapTask

对话中的基础误解:一种面向MapTask的视角主义标注方案

Nan Li, Albert Gatt, Massimo Poesio

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种视角主义标注方案,用于分析MapTask中对话参与者对参照表达的 grounded 解释差异,揭示理解如何演变并修复,评估LLM对视角依赖性 grounding 的建模能力。

Comments 14 pages, 5 figures, 6 tables; Camera-ready Version; Accepted by LREC 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14664 2026-03-17 cs.AI cs.CL cs.CY 62%

Punctuated Equilibria in Artificial Intelligence: The Institutional Scaling Law and the Speciation of Sovereign AI

人工智能中的突变平衡:制度扩展定律与主权人工智能的物种分化

Mark Baciak, Thomas A. Cellucci, Deanna M. Falkowski

专题命中 预训练与数据 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文挑战人工智能发展连续进步的假设,提出基于生物进化突变平衡理论,揭示AI发展通过停滞期与快速转型交替的非单调模式,提出制度扩展定律及主权AI的物种分化概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05980 2026-03-17 cs.LG cs.AI 62%

AMPED: Adaptive Multi-objective Projection for balancing Exploration and skill Diversification

AMPED: 自适应多目标投影用于平衡探索与技能多样化

Geonwoo Cho, Jaemoon Lee, Jaegyun Im, Subi Lee, Jihwan Lee, Sundong Kim

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AMPED方法,通过梯度手术投影平衡探索与多样性,在预训练和微调阶段均提升技能学习性能,实验表明其优于SBRL基线。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13518 2026-03-17 eess.AS cs.CL cs.HC cs.LG cs.SD 62%

VoXtream2: Full-stream TTS with dynamic speaking rate control

VoXtream2:全流文本到语音系统与动态说话速率控制

Nikita Torgashov, Gustav Eje Henter, Gabriel Skantze

机构 * Department of Speech, Music and Hearing, KTH Royal Institute of Technology, Sweden(语音、音乐与听觉系,皇家理工学院,瑞典)

专题命中 预训练与数据 :prompting(abstract);分类 cs.CL、cs.LG

AI总结 VoXtream2是一种全流文本到语音系统,通过动态控制说话速率实现低延迟和可控性,结合分布匹配机制和分类器自由引导提升合成质量,支持文本无关的音频提示。

Comments 10 pages, 9 figures, Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13425 2026-03-17 cs.LG cs.AI cs.CV physics.geo-ph 62%

Self-Flow-Matching assisted Full Waveform Inversion

自流匹配辅助的全波形反演

Xinquan Huang, Paris Perdikaris

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出自流匹配辅助全波形反演方法,通过流匹配学习传输场,无需大规模离线预训练,提升反演精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12101 2026-03-17 cs.RO cs.AI cs.LG 62%

Decoupled Action Expert: Confining Task Knowledge to the Conditioning Pathway

解耦动作专家:将任务知识限制在条件路径中

Jian Zhou, Sihao Lin, Shuai Fu, Zerui Li, Gengze Zhou, Qi WU

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出解耦训练方法,将任务知识限制在条件路径中,使动作主干网络无任务依赖,通过Diffusion Policy验证,证明动作专家编码较少任务特定知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11048 2026-03-12 cs.CV cs.AI cs.CL cs.MA cs.NE 62%

COMIC: Agentic Sketch Comedy Generation

COMIC:基于代理的即兴喜剧生成

Susung Hong, Brian Curless, Ira Kemelmacher-Shlizerman, Steve Seitz

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 COMIC提出了一种基于代理的自动化系统,通过LLM评论家和迭代优化生成高质量喜剧视频。

Comments Project page: https://susunghong.github.io/COMIC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18552 2026-03-12 cs.LG cs.AI 62%

Global Minimizers of Sigmoid Contrastive Loss

对Sigmoid对比损失的全局极小值

Kiril Bangachev, Guy Bresler, Iliyas Noman, Yury Polyanskiy

机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文理论分析了Sigmoid对比损失中同步可训练逆温度和偏置的优势,并提出改进训练动态的重参数化方法。

Comments Author names listed in alphabetical order. NeurIPS 2025. New version includes some results on the geometry of CLIP in addition to geometry of SigLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09517 2026-03-11 cs.CL cs.LG 62%

You Didn't Have to Say It like That: Subliminal Learning from Faithful Paraphrases

你无需那样说:从忠实的同义词中学习的潜意识学习

Isaia Gisler, Zhonghao He, Tianyi Qiu

机构 * ETH Zürich(苏黎世联邦理工学院) University of Cambridge(剑桥大学) Peking University(北京大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究通过自然语言同义词的潜意识学习,发现即使内容与教师偏好矛盾,学生模型仍能继承偏好,揭示了训练数据中潜在影响的隐蔽性。

Comments Accepted for Spotlight presentation at EACL 2026 SRW. 5 pages, 2 figures, plus appendix. Equal supervision by Zhonghao He and Tianyi Qiu

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07779 2026-03-10 cs.CL cs.GL cs.LG 62%

Scaling Data Difficulty: Improving Coding Models via Reinforcement Learning on Fresh and Challenging Problems

数据难度的扩展:通过在新鲜且具有挑战性的问题上进行强化学习来改进编码模型

Zongqian Li, Tengchao Lv, Shaohan Huang, Yixuan Su, Qinzheng Sun, Qiufeng Yin, Ying Xin, Scarlett Li, Lei Cui, Nigel Collier, Furu Wei

机构 * Microsoft Research(微软研究院) University of Cambridge(剑桥大学)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 通过强化学习在新鲜且具有挑战性的问题上改进编码模型,MicroCoder数据集通过系统化数据处理和难度扩展实现了显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06618 2026-03-10 cs.LG cs.AI q-bio.QM 62%

Distilling and Adapting: A Topology-Aware Framework for Zero-Shot Interaction Prediction in Multiplex Biological Networks

知识蒸馏与适应:一种拓扑感知的框架用于多重生物网络中的零样本交互预测

Alana Deng, Sugitha Janarthanan, Yan Sun, Zihao Jing, Pingzhao Hu

机构 * Department of Computer Science, Western University(计算机科学系,西部大学) Department of Biochemistry, Western University(生物化学系,西部大学)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种拓扑感知的框架,通过上下文感知表示学习和知识蒸馏,提升多重生物网络中零样本交互预测的性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06603 2026-03-10 cs.LG cs.AI 62%

Scale Dependent Data Duplication

规模依赖的数据复制

Joshua Kazdan, Noam Levi, Rylan Schaeffer, Jessica Chudnovsky, Abhay Puri, Bo He, Mehmet Donmez, Sanmi Koyejo, David Donoho

机构 * Department of Statistics, Stanford University AI4Science, EPFL Department of Computer Science, Stanford University ServiceNow Research Department of XXX, University of YYY, Location, Country School of ZZZ, Institute of WWW, Location, Country École Polytechnique F\'ed\'erale de Lausanne (EPFL), CH-1015 Lausanne, Switzerland

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究发现数据复制在不同规模下表现不同,模型能力提升导致语义相似性梯度一致,大规模下语义碰撞加速,提出明确的规模定律以提高预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏