arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12486 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2605.13262 2026-05-14 cs.LG q-bio.QM 70%

Chem-GMNet: A Sphere-Native Geometric Transformer for Molecular Property Prediction

Chem-GMNet:一种分子性质预测的球形本征几何变换器

Deepak Warrier, Raja Sekhar Pappala

机构 * MSTACK AI

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出Chem-GMNet,一种基于球形本征的几何变换器,通过改进的模块设计在分子性质预测任务中取得优异表现,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13055 2026-05-14 cs.CL cs.CY 70%

The Cost of Perfect English: Pragmatic Flattening and the Erasure of Authorial Voice in L2 Writing Supported by GenAI

完美英语的成本:生成AI支持的二语写作中的语用扁平化与作者声音的消失

Ao Liu, Shanhua Zhu

机构 * School of Foreign Languages, Southeast University(东南大学外国语言学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨生成AI对二语写作的影响,发现其导致语用扁平化和作者声音的消失,提出需通过批判性AI素养来保护多元语用多样性。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12835 2026-05-14 cs.AI 70%

PROMETHEUS: Automating Deep Causal Research Integrating Text, Data and Models

PROMETHEUS:整合文本、数据和模型的深度因果研究自动化

Sridhar Mahadevan

机构 * Adobe Research and University of Massachusetts, Amherst(Adobe研究院和马萨诸塞大学阿默斯特分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PROMETHEUS通过整合文本、数据和模型构建因果地图,利用局部因果预测状态模型和区域限制图分析研究领域内的因果关系与证据矛盾。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07767 2026-05-13 cs.LG 70%

Taking the Road Less Scheduled with Adaptive Polyak Steps

走少计划之路:自适应Polyak步长

Dimitris Oikonomou, Matthew Buchholz, Yuen-Man Pun, Robert M. Gower, Nicolas Loizou

机构 * Johns Hopkins University(约翰霍普金斯大学) University of British Columbia(不列颠哥伦比亚大学) Australian National University(澳大利亚国立大学) Center for Computational Mathematics(计算数学中心) Flatiron Institute, Simons Foundation(Flatiron 机构,Simons 基金会)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出自适应Polyak步长的Schedule-Free SGD和Adam,通过迭代平均实现无调度优化,无需调优基础学习率,统一了标准与无调度Polyak方法,实验显示其在语言建模中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11691 2026-05-13 cs.LG 70%

Compositional Neural Operators for Multi-Dimensional Fluid Dynamics

组合神经算子用于多维流体动力学

Hamda Hmida, Hsiu-Wen Chang, Youssef Mesri

机构 * Mines Paris - PSL University, Centre for Material Forming (CEMEF)(巴黎矿学院-PSL大学,材料成形中心(CEMEF)) Mines Paris - PSL University, Centre for Robotics (CAOR)(巴黎矿学院-PSL大学,机器人中心(CAOR))

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出组合神经算子框架,通过分解复杂PDE为基础模块,提升流体动力学问题的求解效率与可解释性。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15529 2026-05-12 cs.AI 70%

LACE: Lattice Attention for Cross-thread Exploration

LACE:用于跨线探索的晶格注意力

Yang Li, Zirui Zhang, Yang Liu, Chengzhi Mao

机构 * Amazon AGI Labs(亚马逊人工通用智能实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LACE通过引入跨线注意力机制,使大语言模型在推理过程中实现协同合作,提升推理准确性达7个百分点。

Comments 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09126 2026-05-12 cs.LG 70%

Cosine-Gated Adam-Decay: Drop-In Staleness-Aware Outer Optimization for Decoupled DiLoCo

余弦门控Adam衰减:一种用于解耦DiLoCo的掉入式滞后期感知外优化

Vatsal Shah, Jiahao Sun

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出CGAD,一种基于余弦门控的Adam衰减算法,通过衰减因子和余弦门控机制提升异步DiLoCo系统的稳定性,实验证明其在不同规模模型上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08383 2026-05-12 cs.CL 70%

Change My View? The Dynamics of Persuasion and Polarization in Online Discourse

改变观点?在线讨论中说服与极化的动态

David Freeborn, Malihe Alikani, Anthony Sicilia

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过分析Reddit的ChangeMyView讨论,探讨说服与极化动态,发现让步与共情策略促进观点改变,而直接反驳等策略则抑制观点改变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08299 2026-05-12 cs.SE cs.AI 70%

Do not copy and paste! Rewriting strategies for code retrieval

不要复制粘贴!代码检索的重写策略

Andrea Gurioli, Federico Pennino, Maurizio Gabbrielli

机构 * DISI University of Bologna(博洛尼亚大学DISI学院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究了三种重写策略在不同检索场景下的效果,发现全自然语言重写在在线检索中表现最佳,但离线检索效果下降明显,提出Delta H作为评估重写收益的指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07454 2026-05-11 cs.CL 70%

GRaSp: Automatic Example Optimization for In-Context Learning in Low-Data Tasks

GRaSp:用于低数据任务中上下文学习的自动示例优化

Simen Bihaug-Frøyland, Henrik Brådland

机构 * Centre for Artificial Intelligence Research, University of Agder(人工智能研究中心,阿格德大学) School of Computing and Information, University of Pittsburgh(计算与信息学院,匹兹堡大学) Norkart AS(Norkart公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 GRaSp提出一个三阶段框架,通过生成合成候选集、聚类降维和遗传算法优化,提升上下文学习任务的性能,尤其在金融命名实体识别任务中表现优异。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06990 2026-05-11 cs.CV cs.LG 70%

TRAJGANR: Trajectory-Centric Urban Multimodal Learning via Geospatially Aligned Neural Representations

TRAJGANR: 通过地理对齐的神经表示进行轨迹导向的城市多模态学习

Maria Despoina Siampou, Gengchen Mai, Ni Lao, Jinmeng Rao, Neha Arora, Cyrus Shahabi, Shushman Choudhury

机构 * Google Research, Mountain View, CA(谷歌研究,山景城,加利福尼亚州) Google LLC, Mountain View, CA(谷歌公司,山景城,加利福尼亚州) Dept. of Computer Science, University of Southern California, Los Angeles, CA(计算机科学系,南加州大学,洛杉矶,加利福尼亚州) SEAI Lab, Dept. of Geography and the Environment, The University of Texas at Austin, Austin, TX(SEAI实验室,地理与环境系,德克萨斯大学奥斯汀分校,奥斯汀,德克萨斯州)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 TRAJGANR提出一种新的多模态自监督学习框架,通过将连续移动模式与静态位置观察对齐,提升城市理解和移动任务的性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05267 2026-05-08 cs.SE cs.AI 70%

Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code

连接生成与训练:LLMs用于代码的品质问题系统综述

Kaifeng He, Xiaojun Zhang, Peiliang Cai, Mingwei Liu, Yanlin Wang, Chong Wang, Kaifeng Huang, Bihuan Chen, Xin Peng, Zibin Zheng

机构 * Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学) Fudan University(复旦大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文系统综述114项研究,探讨训练数据质量如何影响代码生成质量,建立统一分类体系,提出18种传播机制,并总结检测与缓解技术,指出质量保障正从事后过滤转向数据驱动的闭环修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16281 2026-05-08 cs.LG q-bio.NC 70%

Laya: A LeJEPA Approach to EEG via Latent Prediction over Reconstruction

Laya: 一种基于联合嵌入预测架构的EEG方法

Saarang Panchavati, Uddhav Panchavati, Hiroki Nariai, Corey Arnold, William Speier

机构 * Department of Medical Informatics(医学信息学系) UCLA(美国加利福尼亚大学洛杉矶分校) Department of Cognitive Science(认知科学系) UCSD(美国圣地亚哥大学) David Geffen School of Medicine(大卫·盖弗医学院) Mattel Children’s Hospital(马特尔儿童医院)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出Laya,一种基于LeJEPA的EEG基础模型,通过预测潜在表示而非信号重建,提升EEG表示的语义结构和临床准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01407 2026-05-05 cs.IR cs.CL 70%

The Pre-Training Study of Expanded-SPLADE Models on Web Document Titles

扩展SPLADE模型在网页文档标题上的预训练研究

Hiun Kim, Tae Kwan Lee, Taeryun Won

机构 * Naver(纳维尔)

专题命中 预训练与数据 :language model(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究了不同预训练数据集和预训练选项对MLM预训练模型在检索微调中的影响,发现高检索效果模型多基于通用语料库并使用较高学习率,但检索成本和posting列表长度变异较大,且通用预训练数据集重复对检索效果影响有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00251 2026-05-04 cs.SD cs.CL eess.AS 70%

Alethia: A Foundational Encoder for Voice Deepfakes

Alethia:一种用于语音深度伪造的 foundational 编码器

Yi Zhu, Brahmi Dwivedi, Jayaram Raghuram, Surya Koppisetti

机构 * Reality Defender Inc.

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文提出Alethia,一种新的基础音频编码器,结合瓶颈掩码嵌入预测与基于流匹配的光谱图重建,显著优于现有语音基础模型,在真实世界扰动和零样本泛化方面表现更优。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24541 2026-05-04 cs.CL 70%

Open Korean Historical Corpus: A Millennia-Scale Diachronic Collection of Public Domain Texts

开放的韩国历史语料库:一个跨越千年的历时性公共领域文本集合

Seyoung Song, Nawon Kim, Songeun Chae, Kiwoong Park, Jiho Jin, Haneul Yoo, Kyunghyun Cho, Alice Oh

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文介绍了一个涵盖1300年历史的韩国语料库,用于量化分析语言演变,包括韩文书写系统的变化及现代语言模型的改进。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24255 2026-05-04 cs.HC cs.LG 70%

Understanding Cognitive States from Head & Hand Motion Data

从头和手的运动数据理解认知状态

Kaiang Wen, Mark Roman Miller

机构 * Department of Computer Science(计算机科学系) Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文研究通过VR telemetry数据推断决策过程中的瞬时认知状态,提出新数据集和VR原生运动适配器,实现82%的准确率,展示VR运动数据蕴含更丰富的行为信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27300 2026-05-01 cs.AI 70%

METASYMBO: Multi-Agent Language-Guided Metamaterial Discovery via Symbolic Latent Evolution

METASYMBO: 多智能体语言引导的超材料发现 via 符号驱动的潜在进化

Jianpeng Chen, Wangzhi Zhan, Dongqi Fu, Junkai Zhang, Zian Jia, Ling Li, Wei Wang, Dawei Zhou

机构 * Virginia Tech(弗吉尼亚理工大学) Meta AI University of California Los Angeles(加州大学洛杉矶分校) Princeton University(普林斯顿大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MetaSymbO框架,通过符号驱动的潜在进化实现语言引导的超材料发现,提升结构有效性和语言指导得分,验证其在实际应用中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22500 2026-05-01 cs.CV cs.AI 70%

OR-VSKC: Resolving Visual-Semantic Knowledge Conflicts in Operating Rooms with Synthetic Data-Guided Alignment

OR-VSKC:通过合成数据引导对齐解决手术室中的视觉-语义知识冲突

Weiyi Zhao, Xiaoyu Tan, Liang Liu, Sijia Li, Youwei Song, Xihe Qiu

机构 * Shanghai University of Engineering Science(上海工程技术大学) Tencent YouTu Lab(腾讯优图实验室) Clinical Research Unit, Zhongshan Hospital of Fudan University(复旦大学中山医院临床研究部)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出OR-VSKC基准,通过合成数据引导对齐解决手术室中的视觉-语义知识冲突,评估多模态大语言模型的可靠性,并展示微调后的模型在未见视角上的鲁棒性。

Comments 13 pages, 5 figures. The dataset and appendix are available at https://github.com/zgg2577/VS-KC

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25967 2026-04-30 cs.CL 70%

Semantic Label Drift in Cross-Cultural Translation

跨文化翻译中的语义标签漂移

Mohsinul Kabir, Tasnim Ahmed, Md Mezbaur Rahman, Polydoros Giannouris, Sophia Ananiadou

机构 * Department of Computer Science, National Center for Text Mining, The University of Manchester(计算机科学系,文本挖掘国家中心,曼彻斯特大学) School of Computing, Queen’s University, Ontario, Canada(计算学院,加拿大皇后大学) Computer Science, University of Illinois Chicago(计算机科学,伊利诺伊大学芝加哥分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了跨文化翻译中因文化差异导致的语义标签漂移问题,发现现代大语言模型在文化敏感领域易引发标签漂移,并揭示文化相似性对标签保真度的关键影响。

Journal ref LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24819 2026-04-29 cs.SE cs.AI 70%

Programming with Data: Test-Driven Data Engineering for Self-Improving LLMs from Raw Corpora

用数据编程:面向自改进大语言模型的测试驱动数据工程

Chenkai Pan, Xinglong Xu, Yuhang Xu, Yujun Wu, Siyuan Li, Jintao Chen, Conghui He, Jingxuan Wei, Cheng Tan

机构 * Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过数据编程方法,将数据工程生命周期映射到软件开发生命周期,实现对大语言模型的可靠训练与改进,通过数据修复提升模型性能。

Comments 57 pages, 28 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23824 2026-04-28 cs.CL 70%

Resource-Lean Lexicon Induction for German Dialects

低资源方言词典诱导

Robert Litschko, Barbara Plank, Diego Frassinelli

机构 * MaiNLP, Center for Information and Language Processing, LMU Munich, Germany(MaiNLP,信息与语言处理中心,慕尼黑大学,德国) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),慕尼黑,德国)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出利用统计模型诱导德语方言词典,优于大语言模型,实现跨方言迁移,提供轻量数据驱动方案,实验显示在双语词典诱导和方言信息检索中表现优异。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23602 2026-04-28 cs.AR cs.LG 70%

TimingLLM: A Two-Stage Retrieval-Augmented Framework for Pre-Synthesis Timing Prediction from Verilog

TimingLLM: 一种两阶段检索增强框架,用于从Verilog预合成时间预测

Armin Abdollahi, Negin Ashrafi, Mehdi Kamal, Massoud Pedram

机构 * University of Southern California(美国南加州大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 TimingLLM通过两阶段检索增强框架,利用Verilog直接预测最坏负松弛和总负松弛,提升预合成时间预测的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29171 2026-04-27 cs.CV cs.LG 70%

Segmentation of Gray Matters and White Matters from Brain MRI data

从脑部MRI数据中分割灰质和白质

Chang Sun, Rui Shi, Tsukasa Koike, Tetsuro Sekine, Akio Morita, Tetsuya Sakai

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Waseda University(早稻田大学) Department of Neurosurgery(神经外科) Teraoka Memorial Hospital(寺田纪念医院) Department of Radiology(放射科) Nippon Medical School Hospital(日本医学大学医院) Tokyo Rosai Hospital(东京罗赛医院)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出改进的MedSAM模型用于多类脑组织分割,通过预处理和调整解码器实现高精度分割,实验显示在IXI数据集上Dice分数达0.8751。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21265 2026-04-24 cs.CL 70%

Listen and Chant Before You Read: The Ladder of Beauty in LM Pre-Training

在阅读前聆听与吟唱:在LM预训练中的美感阶梯

Yoshinori Nomura

机构 * Mirage Mountain Technologies Inc.(Mirage Mountain Technologies公司)

专题命中 预训练与数据 :language model(abstract);small language model(abstract);分类 cs.CL

AI总结 通过在语言前预训练音乐模型,显著加速语言学习。音乐→诗歌→散文的流程在随机初始化下提升了17.5%的困惑度,且在不同模型容量下表现出数据校准原则。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21061 2026-04-24 cs.AI 70%

InVitroVision: a Multi-Modal AI Model for Automated Description of Embryo Development using Natural Language

InVitroVision:一种多模态AI模型,用于通过自然语言自动描述胚胎发育

Nicklas Neu, Thomas Ebner, Jasmin Primus, Raphael Zefferer, Bernhard Schenkenfelder, Mathias Brunbauer, Florian Kromp

机构 * Software Competence Center Hagenberg GmbH(软件能力中心海根贝格有限公司) Kinderwunsch Zentrum Kepler Universitätsklinikum(儿童愿望中心凯普勒大学诊所) Wunschkind Klinik Dr. Brunbauer(愿望宝宝诊所布兰鲍尔医生)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出InVitroVision模型,通过微调多模态视觉语言模型,实现了对胚胎形态和发育的自然语言描述预测,展示了基础视觉语言模型在有限数据下应用于体外受精任务的潜力。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04548 2026-04-24 cond-mat.dis-nn cs.LG stat.ML 70%

Learning Linear Regression with Low-Rank Tasks in-Context

在上下文中学习低秩任务的线性回归

Kaito Takanami, Takashi Takahashi, Yoshiyuki Kabashima

机构 * The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了在上下文中学习如何在高维极限下精确刻画预测分布和泛化误差,并发现有限预训练数据中的统计波动诱导了隐式正则化,揭示了任务结构对泛化误差的相变。

Comments Accepted at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03933 2026-04-24 cs.CL 70%

Losing our Tail, Again: (Un)Natural Selection & Multilingual LLMs

再次失去我们的尾巴:(非)自然选择与多语言大语言模型

Eva Vanmassenhove

机构 * Research Centre for Cognitive Science & Artificial Intelligence(认知科学与人工智能研究中心) Department of Computational Cognitive Science(计算认知科学系) Tilburg University(蒂尔堡大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨多语言大语言模型中翻译技术导致语言多样性丧失的问题,指出模型崩溃可能使语言形式、语法特征和文化内涵消失,呼吁保护多语言多样性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19028 2026-04-22 cs.LG 70%

Learning Posterior Predictive Distributions for Node Classification from Synthetic Graph Priors

从合成图先验学习后验预测分布用于节点分类

Jeongwhan Choi, Jongwoo Kim, Woosung Kang, Noseong Park

机构 * KAIST(韩国科学技术院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出NodePFN,通过学习后验预测分布实现对任意图的通用节点分类,无需图特定训练,利用合成图先验生成多样化的图结构和特征-标签关系。

Comments Accepted to ICLR 2026. OpenReview: https://openreview.net/forum?id=FmxRzlu0rT

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14324 2026-04-21 cs.CV cs.CL 70%

DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies

DualToken: 向通过双视觉词汇统一视觉理解和生成迈进

Wei Song, Yuran Wang, Zijia Song, Yadong Li, Zenan Zhou, Long Chen, Jianhua Xu, Jiaqi Wang, Kaicheng Yu

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Baichuan Inc.(北川科技) Peking University(北京大学) Xiaomi EV(小米电动车)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DualToken通过双视觉词汇统一视觉理解和生成,解决了视觉理解和生成所需不同表示空间的挑战,提升了ImageNet上的重建质量和零样本准确率,并在下游任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏