arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139420 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2512.15840 2026-05-11 cs.RO cs.CV 80%

Large Video Planner Enables Generalizable Robot Control

大视频规划器实现通用机器人控制

Boyuan Chen, Tianyuan Zhang, Haoran Geng, Caiyi Zhang, Peihao Li, Kiwhan Song, William T. Freeman, Jitendra Malik, Pieter Abbeel, Russ Tedrake, Vincent Sitzmann, Yilun Du

机构 * MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校) Harvard(哈佛大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 本文提出利用大规模视频预训练构建通用机器人基础模型,通过生成视频计划实现跨任务和环境的泛化控制,并在真实机器人上验证了其可行性。

Comments 29 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25906 2026-04-29 cs.IR 80%

Make Any Collection Navigable: Methods for Constructing and Evaluating Hypergraph of Text

使任意集合可导航:构建和评估文本超图的方法

Dean E. Alvarez, ChengXiang Zhai

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 本文提出构建和评估文本超图的方法,引入了努力比率指标,实验表明简单TF-IDF基线在该指标上可与基于LLM的方法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24479 2026-04-28 cs.CV 80%

Zero-to-CAD: Agentic Synthesis of Interpretable CAD Programs at Million-Scale Without Real Data

从零到CAD:在百万级规模上无需真实数据合成可解释的CAD程序

Mohammadmehdi Ataei, Farzaneh Askari, Kamal Rahimi Malekshan, Pradeep Kumar Jayaraman

机构 * Autodesk Research(Autodesk研究院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Zero-to-CAD框架,通过代理搜索方法生成可执行的CAD构造序列,实现百万级可解释CAD程序的合成,并展示了其在多视图图像重建中的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15813 2026-04-20 cs.DB 80%

Exploring Agentic Visual Analytics: A Co-Evolutionary Framework of Roles and Workflows

探索代理式可视化分析:角色与工作流的共进化框架

Tianqi Luo, Leixian Shen, Yuyu Luo

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过调研55个代理式可视化分析系统,提出一个共进化框架,分析代理自主性与人类角色转变之间的关系,并提出设计指南和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13489 2026-04-16 astro-ph.GA astro-ph.IM 80%

A Unified HI Rotation Curve Corpus for Computational Astrophysics: 438 Galaxies from SPARC, THINGS, LITTLE THINGS, and WALLABY DR2

为计算天文学构建统一的HI旋转曲线数据集:来自SPARC、THINGS、LITTLE THINGS和WALLABY DR2的438个星系

David C. Flynn

专题命中 预训练与数据 :LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一个统一的HI旋转曲线数据集,包含423个星系的8963个空间分辨测量,用于传统分析和LLM检索增强生成。

Comments 18 pages, 3 figures, 3 tables. Data available at https://zenodo.org/records/19563417. Submitted to Astronomy and Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15170 2026-04-16 cs.CV 80%

Multi-Dimensional Knowledge Profiling with Large-Scale Literature Database and Hierarchical Retrieval

多维知识谱系:基于大规模文献数据库与分层检索

Zhucun Xue, Jiangning Zhang, Juntao Jiang, Jinzhuo Liu, Haoyang He, Teng Hu, Xiaobin Hu, Yong Liu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) APRIL Lab(APRIL实验室) Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 本文通过整合22个顶级会议2020-2025年的10万+论文,构建多维知识谱系分析框架,结合主题聚类、LLM解析与结构检索,揭示研究主题生命周期、方法迁移、数据集与模型使用模式及机构研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07147 2026-04-09 cs.CL cs.AI cs.LG 80%

Dynamic Context Evolution for Scalable Synthetic Data Generation

动态上下文演化用于可扩展的合成数据生成

Ryan Lingo, Rajeev Chhajer

机构 * Honda Research Institute, USA, Inc.(本田研究所美国公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出动态上下文演化(DCE)框架,通过尾部采样、语义记忆和自适应提示演化机制,有效缓解跨批次模式崩溃问题,提升生成多样性与概念结构 richness。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20009 2026-03-24 cs.CL cs.AI cs.LG 80%

LinguaMap: Which Layers of LLMs Speak Your Language and How to Tune Them?

LinguaMap:哪些LLM层说你的语言以及如何调节它们?

J. Ben Tamo, Daniel Carlander-Reuterfelt, Jonathan Rubin, Dezhi Hong, Mingxian Wang, Oleg Poliannikov

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LinguaMap方法,通过分析LLM各层的语言控制机制,发现语言一致性瓶颈并提出选择性微调策略,实现多语言适应的高效优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17326 2026-03-19 cs.CV 80%

FineViT: Progressively Unlocking Fine-Grained Perception with Dense Recaptions

FineViT: 通过密集描述逐步解锁细粒度感知

Peisen Zhao, Xiaopeng Zhang, Mingxing Xu, Ruoyu Sun, Zewei Du, Dunzheng Wang, Guanghao Zheng, Haohang Xu, Zhibo Zhang, Yuhang Zhang, Yi Ai, Lin Liu, Qi Tian

机构 * Huawei Inc.(华为公司)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 FineViT通过密集描述逐步训练,提升细粒度视觉感知能力,在长上下文检索中表现优异,超越现有多模态视觉编码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13220 2026-03-16 cs.MA 80%

A Generative Model of Conspicuous Consumption and Status Signaling

conspicuous 消费与地位信号的生成模型

Logan Cross, Jordi Grau-Moya, William A. Cunningham, Alexander Sasha Vezhnevets, Joel Z. Leibo

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出基于适当性理论的生成模型,通过模拟LLM代理群体的社会互动,揭示了社会观察与预测模式完成的反馈循环如何驱动地位符号的内生生成,展示了消费行为与地位信号的动态关系。

Comments 29 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09800 2026-03-12 cs.IR cs.AI cs.CL cs.LG hep-ex 80%

MITRA: An AI Assistant for Knowledge Retrieval in Physics Collaborations

MITRA:一种用于物理学协作中知识检索的AI助手

Abhishikth Mallampalli, Sridhara Dasu

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MITRA是一种基于RAG的AI助手,通过本地化框架实现物理学协作中的高效知识检索与生成。

Comments Accepted at NeurIPS 2025 Machine Learning for the Physical Sciences workshop and Lepton Photon conference 2025 (Computing AI/ML track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02888 2026-03-05 cs.LG cs.AI cs.CL 80%

When Your Own Output Becomes Your Training Data: Noise-to-Meaning Loops and a Formal RSI Trigger

当你的输出成为你的训练数据:噪声到意义的循环及形式RSI触发

Rintaro Ando

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出N2M-RSI模型,展示AI代理通过自反馈和信息整合阈值可无限增加内部复杂性,并探讨了代理群交互的超线性效应。

Comments Withdrawn due to a critical error discovered in the mathematical derivation and proof of Theorem 2 (Unbounded Growth) and related Lemma 2 (Compression gain lower bound). This flaw invalidates the paper's main conclusion that N2M-RSI guarantees unbounded growth, requiring a fundamental revision of the theoretical framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02081 2026-03-03 cs.DB cs.AI cs.CL cs.LG cs.MA 80%

GenDB: The Next Generation of Query Processing -- Synthesized, Not Engineered

GenDB:查询处理的下一代——合成而非工程

Jiale Lao, Immanuel Trummer

机构 * Cornell University(康奈尔大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GenDB利用大语言模型合成查询执行代码,以替代传统复杂的查询处理引擎,实现更高效和定制化的查询处理系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00193 2026-03-03 q-bio.QM 80%

Multimodal Alignment Improves Generalizability of Genomic Biomarker Prediction in Computational Pathology

多模态对齐提升了计算病理学中基因组生物标志物预测的泛化能力

Ekaterina Redekop, Eric Zimmermann, Ava P Amini, Alex X Lu, Neil Tenenholtz, James Brian Hall, Lorin Crawford, Kristen A Severson

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 MARBLE通过多模态对比预训练策略,将组织病理学图像与基因组生物标志物的表示对齐,提升计算病理学中基因组生物标志物预测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07452 2026-02-26 cs.LG cs.AI cs.CL cs.CY 80%

When Style Breaks Safety: Defending LLMs Against Superficial Style Alignment

当风格破坏安全性:防御大语言模型对抗浅层风格对齐

Yuxin Xiao, Sana Tonekaboni, Walter Gerych, Vinith Suriyakumar, Marzyeh Ghassemi

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了风格对齐对大语言模型安全性的影响,提出 SafeStyle 防御策略有效缓解了浅层风格对齐带来的风险。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18137 2026-02-23 cs.CL cs.AI cs.LG 80%

Agentic Adversarial QA for Improving Domain-Specific LLMs

代理对抗问答:提升领域特定大语言模型

Vincent Grari, Ciprian Tomoiaga, Sylvain Lamprier, Tatsunori Hashimoto, Marcin Detyniecki

机构 * Stanford University(斯坦福大学) Polish Academy of Science, IBS PAN, Warsaw, Poland(波兰科学院、IBS PAN、华沙、波兰)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出了一种对抗性问题生成框架,通过生成语义具有挑战性的问题来提升领域特定大语言模型的适应能力。

Comments 9 pages, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11164 2026-02-13 cs.LG cs.AI cs.CL 80%

Automated Optimization Modeling via a Localizable Error-Driven Perspective

通过可定位的误差驱动视角实现自动化优化建模

Weiting Liu, Han Wu, Yufei Kuang, Xiongwei Han, Tao Zhong, Jianfeng Feng, Wenlian Lu

机构 * Fudan University(复旦大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MIND通过可定位的误差驱动视角,改进自动化优化建模方法,提升训练后性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05879 2026-02-06 cs.CL cs.AI cs.LG 80%

EuroLLM-22B: Technical Report

EuroLLM-22B:技术报告

Miguel Moura Ramos, Duarte M. Alves, Hippolyte Gisserot-Boukhlef, João Alves, Pedro Henrique Martins, Patrick Fernandes, José Pombal, Nuno M. Guerreiro, Ricardo Rei, Nicolas Boizard, Amin Farajian, Mateusz Klimaszewski, José G. C. de Souza, Barry Haddow, François Yvon, Pierre Colombo, Alexandra Birch, André F. T. Martins

机构 * Instituto Superior Técnico & Universidade de Lisboa (Lisbon ELLIS Unit)(里斯本ELLIS单位(理工学院与里斯本大学)) Instituto de Telecomunicações(电信研究院) MICS, CentraleSupélec, Université Paris-Saclay(MICS、中央圣艾尔布兰理工大学、巴黎萨克雷大学) Acolad Carnegie Mellon University(卡内基梅隆大学) University of Edinburgh(爱丁堡大学) Diabolocom Aveni OutSystems Sword Health Sorbonne Université, CNRS, ISIR(索邦大学、国家科学研究中心、ISIR) Artefact Research Center(Artefact研究机构) TransPerfect

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 EuroLLM-22B是一款覆盖24种欧盟语言及11种额外语言的大型语言模型,通过多语言基准测试展现强推理、指令遵循和翻译能力,提供基础模型、指令微调模型及预训练代码库以支持未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04937 2026-02-06 cs.LG cs.AI cs.CL 80%

Linear Model Merging Unlocks Simple and Scalable Multimodal Data Mixture Optimization

线性模型合并解锁了简单且可扩展的多模态数据混合优化

Davide Berasi, Matteo Farina, Massimiliano Mancini, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过模型合并高效估算多模态数据混合效果,结合领域专家训练与参数空间组合,实现可扩展的混合优化方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23407 2026-01-26 cs.LG cs.AI cs.CL 80%

Theoretical Foundations of Scaling Law in Familial Models

家族模型中的缩放定律理论基础

Huan Song, Qingfei Zhao, Ting Long, Shuyu Tian, Hongjun An, Jiawei Shao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出家族模型的缩放定律理论,通过引入粒度变量扩展传统缩放定律,证明在不牺牲计算最优性的情况下可实现多次部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20166 2026-01-13 eess.AS cs.AI cs.CL cs.LG cs.SD 80%

From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data

从对齐到提升:通过合成数据 bootstrap 音频-语言对齐

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出BALSa框架,通过合成数据生成提升音频-语言对齐能力,缓解幻觉问题并增强模型理解与推理性能。

Comments Published in IEEE Transactions on Audio, Speech, and Language Processing (TASLP). Project Website: https://kuan2jiu99.github.io/Balsa

Journal ref IEEE Transactions on Audio, Speech and Language Processing, vol. 33, pp. 4604-4619, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01400 2026-01-13 cs.CL cs.AI cs.LG 80%

ToolACE-R: Model-aware Iterative Training and Adaptive Refinement for Tool Learning

ToolACE-R: 基于模型的迭代训练与自适应细化用于工具学习

Xingshan Zeng, Weiwen Liu, Xu Huang, Zezhong Wang, Lingzhi Wang, Liangyou Li, Yasheng Wang, Lifeng Shang, Xin Jiang, Ruiming Tang, Qun Liu

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ToolACE-R通过基于模型的迭代训练和自适应细化,提升工具学习的效率和性能。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15674 2026-01-07 cs.CL cs.AI cs.LG 80%

Activation Oracles: Training and Evaluating LLMs as General-Purpose Activation Explainers

激活 oracle:训练和评估 LLM 作为通用目的激活解释器

Adam Karvonen, James Chua, Clément Dumas, Kit Fraser-Taliente, Subhash Kantamneni, Julian Minder, Euan Ong, Arnab Sen Sharma, Daniel Wen, Owain Evans, Samuel Marks

机构 * MATS Truthful AI EPFL(瑞士联邦理工学院) ENS Paris-Saclay(巴黎-萨克雷大学) Northeastern University(东北大学) Anthropic

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种通用的 LLM 激活解释器,通过多样化训练在多个下游任务中表现出色,能恢复模型内部信息。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21028 2025-12-25 cs.SE 80%

Artificial or Just Artful? Do LLMs Bend the Rules in Programming?

人工还是艺术?LLMs在编程中是否会打破规则?

Oussama Ben Sghaier, Kevin Delcourt, Houari Sahraoui

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);prompting(abstract)

AI总结 本文研究了LLMs在不同提示条件下如何调整代码生成策略,发现测试可见性显著影响性能,测试驱动的细化成为主要适应策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02152 2025-12-24 cs.IR cs.AI cs.CL cs.LG 80%

Generative Retrieval with Few-shot Indexing

基于少样本索引的生成检索

Arian Askari, Chuan Meng, Mohammad Aliannejadi, Zhaochun Ren, Evangelos Kanoulas, Suzan Verberne

机构 * Leiden University(莱顿大学) The University of Edinburgh(爱丁堡大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种无需训练的少样本索引生成检索框架,通过提示LLM生成文档标识符来提升检索性能。

Comments Accepted for publication at the 48th European Conference on Information Retrieval (ECIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06335 2025-12-10 cs.CV 80%

Harnessing Object Grounding for Time-Sensitive Video Understanding

利用物体接地提升时间敏感视频理解

Tz-Ying Wu, Sharath Nittur Sridhar, Subarna Tripathi

机构 * Intel(英特尔公司)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出 GO-Tokenizer 以提升视频大型语言模型的时间敏感视频理解能力,通过实时编码紧凑的物体信息,提高模型性能并减少噪声影响。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07612 2025-12-09 cs.CL cs.AI cs.LG 80%

PCMind-2.1-Kaiyuan-2B Technical Report

PCMind-2.1-Kaiyuan-2B 技术报告

Kairong Luo, Zhenbo Sun, Xinyu Shi, Shengqi Chen, Bowen Yu, Yunyi Chen, Chenyi Dang, Hengtao Tao, Hui Wang, Fangming Liu, Kaifeng Lyu, Wenguang Chen

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PCMind-2.1-Kaiyuan-2B通过开源20亿参数模型提升资源受限下的训练效率与效果,采用分位数数据基准、战略选择性重复和多领域课程训练等方法,实现与先进开源模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14233 2025-12-03 cs.CL cs.AI cs.LG 80%

Apertus: Democratizing Open and Compliant LLMs for Global Language Environments

Apertus:民主化开放且合规的大型语言模型以适应全球语言环境

Project Apertus, Alejandro Hernández-Cano, Alexander Hägele, Allen Hao Huang, Angelika Romanou, Antoni-Joan Solergibert, Barna Pasztor, Bettina Messmer, Dhia Garbaya, Eduard Frank Ďurech, Ido Hakimi, Juan García Giraldo, Mete Ismayilzada, Negar Foroutan, Skander Moalla, Tiancheng Chen, Vinko Sabolčec, Yixuan Xu, Michael Aerni, Badr AlKhamissi, Inés Altemir Mariñas, Mohammad Hossein Amani, Matin Ansaripour, Ilia Badanin, Harold Benoit, Emanuela Boros, Nicholas Browning, Fabian Bösch, Maximilian Böther, Niklas Canova, Camille Challier, Clement Charmillot, Jonathan Coles, Jan Deriu, Arnout Devos, Lukas Drescher, Daniil Dzenhaliou, Maud Ehrmann, Dongyang Fan, Simin Fan, Silin Gao, Miguel Gila, María Grandury, Diba Hashemi, Alexander Hoyle, Jiaming Jiang, Mark Klein, Andrei Kucharavy, Anastasiia Kucherenko, Frederike Lübeck, Roman Machacek, Theofilos Manitaras, Andreas Marfurt, Kyle Matoba, Simon Matrenok, Henrique Mendonça, Fawzi Roberto Mohamed, Syrielle Montariol, Luca Mouchel, Sven Najem-Meyer, Jingwei Ni, Gennaro Oliva, Matteo Pagliardini, Elia Palme, Andrei Panferov, Léo Paoletti, Marco Passerini, Ivan Pavlov, Auguste Poiroux, Kaustubh Ponkshe, Nathan Ranchin, Javi Rando, Mathieu Sauser, Jakhongir Saydaliev, Muhammad Ali Sayfiddinov, Marian Schneider, Stefano Schuppli, Marco Scialanga, Andrei Semenov, Kumar Shridhar, Raghav Singhal, Anna Sotnikova, Alexander Sternfeld, Ayush Kumar Tarun, Paul Teiletche, Jannis Vamvas, Xiaozhe Yao, Hao Zhao, Alexander Ilic, Ana Klimovic, Andreas Krause, Caglar Gulcehre, David Rosenthal, Elliott Ash, Florian Tramèr, Joost VandeVondele, Livio Veraldi, Martin Rajman, Thomas Schulthess, Torsten Hoefler, Antoine Bosselut, Martin Jaggi, Imanol Schlag

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Apertus通过开放且合规的大型语言模型,解决数据合规性和多语言表示问题,提供透明的开发资源以促进全球语言环境的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14769 2025-11-20 cs.IR cs.AI cs.CL cs.LG 80%

Cluster-based Adaptive Retrieval: Dynamic Context Selection for RAG Applications

Yifan Xu, Vipul Gupta, Rohit Aggarwal, Varsha Mahadevan, Bhaskar Krishnamachari

机构 * University of Southern California(美国南加州大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04601 2025-11-07 cs.CV cs.MM 80%

PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning

Yicheng Xiao, Yu Chen, Haoxuan Ma, Jiale Hong, Caorui Li, Lingxiang Wu, Haiyun Guo, Jinqiao Wang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏