arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-12 至 2025-12-12 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22 篇

2512.08609 2025-12-12 cs.AI 89%

CogMCTS: A Novel Cognitive-Guided Monte Carlo Tree Search Framework for Iterative Heuristic Evolution with Large Language Models

CogMCTS: 一种用于基于大语言模型的迭代启发式进化的大脑引导蒙特卡洛树搜索框架

Hui Wang, Yang Liu, Xiaoyu Zhang, Chaoxu Mu

机构 * School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) Anhui Provincial Key Laboratory of Security Artificial Intelligence, Anhui University(安徽省安全人工智能重点实验室) Pengcheng Laboratory, Shenzhen, China(深圳鹏城实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 CogMCTS通过整合大语言模型的认知引导机制与MCTS,实现高效的自动启发式优化,提升搜索多样性与解质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00791 2025-12-12 cs.CL cs.CV 89%

Vision-centric Token Compression in Large Language Model

以视觉为中心的标记压缩在大语言模型中

Ling Xing, Alex Jinpeng Wang, Rui Yan, Xiangbo Shu, Jinhui Tang

机构 * Nanjing University of Science and Technology(南京理工大学) Central South University(中南大学) Nanjing Forestry University(南京林业大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 Vist通过视觉与语言结合的压缩方法,在减少标记数量的同时保持模型准确性,提升了大语言模型的效率。

Comments NeurIPS 2025 spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01113 2025-12-12 cs.IR cs.AI cs.CL 86%

GFM-RAG: Graph Foundation Model for Retrieval Augmented Generation

基于图的检索增强生成模型:图基础模型

Linhao Luo, Zicheng Zhao, Gholamreza Haffari, Dinh Phung, Chen Gong, Shirui Pan

机构 * Monash University(墨尔本大学) Nanjing University of Science and Technology(南京理工大学) Shanghai Jiao Tong University(上海交通大学) Griffith University(格里菲斯大学)

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GFM-RAG是一种基于图的检索增强生成模型,通过创新的图神经网络捕捉复杂查询-知识关系,实现了在未见数据集上的高效性能和泛化能力。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08001 2025-12-12 cs.LG cs.AI cs.CL 85%

Reparameterized LLM Training via Orthogonal Equivalence Transformation

通过正交等价变换重新参数化LLM训练

Zeju Qiu, Simon Buchholz, Tim Z. Xiao, Maximilian Dax, Bernhard Schölkopf, Weiyang Liu

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 POET通过正交等价变换重新参数化神经元,提升LLM训练的稳定性与泛化能力,并验证了其在大规模神经网络训练中的有效性。

Comments NeurIPS 2025 (40 pages, 26 figures, project page: https://spherelab.ai/poet/, v4: added experiments of finetuning and larger-scale pretraining)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10316 2025-12-12 cs.CV 82%

ConStruct: Structural Distillation of Foundation Models for Prototype-Based Weakly Supervised Histopathology Segmentation

ConStruct:用于基于原型的弱监督病理分割的基模态结构蒸馏

Khang Le, Ha Thach, Anh M. Vu, Trang T. K. Vo, Han H. Huynh, David Yang, Minh H. N. Le, Thanh-Huy Nguyen, Akash Awasthi, Chandra Mohan, Zhu Han, Hien Van Nguyen

机构 * Ho Chi Minh City University of Technology(胡志明市技术大学) University of Technology Sydney(悉尼技术大学) University of Houston(休斯顿大学) University of Information Technology(信息科技大学) College of Medical Science and Technology, Taipei Medical University(台北医学院医学科技学院) Department of Computer Science, Emory University(埃默里大学计算机科学系) Montefiore Medical Center, Albert Einstein College of Medicine(蒙特福伊医疗中心,阿尔伯特·爱因斯坦医学院) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

专题命中 效率与部署 :foundation model(title,abstract);language model(abstract)

AI总结 ConStruct通过结合CONCH的形态感知表示、SegFormer的多尺度结构线索和文本引导的语义对齐,提出一种高效的弱监督病理分割方法,提升分割精度和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10185 2025-12-12 cs.CR cs.CL 79%

Watermarks for Language Models via Probabilistic Automata

通过概率自动机实现语言模型的水印

Yangkun Wang, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 本文提出基于概率自动机的新型语言模型水印方案,兼顾生成多样性和不可检测性,实验验证其在鲁棒性和效率上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06982 2025-12-12 cs.LG cs.SY eess.SY 79%

LLM-Driven Composite Neural Architecture Search for Multi-Source RL State Encoding

基于大语言模型的多源强化学习状态编码复合神经架构搜索

Yu Yu, Qian Xie, Nairen Cao, Li Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Cornell University(康奈尔大学) New York University(纽约大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.LG

AI总结 本文提出基于大语言模型的复合神经架构搜索方法,用于多源强化学习状态编码,通过高效搜索发现更高性能的编码器架构。

Comments NeurIPS 2025 Workshop on Bridging Language, Agent, and World Models for Reasoning and Planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10772 2025-12-12 cs.CL cs.AI cs.LG 75%

Grow Up and Merge: Scaling Strategies for Efficient Language Adaptation

成长与融合:为高效语言适应的扩展策略

Kevin Glocker, Kätriin Kukk, Romina Oji, Marcel Bollmann, Marco Kuhlmann, Jenny Kunz

机构 * Department of Computer and Information Science(计算机与信息科学系) Linköping University(利乌波尔特大学)

专题命中 效率与部署 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过扩展预训练模型以提高语言适应效率,发现扩展模型在数据效率和减少灾难性遗忘方面表现更优,并探索了融合方法在构建多语言系统中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10741 2025-12-12 cs.CL 70%

TRIDENT: A Redundant Architecture for Caribbean-Accented Emergency Speech Triage

TRIDENT:一种用于加勒比口音紧急语音分诊的冗余架构

Elroy Galbraith, Chadwick Sutherland, Donahue Morgan

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TRIDENT通过结合加勒比口音优化的ASR、实体提取和生物声学检测,为调度员提供三种信号以提高紧急分诊效率,解决非标准英语变体识别问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19575 2025-12-12 cs.CV cs.AI 70%

HunyuanOCR Technical Report

HunyuanOCR 技术报告

Hunyuan Vision Team, Pengyuan Lyu, Xingyu Wan, Gengluo Li, Shangpin Peng, Weinong Wang, Liang Wu, Huawen Shen, Yu Zhou, Canhui Tang, Qi Yang, Qiming Peng, Bin Luo, Hower Yang, Xinsong Zhang, Jinnian Zhang, Houwen Peng, Hongming Yang, Senhao Xie, Longsha Zhou, Ge Pei, Binghong Wu, Rui Yan, Kan Wu, Jieneng Yang, Bochao Wang, Kai Liu, Jianchen Zhu, Jie Jiang, Linus, Han Hu, Chengquan Zhang

机构 * Tencent(腾讯)

专题命中 效率与部署 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 HunyuanOCR是一款轻量级视觉-语言模型,通过统一通用性与效率、简化端到端架构、采用数据驱动和强化学习策略,在OCR任务中实现卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20018 2025-12-12 cs.AI cs.AR 70%

Achieving Trustworthy Real-Time Decision Support Systems with Low-Latency Interpretable AI Models

实现低延迟可解释AI模型的可信实时决策支持系统

Zechun Deng, Ziwei Liu, Ziqian Bi, Junhao Song, Chia Xin Liang, Joe Yeong, Xinyuan Song, Junfeng Hao

机构 * School of Physics and Astronomy(物理与天文学系) University of Edinburgh(爱丁堡大学) Siebel School of Computing and Data Science(计算与数据科学学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AI Agent Lab(AI代理实验室) Vokram Group(Vokram集团) Department of Anatomical Pathology(解剖病理学部) Singapore General Hospital(新加坡中央医院) Department of Computer Science(计算机科学系) Emory University(埃默里大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过低延迟可解释AI模型实现可信实时决策支持系统,探讨资源受限环境下的人机协作方法及边缘计算优化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09946 2025-12-12 cs.DC cs.AI 70%

ELANA: A Simple Energy and Latency Analyzer for LLMs

ELANA: 一种用于大语言模型的简单能耗和延迟分析工具

Hung-Yueh Chiang, Bokun Wang, Diana Marculescu

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ELANA是一种用于分析大语言模型能耗和延迟的开源工具,支持多种硬件平台和模型,适用于高效LLMs的研究和实验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02427 2025-12-12 cs.CV cs.RO 67%

From the Laboratory to Real-World Application: Evaluating Zero-Shot Scene Interpretation on Edge Devices for Mobile Robotics

从实验室到现实应用:评估边缘设备上用于移动机器人的零样本场景解读

Nicolas Schuler, Lea Dewald, Nick Baldig, Jürgen Graf

机构 * Laboratories for Cognitive Systems and Robotics(认知系统与机器人实验室) University of Luxembourg(卢森堡大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文评估了适用于移动机器人边缘设备的小型视觉语言模型在零样本场景解读任务中的性能与应用潜力。

Comments 15 pages, 6 figures, 1 table; accepted for AI-2025 Forty-fifth SGAI International Conference on Artificial Intelligence CAMBRIDGE, ENGLAND 16-18 DECEMBER 2025

Journal ref Artificial Intelligence XLII. SGAI-AI 2025. Lecture Notes in Computer Science, vol 16302. Springer, Cham (2026), pp 301-315

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09015 2025-12-12 cs.CL cs.LG 62%

Luxical: High-Speed Lexical-Dense Text Embeddings

Luxical: 高速词典密集文本嵌入

DatologyAI, :, Luke Merrick, Alex Fang, Aldo Carranza, Alvin Deng, Amro Abbas, Brett Larsen, Cody Blakeney, Darren Teh, David Schwab, Fan Pan, Haakon Mongstad, Haoli Yin, Jack Urbanek, Jason Lee, Jason Telanoff, Josh Wills, Kaleigh Mentzer, Paul Burstein, Parth Doshi, Paul Burnstein, Pratyush Maini, Ricardo Monti, Rishabh Adiga, Scott Loftin, Siddharth Joshi, Spandan Das, Tony Jiang, Vineeth Dorna, Zhengping Wang, Bogdan Gaza, Ari Morcos, Matthew Leavitt

机构 * DatologyAI

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 Luxical通过结合稀疏TF-IDF特征和知识蒸馏训练,实现高速词典密集文本嵌入,适用于大规模文本组织任务。

Comments 9 pages, 6 figures (v2 fixes typos only)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09939 2025-12-12 cs.MA cs.AI cs.LG 62%

Norm-Governed Multi-Agent Decision-Making in Simulator-Coupled Environments:The Reinsurance Constrained Multi-Agent Simulation Process (R-CMASP)

规范引导的多智能体决策在耦合环境中的应用:再保险约束的多智能体仿真过程(R-CMASP)

Stella C. Dong

机构 * Reinsurance Analytics(再保险分析)

专题命中 效率与部署 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出R-CMASP模型,通过规范引导和模拟器耦合机制,提升多智能体在再保险决策中的稳定性与合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14573 2025-12-12 cs.LG 61%

State-Space Models for Tabular Prior-Data Fitted Networks

表格先验数据拟合网络的状态空间模型

Felix Koch, Marcel Wever, Fabian Raisch, Benjamin Tischler

机构 * L3S Research Center, Leibniz University Hannover, Hannover, Germany(L3S研究所以及汉诺威莱布尼茨大学) University of Applied Sciences Rosenheim, Rosenheim, Germany(罗斯海姆应用科学大学) Technical University of Munich, Munich, Germany(慕尼黑技术大学)

专题命中 效率与部署 :foundation model(abstract,journal_ref);分类 cs.LG

AI总结 本文提出使用双向线性时间结构状态空间模型Hydra替代Transformer,以减少顺序依赖性并提升表格数据预训练模型的预测性能。

Journal ref International Conference on Machine Learning (ICML), 1st ICML Workshop on Foundation Models for Structured Data, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10430 2025-12-12 cs.CL 57%

T-pro 2.0: An Efficient Russian Hybrid-Reasoning Model and Playground

T-pro 2.0:一种高效的俄语混合推理模型与游乐场

Dmitrii Stoianov, Danil Taranets, Olga Tsymboi, Ramil Latypov, Almaz Dautov, Vladislav Kruglikov, Nikita Surkov, German Abramov, Pavel Gein, Dmitry Abulkhanov, Mikhail Gashkov, Viktor Zelenkovskiy, Artem Batalov, Aleksandr Medvedev, Anatolii Potapov

机构 * Gen-T Team T-Tech(Gen-T团队T-Tech)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL

AI总结 T-pro 2.0是一种高效的俄语混合推理模型,通过开放权重和适应后的EAGLE推测解码流水线实现快速推理和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10439 2025-12-12 cs.LG math.OC stat.ML 57%

Understanding Outer Optimizers in Local SGD: Learning Rates, Momentum, and Acceleration

理解局部SGD中的外优化器:学习率、动量与加速

Ahmed Khaled, Satyen Kale, Arthur Douillard, Chi Jin, Rob Fergus, Manzil Zaheer

机构 * Google DeepMind(谷歌DeepMind) Apple(苹果公司) Chi Jin

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 本文研究了局部SGD中外优化器的作用,证明了调整外学习率可平衡优化误差与噪声方差,并改进收敛率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06120 2025-12-12 cs.LG stat.ML 57%

If generative AI is the answer, what is the question?

如果生成式AI是答案,那么问题又是什么?

Ambuj Tewari

机构 * University of Michigan(密歇根大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.LG

AI总结 本文探讨生成式AI的基础,分析其与预测、压缩和决策的关系,并介绍生成模型家族及社会负责任生成的关键问题。

Comments To appear as a book chapter in a Springer book titled "Statistical Foundations and Applications of Artificial Intelligence, Machine Learning and Deep Learning" and edited by S. Ejaz Ahmed, Pierre Alquier, Yi Li, Shuangge Ma

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10894 2025-12-12 cs.CV 50%

DuetSVG: Unified Multimodal SVG Generation with Internal Visual Guidance

DuetSVG:基于内部视觉引导的统一多模态SVG生成

Peiying Zhang, Nanxuan Zhao, Matthew Fisher, Yiran Xu, Jing Liao, Difan Liu

机构 * City University of Hong Kong(香港城市大学) Adobe Research(Adobe研究院)

专题命中 效率与部署 :language model(abstract)

AI总结 DuetSVG通过端到端生成图像和SVG标记,结合内部视觉引导提升SVG生成质量,实现视觉忠实与语义一致的统一多模态生成。

Comments Project page: https://intchous.github.io/DuetSVG-site

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10674 2025-12-12 cs.CV 50%

Geo6DPose: Fast Zero-Shot 6D Object Pose Estimation via Geometry-Filtered Feature Matching

Geo6DPose:通过几何过滤特征匹配实现快速零样本6D物体姿态估计

Javier Villena Toro, Mehdi Tarkian

机构 * Linköping University(利乌普斯大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 Geo6DPose通过几何过滤特征匹配实现快速零样本6D姿态估计,无需训练或网络访问,具备高效推理与高鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10576 2025-12-12 cs.DC 50%

ESS: An Offload-Centric Latent-Cache Management Architecture for DeepSeek-V3.2-Exp

ESS: 一种面向DeepSeek-V3.2-Exp的卸载导向型潜在缓存管理架构

Xinhang Chen, Chao Zhang, Jiahuan He, Wei Liu, Jianming Zhang, Wenlong Zhou, Xiao Li, Pai Zeng, Shiyong Li, Yuanpan Qian, Dong Li, Zhaogeng Li

专题命中 效率与部署 :LLM(abstract)

AI总结 ESS通过卸载潜在缓存到CPU内存,缓解了DeepSeek-V3.2-Exp中解离阶段的性能瓶颈,提升了大上下文推理任务的吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏