arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-09 至 2026-01-09 共收录 35 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 35 篇

2511.10643 2026-01-09 cs.CL cs.AI 90%

Black-Box On-Policy Distillation of Large Language Models

大规模语言模型的黑盒在线蒸馏

Tianzhu Ye, Li Dong, Zewen Chi, Xun Wu, Shaohan Huang, Furu Wei

机构 * Microsoft Research(微软研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出生成对抗蒸馏(GAD),通过在线和黑盒方式实现大规模语言模型的蒸馏,使学生模型在自动评估中与教师模型性能相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04719 2026-01-09 cs.LG cs.PF 89%

GPU-Accelerated INT8 Quantization for KV Cache Compression in Large Language Models

GPU加速的INT8量化用于大型语言模型中KV缓存压缩

Maanas Taneja, Purab Shingvi

机构 * Maanas Taneja, Purab Shingvi(独立研究者)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本研究通过GPU加速的INT8量化技术,实现了大型语言模型中KV缓存压缩,达到4倍内存减少,同时保持高精度和低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04212 2026-01-09 cs.CL cs.AI 88%

TrueBrief: Faithful Summarization through Small Language Models

TrueBrief: 通过小语言模型实现忠实的摘要生成

Kumud Lakara, Ruibo Shi, Fran Silavong

专题命中 效率与部署 :language model(title,abstract);small language model(title);large language model(abstract);分类 cs.CL、cs.AI

AI总结 TrueBrief通过偏好优化范式提升小语言模型在文本摘要任务中的忠实性,通过受控幻觉注入生成合成数据以增强模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18773 2026-01-09 cs.CR cs.AI cs.LG 88%

Exploring the limits of strong membership inference attacks on large language models

探索对大型语言模型的强大成员推断攻击的极限

Jamie Hayes, Ilia Shumailov, Christopher A. Choquette-Choo, Matthew Jagielski, George Kaissis, Milad Nasr, Sahra Ghalebikesabi, Meenatchi Sundaram Mutu Selva Annamalai, Niloofar Mireshghallah, Igor Shilov, Matthieu Meeus, Yves-Alexandre de Montjoye, Katherine Lee, Franziska Boenisch, Adam Dziedzic, A. Feder Cooper

机构 * Google DeepMind(谷歌DeepMind) University College London(伦敦大学学院) University of Washington(华盛顿大学) Imperial College London(伦敦帝国学院) CISPA Helmholtz Center for Information Security(信息安全赫尔姆霍兹中心) Stanford University(斯坦福大学) Microsoft Research(微软研究院)

专题命中 效率与部署 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过扩展LiRA攻击至GPT-2模型,揭示了强成员推断攻击在大型语言模型上的有效性及局限性,发现其在实际应用中仍存在显著的AUC限制和决策不稳定问题。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12225 2026-01-09 cs.LG cs.AI cs.CL stat.ML 88%

Mining Intrinsic Rewards from LLM Hidden States for Efficient Best-of-N Sampling

从LLM隐藏状态中挖掘内在奖励以实现高效的Best-of-N采样

Jizhou Guo, Zhaomin Wu, Hanchen Yang, Philip S. Yu

机构 * Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫阳学院) National University of Singapore(新加坡国立大学) Tongji University(同济大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 SWIFT通过从LLM隐藏状态中挖掘内在奖励,实现高效Best-of-N采样,提升模型性能并减少计算成本。

Comments Accepted by KDD 2026 (Research Track). Project page: https://aster2024.github.io/swift-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16282 2026-01-09 cs.LG cs.AI 86%

CALM: A CKA-Guided Adaptive Layer-Wise Modularization Framework for LLM Quantization

CALM: 一种基于CKA的自适应层级模块化框架用于LLM量化

Jinhao Zhang, Yunquan Zhang, Daning Chen, JunSun, Zicheng Yan

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 CALM提出一种基于CKA的自适应层级模块化框架,通过独立评估各层最佳量化策略,提升LLM量化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05167 2026-01-09 cs.CL cs.AI cs.LG 86%

RelayLLM: Efficient Reasoning via Collaborative Decoding

RelayLLM: 通过协作解码实现高效推理

Chengsong Huang, Tong Zheng, Langlin Huang, Jinyuan Li, Haolin Liu, Jiaxin Huang

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Maryland(马里兰大学) University of Virginia(弗吉尼亚大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 RelayLLM通过令牌级协作解码实现高效推理,利用SLM作为主动控制器,仅在必要时调用LLM,显著降低计算成本并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17189 2026-01-09 cs.AI 85%

Talking with Tables for Better LLM Factual Data Interactions

通过表格对话提升大语言模型事实数据交互

Jio Oh, Geon Heo, Seungjun Oh, Hyunjin Kim, JinYeong Bak, Jindong Wang, Xing Xie, Steven Euijong Whang

机构 * KAIST(韩国科学技术院) Microsoft Research Asia(微软亚洲研究院) William & Mary(威廉与玛丽学院) SKKU

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过表格结构提升大语言模型在事实数据交互中的性能,展示表格在信息检索和数据操作中的有效性,并验证其在不同任务中的鲁棒性和效率。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23367 2026-01-09 cs.LG cs.AI 84%

Post-Training Quantization of OpenPangu Models for Efficient Deployment on Atlas A2

在Atlas A2上对OpenPangu模型进行训练后量化以实现高效部署

Yilun Luo, Huaqing Zheng, Haoqian Meng, Wenyuan Liu, Peng Zhang

机构 * School of Computer Science and Technology, Tianjin University(计算机科学与技术学院,天津大学)

专题命中 效率与部署 :post-training(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出在Atlas A2上通过低比特量化提升OpenPangu模型的推理效率,实现高效CoT推理并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21400 2026-01-09 cs.LG cs.IT math.IT math.ST stat.ML stat.TH 83%

Breaking AR's Sampling Bottleneck: Provable Acceleration via Diffusion Language Models

突破生成模型的采样瓶颈:通过扩散语言模型实现可证明的加速

Gen Li, Changxiao Cai

机构 * Department of Statistics and Data Science, Chinese University of Hong Kong, Hong Kong(统计与数据科学系,香港中文大学) Department of Industrial and Operations Engineering, University of Michigan, Ann Arbor, USA(工业与运营管理系,密歇根大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本文从信息论角度为扩散语言模型提供收敛保证,证明采样误差随迭代次数减少而降低,从而突破自回归模型所需的L步瓶颈,为生成高质量样本提供理论支持。

Comments This is the full version of a paper published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24449 2026-01-09 cs.DC cs.AI 83%

PackKV: Reducing KV Cache Memory Footprint through LLM-Aware Lossy Compression

PackKV: 通过LLM-aware的有损压缩减少KV缓存内存占用

Bo Jiang, Taolue Yang, Youyuan Liu, Xubin He, Sheng Di, Sian Jin

机构 * Temple University(特伦大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PackKV通过LLM-aware的有损压缩技术,显著减少KV缓存内存占用并提升计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04428 2026-01-09 cs.CV cs.AI 79%

CRUNet-MR-Univ: A Foundation Model for Diverse Cardiac MRI Reconstruction

CRUNet-MR-Univ:一种用于多样化心脏MRI重建的通用模型

Donghang Lyu, Marius Staring, Hildo Lamb, Mariya Doneva

机构 * Department of Radiology, Leiden University Medical Center, Leiden, The Netherlands(莱顿大学医学中心放射科) Philips Innovative Technologies, Hamburg, Germany(飞利浦创新技术)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 CRUNet-MR-Univ是一种基于时空相关性和提示先验知识的通用模型,用于提高心脏MRI重建在多样化场景下的泛化能力与性能表现。

Comments STACOM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14195 2026-01-09 cs.LG cs.CR 79%

N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety Evaluator

N-GLARE:一种非生成式、潜在表示高效的大语言模型安全评估器

Zheyu Lin, Jirui Yang, Yukui Qiu, Hengqi Guo, Yubing Bao, Yao Guan

机构 * University of California, Riverside(加州大学河滨分校) Fudan University(复旦大学) South China University of Technology(华南理工大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.LG

AI总结 N-GLARE通过分析潜在表示动态,提出一种高效无输出的大语言模型安全评估方法,显著降低评估成本并提升诊断效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01266 2026-01-09 cs.CL cs.AI 79%

From Policy to Logic for Efficient and Interpretable Coverage Assessment

从策略到逻辑:为高效和可解释的覆盖评估而设

Rhitabrat Pokharel, Hamid Reza Hassanzadeh, Ameeta Agrawal

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种结合覆盖意识检索器和符号规则推理的方法,以提高医疗覆盖政策审查的效率和可解释性,同时降低模型成本并提升评估准确性。

Comments Accepted at AIMedHealth @ AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04789 2026-01-09 cs.CL cs.AI 79%

NC2C: Automated Convexification of Generic Non-Convex Optimization Problems

NC2C: 通用非凸优化问题的自动凸化

Xinyue Peng, Yanming Liu, Yihan Cang, Yuwei Zhang, Xinyi Wang, Songhang Deng, Jiannan Cao

机构 * Southeast University(东南大学) Zhejiang University(浙江大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 NC2C通过大语言模型实现通用非凸优化问题的自动凸化,提升求解效率并减少专家依赖。

Comments First version of NC2C

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04696 2026-01-09 cs.AI cs.CL 79%

A Method for Constructing a Digital Transformation Driving Mechanism Based on Semantic Understanding of Large Models

基于大模型语义理解的数字化转型驱动机制构建方法

Huayi Liu

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出基于大模型语义理解与知识图谱的数字化转型驱动机制构建方法,通过强化学习优化决策路径,提升企业响应效率与决策准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05214 2026-01-09 cs.AI 77%

Internal Representations as Indicators of Hallucinations in Agent Tool Selection

内部表示作为代理工具选择中的幻觉指示器

Kait Healy, Bharathi Srinivasan, Visakh Madathil, Jing Wu

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种利用LLM内部表示实时检测工具调用幻觉的方法,通过减少计算开销实现高准确率的检测,尤其在参数和工具选择方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04516 2026-01-09 cs.CL 77%

LinguaGame: A Linguistically Grounded Game-Theoretic Paradigm for Multi-Agent Dialogue Generation

LinguaGame: 一种基于语言的多智能体对话生成博弈论范式

Yuxiao Ye, Yiming Zhang, Yiran Ma, Huiyuan Xie, Huining Zhu, Zhiyuan Liu

机构 * Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校) Peking University(北京大学) East China University of Political Science and Law(中国政法大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 LinguaGame通过博弈论范式提升多智能体对话生成的通信效率,利用语言感知推理实现意图和策略的高效沟通。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07602 2026-01-09 cs.AI 77%

HGMF: A Hierarchical Gaussian Mixture Framework for Scalable Tool Invocation within the Model Context Protocol

HGMF:一种用于模型上下文协议中可扩展工具调用的分层高斯混合框架

Wenpeng Xing, Zhipeng Chen, Changting Lin, Meng Han

机构 * Zhejiang University Binjiang Institute of Zhejiang University(浙江大学) Jimei University(集美大学) Zhejiang University GenTel.io(浙江大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HGMF通过分层高斯混合框架提升大规模工具库中的工具调用准确率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04680 2026-01-09 cs.HC 75%

Leveraging LLMs for Efficient and Personalized Smart Home Automation

利用LLMs实现高效且个性化的智能家居自动化

Chaerin Yu, Chihun Choi, Sunjae Lee, Hyosu Kim, Steven Y. Ko, Young-Bae Ko, Sangeun Oh

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 IoTGPT通过分解用户指令和记忆子任务,实现高效且个性化的智能家居自动化,提升可靠性和减少用户负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05988 2026-01-09 cs.LG cs.SE 74%

Pruning the Unsurprising: Efficient LLM Reasoning via First-Token Surprisal

剪除无意义的:通过首词意外度实现高效的LLM推理

Wenhao Zeng, Yaoning Wang, Chao Hu, Yuling Shi, Chengcheng Wan, Hongyu Zhang, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) East China Normal University(华东师范大学) Chongqing University(重庆大学)

专题命中 效率与部署 :LLM(title);分类 cs.LG

AI总结 本文提出ASAP方法,通过锚点引导和首词意外度度量实现高效的CoT压缩,提升推理效率并降低训练成本。

Comments Code and model available at https://github.com/Zengwh02/ASAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05038 2026-01-09 cs.CL cs.AI 73%

ArcAligner: Adaptive Recursive Aligner for Compressed Context Embeddings in RAG

ArcAligner: 用于RAG中压缩上下文嵌入的自适应递归对齐器

Jianbo Li, Yi Jiang, Sendong Zhao, Bairui Hu, Haochun Wang, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 效率与部署 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ArcAligner通过自适应门控机制提升RAG中压缩上下文表示的利用效率,有效解决压缩带来的理解困难问题。

Comments Code is available at https://github.com/liunian-Jay/ArcAligner.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05159 2026-01-09 cs.CV cs.AI 70%

Vision-Language Introspection: Mitigating Overconfident Hallucinations in MLLMs via Interpretable Bi-Causal Steering

视觉-语言反思:通过可解释的双因果引导减轻大语言模型中的过度自信幻觉

Shuliang Liu, Songbo Yang, Dong Fang, Sihang Jia, Yuqi Tang, Lingfeng Su, Ruoshui Peng, Yibo Yan, Xin Zou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) The Hong Kong University of Science and Technology(香港理工大学) LIGHTSPEED

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 VLI通过可解释的双因果引导方法,有效减少大语言模型中的对象幻觉,提升多模态任务的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04603 2026-01-09 cs.CR cs.AI 70%

Constitutional Classifiers++: Efficient Production-Grade Defenses against Universal Jailbreaks

宪法分类器++:高效生产级防御对抗通用劫持攻击

Hoagy Cunningham, Jerry Wei, Zihan Wang, Andrew Persic, Alwin Peng, Jordan Abderrachid, Raj Agarwal, Bobby Chen, Austin Cohen, Andy Dau, Alek Dimitriev, Rob Gilson, Logan Howard, Yijin Hua, Jared Kaplan, Jan Leike, Mu Lin, Christopher Liu, Vladimir Mikulik, Rohit Mittapalli, Clare O'Hara, Jin Pan, Nikhil Saxena, Alex Silverstein, Yue Song, Xunjie Yu, Giulio Zhou, Ethan Perez, Mrinank Sharma

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 宪法分类器++通过高效算法和两阶段分类器流水线,实现生产级防御,大幅降低计算成本并保持高鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04734 2026-01-09 cs.CV 67%

AIVD: Adaptive Edge-Cloud Collaboration for Accurate and Efficient Industrial Visual Detection

AIVD:自适应边缘-云协作用于准确高效的工业视觉检测

Yunqing Hu, Zheming Yang, Chang Zhao, Qi Guo, Meng Gao, Pengcheng Li, Wen Ji

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院工业人工智能研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 AIVD通过边缘-云协作提升工业视觉检测的精度与效率,采用轻量边缘检测与云MLLM协同,结合高效微调策略和动态调度算法,实现高吞吐低延迟的资源优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20687 2026-01-09 cs.LG cs.AI cs.CL cs.DC 67%

PHOTON: Hierarchical Autoregressive Modeling for Lightspeed and Memory-Efficient Language Generation

PHOTON:用于光速和内存高效语言生成的分层自回归建模

Yuma Ichikawa, Naoya Takagi, Takumi Nakagawa, Yuzi Kanazawa, Akira Sakai

机构 * Fujitsu Limited(富士通株式会社) RIKEN Center for AIP(理化学研究所先进信息研究中心) Institute of Science Tokyo(东京科学研究所) Tokai University(立命馆大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PHOTON 提出了一种分层自回归模型,通过垂直多分辨率上下文扫描提高语言生成的吞吐量与内存效率。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04973 2026-01-09 cs.AI cs.CL 62%

ConMax: Confidence-Maximizing Compression for Efficient Chain-of-Thought Reasoning

ConMax:用于高效思维链推理的置信度最大化压缩

Minda Hu, Zexuan Qiu, Zenan Xu, Kun Li, Bo Zhou, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) LLM Department, Tencent(腾讯机器学习部门)

专题命中 效率与部署 :SFT(abstract);分类 cs.CL、cs.AI

AI总结 ConMax通过强化学习框架在保持推理模式的同时,高效压缩推理轨迹,提升大规模推理模型的效率与性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04795 2026-01-09 cs.AI cs.CL cs.CR cs.MA 62%

Defense Against Indirect Prompt Injection via Tool Result Parsing

通过工具结果解析防御间接提示注入

Qiang Yu, Xinran Cheng, Chuanyi Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过工具结果解析来防御间接提示注入,有效过滤恶意代码并降低攻击成功率。

Comments 20 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02780 2026-01-09 cs.CL cs.AI 62%

MiMo-V2-Flash Technical Report

MiMo-V2-Flash 技术报告

Core Team, Bangjun Xiao, Bingquan Xia, Bo Yang, Bofei Gao, Bowen Shen, Chen Zhang, Chenhong He, Chiheng Lou, Fuli Luo, Gang Wang, Gang Xie, Hailin Zhang, Hanglong Lv, Hanyu Li, Heyu Chen, Hongshen Xu, Houbin Zhang, Huaqiu Liu, Jiangshan Duo, Jianyu Wei, Jiebao Xiao, Jinhao Dong, Jun Shi, Junhao Hu, Kainan Bao, Kang Zhou, Lei Li, Liang Zhao, Linghao Zhang, Peidian Li, Qianli Chen, Shaohui Liu, Shihua Yu, Shijie Cao, Shimao Chen, Shouqiu Yu, Shuo Liu, Tianling Zhou, Weijiang Su, Weikun Wang, Wenhan Ma, Xiangwei Deng, Bohan Mao, Bowen Ye, Can Cai, Chenghua Wang, Chengxuan Zhu, Chong Ma, Chun Chen, Chunan Li, Dawei Zhu, Deshan Xiao, Dong Zhang, Duo Zhang, Fangyue Liu, Feiyu Yang, Fengyuan Shi, Guoan Wang, Hao Tian, Hao Wu, Heng Qu, Hongfei Yi, Hongxu An, Hongyi Guan, Xing Zhang, Yifan Song, Yihan Yan, Yihao Zhao, Yingchun Lai, Yizhao Gao, Yu Cheng, Yuanyuan Tian, Yudong Wang, Zhen Tang, Zhengju Tang, Zhengtao Wen, Zhichao Song, Zhixian Zheng, Zihan Jiang, Jian Wen, Jiarui Sun, Jiawei Li, Jinlong Xue, Jun Xia, Kai Fang, Menghang Zhu, Nuo Chen, Qian Tu, Qihao Zhang, Qiying Wang, Rang Li, Rui Ma, Shaolei Zhang, Shengfan Wang, Shicheng Li, Shuhao Gu, Shuhuai Ren, Sirui Deng, Tao Guo, Tianyang Lu, Weiji Zhuang, Weikang Zhang, Weimin Xiong, Wenshan Huang, Wenyu Yang, Xin Zhang, Xing Yong, Xu Wang, Xueyang Xie, Yilin Jiang, Yixin Yang, Yongzhe He, Yu Tu, Yuanliang Dong, Yuchen Liu, Yue Ma, Yue Yu, Yuxing Xiang, Zhaojun Huang, Zhenru Lin, Zhipeng Xu, Zhiyang Chen, Zhonghua Deng, Zihan Zhang, Zihao Yue

机构 * LLM-Core Xiaomi(LLM-Core小米)

专题命中 效率与部署 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 MiMo-V2-Flash通过混合注意力架构和多教师在线蒸馏技术,实现高效推理和代理能力,开源模型权重促进开放研究。

Comments 31 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05027 2026-01-09 cs.AI 57%

OptiSet: Unified Optimizing Set Selection and Ranking for Retrieval-Augmented Generation

OptiSet: 一体化的优化集选择与排序用于检索增强生成

Yi Jiang, Sendong Zhao, Jianbo Li, Bairui Hu, Yanrui Du, Haochun Wang, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 效率与部署 :LLM(abstract);分类 cs.AI

AI总结 OptiSet通过集中心框架统一集选择和集级排序,提升RAG在复杂组合问题上的性能和生成效率。

Comments Code is available at https://github.com/liunian-Jay/OptiSet.git

详情

展开后加载摘要…

URL PDF HTML 收藏