arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-07 至 2026-01-07 共收录 192 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 45 篇

2601.02872 2026-01-07 cs.CL cs.AI 73%

LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark

LongBench Pro: 一个更现实且全面的双语长上下文评估基准

Ziyang Chen, Xing Wu, Junlong Jia, Chaochen Gao, Qi Fu, Debing Zhang, Songlin Hu

机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LongBench Pro通过人机协作构建,提供1500个双语长上下文样本,评估46个模型发现长上下文优化比参数扩展更有效,有效上下文长度较短且存在跨语言偏差,混合思考设计具有潜在优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10769 2026-01-07 cs.AI cs.CL cs.MA 73%

AgentArch: A Comprehensive Benchmark to Evaluate Agent Architectures in Enterprise

AgentArch: 一种全面的基准,用于评估企业中的代理架构

Tara Bogavelli, Roshnee Sharma, Hari Subramani

机构 * ServiceNow

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AgentArch提出一个企业特定的基准,评估代理架构在复杂任务中的性能,揭示模型特定的架构偏好及性能瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24867 2026-01-07 cs.CL cs.AI 73%

Encyclo-K: Evaluating LLMs with Dynamically Composed Knowledge Statements

Encyclo-K:通过动态组成的知识陈述评估LLM

Yiming Liang, Yizhi Li, Yantao Du, Ge Zhang, Jiayi Zhou, Yuchen Wu, Yinzhu Piao, Denghui Cao, Tong Sun, Ziniu Li, Li Du, Bo Lei, Jiaheng Liu, Chenghua Lin, Zhaoxiang Zhang, Wenhao Huang, Jiajun Zhang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学) The University of Manchester(曼彻斯特大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Encyclo-K通过动态组合知识陈述,提出了一种评估LLM全面理解能力的基准测试框架,有效解决了现有基准测试的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03198 2026-01-07 cs.LG 70%

Empowering Reliable Visual-Centric Instruction Following in MLLMs

赋能多模态大语言模型中的可靠指令跟随

Weilei He, Feng Ju, Zhiyuan Fan, Rui Min, Minhao Cheng, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Penn State(宾夕法尼亚州立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出VC-IFEval基准,通过引入视觉依赖性约束,系统评估多模态大语言模型在指令跟随任务中的性能与改进。

Comments Submitted to ARR Jan

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00125 2026-01-07 cs.SE cs.AI cs.DC 70%

A Survey on Failure Analysis and Fault Injection in AI Systems

人工智能系统中故障分析与故障注入的综述

Guangba Yu, Gou Tan, Haojia Huang, Zhenyu Zhang, Pengfei Chen, Roberto Natella, Zibin Zheng

机构 * Sun Yat-sen University(中山大学) Federico II University of Naples(那不勒斯费代里科二世大学) Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究综述了人工智能系统中故障分析与故障注入的方法,分析了现有技术的现状及改进方向,以提高系统可靠性。

Comments Accepted by TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02391 2026-01-07 cs.CL cs.SD eess.AS 70%

WearVox: An Egocentric Multichannel Voice Assistant Benchmark for Wearables

WearVox: 一款面向可穿戴设备的多通道语音助手基准测试平台

Zhaojiang Lin, Yong Xu, Kai Sun, Jing Zheng, Yin Huang, Surya Teja Appini, Krish Narang, Renjie Tao, Ishan Kapil Jain, Siddhant Arora, Ruizhi Li, Yiteng Huang, Kaushik Patnaik, Wenfang Xu, Suwon Shon, Yue Liu, Ahmed A Aly, Anuj Kumar, Florian Metze, Xin Luna Dong

机构 * Meta Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 WearVox是一个面向可穿戴设备的多通道语音助手基准测试平台,通过真实场景下的多通道音频数据评估语音助手性能,揭示了环境噪声对模型表现的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04141 2026-01-07 cs.AI 70%

The Artificial Intelligence Cognitive Examination: A Survey on the Evolution of Multimodal Evaluation from Recognition to Reasoning

人工智能认知测评:多模态评估从识别到推理的演变综述

Mayank Ravishankara, Varindra V. Persad Maharaj

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文综述了多模态AI评估从识别到推理的演变,探讨了测评方法的转变及当前前沿基准的发展。

Journal ref IEEE Access, vol. 14, Dec. 2025, Art. no. 3649182

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06311 2026-01-07 cs.CR cs.AI 70%

Defending against Indirect Prompt Injection by Instruction Detection

对抗间接提示注入的指令检测

Tongyu Wen, Chenglong Wang, Xiyuan Yang, Haoyu Tang, Yueqi Xie, Lingjuan Lyu, Zhicheng Dou, Fangzhao Wu

机构 * Renmin University of China(中国人民大学) Peking University Shenzhen Graduate School(北京大学深圳研究生院) Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Hong Kong University of Science and Technology(香港科技大学) Sony AI(索尼人工智能) Microsoft Research Asia(微软亚洲研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出InstructDetector,通过检测LLMs行为状态来识别IPI攻击,实现高检测准确率和低攻击成功率。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02601 2026-01-07 cs.SE 67%

State of the Quantum Software Engineering Ecosystem

量子软件工程生态系统的现状

Nazanin Siavash, Armin Moin

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文利用AI技术研究量子软件工程生态系统的现状,识别活跃且成果显著的机构和公司。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22322 2026-01-07 cs.CL cs.AI cs.CV cs.LG cs.MA 67%

SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents

SmartSnap: 为自主代理的主动证据寻求

Shaofei Cai, Yulei Qin, Haojia Lin, Zihan Xu, Gang Li, Yuchen Shi, Zongyi Li, Yong Mao, Siqi Cai, Xiaoyu Tan, Yitao Liang, Ke Li, Xing Sun

机构 * Tencent(腾讯)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SmartSnap通过主动证据寻求机制,使自主代理在复杂任务中实现高效自我验证,提升性能并增强可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02941 2026-01-07 cs.CR cs.AI cs.CL 62%

SastBench: A Benchmark for Testing Agentic SAST Triage

SastBench: 一个用于测试代理SAST分拣的基准

Jake Feiglin, Guy Dar

机构 * Rival Labs(Rival实验室)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 SastBench是一个用于评估SAST分拣代理性能的基准,结合真实CVE和过滤后的SAST发现,提供性能比较和未来发展的讨论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10675 2026-01-07 cs.RO cs.AI cs.CV cs.LG 62%

Evaluating Gemini Robotics Policies in a Veo World Simulator

在Veo世界模拟器中评估Gemini机器人策略

Gemini Robotics Team, Krzysztof Choromanski, Coline Devin, Yilun Du, Debidatta Dwibedi, Ruiqi Gao, Abhishek Jindal, Thomas Kipf, Sean Kirmani, Isabel Leal, Fangchen Liu, Anirudha Majumdar, Andrew Marmon, Carolina Parada, Yulia Rubanova, Dhruv Shah, Vikas Sindhwani, Jie Tan, Fei Xia, Ted Xiao, Sherry Yang, Wenhao Yu, Allan Zhou

机构 * Gemini Robotics Team(Gemini机器人团队) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出基于Veo视频模型的生成式评估系统,用于在Veo世界模拟器中全面评估Gemini机器人策略的性能,包括名义性能、分布外泛化及安全约束测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22334 2026-01-07 cs.AI cs.CL 62%

SciEvalKit: An Open-source Evaluation Toolkit for Scientific General Intelligence

SciEvalKit: 一个用于科学通用智能的开源评估工具包

Yiheng Wang, Yixin Chen, Shuo Li, Yifan Zhou, Bo Liu, Hengjian Gao, Jiakang Yuan, Jia Bu, Wanghan Xu, Yuhao Zhou, Xiangyu Zhao, Zhiwang Zhou, Fengxiang Wang, Haodong Duan, Songyang Zhang, Jun Yao, Han Deng, Yizhou Wang, Jiabei Xiao, Jiaqi Liu, Encheng Su, Yujie Liu, Weida Wang, Junchi Yao, Shenghe Zheng, Haoran Sun, Runmin Ma, Xiangchao Yan, Bo Zhang, Dongzhan Zhou, Shufei Zhang, Peng Ye, Xiaosong Wang, Shixiang Tang, Wenlong Zhang, Lei Bai

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 SciEvalKit是一个开源工具包,用于评估科学通用智能,涵盖科学多模态感知、推理、理解等核心能力,并提供灵活的评估流程和可定制的基准测试环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02504 2026-01-07 cs.SE cs.AI cs.CY 57%

Enhancing Debugging Skills with AI-Powered Assistance: A Real-Time Tool for Debugging Support

利用AI赋能提升调试技能:一种实时的调试支持工具

Elizaveta Artser, Daniil Karol, Anna Potriasaeva, Aleksei Rostovskii, Katsiaryna Dzialets, Ekaterina Koshchenko, Xiaotian Su, April Yi Wang, Anastasiia Birillo

机构 * JetBrains Research(JetBrains研究)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出一种基于AI的实时调试辅助工具,通过减少LLM调用并提升准确性,帮助提升编程教育中的调试技能。

Comments Accepted at ICSE SEET 2026, 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12229 2026-01-07 cs.CL 57%

Infini-gram mini: Exact n-gram Search at the Internet Scale with FM-Index

Infini-gram mini:基于FM-索引的互联网级精确n-gram搜索

Hao Xu, Jiacheng Liu, Yejin Choi, Noah A. Smith, Hannaneh Hajishirzi

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 infini-gram mini是一种基于FM索引的高效系统,可实现互联网级大规模文本的精确n-gram搜索,显著提升索引速度和内存使用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10963 2026-01-07 cs.CV cs.CL 57%

MMMG: A Massive, Multidisciplinary, Multi-Tier Generation Benchmark for Text-to-Image Reasoning

MMMG:大规模、跨学科、多层级的文本到图像推理生成基准

Yuxuan Luo, Yuhui Yuan, Junwen Chen, Haonan Cai, Ziyi Yue, Yuwei Yang, Fatima Zohra Daha, Ji Li, Zhouhui Lian

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出MMMG基准,用于评估文本到图像生成模型的推理能力,揭示现有模型在知识图像生成中的不足,并发布FLUX-Reason作为开放基线。

Comments 85 pages, 70 figures, code: https://github.com/MMMGBench/MMMG, project page: https://mmmgbench.github.io/

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025) Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03090 2026-01-07 cs.CV 50%

LesionTABE: Equitable AI for Skin Lesion Detection

LesionTABE:面向皮肤病变检测的公平AI

Rocio Mexia Diaz, Yasmin Greenway, Petru Manescu

机构 * UCL Department of Computer Science(伦敦大学学院计算机科学系) DermieAI

专题命中 评测与基准 :foundation model(abstract)

AI总结 LesionTABE通过结合对抗性去偏见和皮肤病基础模型嵌入,提升了皮肤病变检测的公平性和诊断准确性。

Comments Submitted to IEEE ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02750 2026-01-07 cs.IR 50%

Ahead of the Spread: Agent-Driven Virtual Propagation for Early Fake News Detection

提前传播:基于代理的虚拟传播用于早期虚假新闻检测

Bincheng Gu, Min Gao, Junliang Yu, Zongwei Wang, Zhiyi Liu, Kai Shu, Hongyu Zhang

专题命中 评测与基准 :LLM(abstract)

AI总结 AVOID通过基于代理的虚拟传播方法,主动模拟早期虚假新闻的扩散行为,从而提升早期检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02586 2026-01-07 cs.SD cs.IR 50%

Understanding Human Perception of Music Plagiarism Through a Computational Approach

通过计算方法理解人类对音乐剽窃的感知

Daeun Hwang, Hyeonbin Hwang

专题命中 评测与基准 :LLM(abstract)

AI总结 本文通过计算方法研究人类感知音乐剽窃的关键标准,探讨旋律、节奏和和弦进行在音乐相似性判断中的作用。

Comments 3 pages, D. Hwang and H. Hwang, Understanding Human Perception of Music Plagiarism Through a Computational Approach, in Extended Abstracts for the Late-Breaking Demo Session of the 25th Int. Society for Music Information Retrieval Conf., San Francisco, United States, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02384 2026-01-07 cs.CV 50%

RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided Captioning

RxnCaption:将反应图解析重新表述为视觉提示引导的描述生成

Jiahe Song, Chuang Wang, Bowen Jiang, Yinfan Wang, Hao Zheng, Xingjian Wei, Chengjin Liu, Rui Nie, Junyuan Gao, Jiaxing Sun, Yubin Wang, Lijun Wu, Zhenhua Huang, Jiang Wu, Qian Yu, Conghui He

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Beihang University(北航) Peking University(北京大学) South China Normal University(华南师范大学) Northwestern Polytechnical University(西北工业大学)

专题命中 评测与基准 :language model(abstract)

AI总结 RxnCaption通过将反应图解析转化为视觉提示引导的描述生成任务,提升化学反应数据的机器可读性,并构建大规模数据集推动AI在化学领域的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 38 篇

2601.03211 2026-01-07 cs.IR cs.AI cs.CL 91%

Fine-tuning Small Language Models as Efficient Enterprise Search Relevance Labelers

微调小型语言模型作为高效的企业搜索相关性标注器

Yue Kang, Zhuoyi Huang, Benji Schussheim, Diana Licon, Dina Atia, Shixing Cao, Jacob Danovitch, Kunho Kim, Billy Norcilien, Jonah Karpman, Mahmound Sayed, Mike Taylor, Tao Sun, Pavel Metrikov, Vipul Agarwal, Chris Quirk, Ye-Yi Wang, Nick Craswell, Irene Shaffer, Tianwei Chen, Sulaiman Vesal, Soundar Srinivasan

机构 * Microsoft(微软)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文提出通过微调小型语言模型实现高效企业搜索相关性标注,利用合成数据生成提升标注质量和吞吐量,比大型模型更高效且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04054 2026-01-07 cs.CL cs.AI cs.MA cs.SI physics.soc-ph 90%

Large Language Models can Achieve Social Balance

大语言模型可以实现社会平衡

Pedro Cisneros-Velarde

机构 * VMware Research(VMware研究)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 大语言模型通过分析相互作用类型、更新机制和种群规模,实现了社会平衡,并指导了代理系统的设计与部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04833 2026-01-07 cs.CV cs.AI cs.CL 88%

E$^2$AT: Multimodal Jailbreak Defense via Dynamic Joint Optimization for Multimodal Large Language Models

E$^2$AT: 通过动态联合优化实现多模态对抗防御

Liming Lu, Xiang Gu, Shuchao Pang, Siyuan Liang, Haotian Zhu, Xiyu Zeng, Xu Zheng, Yongbin Zhou

机构 * School of Cyber Science and Engineering, Nanjing University of Science and Technology, China(南京理工大学信息科学与工程学院) HKUST(GZ) and INSAIT, Sofia University St. Kliment Ohridski(香港科技大学(广州)及INSAIT,索菲亚大学圣克莱门特·奥赫里迪斯学院) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 E$^2$AT通过动态联合优化提升多模态大语言模型对对抗攻击的鲁棒性,实验显示其在文本和图像模态上性能优于现有方法34%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16753 2026-01-07 cs.AI 88%

ELMM: Efficient Lightweight Multimodal Large Language Models for Multimodal Knowledge Graph Completion

ELMM: 为多模态知识图谱补全设计的高效轻量多模态大语言模型

Wei Huang, Peining Li, Meiyu Liang, Xu Hou, Junping Du, Yingxia Shao, Guanhua Ye, Wu Liu, Kangkang Lu, Yang Yu

机构 * School of Computer Science, Beijing University of Posts and Telecommunications(计算机学院,北京邮电大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 ELMM通过多视图视觉标记压缩和注意力修剪策略,高效解决多模态知识图谱补全中的模态冲突和计算成本问题,实现最先进的性能。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02674 2026-01-07 cs.CL 88%

Iterative Structured Pruning for Large Language Models with Multi-Domain Calibration

迭代式结构剪枝用于具有多领域校准的大语言模型

Guangxin Wu, Hao Zhang, Zhang Zhibin, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出了一种迭代式结构剪枝方法,通过多领域校准集和迭代策略实现高效模型压缩,减少计算开销和内存占用,同时保持性能稳定。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03067 2026-01-07 cs.LG cs.AI 86%

Joint Encoding of KV-Cache Blocks for Scalable LLM Serving

KV缓存块的联合编码以实现可扩展的LLM服务

Joseph Kampeas, Emir Haleva

机构 * Distributed and Parallel Software Lab(分布式并行软件实验室) Huawei Technologies(华为技术)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过联合编码KV缓存块,实现高并发LLM服务,提升吞吐量并减少内存消耗。

Comments 12 pages, 16 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02875 2026-01-07 cs.CL 85%

Revisiting Data Compression with Language Modeling

重新审视语言模型在数据压缩中的应用

Chen-Han Tsai

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 本文探讨了使用大型语言模型进行数据压缩的潜力,展示了在enwik9数据集上达到18%的调整压缩率,并探讨了LLM在压缩非英语数据、代码和字节流序列中的应用。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02695 2026-01-07 cs.CL cs.MA 85%

EvoRoute: Experience-Driven Self-Routing LLM Agent Systems

EvoRoute: 基于经验的自我路由LLM代理系统

Guibin Zhang, Haiyang Yu, Kaiming Yang, Bingli Wu, Fei Huang, Yongbin Li, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Tongyi Lab(通义实验室)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 EvoRoute通过动态选择最优LLM模型,解决代理系统在性能、成本和延迟间的平衡问题,显著提升效率并降低成本

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00454 2026-01-07 cs.CL 85%

Learning an Efficient Multi-Turn Dialogue Evaluator from Multiple LLM Judges

从多个LLM裁判中学习高效的多轮对话评估器

Yuqi Tang, Kehua Feng, Yunfeng Wang, Zhiwen Chen, Chengfei Lv, Gang Yu, Qiang Zhang, Keyan Ding, Huajun Chen

机构 * ZJU–UIUC Institute(浙大UIUC研究院) ZJU–Hangzhou Global Scientific and Technological Innovation Center(浙大杭州全球科技创新中心) College of Computer Science and Technology(计算机科学与技术学院) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种高效多轮对话评估器,通过整合多个LLM裁判的偏好知识,减少计算开销并提升评估效率与鲁棒性。

Comments 20 pages, 4 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02512 2026-01-07 cs.SE 85%

Green LLM Techniques in Action: How Effective Are Existing Techniques for Improving the Energy Efficiency of LLM-Based Applications in Industry?

绿色大语言模型技术实践:现有技术在工业中提升大语言模型应用能效的有效性如何?

Pelin Rabia Kuran, Rumbidzai Chitakunye, Vincenzo Stoico, Ilja Heitlager, Justus Bogner

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文评估了四种技术在工业应用中提升大语言模型能效的有效性,发现提示优化和量化可显著降低能耗,但会损害准确性,而小模型与大模型协作在不显著影响其他指标的情况下实现了显著节能。

Comments Accepted for publication at the 2026 International Conference on Software Engineering: Software Engineering in Practice (ICSE-SEIP'26)

详情

展开后加载摘要…

URL PDF HTML 收藏