arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-08 至 2026-01-08 共收录 218 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 60 篇

2601.03543 2026-01-08 cs.CL 77%

EvolMem: A Cognitive-Driven Benchmark for Multi-Session Dialogue Memory

EvolMem:一种基于认知的多会话对话记忆基准

Ye Shen, Dun Pei, Yiqiu Guo, Junying Wang, Yijin Guo, Zicheng Zhang, Qi Jia, Jun Zhou, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 EvolMem提出了一种基于认知的多会话对话记忆基准,用于评估LLMs和智能体系统的多会话记忆能力,揭示了不同模型在多维记忆任务中的表现差异。

Comments 14 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10549 2026-01-08 cs.AI 77%

ELAIPBench: A Benchmark for Expert-Level Artificial Intelligence Paper Understanding

ELAIPBench: 一个用于专家级人工智能论文理解的基准

Xinbang Dai, Huikang Hu, Yongrui Chen, Jiaqi Li, Rihui Jin, Yuyang Zhang, Xiaoguang Li, Lifeng Shang, Guilin Qi

机构 * Southeast University(东南大学) Noah’s Ark Lab(诺亚实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ELAIPBench通过专家编纂的多选题评估LLM对AI论文的理解能力,发现最佳模型准确率仅为39.95%,远低于人类,揭示了LLM在学术论文理解上的显著不足。

Comments 24 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03780 2026-01-08 cs.SE 75%

Assessing and Improving the Representativeness of Code Generation Benchmarks Using Knowledge Units (KUs) of Programming Languages -- An Empirical Study

基于编程语言知识单元(KUs)评估和改进代码生成基准的代表性——一项实证研究

Md Ahasanuzzaman, Bram Adams, Emad Fallahzadeh, Gustavo A. Oliva, Ahmed E. Hassan

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文通过分析编程语言知识单元(KUs)的覆盖情况,提出基于提示的框架改进代码生成基准的代表性,从而更准确评估LLM的代码生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03594 2026-01-08 cs.CR 75%

Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense

突破大语言模型与视觉语言模型:机制、评估与统一防御

Zejian Chen, Chaozhuo Li, Chao Li, Xi Zhang, Litian Zhang, Yiming He

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出三维框架系统回顾大语言模型和视觉语言模型的突破攻击与防御机制,提出统一防御原则并讨论未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03791 2026-01-08 cs.CL cs.AI 73%

Do LLMs Really Memorize Personally Identifiable Information? Revisiting PII Leakage with a Cue-Controlled Memorization Framework

大型语言模型真的会记忆个人身份信息吗?基于提示控制的记忆框架重新审视PII泄露

Xiaoyu Luo, Yiyi Chen, Qiongxiu Li, Johannes Bjerva

机构 * Department of Computer Science(计算机科学系) Department of Electronic Systems(电子系统系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过提示控制框架重新评估LLMs的PII泄露现象,发现其泄露更多由提示驱动而非真实记忆,强调了提示控制在隐私保护中的重要性。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03752 2026-01-08 cs.CL cs.AI 73%

Evaluation of Multilingual LLMs Personalized Text Generation Capabilities Targeting Groups and Social-Media Platforms

多语言大语言模型针对特定群体和社会媒体平台的个性化文本生成能力评估

Dominik Macko

机构 * Kempelen Institute of Intelligent Technologies(克姆佩尔智能技术研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估多语言大语言模型在不同语言中针对特定群体和社会媒体平台的个性化文本生成能力,发现个性化对文本可检测性的影响因语言而异,尤其在英语中影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03403 2026-01-08 cs.CL cs.AI 73%

Tigrinya Number Verbalization: Rules, Algorithm, and Implementation

提格里尼亚数字语音化:规则、算法与实现

Fitsum Gaim, Issayas Tesfamariam

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出提格里尼亚数字语音化的规则、算法及实现,揭示了大语言模型在该任务上的不足,为语言建模和语音合成提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03857 2026-01-08 cs.SE 71%

Once Upon a Team: Investigating Bias in LLM-Driven Software Team Composition and Task Allocation

团队故事:调查LLM驱动的软件团队组成和任务分配中的偏见

Alessandra Parziale, Gianmario Voria, Valeria Pontillo, Amleto Di Salle, Patrizio Pelliccione, Gemma Catolino, Fabio Palomba

专题命中 评测与基准 :LLM(title)

AI总结 本研究发现LLM在软件团队组成和任务分配中存在偏见,加剧了人口不平等,需引入公平性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03860 2026-01-08 cs.CL 70%

PartisanLens: A Multilingual Dataset of Hyperpartisan and Conspiratorial Immigration Narratives in European Media

PartisanLens: 一种多语言的欧洲媒体中极偏见和阴谋论移民叙述数据集

Michele Joshua Maggini, Paloma Piot, Anxo Pérez, Erik Bran Marino, Lúa Santamaría Montesinos, Ana Lisboa, Marta Vázquez Abuín, Javier Parapar, Pablo Gamallo

机构 * Centro Singular de Investigación en Tecnoloxías Intelixentes da USC(乌拉特大学智能技术研究中心) IRLab, CITIC Research Centre, Universidade da Coruña(IR实验室,CITIC研究中心,科鲁纳大学) Universidade de Évora(埃夫拉大学) Universidad de La Rioja(里瓦达维亚大学) GESIS Leibniz Institute for the Social Sciences(莱比锡社会科学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PartisanLens 是首个多语言数据集,用于研究欧洲媒体中的极偏见和阴谋论移民叙述,评估LLMs在分类和标注中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03783 2026-01-08 cs.CL 70%

HearSay Benchmark: Do Audio LLMs Leak What They Hear?

HearSay基准:音频大语言模型是否泄露所听内容?

Jin Wang, Liang Lin, Kaiwen Luo, Weiliu Wang, Yitian Chen, Moayad Aloqaily, Xuehai Tang, Zhenhong Zhou, Kun Wang, Li Sun, Qingsong Wen

机构 * XDU(北华大学) NTU(国立台湾大学) NCEPU(南京工程大学) BUPT(北京邮电大学) SHU(上海大学) UAEU(阿联酋大学) UCAS-IIE(中国科学院大学国际学院) Squirrel AI

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 HearSay基准研究发现音频大语言模型通过声纹泄露隐私,揭示其固有隐私风险及安全机制不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03540 2026-01-08 cs.CL 70%

DeepSynth-Eval: Objectively Evaluating Information Consolidation in Deep Survey Writing

DeepSynth-Eval: 从客观角度评估深度调研写作中的信息整合

Hongzhi Zhang, Yuanze Hu, Tinghai Zhang, Jia Fu, Tao Wang, Junwei Jing, Zhaoxin Fan, Qi Wang, Ruiming Tang, Han Li, Guorui Zhou, Kun Gai

机构 * Kuaishou Technology(快手科技) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DeepSynth-Eval通过客观评估信息整合能力,揭示了深度调研写作中整合碎片信息的挑战,并证明代理计划与写作流程在提升报告质量方面优于单一生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03458 2026-01-08 cs.CY cs.AI 70%

Automated Feedback Generation for Undergraduate Mathematics: Development and Evaluation of an AI Teaching Assistant

大学数学自动反馈生成:一种AI教学助教的开发与评估

Aron Gohr, Marie-Amelie Lawn, Kevin Gao, Inigo Serjeant, Stephen Heslip

机构 * Imperial College London(帝国理工学院伦敦校区)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI的教学助手系统,用于生成大学数学作业的自动反馈,通过模块化工作流和大型语言模型实现了对技术正确性和风格的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03434 2026-01-08 cs.LG 70%

VNU-Bench: A Benchmarking Dataset for Multi-Source Multimodal News Video Understanding

VNU-Bench:多源多模态新闻视频理解的基准数据集

Zibo Liu, Muyang Li, Zhe Jiang, Shigang Chen

机构 * University of Florida(佛罗里达大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 VNU-Bench是首个多源多模态新闻视频理解基准数据集,通过设计新颖问题类型和混合生成方法,评估模型跨源信息整合能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03418 2026-01-08 cs.CL 70%

PCoA: A New Benchmark for Medical Aspect-Based Summarization With Phrase-Level Context Attribution

PCoA: 一种新的医疗基于方面摘要的基准,具有短语级上下文归因

Bohao Chu, Sameh Frihat, Tabea M. G. Pakull, Hendrik Damm, Meijie Li, Ula Muhabbek, Georg Lodde, Norbert Fuhr

机构 * University of Duisburg-Essen(杜伊斯堡-埃森大学) University of Applied Sciences and Arts Dortmund(多特蒙德应用科学大学) University Hospital Essen(埃森大学医院) Institute for Artificial Intelligence in Medicine (IKIM)(医学人工智能研究所(IKIM))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PCoA提出了一种医疗领域基于方面摘要的基准,通过短语级上下文归因提升摘要质量,并验证了其在评估系统生成摘要中的有效性。

Comments ACL 2026 Conference Submission (8 main pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03288 2026-01-08 cs.CR cs.CL 70%

How Real is Your Jailbreak? Fine-grained Jailbreak Evaluation with Anchored Reference

你的 jailbreak 真的可信吗?基于锚定参考的细粒度 jailbreak 评估

Songyang Liu, Chaozhuo Li, Rui Pu, Litian Zhang, Chenxu Wang, Zejian Chen, Yuting Zhang, Yiming Hei

机构 * Key Laboratory of Trustworthy Distributed Computing(可信分布式计算重点实验室) Service Beijing University of Posts(北京邮电大学) Artificial Intelligence Research Institute China Academy of Information(人工智能研究所信息与通信技术 academy)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出 FJAR 框架,通过细粒度分类和锚定参考方法,评估 jailbreak 攻击的真实性和失败原因,提升攻击策略改进的指导性。

Comments 7 pages, 3 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03262 2026-01-08 cs.IR cs.CL 70%

Roles of MLLMs in Visually Rich Document Retrieval for RAG: A Survey

多模态大语言模型在视觉丰富文档检索中的作用:一项综述

Xiantao Zhang

机构 * Beihang University(北航大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文综述了多模态大语言模型在视觉丰富文档检索中的应用,探讨了三种关键角色及其在RAG中的作用与权衡。

Comments 18 pages; accepted at AACL-IJCNLP 2025 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13936 2026-01-08 cs.CL 70%

FinDeepResearch: Evaluating Deep Research Agents in Rigorous Financial Analysis

FinDeepResearch:在严谨的金融分析中评估深度研究代理

Fengbin Zhu, Xiang Yao Ng, Ziyang Liu, Chang Liu, Xianwei Zeng, Chao Wang, Tianhui Tan, Xuan Yao, Pengyang Shao, Min Xu, Zixuan Wang, Jing Wang, Xin Lin, Junfeng Li, Jingxian Zhu, Yang Zhang, Wenjie Wang, Fuli Feng, Richang Hong, Huanbo Luan, Ke-Wei Huang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) Estates Pte Ltd(6Estates公司) Asian Institute of Digital Finance(亚洲数字金融研究所) Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FinDeepResearch通过HisRubric框架评估深度研究代理在金融分析中的能力,构建包含多语言和多市场的基准测试,揭示不同方法在财务分析中的优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05281 2026-01-08 cs.SE cs.CL 70%

CoreCodeBench: Decoupling Code Intelligence via Fine-Grained Repository-Level Tasks

CoreCodeBench:通过细粒度仓库级任务解耦代码智能

Lingyue Fu, Hao Guan, Bolun Zhang, Haowei Yuan, Yaoming Zhu, Jun Xu, Zongyu Wang, Lin Qiu, Xunliang Cai, Xuezhi Cao, Weiwen Liu, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CoreCodeBench通过细粒度仓库级任务解耦编码能力,揭示LLM在编程任务中的非单一性,提供更精确的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19204 2026-01-08 cs.CY cs.AI 70%

Towards the Terminator Economy: Assessing Job Exposure to AI through LLMs

迈向终止经济:通过大语言模型评估工作对AI的暴露

Emilio Colombo, Fabio Mercorio, Mario Mezzanzanica, Antonio Serino

机构 * Dept of International Economics, Institutions and Development, Catholic University of Milan(国际经济学、机构与发展系,米兰天主教大学) Dept of Statistics and Quantitative Methods, University of Milano-Bicocca, Italy(统计与定量方法系,米兰-比科卡大学,意大利) CRISP Research Centre, University of Milano-Bicocca, Italy(CRISP研究中心,米兰-比科卡大学,意大利) Dept of Economics, Management and Statistics, University of Milano-Bicocca(经济学、管理与统计系,米兰-比科卡大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过大语言模型评估工作对AI的暴露度,揭示AI对就业和生产力的积极影响及职业间互补性。

Comments 10 pages. Accepted for publication at IJCAI 2025. Final version available at https://doi.org/10.24963/ijcai.2025/1066

Journal ref Proceedings of the 34th International Joint Conference on Artificial Intelligence (IJCAI 2025), article no. 1066

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09818 2026-01-08 cs.CV 67%

ViMoNet: A Multimodal Vision-Language Framework for Human Behavior Understanding from Motion and Video

ViMoNet: 一种多模态视觉-语言框架,用于从运动和视频中理解人类行为

Rajan Das Gupta, Lei Wei, Md Yeasin Rahat, Nafiz Fahad, Abir Ahmed, Liew Tze Hui

机构 * Department of Computer Science, American International University–Bangladesh (AIUB)(美国国际大学-孟加拉国计算机科学系) Faculty of Psychology, Shinawatra University(信武大学心理学系) Faculty of Information Science and Technology, Multimedia University(多媒体大学信息科学与技术系) Department of Information Technology, Washington University of Science & Technology(华盛顿科学与技术大学信息科技系)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 ViMoNet通过整合运动和视频数据,提出多模态视觉-语言框架,有效提升人类行为理解与医疗保健应用潜力。

Comments This is the preprint version of the manuscript. It is currently being prepared for submission to an academic conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04137 2026-01-08 cs.RO cs.AI cs.CV 57%

Wow, wo, val! A Comprehensive Embodied World Model Evaluation Turing Test

哇,哇,val!一个综合的具身世界模型评估图灵测试

Chun-Kai Fan, Xiaowei Chi, Xiaozhu Ju, Hao Li, Yong Bao, Yu-Kai Wang, Lizhang Chen, Zhiyuan Jiang, Kuangzhi Ge, Ying Li, Weishi Mi, Qingpo Wuwu, Peidong Jia, Yulin Luo, Kevin Zhang, Zhiyuan Qin, Yong Dai, Sirui Han, Yike Guo, Shanghang Zhang, Jian Tang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文提出Wow-wo-val基准测试,评估视频基础模型在具身人工智能中的生成能力,发现其在长期规划和物理一致性上表现有限,揭示了现实世界与生成视频之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03698 2026-01-08 cs.CL 57%

Evaluation Framework for AI Creativity: A Case Study Based on Story Generation

人工智能创造力评估框架:基于故事生成的案例研究

Pharath Sathya, Yin Jou Huang, Fei Cheng

机构 * Graduate School of Informatics(信息科学研究生院) Kyoto University(京都大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 本文提出了一种评估AI故事生成创造力的框架,通过实验发现创造力评估是分层而非累积的,且反思性评估能显著影响评分和一致性。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03670 2026-01-08 cs.CL 57%

DisastQA: A Comprehensive Benchmark for Evaluating Question Answering in Disaster Management

DisastQA:一个评估灾难管理中问答能力的综合性基准

Zhitong Chen, Kai Yin, Xiangjue Dong, Chengkai Liu, Xiangpeng Li, Yiming Xiao, Bo Li, Junwei Ma, Ali Mostafavi, James Caverlee

机构 * Texas A&M University(德克萨斯大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 DisastQA是一个用于评估灾难管理中问答能力的综合性基准,通过严格验证的问题和人类-LLM协作流程,揭示了在噪声环境下模型性能的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03435 2026-01-08 cs.CL 57%

The Critical Role of Aspects in Measuring Document Similarity

在测量文档相似性中的方面作用的至关重要性

Eftekhar Hossain, Tarnika Hazra, Ahatesham Bhuiyan, Santu Karmaker

机构 * Department of Computer Science University of Central Florida(佛罗里达大学中央分校计算机科学系)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 ASPECTSIM通过显式考虑方面来提高文档相似性测量的人类-机器一致性,尽管在小型开源模型上效果有限,但仍展示了改进的方向。

Comments 24 Pages, 10 Figures, 10 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03959 2026-01-08 cs.CV 50%

FUSION: Full-Body Unified Motion Prior for Body and Hands via Diffusion

FUSION: 全身统一运动先验用于身体和手部的扩散模型

Enes Duran, Nikos Athanasiou, Muhammed Kocabas, Michael J. Black, Omid Taheri

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Tübingen(图宾根大学) Meshcapade GmbH(Meshcapade公司)

专题命中 评测与基准 :LLM(abstract)

AI总结 FUSION提出首个基于扩散的全身运动先验模型,联合建模身体和手部运动,实现更自然的运动生成和多样化应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03956 2026-01-08 cs.RO 50%

CoINS: Counterfactual Interactive Navigation via Skill-Aware VLM

基于技能感知的反事实交互导航:通过技能感知视觉语言模型

Kangjie Zhou, Zhejia Wen, Zhiyong Zhuo, Zike Yan, Pengying Wu, Ieng Hou U, Shuaiyang Li, Han Gao, Kang Ding, Wenhan Cao, Wei Pan, Chang Liu

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系) College of Design and Engineering, National University Of Singapore(新加坡国立大学设计与工程学院) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系)

专题命中 评测与基准 :language model(abstract)

AI总结 CoINS通过整合技能感知推理与稳健执行,提升机器人在复杂环境中的交互导航能力。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03736 2026-01-08 cs.CV 50%

HyperCOD: The First Challenging Benchmark and Baseline for Hyperspectral Camouflaged Object Detection

HyperCOD:首个具有挑战性的基准和基线用于超光谱伪装物体检测

Shuyan Bai, Tingfa Xu, Peifu Liu, Yuhao Qiu, Huiyan Bai, Huan Chen, Yanyan Peng, Jianan Li

专题命中 评测与基准 :foundation model(abstract)

AI总结 HyperCOD是首个针对超光谱伪装物体检测的挑战性基准,提出HSC-SAM方法,通过分解超光谱图像以提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03303 2026-01-08 cs.CR 50%

Autonomous Threat Detection and Response in Cloud Security: A Comprehensive Survey of AI-Driven Strategies

云安全中的自主威胁检测与响应:基于AI驱动策略的全面综述

Gaurav Sarraf, Vibhor Pal

专题命中 评测与基准 :language model(abstract)

AI总结 本文综述了基于AI驱动策略的云安全威胁检测与响应方法,探讨了AI在提升安全性和自动化防护中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 29 篇

2601.02232 2026-01-08 cs.LG 89%

ELLA: Efficient Lifelong Learning for Adapters in Large Language Models

ELLA:为大语言模型适配器实现高效的终身学习

Shristi Das Biswas, Yue Zhang, Anwesan Pal, Radhika Bhargava, Kaushik Roy

机构 * Purdue University(普渡大学) AWS(亚马逊公司) AWS AI Labs(亚马逊人工智能实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 ELLA通过选择性子空间去相关原理,实现高效终身学习,无需数据重放或架构扩展,显著提升连续学习性能和零样本泛化能力。

Comments Accepted at EACL (Main Conference) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03274 2026-01-08 cs.CL cs.AI 86%

LLM_annotate: A Python package for annotating and analyzing fiction characters

LLM_annotate: 一个用于标注和分析小说人物的Python包

Hannes Rosenbusch

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LLM_annotate是一个基于大语言模型的Python工具,用于高效、可重复地分析小说人物性格,支持多种LLM并提供交互式GUI验证

详情

展开后加载摘要…

URL PDF HTML 收藏