arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-08 至 2026-01-08 共收录 61 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 61 篇

2601.03265 2026-01-08 cs.CL cs.CR cs.LG 90%

Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models

Jailbreak-Zero:大型语言模型安全评估的帕累托最优渗透测试路径

Kai Hu, Abhinav Aggarwal, Mehran Khodabandeh, David Zhang, Eric Hsin, Li Chen, Ankit Jain, Matt Fredrikson, Akash Bharadwaj

机构 * Meta Superintelligence Labs(Meta超智能实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 Jailbreak-Zero通过生成多样化对抗性提示并微调攻击模型,实现了LLM安全评估的帕累托最优,提高了攻击成功率并减少了人工干预需求。

Comments Socially Responsible and Trustworthy Foundation Models at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04034 2026-01-08 cs.CR cs.AI 89%

HoneyTrap: Deceiving Large Language Model Attackers to Honeypot Traps with Resilient Multi-Agent Defense

HoneyTrap: 通过坚韧的多智能体防御欺骗大语言模型攻击者以诱捕陷阱

Siyuan Li, Xi Lin, Jun Wu, Zehao Liu, Haoyu Li, Tianjie Ju, Xiang Chen, Jianhua Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 HoneyTrap通过多智能体协作防御机制,有效降低大语言模型劫持攻击的成功率,提升防御效率与资源消耗效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03023 2026-01-08 cs.CL cs.HC 89%

MedDialogRubrics: A Comprehensive Benchmark and Evaluation Framework for Multi-turn Medical Consultations in Large Language Models

MedDialogRubrics: 一种用于大型语言模型多轮医疗咨询的综合基准和评估框架

Lecheng Gong, Weimin Fang, Ting Yang, Dongjie Tao, Chunxiao Guo, Peng Wei, Bo Xie, Jinqun Guan, Zixiao Chen, Fang Shi, Jinjie Gu, Junwei Liu

机构 * Ant Group(蚂蚁集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 MedDialogRubrics提出了一种用于评估大型语言模型多轮医疗对话能力的综合基准和评估框架,通过合成患者案例和细粒度评估 rubrics,揭示了当前模型在医疗对话管理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05319 2026-01-08 cs.CV cs.CR 89%

$\mathbf{S^2LM}$: Towards Semantic Steganography via Large Language Models

$S^2LM$:通过大语言模型实现语义隐写术

Huanqi Wu, Huangbiao Xu, Runfeng Xie, Jiaxin Cai, Kaixin Zhang, Xiao Ke

机构 * College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院) College of Computer Science, Beijing University of Technology(北京理工大学计算机科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 S^2LM通过大语言模型实现语义隐写术,能够将任意句级信息嵌入图像并实现恢复。

Comments 30 Pages, 24 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12460 2026-01-08 cs.CL cs.AI 88%

Exploring Iterative Controllable Summarization with Large Language Models

探索基于大语言模型的可控制摘要方法

Sangwon Ryu, Heejin Do, Daehee Kim, Hwanjo Yu, Dongwoo Kim, Yunsu Kim, Gary Geunbae Lee, Jungseul Ok

机构 * GSAI, POSTECH(POSTECH 人工智能研究所) CSE, POSTECH(POSTECH 计算科学与工程系) ETH AI Center(苏黎世联邦理工学院人工智能中心) AI future lab, KT(KT 人工智能未来实验室) LILT(LILT 研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出GTE框架,通过迭代优化提升大语言模型在可控摘要任务中的性能,有效解决属性控制难题。

Comments EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03578 2026-01-08 cs.CL 88%

PsychEthicsBench: Evaluating Large Language Models Against Australian Mental Health Ethics

PsychEthicsBench: 评估大型语言模型在澳大利亚心理健康伦理中的表现

Yaling Shen, Stephanie Fong, Yiwen Jiang, Zimu Wang, Feilong Tang, Qingyang Xu, Xiangyu Zhao, Zhongxing Xu, Jiahe Liu, Jinpeng Hu, Dominic Dwyer, Zongyuan Ge

机构 * Monash University(墨尔本大学) University of Liverpool(利物浦大学) Hefei University of Technology(合肥工业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 PsychEthicsBench通过多选和开放式任务评估LLMs在心理健康伦理方面的表现,揭示拒绝率作为伦理指标的不足,并指出领域微调可能损害伦理鲁棒性。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17118 2026-01-08 cs.CL 88%

After Retrieval, Before Generation: Enhancing the Trustworthiness of Large Language Models in Retrieval-Augmented Generation

检索后,生成前:增强检索增强生成中大型语言模型的可信度

Xinbang Dai, Huikang Hu, Yuncheng Hua, Jiaqi Li, Yongrui Chen, Rihui Jin, Nan Hu, Guilin Qi

机构 * Southeast University(东南大学) University of New South Wales(新南威尔士大学) Noah’s Ark Lab(诺亚实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 BRIDGE框架通过动态确定响应策略,提升检索增强生成中大型语言模型的可信度,实验显示其在准确性上优于基线方法。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03432 2026-01-08 cs.SE 88%

CodeEval: A pedagogical approach for targeted evaluation of code-trained Large Language Models

CodeEval: 一种面向代码训练大语言模型的教育性评估方法

Danny Brahman, Mohammad Mahoor

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 CodeEval通过多维基准数据集和开源执行框架,针对代码训练大语言模型的评估与改进提供教育性方法。

Comments Accepted at the International Joint Conference on Natural Language Processing & Asia-Pacific Chapter of the Association for Computational Linguistics, 2025. Will be published at ACL anthology

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02757 2026-01-08 cs.AI 87%

LLM Agent Framework for Intelligent Change Analysis in Urban Environment using Remote Sensing Imagery

基于遥感影像的城市环境智能变化分析LLM代理框架

Zixuan Xiao, Jun Ma

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出基于LLM和视觉基础模型的ChangeGPT框架,通过分层结构提升变化检测的智能与适应性,实现在城市环境中的高效变化分析。

Journal ref Automation in Construction 177 (2025) 106341

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03444 2026-01-08 cs.CL cs.AI cs.HC 86%

Grading Scale Impact on LLM-as-a-Judge: Human-LLM Alignment Is Highest on 0-5 Grading Scale

评分尺度对LLM作为裁判的影响:人类与LLM的对齐在0-5评分尺度上最高

Weiyue Li, Minda Zhao, Weixuan Dong, Jiahui Cai, Yuze Wei, Michael Pocress, Yi Li, Wanyan Yuan, Xiaoyue Wang, Ruoyu Hou, Kaiyuan Lou, Wenqi Zeng, Yutong Yang, Yilun Du, Mengyu Wang

机构 * Harvard University(哈佛大学) CMU(卡内基梅隆大学) Stanford University(斯坦福大学) UC San Diego(圣地亚哥大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了评分尺度对LLM作为裁判一致性的影响,发现0-5评分尺度在人类与LLM之间产生最强的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03276 2026-01-08 cs.CL cs.AI 86%

Topic Segmentation Using Generative Language Models

使用生成语言模型进行主题分割

Pierre Mackenzie, Maya Shah, Patrick Frenett

机构 * Adarga(阿达格) University of Edinburgh(爱丁堡大学) University of Exeter(埃克塞特大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于生成语言模型的重叠递归提示策略,用于提升主题分割效果,但指出仍需进一步解决相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12227 2026-01-08 cs.LG cs.AI stat.ML 86%

Uncovering Bias Paths with LLM-guided Causal Discovery: An Active Learning and Dynamic Scoring Approach

通过LLM引导的因果发现揭示偏见路径:一种主动学习和动态评分方法

Khadija Zanna, Akane Sano

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种结合LLM引导的主动学习和动态评分方法,用于在存在噪声和混杂因素时发现公平性相关的因果路径。

Comments To be presented at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00224 2026-01-08 cs.CL cs.SE 85%

Talk Less, Verify More: Improving LLM Assistants with Semantic Checks and Execution Feedback

少说多查:通过语义检查和执行反馈改进LLM助手

Yan Sun, Ming Cai, Stanley Kok

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Q*和Feedback+两种验证技术,通过语义检查和执行反馈提升LLM助手的输出准确性与可靠性。

Comments WITS 2025 (Workshop on Information Technologies and Systems 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03359 2026-01-08 cs.AI 85%

Enhancing LLM Instruction Following: An Evaluation-Driven Multi-Agentic Workflow for Prompt Instructions Optimization

增强大语言模型指令遵循:一种以评估为导向的多智能体工作流用于提示指令优化

Alberto Purpura, Li Wang, Sahil Badyal, Eugenio Beaufrand, Adam Faulkner

机构 * Card Intelligence, Capital One(卡德智能,Capital One)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种多智能体工作流,通过评估驱动的方法优化提示指令,提升大语言模型对约束条件的遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20278 2026-01-08 cs.CL 85%

Quantifying LLM Biases Across Instruction Boundary in Mixed Question Forms

量化混合问题形式中跨指令边界的LLM偏见

Zipeng Ling, Shuliang Liu, Yuehao Tang, Chen Huang, Gaoyang Jiang, Shenghong Fu, Junqi Yang, Yao Wan, Jiawan Zhang, Kejia Huang, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Pennsylvania(宾夕法尼亚大学) Huazhong University of Science and Technology(华中科技大学) Hong Kong Polytechnic University(香港理工大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出BiasDetector基准,用于评估LLM在混合问题形式数据集下对稀疏标签混合的识别能力,揭示用户指令对LLM偏见的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03328 2026-01-08 cs.MA 85%

LLM-Enabled Multi-Agent Systems: Empirical Evaluation and Insights into Emerging Design Patterns & Paradigms

基于大语言模型的多智能体系统:对新兴设计模式与范式的实证评估与洞察

Harri Renney, Maxim N Nethercott, Nathan Renney, Peter Hayes

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过实证评估,探讨了基于大语言模型的多智能体系统在不同领域中的应用效果,揭示了新兴设计模式与范式的优劣及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04025 2026-01-08 cs.CL cs.CY 84%

Simulated Students in Tutoring Dialogues: Substance or Illusion?

辅导对话中的模拟学生:实质还是幻象?

Alexander Scarlatos, Jaewook Lee, Simon Woodhead, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Eedi

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文定义了学生模拟任务,提出涵盖语言、行为和认知的评估指标,并通过实验表明模拟学生的方法存在局限性,需进一步研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03986 2026-01-08 cs.CL 83%

Benchmark^2: Systematic Evaluation of LLM Benchmarks

Benchmark^2: 大语言模型评估基准的系统性评估

Qi Qian, Chengsong Huang, Jingwen Xu, Changze Lv, Muling Wu, Wenhao Liu, Xiaohua Wang, Zhenghua Wang, Zisu Huang, Muzhao Tian, Jianhan Xu, Kun Hu, He-Da Wang, Yao Hu, Xuanjing Huang, Xiaoqing Zheng

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Washington University in St. Louis(华盛顿大学圣路易斯分校) Xiaohongshu Inc.(小红书公司)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Benchmark^2 提出了一种系统性评估大语言模型评估基准的方法,通过三个互补指标分析基准质量,揭示现有基准的差异并展示选择性构建的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03531 2026-01-08 cs.CL 83%

PALM-Bench: A Comprehensive Benchmark for Personalized Audio-Language Models

PALM-Bench: 一个全面的个性化音频-语言模型基准测试

Yuwen Wang, Xinyuan Qian, Tian-Hao Zhang, Jiaran Gao, Yuchen Pan, Xin Wang, Zhou Pan, Chen Wei, Yiming Wang

机构 * University of Science and Technology Beijing(北京科技大学) Li Auto(利汽车) Fondazione Bruno Kessler(布鲁诺·克塞尔基金会)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 PALM-Bench旨在通过构建首个个性化音频-语言模型基准测试,促进个性化模型在多说话者场景中的方法发展和评估。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03268 2026-01-08 cs.CL cs.LG 82%

WRAVAL -- WRiting Assist eVALuation

WRAVAL -- 书写辅助评估

Gabriel Benedict, Matthew Butler, Naved Merchant, Eetu Salama-Laine

机构 * Amazon Fire Tablets(亚马逊火平板) Amazon Devices Product(亚马逊设备产品部) Amazon Devices OS(亚马逊设备操作系统部)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 WRAVAL提出了一种评估框架,用于评估小型语言模型在非推理任务中的能力,特别是在缺乏预定义数据集的情况下,通过任务特定微调展示其潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03915 2026-01-08 cs.CV 82%

HemBLIP: A Vision-Language Model for Interpretable Leukemia Cell Morphology Analysis

HemBLIP:一种用于可解释性白血病细胞形态分析的视觉-语言模型

Julie van Logtestijn, Petru Manescu

机构 * Department of Computer Science, University College London, United Kingdom(计算机科学系,伦敦大学学院,英国)

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract)

AI总结 HemBLIP是一种基于视觉-语言模型的白血病细胞形态分析工具,通过可解释的描述提升诊断透明度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03640 2026-01-08 cs.SE cs.CR 82%

Verbatim Data Transcription Failures in LLM Code Generation: A State-Tracking Stress Test

LLM代码生成中的verbatim数据转录失败:一种状态跟踪压力测试

Mohd Ariful Haque, Kishor Datta Gupta, Mohammad Ashiqur Rahman, Roy George

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract)

AI总结 本文提出了一种最小化的基准测试,用于评估LLM在生成代码时对verbatim数据转录的可靠性,通过精确字符串包含和状态跟踪分析来检测长周期生成失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03534 2026-01-08 cs.CL cs.CV cs.HC cs.LG 81%

Persona-aware and Explainable Bikeability Assessment: A Vision-Language Model Approach

具有人格意识和可解释性的自行车适应性评估:一种视觉-语言模型方法

Yilong Dai, Ziyi Wang, Chenguang Wang, Kexin Zhou, Yiheng Qian, Susu Xu, Xiang Yan

机构 * University of Alabama(阿拉巴马大学) University of Maryland, College Park(马里兰大学学院公园分校) Stony Brook University(石溪大学) University of Florida(佛罗里达大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种视觉-语言模型框架,通过人格意识和可解释性方法评估自行车适应性,解决道路环境复杂性和用户感知异质性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03483 2026-01-08 cs.CL cs.CY cs.LG 81%

CALM: Culturally Self-Aware Language Models

CALM:具有文化自感知能力的语言模型

Lingzhi Shen, Xiaohao Cai, Yunfei Long, Imran Razzak, Guanming Chen, Shoaib Jameel

机构 * University of Southampton(索姆塞特大学) Queen Mary University of London(伦敦女王学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 CALM通过对比学习和专家混合机制,赋予语言模型文化自感知能力,提升其在跨文化任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04066 2026-01-08 cs.CL cs.AI 81%

Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training

超越规模:测量和预测语言模型预训练中知识保留的上限

Changhao Jiang, Ming Zhang, Yifei Cao, Junjie Ye, Xiaoran Fan, Shihan Dou, Zhiheng Xi, Jiajun Sun, Yi Dong, Yujiong Shen, Jingqi Tong, Baoyu Fan, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SMI方法,通过整合知识频率、特异性与模型大小,预测语言模型在封闭书目问答中的准确性,揭示预训练知识保留的上限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18484 2026-01-08 cs.CV cs.CL 79%

PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus

PM4Bench: 通过平行多语言多模态多任务语料库对大型视觉-语言模型进行基准测试

Junyuan Gao, Jiahe Song, Jiang Wu, Runchuan Zhu, Guanlin Shen, Shasha Wang, Xingjian Wei, Haote Yang, Songyang Zhang, Weijia Li, Bin Wang, Dahua Lin, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Sun Yat-Sen University(中山大学) Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 PM4Bench通过平行多语言多模态多任务语料库评估大型视觉-语言模型,揭示跨语言性能差异与OCR能力的关系。

Comments Equal contribution: Junyuan Gao, Jiahe Song, Jiang Wu; Corresponding author: Conghui He

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16925 2026-01-08 cs.CV cs.AI cs.IR cs.MA 79%

V-Agent: An Interactive Video Search System Using Vision-Language Models

V-Agent:一种利用视觉-语言模型的交互式视频搜索系统

SunYoung Park, Jong-Hyeon Lee, Youngjune Kim, Daegyu Sung, Younghyun Yu, Young-rok Cha, Jeongho Ju

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 V-Agent通过多智能体协作和视觉-语言模型提升视频搜索性能,实现多模态交互与零样本性能。

Comments CIKM 2025 MMGENSR Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03812 2026-01-08 cs.CL cs.AI 79%

AI Generated Text Detection

检测人工智能生成的文本

Adilkhan Alikhanov, Aidar Amangeldi, Diar Demeubay, Dilnaz Akhmetzhan, Nurbek Moldakhmetov, Omar Polat, Galymzhan Zharas

机构 * Department of Computer Science(计算机科学系) Nazarbayev University(纳扎尔拜耶夫大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了AI生成文本检测方法,发现基于Transformer的模型在准确率和ROC-AUC上表现更优,强调了语义建模的重要性,并计划通过扩展数据集和优化方法来改进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03553 2026-01-08 cs.CL cs.AI 79%

Evaluating LLMs for Police Decision-Making: A Framework Based on Police Action Scenarios

评估大语言模型用于警务决策:基于警务行动场景的框架

Sangyub Lee, Heedou Kim, Hyeoncheol Kim

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PAS框架,用于评估大语言模型在警务决策中的应用,揭示其在警务任务中的不足,并发布相关数据和模板以促进进一步研究。

Comments This work was accepted at AAAI 2026 social good track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03272 2026-01-08 cs.CL cs.AI 79%

Less is more: Not all samples are effective for evaluation

少即是多:并非所有样本都适合评估

Wentang Song, Jinqiang Li, Kele Huang, Junhui Lin, Shengxiang Wu, Zhongshi Xie

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出无需历史数据的测试集压缩框架,通过微调LLM和任务感知聚类,有效减少冗余样本,降低评估成本90%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏