arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32207 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32207 篇

2605.07395 2026-05-11 cs.LG cs.AI cs.CL 90%

Unsolvability Ceiling in Multi-LLM Routing: An Empirical Study of Evaluation Artifacts

多LLM路由中的不可解上限:评估 artifacts 的实证研究

Saloni Garg, Amit Sagtani

机构 * Independent Researcher(独立研究者) San Francisco State University(圣弗朗西斯科州立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过206000个查询-模型对研究多级LLM路由,发现大量不可解问题源于评估 artifacts,如判断偏差、截断和格式不匹配,并提出改进方法以减少不可解性。

Comments 12 pages, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06486 2026-05-08 cs.CR 90%

Autonomous Adversary: Red-Teaming in the age of LLM

自主对抗者:在LLM时代进行红队测试

Mohammad Mamun, Mohamed Gaber, Scott Buffett, Sherif Saad

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract)

AI总结 本文探讨了语言模型代理在红队操作中的应用,通过MITRE ATT&CK框架分析其与核心进攻功能的交集,并评估LLM代理在治理和现实评估中的优缺点。研究通过两个横向移动场景对比三种操作模式,发现专家定义的行动计划任务完成率最高,但所有模式均存在频繁失败问题。

Comments Accepted at ACISP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22417 2026-04-27 cs.CY 90%

Trust as a Situated User State in Social LLM-Based Chatbots: A Longitudinal Study of Snapchat's My AI

信任作为社交LLM聊天机器人中的情境用户状态:对Snapchat My AI的纵向研究

Annie Landerberg, Kari Flatmo, Alan Said

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究探讨了用户在社交LLM聊天机器人中信任的形成机制,发现信任受感知能力、对话行为、人类相似性、透明度、隐私担忧及主机平台信任等因素影响,强调信任是动态变化的交互过程。

Comments Accepted to 34th ACM International Conference on User Modeling, Adaptation and Personalization (UMAP'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18835 2026-04-22 cs.CL cs.AI cs.LG 90%

Semantic Needles in Document Haystacks: Sensitivity Testing of LLM-as-a-Judge Similarity Scoring

语义针在文档 haystack 中:LLM-as-a-Judge 的相似性评分敏感性测试

Sinan G. Aksoy, Alexandra A. Sabrio, Erik VonKaenel, Lee Burke

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) Washington University in St. Louis(华盛顿大学圣路易斯分校) Humana Inc.(Humana公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一个可扩展的多因素实验框架,系统探讨LLM对文档配对中细微语义变化的敏感性。通过针在 haystack 中的类比,测试不同扰动类型、上下文类型、针位置和文档长度对五种LLM相似性评分的影响,揭示LLM在文档内位置偏倚、上下文相关性对评分的影响及模型间的评分分布差异。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15588 2026-04-20 cs.CL cs.AI cs.HC cs.LG 90%

"Excuse me, may I say something..." CoLabScience, A Proactive AI Assistant for Biomedical Discovery and LLM-Expert Collaborations

请问,我可以发言吗... CoLabScience,一种用于生物医学发现和LLM专家协作的主动AI助手

Yang Wu, Jinhong Yu, Jingwei Xiong, Zhimin Tao, Xiaozhong Liu

机构 * Worcester Polytechnic Institute(沃斯特理工大学) University of California, Davis(加州大学戴维斯分校) Jiangsu University(江苏大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CoLabScience,一种主动AI助手,通过及时的上下文感知干预提升生物医学领域AI与人类专家的协作效率,PULI框架在流式科学讨论中实现精准干预,实验表明其在干预精度和协作任务实用性上优于现有基线。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15302 2026-04-17 cs.AI cs.CL cs.LG 90%

Diagnosing LLM Judge Reliability: Conformal Prediction Sets and Transitivity Violations

LLM评判可靠性诊断:符合预测集与传递性违反

Manan Gupta, Dhruv Kumar

机构 * BITS Pilani, Pilani Campus, India(比斯理工学院,帕利尼校区,印度)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SummEval中诊断LLM评判可靠性的双管工具,通过传递性分析和分割符合预测集揭示文档不一致性及评判可靠性,发现相关性比其他标准更可靠。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13145 2025-11-03 cs.SD 90%

UTI-LLM: A Personalized Articulatory-Speech Therapy Assistance System Based on Multimodal Large Language Model

Yudong Yang, Xiaokang Liu, Shaofeng zhao, Rongfeng Su, Nan Yan, Lan Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, China(深圳先进技术研究院,中国科学院,中国) Key Laboratory of Biomedical Imaging Science and System, Chinese Academy of Sciences, China(生物医学成像科学与系统重点实验室,中国科学院,中国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10409 2024-02-19 cs.CL cs.AI cs.IR cs.LG 90%

Understanding Survey Paper Taxonomy about Large Language Models via Graph Representation Learning

Jun Zhuang, Casey Kennington

专题命中 评测与基准 :language model(title,abstract);large language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI、cs.LG

Comments TL;DR: We collected metadata about LLM surveys and developed a method for categorizing them into a taxonomy, indicating the superiority of graph representation learning over language models and revealing the efficacy of fine-tuning using weak labels

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03422 2023-06-07 cs.CV 90%

Prompting Large Language Models to Reformulate Queries for Moment Localization

Wenfeng Yan, Shaoxiang Chen, Zuxuan Wu, Yu-Gang Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title)

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14551 2026-08-18 cs.CL cs.DL cs.IR cs.LG 新提交 90%

Auxiliary uncertainty signals for LLM-assisted systematic review screening: a benchmark across eight Cohen drug-class reviews

用于大语言模型辅助系统评价筛选的辅助不确定性信号:八项Cohen药物分类综述的基准测试

Arya Rahgozar, Pouria Mortezaagha

机构 * University of Ottawa(渥太华大学) Ottawa Hospital Research Institute(渥太华医院研究所)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对LLM辅助系统评价筛选的不确定性问题,提出BERT+GCN辅助分类器的不确定性信号,在8个Cohen药物分类数据集上验证了提示策略的效率,发现仅弃权路由为帕累托最优且LLM无法自我分类。

Comments 27 pages, 7 figures, 10 tables. Code, prompts, and cached LLM responses at https://github.com/rahgoar/LR-Spectral-BERTGCN-Topological-Undecidability-in-Clinical-AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08467 2026-08-11 cs.AI cs.CL cs.IR 新提交 90%

LLM within MCP Matters: Measuring Inefficient Resource Utilization Driven by LLMs

MCP中的大语言模型很重要:测量由大语言模型驱动的低效资源利用

Minhan Cho, Soyoung Park, Kihyeon Jeong, Byeongkyu Jeon, Daejin Choi, Jinyoung Han

机构 * Sungkyunkwan University(成均馆大学) National Assembly Research Service(国会研究服务处) AlphaBridge(阿尔法桥公司) Ewha Womans University(梨花女子大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对24个LLM开展54000次试验,发现MCP中服务器嵌入的参考数据会因LLM偏好导致低效资源利用,提出需将服务器指令置于客户端LLM工具选择之前的改进方向。

Comments 4 pages, 1 table. Accepted at the AgentSearch Workshop at SIGIR 2026, Melbourne, Australia (non-archival). Code and data: https://github.com/rabqatab/llm-in-mcp-matters

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22025 2026-06-11 cs.CL cs.AI cs.IR cs.SE 版本更新 90%

When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications

当通用提示改进有害:LLM应用的评估驱动迭代

Daniel Commey

机构 * Daniel Commey

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出最小可行评估套件(MVES),通过结构化评估框架和本地复现实验,发现通用提示添加并非单调改进,强调评估驱动的提示迭代。

Comments Technical report. 42 pages, 3 figures. Code, test suites, and result logs: https://github.com/dcommey/llm-eval-benchmarking

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04505 2026-05-28 cs.AI cs.CL cs.SY eess.SY 90%

CircuitLM: A Multi-Agent LLM-Aided Design Framework for Generating Circuit Schematics from Natural Language Prompts

CircuitLM: 一种基于多智能体的大语言模型辅助设计框架,用于从自然语言提示生成电路原理图

Khandakar Shakib Al Hasan, Syed Rifat Raiyan, Hasin Mahtab Alvee, Wahid Sadik

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Department of Electrical and Electronic Engineering(电气与电子工程系) Islamic University of Technology(伊斯兰技术大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出CircuitLM多智能体流水线,通过嵌入驱动的组件知识库和五阶段流程,将自然语言提示转化为结构化的CircuitJSON原理图,并采用确定性电气规则检查和LLM作为评判的元评估器双重验证,解决大语言模型在电路设计中的幻觉和物理约束问题。

Comments Accepted at the 2026 IEEE International Conference on LLM-Aided Design (ICLAD), 10 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17076 2026-05-25 cs.LG cs.AI cs.DC cs.MA 90%

S-Bus: Automatic Read-Set Reconstruction for Multi-Agent LLM State Coordination

S-Bus: 多智能体LLM状态协调的自动读集重建

Sajjad Khan

机构 * Sajjad Khan

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出S-Bus中间件,通过服务端DeliveryLog机制在提交时从HTTP GET流量中重建每个智能体的读集,实现可观测读隔离(ORI)一致性,防止专用分片拓扑中的结构性竞态条件,并通过形式化证明和实验验证其安全性。

Comments v2: LLM judge validated against human annotator (Zahid Hussain, Mindgigs Peshawar) on PH-3 at strict kappa=0.93 (n=93, 96.8% agreement); over-claim refined to 32% (LLM) / 49% (human). Adds Exp.PG-Comparison Rust-Native and Workload-B chi2=1094.98. 24 pages, 23 tables. Annotation data attached as arXiv ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10034 2024-05-30 cs.NE cs.AI cs.CL 90%

Evolutionary Computation in the Era of Large Language Model: Survey and Roadmap

Xingyu Wu, Sheng-hao Wu, Jibin Wu, Liang Feng, Kay Chen Tan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI

Comments evolutionary algorithm (EA), large language model (LLM), optimization problem, prompt engineering, algorithm generation, neural architecture search

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19208 2026-08-21 cs.CL cs.CV 新提交 90%

When Irrelevant Text Matters: Affine Margin Shifts in Multimodal Large Language Models

当无关文本起作用时:多模态大语言模型中的仿射间隔偏移

Yinfeng Wang, Zhiyuan Yao, Zheren Fu, Lei Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文研究多模态大语言模型(MLLMs)中任务无关文本对视觉判断任务的影响,发现其会使模型决策间隔发生可预测的仿射变换,为提升模型对噪声上下文的鲁棒性提供了诊断基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16893 2026-08-19 cs.CY cs.AI 新提交 90%

A Framework for Using and Evaluating LLMs as Surrogate Experts in Security Surveys: Reliability, Bias, and Implications

在安全调查中使用和评估大语言模型(LLM)作为代理专家的框架:可靠性、偏差及启示

Despoina Giarimpampa, Roland Meier, Tegawendé F. Bissyandé, Vincent Lenders, Jacques Klein

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究提出了评估LLM作为安全调查代理专家的框架,发现LLM虽内部一致但与专家响应存在系统性偏差,可用于试点和假设生成但不能替代专家征询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15145 2026-08-18 cs.AI 新提交 90%

ACTS-SQL: Agentic and Critic-Oriented Tree-Structured SQL Correctness with Large Language Models

ACTS-SQL:基于大型语言模型的面向智能体与评判器的树结构化SQL正确性校验

Xinmei Huang, Jie Song, Peng Li, Fuxin Jiang, Jing Zhang, Tieying Zhang, Jianjun Chen, Chenming Liu, Tao Yang, Maoyin Liu, Wenda Li, Hong Chen, Cuiping Li

机构 * Renmin University of China(中国人民大学) ByteDance Inc.(字节跳动公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出无训练框架ACTS-SQL,将SQL修正建模为计划引导的树结构化调试过程,集成执行校验与诊断工具,在BIRD-Critic基准及火山引擎TLS生产环境中均实现显著准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22456 2026-08-18 cs.SE cs.AI 版本更新 90%

Automating the Detection of Requirement Dependencies Using Large Language Models

利用大语言模型自动化检测需求依赖

Ikram Darif, Feifei Niu, Manel Abdellatif, Lionel C. Briand, Ramesh S., Arun Adiththan

机构 * University of Ottawa(渥太华大学) École de technologie supérieure(超技术学院) Research Ireland Lero Centre for Software Research(爱尔兰Lero软件研究中心) University of Limerick(利默里克大学) General Motors(通用汽车公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出LEREDD,一种基于大语言模型的自动化需求依赖检测方法,利用RAG和ICL技术,实现高准确率的依赖分类和细粒度依赖检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14179 2026-08-17 cs.AI 新提交 90%

Can Language Models Understand mmWave Data? Benchmarking Large Language Models for mmWave Radar-Based Human Understanding

语言模型能否理解毫米波数据?基于毫米波雷达的人类理解任务对大语言模型进行基准测试

Jeongwan Shin, Jaehyeon Kim, Donguk Ko, Jaeho Choi

机构 * DGIST(大邱庆北科学技术院) KAIST(韩国科学技术院) InnoCORE LLM

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对毫米波数据与大语言模型融合的研究空白,构建首个毫米波人类感知基准mmWave-QA,评估LLMs在该任务上的零样本推理潜力与视觉退化下的鲁棒性,为相关研究奠定基础。

Comments Accepted to CVPR 2026 Findings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05246 2026-08-17 cs.AI 版本更新 90%

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs

LUNAR:基于通用用户行为日志的个性化大语言模型基准测试

Jiahao Zhang, Yongzhi Tong, Zelin Fu, Pengde Zhao, Yanmei Jiang, Feng Jiang, Min Yang

机构 * Shenzhen University of Advanced Technology(深圳理工大学) Ant Group(蚂蚁集团)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 该研究推出首个基于衣食住行等通用领域用户行为日志的LUNAR基准,经实验揭示LLM个性化的关键影响因素,为个性化LLM的发展指明了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13129 2026-08-14 cs.AI 新提交 90%

Numeracy in Large Language Models: Fundamental Limitations and Paths to Improvement

大型语言模型中的数字能力:基本局限与改进路径

Aoxin Ni

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);pretraining(abstract)

AI总结 本研究针对LLMs在基础数值任务中的不可靠性,提出数值基础框架(NGF)并结合三大基准评估前沿模型,给出改进数值能力的部署建议与研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00048 2026-08-14 cs.CY cs.AI 版本更新 90%

MOSAIC: Unveiling the Moral, Social and Individual Dimensions of Large Language Models

MOSAIC:揭示大型语言模型的道德、社会和个体维度

Erica Coppolillo, Emilio Ferrara

机构 * University of Southern California(南加州大学) University of Calabria and ICAR-CNR(卡利亚里大学和ICAR-CNR) Thomas Lord Department of Computer Science(托马斯·劳德计算机科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 MOSAIC首次提出评估大型语言模型道德、社会和个体维度的综合基准测试,通过九个问卷和四个游戏全面考察伦理推理能力,揭示MFT的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07762 2026-08-11 cs.AI cs.CR 新提交 90%

Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation

谁来验证基准?去中心化大语言模型评估中的信任问题

Sahil Pardasani, Madhusudan Singh

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 针对LLM基准测试的信任问题,该研究分析7种验证模型的身份感知偏差,提出基于区块链的提交-披露协议以实现去中心化、可验证的LLM评估。

Comments Accepted to International Conference on Quantum Enhanced AI and Secure Computing (QASC2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06955 2026-08-10 cs.AI cs.CY 新提交 90%

Critical Acclaim Orientation in Large Language Models: Evidence from Film Preference Elicitation

大语言模型中的评论赞誉导向:来自电影偏好诱导的证据

Jonghyun Jee, Aaron Shaw

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究以8种大语言模型为对象,通过200部电影的基准测试,发现模型普遍呈现评论赞誉导向,该导向随模型规模增强,且提示框架会影响评价排名。

Comments 12 pages, 2 figures, accepted to AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17359 2026-08-07 cs.CY cs.AI 版本更新 90%

Plausible Patients, Impossible Populations: Auditing Epidemiological Fidelity in Large Language Model Mental Health Simulations

PsychBench: 对大型语言模型心理健康模拟中的流行病学真实性进行审计

Patrick Keough

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(title);分类 cs.AI

AI总结 本文通过PsychBench对LLM患者模拟进行流行病学审计,发现模型在临床合理性与人口代表性之间存在不一致,揭示了模型在不同群体中的偏差问题。

Comments v2: substantially revised and retitled; withdraws the variance-compression and transgender-suppression results and adds a pre-registered decoding control. 21 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04015 2026-08-06 cs.CL 新提交 90%

Transfer Learning for Named Entity Recognition of Classical Latin through LLM Prompting

通过大语言模型提示学习实现古典拉丁语命名实体识别的迁移学习

Callum Chan

机构 * University of Ottawa(渥太华大学)

专题命中 评测与基准 :LLM(title,abstract);prompting(title);large language model(abstract);language model(abstract)

AI总结 本文介绍渥太华大学团队通过对gemini-2.5-pro和claude-sonnet-4-5进行提示工程,利用跨语言迁移学习完成古典拉丁语NER任务,在EvaLatin 2026的两个NER子任务中均获第一。

Journal ref EvaLatin (LT4HALA@LREC), ELRA, May 2026, Palma De Majorque, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02915 2026-08-05 cs.AR cs.CL cs.SE 新提交 90%

LACE: Large Language Model Aided Multi-Agent Framework for Agile RISC-V Instruction Extension

LACE:用于敏捷RISC-V指令扩展的大语言模型辅助多智能体框架

Pingqing Zheng, Jiayin Qin, Fuqi Zhang, Zishen Wan, Shang Wu, Yu Cao, Caiwen Ding, Yang Katie Zhao

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL

AI总结 针对RISC-V指令扩展实现验证缓慢碎片化问题,提出LLM辅助多智能体框架LACE,可提升指令生成准确率并减少集成返工。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02409 2026-08-04 cs.AI cs.CY 新提交 90%

MonitrLLM: A Community-Centered Evaluation Infrastructure for Large Language Models

MonitrLLM:面向大型语言模型的社区中心评估基础设施

Victor Ojewale, Ro Encarnación, Suresh Venkatasubramanian, Danaé Metaxa

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 本研究提出开源LLM评估基础设施MonitrLLM,将对话记录、用户任务意图与结果关联,试点显示多轮对话失败率为单轮2.5倍,为LLM评估提供新方法。

Comments Accepted to AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01849 2026-08-04 cs.AI 新提交 90%

Exploring and Bridging Knowledge Holes in Unlearned Multimodal Large Language Models

探索与弥合未学习多模态大语言模型中的知识缺口

Junxiang You, Junkai Chen, Yuhao He, Ruiqi Liu, Zhetao Guo, Shu Wu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对未学习多模态大语言模型存在的知识缺口问题,提出带锚定正则化的选择性保护方法,在保障未学习安全性的同时大幅恢复模型响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏