arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2798 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2608.03636 2026-08-05 cs.NE cs.AI 新提交 90%

MuEvo: LLM-Driven Evolution of Multi-Heuristic Ensemble

MuEvo:大语言模型驱动的多启发式集成演化

Haoze Lv, Ning Lu, Shengcai Liu, Shaofeng Zhang, Ke Tang

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MuEvo框架,结合动态组件管理与LLM驱动协同演化,在四类组合优化领域的实验显示其优于现有LLM-AHD方法,可改进人工设计的优化框架。

Comments 30 pages, 4 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03627 2026-08-05 cs.AI 新提交 90%

Unequal Verdicts: Investigating Gender Bias in LLM-Based Fake News Detection

不等的裁决:研究基于大语言模型的假新闻检测中的性别偏见

Razieh Chalehchaleh, Reza Farahbakhsh, Noel Crespi

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过扩展LIAR基准数据集,评估六个LLM的假新闻检测性能,发现存在性别偏见,影响检测的可靠性与公平性,且数据集已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03591 2026-08-05 cs.CR cs.AI 新提交 90%

DiagChain: A Diagnostic Benchmark for Evaluating LLM Agents on Evidence-Grounded Attack Chain Reconstruction

DiagChain:用于评估大语言模型智能体基于证据的攻击链重构的诊断基准

Xuyang Liu, Yibin Han, Zhenwei Zhang, Kai Chang, Zhiwei Xu, Tian Qiu, Weixian Deng, Jiabao Gao, Xiaolin Peng, Hai Wan, Xibin Zhao

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对LLM智能体攻击链重构基准的不足,提出DiagChain基准与ECRAG方法,经6种LLM评估发现模型在证据整合与排序环节存在瓶颈,为网络安全智能体改进提供了诊断依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03501 2026-08-05 cs.AI 新提交 90%

Can LLM design high-quality experiments? A Comprehensive and Systematic Benchmark on Autonomous Experimental Design

大语言模型(LLM)能否设计高质量实验?一项针对自主实验设计的全面系统基准测试

Zejun Liu, Jian Wu, Ru Peng, Yuliang Ji, Dongyuan Li, Renhe Jiang, Yue Zhang

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究构建SCOPE基准评估LLM的自主实验设计能力,发现多数LLM无法直接设计高质量实验,低层配置存在瓶颈,进而提出OptED工作流缓解该瓶颈。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03239 2026-08-05 cs.CL 新提交 90%

Relational Priors as Convergence Pressure in LLM-Based Multi-Agent Systems

关系先验作为基于大语言模型的多智能体系统中的收敛压力

Ming Shen, Chao Shang, Sadat Shahriar, Devang Kulshreshtha, Yi Zhang, Sandesh Swamy, Yanjun Qi

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究将关系先验注入LLM-MAS提示中,发现其主要起收敛压力作用,正向性提升可促进智能体协调但未必提高准确性,建议按需使用而非默认添加。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02677 2026-08-05 cs.SE cs.AI cs.MA 新提交 90%

When Policies Change Probabilities: Modular Decision-Making for LLM Code Review

当策略改变概率时:用于LLM代码审查的模块化决策

Rasvik Kudum, Max Corbett, Hitansh Paliwal, Romaisa Fatima, Thomas Jiralerspong, Sneheel Sarangi

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究针对LLM代码审查,测试4种审查界面的策略与概率分离情况,提出模块化流水线可提升概率准确性、降低损失,验证了风险与行动分离评估的必要性。

Comments 20 pages, 6 figures; includes technical appendices. Code and data: https://github.com/rasvik/when-policies-change-probabilities

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02024 2026-08-04 cs.AI cs.CY 新提交 90%

EduZone: A Framework for Evaluating LLM Safety for K-12 Students and Teachers

EduZone:面向K-12学生与教师的大语言模型安全评估框架

Junyeong Park, Jieun Han, Haneul Yoo, So-Yeon Ahn, Jinsung Yoon, Alice Oh

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EduZone是针对K-12教育场景的LLM安全评估框架,整合多维度要素生成对抗交互,评估10个LLMs后发现其对教育特定风险更脆弱,现有防护措施不足,该框架可助力开发更安全的教育类LLMs。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01810 2026-08-04 cs.CL 新提交 90%

RADAR: Rubric-Aware Dependency and Redundancy Analysis for LLM-as-Judge Evaluation

RADAR:用于LLM作为评判者评估的基于 Rubric 的依赖与冗余分析

Divyansh Singh, Reza Davari, Afra Mashhadi

机构 * Microsoft(微软公司) University of Florida(佛罗里达大学) University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出 RADAR 框架,用于在 LLM 作为评判者的大规模评估前,通过少量探针估计评估标准间的耦合,验证显示其可恢复人类标准间高相关性,提供审计信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01684 2026-08-04 cs.AI 新提交 90%

GABench: A Comprehensive Benchmark for Evaluating LLM Agents on Graph Analysis Tasks

GABench:用于评估大语言模型智能体图分析任务的综合基准

Jiarui Tan, Zhongjian Zhang, YaBo Guo, Jiawei Liu, Yujie Xing, Muhan Zhang, Cheng Yang, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出GABench这一综合基准,涵盖多类图类型与任务及84个可执行工具,构建10400个带可验证答案的任务,评估前沿LLM及智能体框架,发现现有智能体应对复杂图任务仍存局限等结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01633 2026-08-04 cs.LG 新提交 90%

GraphIR: Architecture-Level Search States for LLM-Guided Neural Architecture Evolution

GraphIR:面向大语言模型引导的神经架构演化的架构级搜索状态

Zhen Liu, Wanqi Zhou, Shuanghao Bai, Yuhan Liu, Jinjun Wang, Jingwen Fu

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对LLM引导NAS中代码级表示无法满足架构变异需求的问题,提出架构感知中间表示GraphIR,在六个下游基准中集成到OpenEvolve后实现最佳搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00685 2026-08-04 cs.AI 新提交 90%

When Does LLM Orchestration Pay Off? A Controlled Evaluation of Accuracy, Cost, and Task Difficulty

LLM编排何时划算?关于准确率、成本与任务难度的对照评估

Nicolas Leins, Nico Pelleriti, Jana Gonnermann-Müller, Sebastian Pokutta

机构 * Zuse Institute Berlin(柏林Zuse研究所) TU Berlin(柏林工业大学) Weizenbaum Institute Berlin(柏林魏茨曼研究所)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究对照评估了Self-Refine等三种LLM编排方法与基线方法在5种骨干模型、3个领域的表现,发现编排收益依赖模型,需权衡准确率提升与额外推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28840 2026-08-03 cs.CL cs.SE 新提交 90%

Benchmarks Are Not Validation: A System-Level View of Financial LLM Applications

基准测试并非验证:金融大语言模型应用的系统级视角

Burak Payzun, İrem Demirtaş, Simona Scala, Elena Ferretti, Seçil Arslan

机构 * Prometeia S.p.A.(普罗米特亚公司)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究指出金融大语言模型不能仅靠基准测试验证,提出需从系统全栈进行多层验证,还讨论了LLM-as-a-judge的应用与控制措施,强调要研究系统感知基准等相关方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28643 2026-08-03 cs.HC cs.CL 新提交 90%

To Facilitate or not to Facilitate: Human and LLM Facilitator Tendencies in Online Discussions

是否促进:在线讨论中的人类与大语言模型(LLM)促进者倾向

Dimitris Tsirmpas, Katerina Korre, John Pavlopoulos

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本研究创建PEFK语料库,对比人类与LLM的在线讨论促进倾向,发现LLM过度急于促进,训练ModernBert分类器修正效果优于LLM替代设置。

Comments For the moderators: The acronym package may complain that some "acro" references are undefined. These references are, in fact, defined and the readability of the article remains the same

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28006 2026-07-31 cs.AI 新提交 90%

MMLDSum-LLM: Multimodal Long-Document Summarization with Visual-Alignment and Keyword-Aware

MMLDSum-LLM:结合视觉对齐与关键词感知的多模态长文档摘要方法

Xianpeng Zhang, Jiahua Yang, Dongyu Chen, Lei zhang, Jian Ma, Xu guohuan, Haonan Lu, Tianhuang Su, Chuangchuang Wang, Kai Tang

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对多模态长文档摘要的关键信息遗漏与跨模态幻觉问题,提出结合视觉对齐与关键词感知的两阶段训练框架MMLDSum-LLM,在自研基准MMLDSum-Bench上验证了其性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26849 2026-07-30 cs.CR cs.LG 新提交 90%

ToxScreen: Detecting Whether an LLM Has Been Poisoned

ToxScreen:检测大语言模型是否被植入后门

Anthony Hughes, Nicole Xing, Collin Francel, Andy Kim, Andrew Draganov

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出ToxScreen基准,研究现实条件下防御者能否恢复LLM的后门触发器,发现令牌查找方法可有效恢复触发器,且易越狱模型是有用信号,相关模型与代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26724 2026-07-30 cs.AI 新提交 90%

UrbanDS: A Graph-Guided LLM Multi-Agent System for Data-Intensive Urban Tasks

UrbanDS:一种用于数据密集型城市任务的图引导大语言模型多智能体系统

Zhilun Zhou, Jianghao Yu, Yuming Lin, yongjun yang, Sun Yongquan, Depeng Jin, Yong Li

机构 * Tsinghua University(清华大学) Jiangmen Municipal Smart Social Governance Technology Innovation Center(江门市智慧社会治理技术创新中心)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对数据密集型城市任务中现有LLM智能体依赖有限数据集的问题,提出图引导多智能体系统UrbanDS,构建基准UrbanDS-Bench验证其性能,该系统已在武汉东西湖城市平台落地应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25297 2026-07-29 cs.CR cs.AI 新提交 90%

Hybrid Analysis for Secure MCP Tool Use in LLM Agents

用于大语言模型智能体中安全MCP工具使用的混合分析

Ping He, Yuexiang Xie, Yaliang Li, Shouling Ji

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究LLM智能体中MCP工具使用的安全问题,提出基于混合分析的MTGuard框架,利用生命周期感知的静态 - 动态协同分析,有效减轻有害工具使用,保持良性任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21614 2026-07-27 cs.AI 新提交 90%

Household Movement Detection in Mixed-Format Occupancy Data Using LLM-Based Entity Resolution

使用基于大语言模型的实体解析在混合格式居住数据中进行家庭移动检测

Sasirekha Oguri, John R. Talburt, Mert Can Cakmak

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究在混合格式居住数据中检测家庭移动相关间接实体链接的问题,核心方法是集成基于提示的LLM命名实体识别、语义文本嵌入和基于图的推理,主要贡献是提高召回率和F1分数。

Comments Computer Science & Information Technology (CS & IT) ISSN : 2231 - 5403, Volume 16, Number 10, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21010 2026-07-24 cs.AI 新提交 90%

Reexamining zero-shot summarization: Empirical investigation of trustworthiness of LLM-summarizers

重新审视零样本摘要:对大语言模型摘要器可信度的实证研究

Vasudha Bhatnagar, Purnima Bindal, Vikas Kumar, Raj Kumari Bahl

机构 * Department of Computer Science, University of Delhi(德里大学计算机科学系) Department of Statistics, Ramjas College, University of Delhi(德里大学拉姆贾斯学院统计系)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型零样本摘要的稳定性与可信度问题,提出两级诊断协议,通过文档级稳定性分析及分层样本观察估计稳定性指数,经对三种文档类型的三个LLM摘要器实证研究,揭示差异,推动相关研究发展。

Comments 28 pages, Under review in a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20531 2026-07-24 cs.AI 新提交 90%

DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP Servers

DynamicMCPBench:用于实时MCP服务器上的大语言模型智能体的基于轨迹的效果评分基准测试

Jerzy Kamiński, Ilya Galyukshev, Artem Kuznetsov, Sergey Chuprin, Kirill Redko, Aidar Shumbalov, Anna Kalyuzhnaya

机构 * ITMO University(俄罗斯圣彼得堡国立信息技术机械与光学大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对LLM智能体在MCP服务器上的评估基准问题,提出DynamicMCPBench框架,能生成目标、追踪轨迹并按效果评分。大规模测试发现智能体处理长多步任务能力不足,且该框架可重复运行,人工验证其自动评分可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17615 2026-07-21 cs.SD cs.AI 新提交 90%

Re-Sonance: A Dysarthric Asynchronous Real-Time Speech Conversion System Based on a Three-Stage Cascaded ASR-LLM-TTS Architecture

共振:基于三级级联ASR-LLM-TTS架构的构音障碍异步实时语音转换系统

Yuxuan Wu, Yifan Xu, Junkun Wang, Jiayong Jiang, Xin Zhao, Zhaojie Luo

机构 * Southeast University(东南大学) School of Biological Science & Medical Engineering, Southeast University(东南大学生物科学与医学工程学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对构音障碍患者在专业演讲场景的沟通问题,提出基于三级级联ASR-LLM-TTS架构的Re-Sonance系统,集成多种技术,经评估其能提高轻度至中度构音障碍患者语音清晰度与自然度,验证了基于LLM方法增强语音驱动AAC系统的潜力。

Comments Accepted by NCMMSC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15899 2026-07-20 cs.LG 新提交 90%

ContinuityBench: A Benchmark and Systems Study of Stateful Failover in Multi-Provider LLM Routing

ContinuityBench:多提供商大语言模型路由中有状态故障转移的基准测试与系统研究

Vishal Pandey, Gopal Singh

机构 * Metriqual(梅特里夸尔)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究多提供商LLM路由中状态故障转移问题,提出有状态代理架构及历史转发策略,引入新指标,通过continuity - bench评估,实证表明该架构CPR达99.20%,刻画延迟分布,为构建多模型推理系统提供基础。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14118 2026-07-17 cs.CL cs.SE 新提交 90%

Budgeted Subset Refinement for Execution-Aware LLM Research Ideation

用于执行感知大语言模型研究构思的预算子集优化

Micah Zhang

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对LLMs生成研究想法存在的问题,引入预算子集优化策略,在统一共享候选池评估中对比不同策略效果,发现随机k优化是低成本基线,多样性感知的MMR - k优化权衡最佳,表明LLM研究构思系统应作为预算支持分配系统评估。

Comments 18 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10103 2026-07-14 cs.CR cs.CL 新提交 90%

A Survey on LLM Watermarking: Theory and Deployment

大语言模型水印:理论与部署综述

Huy Phan, Kieu Dang, Ojaswi Dulal, Aiham AL Shukairi, Abby Shine, Chase Garner, Phung Lai

机构 * Truman State University(特伦特州立大学) University at Albany, State University of New York(纽约州立大学阿尔巴尼分校)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 综述大语言模型水印技术,通过从业者核心问题组织内容,综合技术家族并分析安全效用权衡,回顾攻击策略、评估协议等,为LLM水印设计提供实际指导,明确可靠部署的研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17041 2026-07-02 cs.CL cs.IR 新提交 90%

MetaSyn: A Benchmark for LLM Agents on Meta-Analysis Articles from Nature Portfolio

对Nature Portfolio元分析文章进行LLM代理基准测试

Anzhe Xie, Weihang Su, Yujia Zhou, Yiqun Liu, Min Zhang, Qingyao Ai

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出MetaSyn数据集,包含442篇专家策划的元分析,用于评估LLM代理在检索-筛选-综合全流程中的表现,发现当前系统在筛选阶段存在严重瓶颈。

Comments 17 pages, 8 figures, 11 tables. Code and evaluation: https://github.com/THUIR/MetaSyn Dataset: https://huggingface.co/datasets/THUIR/MetaSyn Model: https://huggingface.co/BFTree/MA-Retriever

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31039 2026-07-01 cs.CL 新提交 90%

Truth or Sophistry? LoFa: A Benchmark for LLM Robustness Against Logical Fallacies

真相还是诡辩?LoFa:大语言模型对逻辑谬误鲁棒性的基准测试

Xudong Shen, Li Yuan, Ye Chen, Xin Wu, Yi Cai, Zhiyong Wu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) South China University of Technology(华南理工大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出LoFa基准,通过多智能体管道生成事实与谬误配对,结合多轮辩论框架评估LLM对逻辑谬误的鲁棒性,并设计LFR@k指标量化抵抗能力。

Comments Accepted to ACL 2026 Main. 33 pages (9 pages main text)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27314 2026-06-26 cs.CL 新提交 90%

Beyond Surface Forms: A Comprehensive, Mechanism-Oriented Taxonomy of Indirect Linguistic Encoding for LLM-Based Coded Language Detection

超越表面形式:面向LLM的编码语言检测的全面、机制导向的间接语言编码分类法

Hamid Reza Firoozfar, Mohammadsadegh Abolhasani, Reza Mousavi, Paul Jen-Hwa Hu

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出一种机制导向的间接语言表达分类法,通过抽象编码操作而非沟通目标,在LLM提示中集成后,在TikTok和Bluesky数据集上检测准确率提升4.7%,F1提升5.4%。

Comments Submitted for review in ARR for EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26185 2026-06-26 cs.LG 新提交 90%

Necessary but Not Sufficient: Temperature Control and Reproducibility in LLM-as-Judge Safety Evaluations

必要但不充分:LLM作为评判者的安全评估中的温度控制与可重复性

Hiroki Tamba

机构 * Tamba Research Academy(Tamba研究学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 研究LLM评判者在安全评估中温度设置对结果可重复性的影响,发现温度未设置或设为0仍无法完全消除判决翻转,建议将评判者分歧作为首要健康指标。

Comments 7 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25608 2026-06-25 cs.CR cs.AI 新提交 90%

An Approach for a Supporting Multi-LLM System for Automated Certification Based on the German IT-Grundschutz

基于德国IT-Grundschutz的自动化认证的多LLM支持系统方法

Lea Roxanne Muth, Marian Margraf

机构 * Department of Mathematics and Computer Science(数学与计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种多LLM系统结合混合RAG的方法,用于半自动化BSI IT-Grundschutz认证,以提高效率、降低成本并应对NIS2指令带来的认证需求增长。

Comments Accepted for publication at the 2025 IEEE International Conference on Cyber Security and Resilience (IEEE CSR), Chania, Crete, Greece, August 4-6, 2025. 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24834 2026-06-24 cs.AI 新提交 90%

Accuracy and Satisfaction in Multi-Turn LLM Dialogues for NFR Assessment

多轮LLM对话中NFR评估的准确性与满意度

Ali Pourghasemi Fatideh, Wilder Baldwin, Maria Dhakal, Collin McMillan, Sepideh Ghanavati

机构 * University of Maine(缅因大学) University of Notre Dame(圣母大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 研究开发者在与LLM对话助手评估非功能需求(NFR)时的准确性和满意度,发现开发者倾向于同意LLM评估但准确性低,且长回复和过多信息提供轮次降低满意度,而主动交互提升满意度。

Comments 9 pages, 5 figures. Accepted to SIGDIAL 2026 (27th Annual Meeting of the Special Interest Group on Discourse and Dialogue)

详情

展开后加载摘要…

URL PDF HTML 收藏