arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2798 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2606.22706 2026-06-23 cs.AI 新提交 90%

Safety-Aware Evaluation of LLM-Generated Driver Intervention Messages through Multi-Task Risk Fusion

通过多任务风险融合的LLM生成驾驶员干预信息的安全感知评估

Keito Inoshita

机构 * Faculty of Business and Commerce, Kansai University(关西大学商学部) Data Science and AI Innovation Research Promotion Center, Shiga University(滋贺大学数据科学与人工智能创新研究推进中心)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出DSAIS指标,结合规则与LLM评估五个维度,通过多任务风险融合框架提升干预信息质量,实验表明多任务集成使上下文相关性提升9.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21071 2026-06-23 cs.CR cs.AI 新提交 90%

Local LLM Agents as Vulnerable Runtimes:A Source-Code Audit of the Agent Runtime Layer

本地LLM智能体作为易受攻击的运行时:智能体运行时层的源代码审计

Zhengsong Zhang, Zongze Li, Jiawei Guo, Haipeng Cai

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University at Buffalo, SUNY(布法罗大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出CLAWAUDIT静态审计框架,通过STRIDE导出的五类漏洞分类法和自定义静态分析规则,评估本地LLM智能体运行时的安全弱点,在OpenClaw基准上显著提升召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20695 2026-06-23 cs.MA cs.AI 新提交 90%

How Much Coordination Gain Is Real? A Paired Noise-Floor Protocol for Multi-Agent LLM Benchmarks

真正的协调增益有多大?多智能体LLM基准测试的配对噪声底线协议

Alibek T Kaliyev, Artem Maryanskyy

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对多智能体LLM协调基准测试中微小增量不可靠的问题,提出配对噪声底线协议,通过配置等价对比发现典型效应量低于观测噪声包络,并定义协调活跃pass^k作为最低报告标准。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18774 2026-06-23 cs.LG 新提交 90%

RouteJudge: An Open Platform for Reproducible and Preference-Aware LLM Routing

RouteJudge: 一个可复现且偏好感知的LLM路由开放平台

Guannan Lai, Haoran Hu, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) SinapisAI

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 提出RouteJudge平台,通过匿名成对比较评估LLM路由策略的决策质量,并发布ORBIT工具箱标准化路由工作流,支持可复现和偏好感知的路由评估。

Comments Accepted by Pluralistic Alignment Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19787 2026-06-19 cs.AI 新提交 90%

ORAgentBench: Can LLM Agents Solve Challenging Operations Research Tasks End to End?

ORAgentBench: LLM代理能否解决具有挑战性的端到端运筹学任务?

Jiajun Li, Mingshu Cai, Yixuan Li, Yu Ding, Ran Hou, Guanyu Nie, Xiongwei Han, Wanyuan Wang

机构 * Southeast University(东南大学) Waseda University(早稻田大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ORAgentBench基准,评估LLM代理在端到端运筹学任务中的表现,发现当前代理通过率仅35.51%,主要受策略性弱点限制。

Comments 31 pages, preprint, v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18596 2026-06-18 cs.HC cs.AI 新提交 90%

Better Adherence, Richer Context: A Field Evaluation of LLM-Powered Conversational Voice Diaries for Sleep

更好的依从性,更丰富的上下文:基于LLM的对话式语音睡眠日记的现场评估

Amama Mahmood, Bokyung Kim, Honghao Zhao, Molly E. Atwood, Luis F. Buenaver, Michael T. Smith, Chien-Ming Huang

机构 * The Johns Hopkins University(约翰霍普金斯大学) Department of Psychiatry and Behavioral Sciences, The Johns Hopkins University School of Medicine(精神病学与行为科学系,约翰霍普金斯大学医学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 通过现场实验评估基于LLM的对话式语音睡眠日记,发现相比文本日记,语音日记提高了依从性并收集了更详细的上下文信息,但结构化字段完整性较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18129 2026-06-17 cs.HC cs.AI 新提交 90%

Towards Understanding and Measuring COGNITIVE ATROPHY in LLM Behaviour

理解和测量LLM行为中的认知萎缩

Abeer Badawi, Moyosoreoluwa Olatosi, Negin Baghbanzadeh, Laleh Seyyed-Kalantari, Frank Rudzicz, R. Shayna Rosenbaum, Sara Pishdadian, Elham Dolatabadi

机构 * York University(约克大学) Vector Institute(向量研究所) Rotman Research Institute(罗特曼研究学院) Dalhousie University(达尔豪斯大学) Centre for Addiction & Mental Health(成瘾与心理健康中心) KITE Research Institute(KITE研究机构)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM在心理健康支持中缺乏过程行为评估的问题,提出认知萎缩概念及基准,通过临床标注和专家评估揭示模型普遍存在中度至高度萎缩行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17213 2026-06-17 cs.CL cs.CV 新提交 90%

Revisiting LLM Adaptation for 3D CT Report Generation: A Study of Scaling and Diagnostic Priors

重新审视用于3D CT报告生成的LLM适应:缩放与诊断先验研究

Vanshali Sharma, Andrea M. Bejar, Halil Ertugrul Aktas, Quoc-Huy Trinh, Debesh Jha, Gorkem Durak, Ulas Bagci

机构 * Northwestern University(西北大学) University of South Dakota(南达科他大学) Aalto University(阿尔托大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出RAD3D-Prefix轻量级诊断先验框架,通过冻结大语言模型并融合多标签分类逻辑,在少量可训练参数下实现3D CT报告生成,优于全微调基线并展现强泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09004 2026-06-17 cs.AI 新提交 90%

LATTEArena: An Evaluation Framework for LLM-powered Tabular Feature Engineering (Extended Version)

LATTEArena: 基于LLM的表格特征工程评估框架(扩展版)

Ankai Hao, Ke Chen, Huan Li, Lidan Shou

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出LATTEArena,首个标准化评估框架,通过六维分类法分解15种方法、模块化竞技场和组件消融实验,揭示Tree-of-Thought与MCTS成本效益最优等16项关键发现。

Comments 31 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16613 2026-06-16 cs.AI 新提交 90%

CoffeeBench: Benchmarking Long-Horizon LLM Agents in Heterogeneous Multi-Agent Economies

CoffeeBench:异构多智能体经济中的长周期LLM智能体基准测试

Issa Sugiura, Daichi Hattori, Kazuo Araragi, Keita Ogawa, Shota Onose, Taro Makino, Teppei Usuki, Takashi Ishida

机构 * Sakana AI KPMG AZSA LLC

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出CoffeeBench基准,在90天模拟中评估LLM智能体在异构多智能体经济中的长周期任务表现,发现高性能模型更积极沟通,而Claude Haiku 4.5存在空闲漂移失败模式。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16364 2026-06-16 cs.AI cs.CR cs.SE 新提交 90%

Looking Is Not Picking: An Attention-Segment Account of Tool-Selection Failures in LLM Agents

看而非选:LLM智能体工具选择失败的注意力-片段解释

Shiyang Chen

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过分析LLM智能体对工具定义片段的注意力,发现工具选择失败源于决策读出阶段而非工具可见性,并提出了基于注意力的无训练选择器来修复。

Comments 13 pages, 1 figure, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16262 2026-06-16 cs.SE cs.AI 新提交 90%

UXBench: Measuring the Actionability of LLM-Generated UX Critiques

UXBench: 衡量LLM生成的UX评论的可操作性

Wenjie Wang, Yue Huang, Zipeng Ling, Han Bao, Hang hua, Xiaonan Luo, Yu Jiang, Shiyi Du, Yuexing Hao, Xiaomin Li, Yuchen Ma, Dianzhuo Wang, Yanfang Ye, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) University of Pennsylvania(宾夕法尼亚大学) University of Rochester(罗切斯特大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学) LMU Munich(慕尼黑路德维希-马克西米利安大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出UXBench基准,通过下游修复代理能否基于评论改进界面来评估LLM作为UX评判者的可操作性,发现不同模型在报告可操作性、修复特征和可靠性上存在显著差异。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15500 2026-06-16 cs.AR cs.AI cs.SY eess.SY 新提交 90%

LLM4RTL: Tool-Assisted LLM for RTL Generation

LLM4RTL: 工具辅助的大语言模型用于RTL生成

Jing Jin, Robert Chu, Ning Yan, Masood S. Mortazavi

机构 * UC Riverside(加州大学河滨分校) Futurewei(未来科技)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出JRCRC流水线,利用商业LLM层次结构过滤和优化RTL代码生成数据集,并设计工具辅助架构提升逻辑推理能力,在VerilogEval上超越多数方法,用更小模型达到GPT-4O性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15474 2026-06-16 cs.AI stat.AP 新提交 90%

Who Drifted: the System or the Judge? Anytime-Valid Attribution in LLM Evaluation Pipelines

谁漂移了:系统还是裁判?LLM评估流水线中的随时有效归因

Yitao Li

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种基于固定锚点集和赌检验的方法,区分LLM评估中产品性能下降与裁判模型变化导致的分数漂移,并证明其随时有效性和归因准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15029 2026-06-16 cs.AI 新提交 90%

Metric Match: A Subset Selection Approach to Evaluating LLM Judge Reliability

Metric Match:一种评估LLM评判可靠性的子集选择方法

Alyssa Unell, Natalie Dullerud, Naomi Boneh, Meena Jagadeesan, Tatsu Hashimoto, Nigam Shah, Sanmi Koyejo

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出Metric Match方法,通过选择少量样本进行人工标注,以子集匹配总体可靠性指标,从而高效估计LLM评判的可靠性,实验表明在15个数据集上平均估计误差降低18.7%,标注需求减少32.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14762 2026-06-16 cs.CV cs.AI 新提交 90%

Scribby: A Multi-Level LLM Framework for Semantic Video Analysis

Scribby: 一种用于语义视频分析的多级LLM框架

Julian Abelarde, Hugo Garrido-Lestache Belinchon

机构 * Department of Computer Science and Software Engineering, Milwaukee School of Engineering(密尔沃基工程学院计算机科学与软件工程系)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种基于LLM的视频摘要框架,通过微观索引(分析完整转录、句子及语义分组)平衡宏观理解与微观语义分析,并利用相关性热图实现语义分块和匹配的可视化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13706 2026-06-15 cs.AR cs.AI 新提交 90%

HierSVA: A Data Synthesis Pipeline, Dataset, and Benchmark for LLM-Driven Hierarchical Hardware Formal Verification

HierSVA:面向LLM驱动的层次化硬件形式化验证的数据合成流水线、数据集与基准

Maohua Nie, Jiang Zhu, Jingqun Zhang, Zhichen Zeng, Jiayi Wang, Sibo Zhang, Jialin Wang, C. -J. Richard Shi

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出HierSVA套件,包含数据合成流水线、数据集和基准,用于LLM驱动的层次化硬件形式化验证;通过RTL预处理与LLM在环流程生成SystemVerilog断言,并构建342模块数据集;设计六轴指标评估断言质量,揭示LLM在层次化验证中的性能与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13111 2026-06-12 cs.CL 新提交 90%

MÖVE: A Holistic LLM Benchmark for the German Public Sector

MÖVE:德国公共部门的大语言模型整体基准

Camilla Dalerci, Thilo Michael, Robin Schaefer, Daniel Weinland

机构 * Innovations Department, Bundesdruckerei GmbH(德国联邦印钞公司创新部)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出MÖVE基准,从性能和治理两个维度评估39个LLM在德国公共部门的应用,发现无单一模型全面领先,模型大小非质量可靠指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12071 2026-06-11 cs.DL cs.AI 新提交 90%

On the Limits of LLM-as-Judge for Scientific Novelty Assessment

论LLM作为评审在科学新颖性评估中的局限性

Soumitra Sinhahajari, Navonil Majumder, Soujanya Poria

机构 * DeCLaRe Lab, Nanyang Technological University(德克莱实验室,南洋理工大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过构建RQ-Bench基准,发现LLM评审对模型生成的研究问题产生新颖性幻觉,而人类专家则持相反意见,揭示了LLM在评估科学新颖性时的可靠性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11316 2026-06-11 cs.CL 新提交 90%

Schützen: Evaluating LLM Safety in Bulgarian and German Contexts

Schützen: 在保加利亚语和德语语境中评估LLM安全性

Kiril Georgiev, Yuxia Wang, Dimitar Iliyanov Dimitrov, Preslav Nakov, Ivan Koychev

机构 * Sofia University "St. Kliment Ohridski" MBZUAI(索菲亚大学"圣克莱门特·奥赫里德斯基" MBZUAI)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有安全评估数据集以英语和中文为主的问题,构建了覆盖低资源语言保加利亚语和高资源语言德语的Schützen安全数据集,实验揭示多语言LLM在安全行为上的显著跨语言差异,强调了区域特定评估资源的必要性。

Comments 19 pages, 13 tables, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11016 2026-06-10 cs.AI 新提交 90%

Superficial Beliefs in LLM Decision-Making

LLM决策中的表面信念

Gabriel Freedman, Francesca Toni

机构 * Department of Computing, Imperial College London(帝国理工学院计算系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大型语言模型在二元选择中是否仅模仿理由,通过合成决策实验发现模型行为有系统性但自我报告与行为推断的驱动因素不完全一致,表明存在“表面信念”。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10389 2026-06-10 cs.AI 新提交 90%

Beyond Static Evaluation: Co-Evolutionary Mechanisms for LLM-Driven Strategy Evolution in Adversarial Games

超越静态评估:对抗性游戏中LLM驱动策略演化的协同进化机制

Haoran Li, Zengle Ge, Ziyang Zhang, Xiaomin Yuan, Yui Lo, Qianhui Liu, Bocheng An, Dongke Rong, Jiaqun Liu, Annan Li, Jianmin Wu, Dawei Yin, Dou Shen

机构 * Baidu Inc.(百度公司) University of Chinese Academy of Sciences(中国科学院大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) University of Technology Sydney(悉尼科技大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM驱动代码进化在对抗性多智能体游戏中因评估景观变化导致停滞的问题,提出评估器协同进化、层次深度评估和弱点压力三种机制,在MCTF任务中实现最优性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09863 2026-06-10 cs.LG 新提交 90%

From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents

从自信收尾到无声失败:LLM智能体中的虚假成功特征分析

Laksh Advani

机构 * Laksh Advani

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 研究LLM智能体在环境状态未完成时声称任务完成的虚假成功模式,发现其普遍存在但检测困难,轻量级TF-IDF检测器优于LLM评判器。

Comments Accepted to FAGEN@ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09334 2026-06-09 cs.CL 新提交 90%

How Far Can Prompting Go for Minimal-Edit Ukrainian Grammatical Error Correction?

提示工程在最小编辑乌克兰语语法错误纠正中能走多远?

Kateryna Karpo, Artem Chernodub

机构 * Ukrainian Catholic University(乌克兰天主教大学) YouScan Zendesk

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(title);large language model(abstract);language model(abstract)

AI总结 评估11个商业LLM在乌克兰语最小编辑语法错误纠正上的表现,发现结合最小编辑提示和少样本策略的Gemini 3.1-Pro达到F0.5=69.22,缩小了与微调SOTA的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07867 2026-06-09 cs.CL 新提交 90%

The Cold-Start Safety Gap in LLM Agents

LLM智能体中的冷启动安全差距

Chung-En Sun, Linbo Liu, Tsui-Wei Weng

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 研究发现工具调用型LLM智能体在会话开始时最脆弱,随着常规任务执行安全性提升,提出SODA基准并验证预热策略可缩小冷启动安全差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07726 2026-06-09 cs.LG 新提交 90%

Cutting LLM Evaluation Costs with SySRs: A Bandit Algorithm that Provably Exploits Model Similarity

利用SySRs降低LLM评估成本:一种可证明利用模型相似性的Bandit算法

Zifan Lyu, Chahine Nejma, Tobias Wegel, Fanny Yang, Florian E. Dorner

机构 * ETH Zurich(苏黎世联邦理工学院) Centrale Supélec(中央理工-高等电力学院) ENS de Cachan(卡尚高等师范学校) MPI for Intelligent Systems, Tübingen(马克斯·普朗克智能系统研究所,图宾根)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出SySRs算法,通过配对比较和自适应分配评估预算,利用模型相似性降低LLM评估成本,在15个基准上平均错误率最低。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07367 2026-06-08 cs.LG 新提交 90%

Self-evolving LLM agents with in-distribution Optimization

自演化分布内优化的LLM智能体

Yudi Zhang, Meng Fang, Zhenfang Chen, Mykola Pechenizkiy

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Q-Evolve框架,通过分布内强化学习统一过程奖励标注与策略学习,利用加权隐式Q学习稳定贝尔曼更新,实现智能体自演化,在AlfWorld等任务上优于基线。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06838 2026-06-08 cs.SE cs.AI 新提交 90%

LLM Agent-Assisted Reverse Engineering with Quantitative Readability Metrics

LLM 代理辅助逆向工程与定量可读性指标

Neil Archibald, Ruben Thijssen

机构 * University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出定量可读性分数(QRS)框架,结合结构相似性门控与三个可读性子指标,指导 LLM 代理提升反编译代码可读性,同时保持功能正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16030 2026-08-18 cs.RO cs.CY 新提交 90%

Benchmarking Identity-Sensitive LLM Outputs for Surveillance and Security Robots

针对监控与安全机器人的身份敏感型大语言模型输出基准测试

Nneka Hyman, Jasmine Khan, Raj Korpan

机构 * Hunter College, City University of New York(纽约城市大学亨特学院) The Graduate Center, City University of New York(纽约城市大学研究生中心)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);foundation model(comments)

AI总结 该研究测试身份条件提示对LLM生成的监控与安全机器人设计描述的影响,用236个人口统计学身份标签分析可读性,发现存在显著差异,可读性可为相关基准框架提供可解释基线。

Comments Accepted to the Foundation Models in the Ro-Man Age (FoRMA) Workshop at IEEE RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19437 2026-08-21 cs.CL cs.AI cs.CY 新提交 90%

Are LLMs becoming similarly creative? Evidence from three years of models

大型语言模型(LLM)正变得同样具有创造力吗?来自三年模型的证据

Nirav Patel, Josiah Crossman, Eva Aggarwal, Emily Wenger

机构 * Duke University(杜克大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过分析三年间的LLM在Infinity-Chat100和替代用途任务上的表现,发现LLM创造性输出多样性随时间显著下降,存在同质化趋势,需关注其对人机协同创作中人类能动性的影响。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏