arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32411 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32411 篇

2510.25860 2026-02-23 cs.AI cs.CL cs.HC 86%

Through the Judge's Eyes: Inferred Thinking Traces Improve Reliability of LLM Raters

通过裁判之眼:推断的思考轨迹提升LLM评分器的可靠性

Xingjian Zhang, Tianhong Gao, Suliang Jin, Tianhao Wang, Teng Ye, Eytan Adar, Qiaozhu Mei

机构 * University of Michigan(密歇根大学) University of California, San Diego(加州大学圣地亚哥分校) University of Minnesota(明尼苏达大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过人与LLM协作框架推断思考轨迹,提升LLM评分器的可靠性及人类与LLM之间的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17316 2026-02-20 cs.CL cs.AI 86%

Same Meaning, Different Scores: Lexical and Syntactic Sensitivity in LLM Evaluation

相同意义,不同分数:在LLM评估中的词汇与语法敏感性

Bogdan Kostić, Conor Fallon, Julian Risch, Alexander Löser

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了词汇和语法扰动对LLM性能的影响,发现词汇扰动导致显著性能下降,而语法扰动效果异质,揭示LLM更依赖表层词汇模式而非抽象语言能力。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16741 2026-02-20 cs.CR cs.AI cs.LG 86%

Can Adversarial Code Comments Fool AI Security Reviewers -- Large-Scale Empirical Study of Comment-Based Attacks and Defenses Against LLM Code Analysis

对抗性代码注释能否欺骗AI安全审查员 -- 大规模实证研究:基于注释的攻击与防御对抗大语言模型代码分析

Scott Thornton

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了对抗性代码注释对AI安全审查的影响,发现其对漏洞检测无显著影响,静态分析交叉参考效果最佳。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12915 2026-02-20 cs.CY cs.CL cs.LG 86%

Toward LLM-Supported Automated Assessment of Critical Thinking Subskills

迈向支持性的人工智能自动评估批判性思维子技能

Marisa C. Peczuh, Nischal Ashok Kumar, Ryan Baker, Blair Lehman, Danielle Eisenberg, Caitlin Mills, Payu Wittawatolarn, Kushaan Naskar, Keerthi Chebrolu, Sudhip Nashi, Cadence Young, Brayden Liu, Sherry Lachman, Andrew Lan

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文探讨了利用大型语言模型评估批判性思维子技能的可行性,通过实验发现微调Llama 3.1 8B在评估具有高度可分离熟练度层级的子技能时表现最佳。

Comments preprint: 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23339 2026-02-20 cs.AI cs.CL cs.HC 86%

A Scalable Framework for Evaluating Health Language Models

可扩展的健康语言模型评估框架

Neil Mallinar, A. Ali Heydari, Xin Liu, Anthony Z. Faranesh, Brent Winslow, Nova Hammerquist, Benjamin Graef, Cathy Speed, Mark Malhotra, Shwetak Patel, Javier L. Prieto, Daniel McDuff, Ahmed A. Metwally

机构 * Google Research(谷歌研究)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出自适应精确布尔评估框架,用于高效评估健康领域语言模型,提升评估效率和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15758 2026-02-18 cs.CL cs.AI 86%

ChartEditBench: Evaluating Grounded Multi-Turn Chart Editing in Multimodal Language Models

ChartEditBench: 评估多轮视觉引导图表编辑在多模态语言模型中的表现

Manav Nitin Kapadnis, Lawanya Baghel, Atharva Naik, Carolyn Rosé

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 ChartEditBench通过代码进行多轮视觉引导图表编辑,评估多模态语言模型在持续、上下文感知编辑中的表现,揭示了多轮交互中错误累积和共享上下文失效的问题。

Comments 16 pages, 13 figures including Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13571 2026-02-17 cs.CL cs.AI 86%

LLM-Confidence Reranker: A Training-Free Approach for Enhancing Retrieval-Augmented Generation Systems

LLM-Confidence Reranker: 一种无需训练的增强检索增强生成系统的方法

Zhipeng Song, Xiangyu Kong, Xinrui Bao, Yizhi Zhou, Jiulong Jiao, Sitong Liu, Yuhang Zhou, Heng Qi

机构 * organization= School of Computer Science Technology, Dalian University of Technology , addressline= No.2 Linggong Road, Ganjingzi District , city= Dalian , postcode= 116024 , country= China organization= School of Information Engineering, Liaodong University , addressline= No.116 Linjiang Back Street, Zhenan District , city= Dandong , postcode= 118001 , country= China organization= School of Information Engineering, Dalian Ocean University , addressline= No. 2-52, Heishijiao Street, Shahekou District , city= Dalian , postcode= 116023 , country= China organization= Information Technology Center, Qinghai University , addressline= 251 Ningda Road, Chengbei District , city= Xining , postcode= 810016 , country= China organization= School of Electronic Information Engineering, Liaoning Technical University , addressline= 188 Longwan South Street, Sijiatun District , city= Huludao , postcode= 125105 , country= China organization= School of Artificial Intelligence, Tianjin Normal University , addressline= 393 Binshui West Road, Xiqing District , city= Tianjin , postcode= 300387 , country= China organization= Tencent (Dalian Northern Interactive Entertainment Technology Co., Ltd.) , addressline= 21/F, Tencent Building, No. 26 Jingxian St, Ganjingzi District , city= Dalian , postcode= 116085 , country= China

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LLM-Confidence Reranker通过利用LLM置信度信号,无需训练提升检索增强生成系统的排序效果,有效减少幻觉问题。

Comments Published by ESWA

Journal ref Expert Systems with Applications. (2026) 131627

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13543 2026-02-17 cs.IR cs.CL cs.LG 86%

LiveNewsBench: Evaluating LLM Web Search Capabilities with Freshly Curated News

LiveNewsBench: 用最新整理的新闻评估大语言模型网络搜索能力

Yunfan Zhang, Kathleen McKeown, Smaranda Muresan

机构 * Columbia University(哥伦比亚大学) Barnard College(巴纳德学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 LiveNewsBench通过最新新闻数据评估大语言模型的网络搜索能力,提供多跳搜索和推理任务,支持大规模训练数据集构建,公开排行榜和代码。

Comments An earlier version of this work was publicly available on OpenReview as an ICLR 2026 submission in September 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12631 2026-02-16 cs.AI cs.HC cs.LG 86%

AI Agents for Inventory Control: Human-LLM-OR Complementarity

面向库存控制的AI代理:人类-大语言模型-运筹学互补性

Jackie Baek, Yaopeng Fu, Will Ma, Tianyi Peng

机构 * Stern School of Business, New York University(纽约大学斯特恩商学院) Columbia University(哥伦比亚大学) Graduate School of Business and Data Science Institute, Columbia University(哥伦比亚大学商学院与数据科学研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了人类、大语言模型和运筹学算法在库存控制中的互补性,通过实验发现人机协作能提升利润,且大量个体从中受益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22968 2026-02-16 cs.CE cs.AI cs.CL 86%

Redefining Evaluation Standards: A Unified Framework for Evaluating the Korean Capabilities of Language Models

重新定义评估标准:一种统一评估韩语模型能力的框架

Hanwool Lee, Dasol Choi, Sooyong Kim, Ilgyun Jeong, Sangwon Baek, Guijin Son, Inseon Hwang, Naeun Lee, Seunghyeok Hong

机构 * AIM Intelligence Seoul National University(首尔国立大学) A.I.MATICS TigerCompany Catius National Assembly of Korea(韩国国会) Coupang Hankuk University of Foreign Studies(韩国外交大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HRET框架,通过统一评估韩语大语言模型的能力,结合多种评估方法和数据集,提升模型在韩语任务中的表现和诊断能力。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11179 2026-02-13 cs.CL cs.AI 86%

From Instruction to Output: The Role of Prompting in Modern NLG

从指令到输出:提示在现代自然语言生成中的作用

Munazza Zaib, Elaf Alhazmi

机构 * Faculty of Information Technology, Monash University(莫纳什大学信息科技学院) School of Computer, Data and Mathematical Sciences, Western Sydney University(西澳大学计算机、数据与数学科学学院) School of Computing, Macquarie University(麦考瑞大学计算学院)

专题命中 评测与基准 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了提示工程在自然语言生成中的作用,提出了提示范式的分类和决策框架,旨在提升NLG的可控性和可推广性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19905 2026-02-13 cs.LG cs.AI 86%

Demystifying LLM-as-a-Judge: Analytically Tractable Model for Inference-Time Scaling

解析LLM作为裁判:用于推理时间扩展的可分析模型

Indranil Halder, Cengiz Pehlevan

机构 * John A. Paulson School of Engineering And Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) Center for Brain Science, Harvard University(哈佛大学脑科学中心) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个可分析的模型,用于推理时间扩展,通过奖励加权采样器和贝叶斯线性回归,分析推理时间样本与一般化误差的关系,并展示在任务难度增加时该优势的退化。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04860 2026-02-13 cs.LG cs.AI 86%

Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails

对齐倾倒过程:自我进化如何推动LLM代理偏离轨道

Siwei Han, Kaiwen Xiong, Jiaqi Liu, Xinyu Ye, Yaofeng Su, Wenbo Duan, Xinyuan Liu, Cihang Xie, Mohit Bansal, Mingyu Ding, Linjun Zhang, Huaxiu Yao

机构 * Rutgers University(罗切斯特大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示了自我进化LLM代理在部署后因持续互动而偏离对齐约束的风险,通过自我利益探索和模仿策略扩散两种范式分析,发现对齐优势会迅速衰减,现有对齐方法难以有效防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21963 2026-02-12 cs.CY cs.AI cs.CL cs.SI 86%

Industrialized Deception: The Collateral Effects of LLM-Generated Misinformation on Digital Ecosystems

工业化的欺骗:大语言模型生成的虚假信息对数字生态系统的影响

Alexander Loth, Martin Kappes, Marc-Oliver Pahl

机构 * Frankfurt University of Applied Sciences(法兰克福应用科学大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出JudgeGPT和RogueGPT工具,研究人类对AI生成虚假信息的感知与检测,探讨生成与检测之间的竞争及缓解策略。

Comments Accepted at ACM TheWebConf '26 Companion

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17512 2026-02-12 cs.AI cs.CL 86%

Is Your LLM Really Mastering the Concept? A Multi-Agent Benchmark

你的大语言模型真的掌握了概念吗?一个多智能体基准

Shuhang Xu, Weijian Deng, Yixuan Zhou, Fangwei Zhong

机构 * Beijing Normal University(北京师范大学) Australian National University(澳大利亚国立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CK-Arena,通过多智能体社交推理游戏评估大语言模型的概念理解能力,揭示模型在概念掌握上的差异性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08003 2026-02-10 cs.LG cs.AI cs.DC cs.IT math.IT stat.ML 86%

Don't Always Pick the Highest-Performing Model: An Information Theoretic View of LLM Ensemble Selection

不要总是选择表现最好的模型:对大语言模型集成选择的信息论视角

Yigit Turkmen, Baturalp Buyukates, Melih Bastopcu

机构 * Department of Electrical and Electronics Engineering, Bilkent University, Ankara, Turkey(电气与电子工程系,比尔肯大学,安卡拉,土耳其) School of Computer Science, University of Birmingham, Birmingham, UK(计算机科学学院,伯明翰大学,伯明翰,英国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于信息论的集成选择算法,通过最大化互信息来选择模型,以提高集成性能并避免性能饱和问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19614 2026-02-09 cs.CL cs.AI 86%

Is Your Paper Being Reviewed by an LLM? Benchmarking AI Text Detection in Peer Review

你的论文正在由LLM审查吗?同行评审中AI文本检测的基准测试

Sungduk Yu, Man Luo, Avinash Madasu, Vasudev Lal, Phillip Howard

机构 * Oracle AI Abridge Intel Labs(Intel实验室) Thoughtworks

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个包含788,984篇AI与人类同行评审的综合数据集,评估18种AI文本检测算法的性能,并探索上下文感知的Anchor检测方法,揭示识别AI生成文本的困难。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06008 2026-02-06 cs.AI cs.LG 86%

AgenticPay: A Multi-Agent LLM Negotiation System for Buyer-Seller Transactions

AgenticPay: 一种基于多智能体LLM的买方卖方交易谈判系统

Xianyang Liu, Shangding Gu, Dawn Song

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 AgenticPay是一种基于多智能体LLM的买方卖方交易谈判系统,通过自然语言驱动的多轮谈判解决市场交易问题,评估智能体在经济互动中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17208 2026-02-06 cs.SE cs.AI cs.CL 86%

Dissecting the SWE-Bench Leaderboards: Profiling Submitters and Architectures of LLM- and Agent-Based Repair Systems

解析SWE-Bench排行榜:LLM和基于代理的修复系统的提交者与架构分析

Matias Martinez, Xavier Franch

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文分析了SWE-Bench排行榜上的提交者和架构,揭示了专有LLM的主导地位及不同设计类型。

Comments Part of this work (RQ1) has been published at the 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE-SEIP 2026), DOI: 10.1145/3786583.3786904. The published version is also available on arXiv at arXiv:2602.04449

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04456 2026-02-05 cs.CY cs.AI cs.CL 86%

Growth First, Care Second? Tracing the Landscape of LLM Value Preferences in Everyday Dilemmas

先成长,再关怀?追踪LLM在日常困境中的价值偏好景观

Zhiyi Chen, Eun Cheol Choi, Yingjia Luo, Xinyi Wang, Yulei Xiao, Aizi Yang, Luca Luceri

机构 * University of Southern California(美国南加州大学) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示LLM在日常困境中更倾向优先考虑探索与成长的价值,而非关怀与连接,指出AI建议系统可能带来的价值同质化风险。

Comments dataset available at https://github.com/Renesmeeczy/Value-Trade-off-in-Reddit-Dilemmas

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04294 2026-02-05 cs.CL cs.AI cs.CR 86%

How Few-shot Demonstrations Affect Prompt-based Defenses Against LLM Jailbreak Attacks

少样本演示如何影响基于提示的对抗LLM劫持攻击防御

Yanshu Wang, Shuaishuai Yang, Jingjing He, Tong Yang

机构 * Peking University(北京大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究少样本演示对基于提示的LLM防御策略的影响,发现其对RoP和ToP产生相反效果,提出实用部署建议。

Comments 13 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02589 2026-02-04 cs.AI cs.LG 86%

PeerRank: Autonomous LLM Evaluation Through Web-Grounded, Bias-Controlled Peer Review

PeerRank: 通过基于网络的、受偏见控制的同行评审实现自主LLM评估

Yanki Margalit, Erni Avram, Ran Taig, Oded Margalit, Nurit Cohen-Inger

机构 * Computer Science and Information, Ben-Gurion University of the Negev(本·加里翁大学(内盖夫)计算机科学与信息学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 PeerRank通过基于网络的、受偏见控制的同行评审实现自主LLM评估,产生稳定且具有区分性的排名,并揭示可测量的身份和呈现偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14151 2026-02-03 cs.LG cs.AI cs.CY cs.DB 86%

Trajectory Data Management and Mining: A Survey from Deep Learning to the LLM Era

轨迹数据管理与挖掘:从深度学习到大语言模型时代的综述

Wei Chen, Yuanshao Zhu, Yanchuan Chang, Kang Luo, Haomin Wen, Lei Li, Yanwei Yu, Qingsong Wen, Chao Chen, Kai Zheng, Yunjun Gao, Yu Zheng, Xiaofang Zhou, Yuxuan Liang

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文综述了轨迹计算从深度学习到大语言模型的发展,探讨了轨迹数据管理与挖掘的应用及未来研究方向。

Comments Version 2 of Trajectory Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19904 2026-01-29 cs.AR cs.AI cs.CL cs.DC cs.PF 86%

DABench-LLM: Standardized and In-Depth Benchmarking of Post-Moore Dataflow AI Accelerators for LLMs

DABench-LLM: 大规模语言模型后摩尔数据流AI加速器的标准化与深入基准测试

Ziyu Hu, Zhiqing Zhong, Weijian Zheng, Zhijing Ye, Xuwei Tan, Xueru Zhang, Zheng Xie, Rajkumar Kettimuthu, Xiaodong Yu

机构 * Dept. of Computer Science Stevens Institute of Technology(计算机科学系 斯坦福理工学院) Dept. of Computer Science Binghamton University(计算机科学系 哈伯里顿大学) Engineering The Ohio State University(工程学 俄亥俄州立大学) Learning Division Argonne National Laboratory(学习部 阿贡国家实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DABench-LLM是一个用于评估数据流AI加速器上LLM工作负载的基准测试框架,通过性能分析和可扩展性研究,揭示性能瓶颈并提供优化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10187 2026-01-29 cs.CL cs.AI 86%

HOMURA: Taming the Sand-Glass for Time-Constrained LLM Translation via Reinforcement Learning

HOMURA:通过强化学习驯服沙漏以实现时间受限的LLM翻译

Ziang Cui, Mengran Yu, Tianjiao Li, Chenyu Shi, Yingxuan Shi, Lusheng Zhang, Hongwei Lin

机构 * Bilibili Inc.(哔哩哔哩公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HOMURA通过强化学习框架优化语义保持与时间合规性平衡,实现精确的翻译长度控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15098 2026-01-28 cs.CL cs.AI 86%

TextMineX: Data, Evaluation Framework and Ontology-guided LLM Pipeline for Humanitarian Mine Action

TextMineX: 用于人道主义排雷行动的数据集、评估框架及基于本体的LLM流水线

Chenyue Zhou, Gürkan Solmaz, Flavio Cirillo, Kiril Gashteovski, Jonathan Fürst

机构 * NEC Laboratories Europe(NEC欧洲实验室) University of Stuttgart(斯图加特大学) VAGO Solutions(VAGO解决方案) Zurich University of Applied Sciences(苏黎世应用科学大学) CAIR, Ss. Cyril and Methodius University of Skopje, North Macedonia(CAIR,斯科普耶塞尔维亚·梅托迪乌斯大学,北马其顿)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TextMineX通过构建首个HMA领域数据集和基于本体的LLM流水线,提升文本中领域知识的提取准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21372 2026-01-28 cs.LG cs.AI 86%

Improving LLM-based Global Optimization with Search Space Partitioning

通过搜索空间划分改进基于LLM的全局优化

Andrej Schwanke, Lyubomir Ivanov, David Salinas, Fabio Ferreira, Aaron Klein, Frank Hutter, Arber Zela

机构 * University of Freiburg(弗赖堡大学) ELLIS Institute Tübingen(图宾根ELLIS研究所) Prior Labs(Prior实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HOLLM通过搜索空间划分提升LLM在高维优化中的性能,有效平衡探索与利用,优于现有全局优化方法。

Comments 31 pages, 19 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18785 2026-01-27 cs.HC cs.AI cs.CL 86%

Design Techniques for LLM-Powered Interactive Storytelling: A Case Study of the Dramamancer System

基于LLM的交互叙事设计技术:Dramamancer系统的案例研究

Tiffany Wang, Yuqian Sun, Yi Wang, Melissa Roemmele, John Joon Young Chung, Max Kreminski

机构 * Midjourney

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Dramamancer系统利用LLM将作者创建的故事架构转化为玩家驱动的交互叙事,探讨了相关设计技术和评估方法。

Comments Extended abstract presented at the 2025 Wordplay Workshop at EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04663 2026-01-27 cs.CL cs.LG cs.MA 86%

Debate, Deliberate, Decide (D3): A Cost-Aware Adversarial Framework for Reliable and Interpretable LLM Evaluation

辩论、 deliberative、决定(D3):一种成本意识的对抗框架,用于可靠且可解释的LLM评估

Abir Harrasse, Chaithanya Bandi, Hari Bandi

机构 * Martian NUS(新加坡国立大学) MIT(麻省理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 D3是一种通过结构化辩论和聚合机制提升LLM评估可靠性和可解释性的对抗框架,通过预算停止机制优化成本效率。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16134 2026-01-23 cs.AI cs.CL 86%

LLM Prompt Evaluation for Educational Applications

用于教育应用的LLM提示评估

Langdon Holmes, Adam Coscia, Scott Crossley, Joon Suh Choi, Wesley Morris

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出了一种系统评估方法,通过测试六个提示模板,发现一个结合角色和上下文管理器模式的提示在教育应用中表现最佳,支持元认知学习策略。

详情

展开后加载摘要…

URL PDF HTML 收藏