arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32271 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32271 篇

2603.20907 2026-08-12 cs.CL 版本更新 87%

The Hidden Puppet Master: Predicting Human Belief Change in Manipulative LLM Dialogues

隐藏的提线人:预测操纵性大语言模型对话中的人类信念变化

Jocelyn Shen, Amina Luvsanchultem, Jessica Kim, Kynnedy Smith, Valdemar Danry, Kantwon Rogers, Hae Won Park, Maarten Sap, Cynthia Breazeal

机构 * Massachusetts Institute of Technology(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 本文提出PUPPET框架,通过分析1035个人类与LLM交互数据,揭示当前安全范式在检测操纵策略与信念变化幅度之间的关键断层,证明先进LLM对人类信念易感性的系统低估。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23452 2026-08-12 cs.CV cs.CL 版本更新 87%

FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing

FoR-SALE:基于参考坐标系引导的LLM驱动扩散编辑中的空间调整

Tanawan Premsri, Parisa Kordjamshidi

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 FoR-SALE是SLD的扩展,通过参考坐标系引导的潜在空间操作调整图像朝向与深度,在三个空间理解基准上仅单轮校正就将SOTA T2I模型性能提升最高7.0个百分点,解决了非相机视角空间表达的生成偏差问题。

Comments Published in COLM 2026. 10 main pages, 4 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09343 2026-08-11 cs.AI 新提交 87%

LLM-Guided Heuristic Design from Simulation Traces: A Case Study in Dynamic Production and AGV Scheduling

基于模拟轨迹的大语言模型引导式启发式设计:动态生产与自动导引车调度的案例研究

Jinbo Li, Chuanhao Li

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究提出LLM引导的启发式设计框架,通过模拟轨迹诊断优化AGV与生产调度策略,在多组实验中优于多种基线方法,证实模拟轨迹可指导代码层面的策略改进。

Comments 33 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09140 2026-08-11 cs.CR cs.CL 新提交 87%

Beyond Direct Identifiers: Probabilistic Privacy Risk Estimation for Privacy-Conscious LLM Query Delegation

超越直接标识符:面向注重隐私的大语言模型查询委托的概率隐私风险估计

Li Siyan, Zhou Yu, Julia Hirschberg

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究针对注重隐私的LLM查询委托问题,提出概率变体PCD,结合LLM驱动的k-匿名性估计,创建PUPA-SD数据集,发现PAPILLON在Llama-3.2-3B上实现最佳隐私-效用平衡,k-匿名性是有用辅助指标。

Comments Accepted into HAIPS workshop at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08968 2026-08-11 cs.SE cs.AI 新提交 87%

GALA: Graph-Augmented LLM Agents for Root Cause Analysis and Incident Response in Microservices

GALA:用于微服务根本原因分析和事件响应的图增强大语言模型智能体

Yifang Tian, Yaming Liu, Zichun Chong, Zihang Huang, Yiran Li, Hans-Arno Jacobsen

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 针对微服务RCA的现有方法存在局限,提出图增强LLM智能体框架GALA+,结合STRIX与SURE-Score,在基准测试中性能优于最佳LLM基线,获SRE专家认可。

Comments Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), October 12--16, 2026, Munich, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08621 2026-08-11 cs.AI 新提交 87%

Business Arena: Benchmarking LLM Agents in a Realistic Marketplace

商业竞技场:在现实市场中对大语言模型智能体进行基准测试

Yijun Pan, Yukun Lian, Kunyu Shi, Junbo Li, Hongwei Xue, Sicong Xie, Guannan Zhang, Xiaoying Xing

机构 * Alibaba Group(阿里巴巴集团) Yale University(耶鲁大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 研究人员推出Business Arena测试平台,评估15个前沿LLM智能体在跨境商店运营中的表现,发现其平均最终净资产差9倍,最优模型仍逊于人类策略,为商业智能体评估提供了现实测试基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08245 2026-08-11 cs.CR cs.AI cs.HC 新提交 87%

Privacy-Preserving Data Drift Detection and Recovery for Large-Scale LLM Applications via Proxy Representations

基于代理表示的大规模大语言模型应用的隐私保护数据漂移检测与恢复

Michael Levit, Josh Ledgard, Haoyu Dong, Vishwas Suryanarayanan, Eyal Kolman, Sharon Tan, Qiang Gan, Vishal Chowdhary

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 针对大规模LLM应用的隐私约束导致的评估与漂移追踪难题,提出ProxyDrift框架,基于非PII代理表示实现无敏感数据暴露的漂移监测与合成数据生成,实验验证其对齐度达RA~0.9。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08189 2026-08-11 cs.AI 新提交 87%

Janus: An Algorithm-Evaluator Co-Evolution Framework for LLM-Driven Discovery under Expensive Evaluation Budgets

Janus:面向评估预算昂贵的大语言模型驱动发现的算法-评估器协同进化框架

Ximeng Liu, Qianlong Wang, Yingming Mao, Annan Li, Yatao Li, Shizhen Zhao, Jianmin Wu, Dawei Yin, Dou Shen

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 Janus是一个算法-评估器协同进化框架,它用LLM协同进化目标程序与代理评估器,通过真实结果校准、在线信用更新等策略缓解分布偏移,在五项任务中用更少真实评估实现更优性能,将评估器引导的LLM发现扩展到评估昂贵的科学领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07925 2026-08-11 cs.AI 新提交 87%

ZhuLong: Execution-Grounded LLM Agent for EDA Scripting with Offline API Self-Exploration

ZhuLong:基于执行的大语言模型智能体,用于结合离线API自探索的EDA脚本编写

Yang Liu, Shiwei Hou, Xiyuan Chen, Yu Wang, Sen Yuan, Qirui Gan, Shao You, Feifan Chen, Wencheng Li, Shuyang Hu, Yongzhou Liu, Emma Xia, Xiaojing Lu, Hao Wang, Fan Xu, Yanfeng Li

机构 * Changxin Memory Technologies, Inc.(长鑫存储技术有限公司)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 本文提出基于执行的LLM智能体ZhuLong,结合API检索、沙箱执行与离线API自探索机制,在EDA脚本任务基准测试中性能远超纯LLM基线,为EDA脚本编写提供了有效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07614 2026-08-11 cs.SE cs.CL 新提交 87%

DevIntent: How Much Does LLM-Generated Code Violate Developer Intent?

DevIntent:大语言模型生成的代码在多大程度上违反开发者意图?

Susana Haing, Natan Vidra, Spurthi Setty

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究针对LLM生成代码违反开发者隐式意图的问题,构建含49个问题的基准并提出IVR指标,发现两款主流LLM生成代码虽通过率高但超半数违反意图,揭示现有基准局限性。

Comments 8 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10794 2026-08-11 cs.AI 版本更新 87%

READER: Dynamic LLM Provenance from Query-Varying Interactions

READER: 基于提取表示的鲁棒证据作者身份解码

Jiaxu Liu, Sunnan Mu, Dong Huang, Liuyin Wang, Jing Shao, Jie Zhang

机构 * National University of Singapore(新加坡国立大学) Xidian University(西安电子科技大学) Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 针对黑盒LLM来源识别问题,提出READER框架,通过冻结代理LLM读取隐藏作者证据,利用贝叶斯证据累积实现多查询归因,在Agent500数据集上显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04415 2026-08-06 cs.CL 新提交 87%

Social Pressure Breaks Majority Voting in LLM Safety Panels

社交压力会破坏大语言模型安全评审团的多数投票机制

Yibo Hu, Jiaming Qu

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Amazon(亚马逊)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究发现,在LLM安全评审团中,同行的错误标签断言会大幅提升误报率,且评审员更易追随“不安全”方向,多数投票机制会因社交压力失效,还提供了部署前诊断方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03166 2026-08-05 cs.AI 新提交 87%

Adversarial Stress Testing of Role-Playing Language Agents using Multi-Agent Evaluation

基于多智能体评估的角色扮演语言智能体的对抗性压力测试

Saqib Shouqi, Abdullah Nazly, Januki Wanniarachchi, Ravisha De Alwis

专题命中 评测与基准 :language agent(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出模块化多智能体平台,通过多轮对话对角色扮演语言智能体开展对抗性压力测试,揭示单策略测试无法发现的故障模式,相关成果作为开源平台发布以支持AI安全。

Comments 8 pages, 1 figure, 7 tables; accepted and presented at ADScAI Conference 2026, University of Moratuwa, Sri Lanka

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01645 2026-08-04 cs.AI 新提交 87%

GISAgentBench: A Practitioner-Sourced Benchmark for Evaluating LLM Agents on GIS Tasks

GISAgentBench:面向GIS任务的、由从业者提供的用于评估大语言模型智能体的基准测试

Abhinav Pothuri, Zhe Jiang, Zelin Xu, Di Yang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有GIS智能体基准缺乏真实输出等问题,推出由从业者提供的GISAgentBench基准,含349项多步骤GIS任务,评估显示最佳智能体仅完成32.7%的任务,凸显真实GIS工作流的挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01322 2026-08-04 cs.CL cs.CY 新提交 87%

Can Language Models Identify Shadow Trading Targets? An NLP Evaluation of SEC Enforcement Theory

语言模型能否识别影子交易标的?对SEC执法理论的NLP评估

Sarah Wilson, Michael MacKay, Anthony Marello, Trinav Bhattacharyya

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title);分类 cs.CL

AI总结 本研究通过两阶段LLM管道分析SEC 10-K文件,发现NLP无法有效识别影子交易关联公司,对SEC影子交易执法的经验前提提出质疑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00100 2026-08-04 cs.CV cs.AI 新提交 87%

SPARC-Rad: A Multimodal Benchmark Dataset and Evaluation Pipeline for Spatial and Anatomical Reasoning in Radiology Vision-Language Models

SPARC-Rad:面向放射学视觉语言模型的空间与解剖推理多模态基准数据集及评估流程

Satvik Tripathi, Mustafa Ege Seker, Kristian Quevada, Ebubechukwu D Enwerem, Pratham Khandelwal, Emine Meltem, Bera Koca, Shahriar Faghani, Jacinta Arnold, Dania Daye, Tessa S. Cook

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 该研究开发了SPARC-Rad多模态基准数据集及评估流程,用于评估放射学VLMs的空间与解剖推理能力,为相关模型的开发与部署前评估提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08262 2026-08-04 cs.AI 版本更新 87%

FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use

FinToolBench:评估LLM代理在真实金融工具使用中的表现

Jiaxuan Lu, Kong Wang, Yemin Wang, Qingmei Tang, Hongwei Zeng, Xiang Chen, Jiahao Pi, Shujian Deng, Lingzhi Chen, Yi Fu, Kehua Yang, Xiao Sun

机构 * Shanghai AI Laboratory(上海人工智能实验室) Hunan University(湖南大学) Xiamen University(厦门大学) Tencent(腾讯) UCAS(中国科学技术大学) Tongji University(同济大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FinToolBench是首个评估金融工具学习代理真实世界表现的基准,通过760个可执行金融工具和295个严格查询,评估时效性、意图类型和合规性等关键维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29626 2026-08-03 cs.AI 新提交 87%

AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers

AgentHPOBench:用于评估LLM智能体作为序列超参数优化器的基准

Tianyu Huai, Tingshuo Fan, Xinchi Chen, Yining Zheng, Yuxin Wang, Shuang Chen, Jie Zhou, Xuanjing Huang

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 AgentHPOBench是含30个任务的序列基准,用于评估LLM智能体的超参数优化能力,实验显示其在多领域有优化能力,但在迭代优化等方面存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00093 2026-08-03 cs.CL cs.HC physics.data-an 版本更新 87%

Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why

LLM作为评判者的评估一致性指标:报告什么及为什么

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文通过调查24篇近期论文,指出在二元评判标准下多数一致性指标冗余,强调Cohen's κ提供额外信息,并给出报告清单。

Comments 17 pages, 4 figures; arxiv ancillary files included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22653 2026-07-28 cs.AI 新提交 87%

Do Language Models Converge to Themselves? Recursive Self-Refinement as Textual Relaxation

语言模型会收敛到自身吗?递归自精炼作为文本松弛

Xuening Wu, Qianya Xu, Yanlan Kang, Zeping Chen, Yubin Liu, Shenqin Yin

机构 * Pfizer(辉瑞公司) University of California San Diego(加利福尼亚大学圣地亚哥分校) Institute for Medical Philosophy and Future Artificial Intelligence(医学哲学与未来人工智能研究所) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) Institute of Humanities and Social Science Data, Fudan University(复旦大学人文社会科学数据研究所)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 研究大语言模型递归自精炼工作流程的长期动态。通过生成精炼轨迹并分析多种指标,发现轨迹迅速饱和,编辑多在前几次迭代,确定性解码表现更好,平均编辑幅度呈指数松弛,收敛摘要有多种优势,支持动态系统观点并推动停止标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12993 2026-07-28 cs.CL 版本更新 87%

Tailored untruths: How personalisation challenges LLM safeguards

量身定制的虚假信息:个性化如何挑战大语言模型的安全防护

João A. Leite, João Luz, Silvia Gargova, Arnav Arora, Gustavo Sampaio, Ian Roberts, Carolina Scarton, Kalina Bontcheva

机构 * University of Sheffield(谢菲尔德大学) University of Copenhagen(哥本哈根大学) Big Data for Smart Society Institute (GATE)(大数据智能社会研究所(GATE)) University of São Paulo(圣保罗大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究LLMs针对特定角色生成虚假信息的情况,采用红队测试方法创建数据集,发现安全防护在多数情况下失效,各模型能有效定制输出,还揭示了特定语言和心理模式及安全防护有效性差异,凸显加强多语言安全防护的必要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17063 2026-07-27 cs.AI 版本更新 87%

When LLMs Over-Answer: Measuring and Mitigating Quality Issues in LLM-Based Hardware Description Language Question Answering

当大语言模型过度回答时:测量和缓解基于大语言模型的硬件描述语言问答中的质量问题

Ziteng Hu, Jiachi Chen, Wenhao Lv, Huan Zhang, Yingjie Xia

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于大语言模型的硬件描述语言问答质量问题,收集相关问答帖子构建数据集并开展用户研究,发现LLMs存在过度回答倾向。据此提出多智能体框架,用特定指标评估答案质量,该框架有效提升了主流LLMs的回答质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20446 2026-07-24 cs.CL cs.CY 新提交 87%

Distinguishing Artificial from Authentic: Evaluating LLMs for Detecting LLM-Generated Content

区分人工与真实:评估大语言模型检测由大语言模型生成的内容

Juho Leinonen, Paul Denny

机构 * Aalto University(阿尔托大学) University of Auckland(奥克兰大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型检测自身生成内容的能力,通过真实学生回答和模型生成答案的多种变体,评估不同提示策略和输出格式下的检测性能,发现其检测高度依赖任务,提示框架等因素影响检测效果,凸显了大语言模型自我检测的潜力与局限。

Comments 8 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20115 2026-07-23 cs.CL 新提交 87%

Understanding the Impact of Linguistic Realization Choices on LLM Stance with Causal Tracing

通过因果追踪理解语言实现选择对大语言模型立场的影响

Langchen Huang, Sebastian Padó, Franziska Weeber

机构 * Institute for Natural Language Processing, University of Stuttgart(斯图加特大学自然语言处理研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究语言结构对大语言模型立场的影响,以政治立场判断为案例,扩展数据集得六种重写类型,通过对四个模型实验及激活修补发现,中晚期解码器层尤其是最终提示位置的块输出,对恢复原立场分布有最强信号。

Comments KONVENS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18485 2026-07-22 cs.CR cs.AI 新提交 87%

Trusted Credentials, Untrusted Behavior: Benchmarking LLM-Agent Security in High-Performance Computing

可信凭证,不可信行为:高性能计算中语言模型代理安全性基准测试

Jie Li

机构 * Texas Tech University(德克萨斯技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究高性能计算中语言模型代理安全性,定义其威胁模型,识别攻击面及当前控制不足,提出研究议程和TaskBound实证基准测试计划,以应对代理按用户凭证运行时可能出现的劫持授权代理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18147 2026-07-16 cs.LG 版本更新 87%

Foundation Models for Credit Risk Prediction: A Game Changer?

信贷风险预测的基础模型:变革性突破?

Bart Baesens, Andreas Goethals, Stefan Lessmann, Simon De Vos, Cristián Bravo, David Martens, Victor Medina-Olivares, Christophe Mues, Maria Oskarsdóttir, Seppe vanden Broucke, Tony Van Gestel, Tim Verdonck, Wouter Verbeke

机构 * Faculty of Economics and Business, KU Leuven, Belgium(比利时库勒万大学经济与商业学院) School of Business and Economics, Humboldt University of Berlin, Germany(德国洪堡大学商学院) Department of Statistical and Actuarial Sciences, Western University, Canada(加拿大西部大学统计与精算科学系) Department of Engineering Management, University of Antwerp, Belgium(比利时安特卫普大学工程管理系) Business School, University of Edinburgh, United Kingdom(英国爱丁堡大学商学院) Business School, University of Southampton, United Kingdom(英国南安普顿大学商学院) School of Mathematical Sciences, University of Southampton, United Kingdom(英国南安普顿大学数学科学学院) Department of Business Informatics and Operations Management, Ghent University, Belgium(比利时根特大学商业信息与运营管理系) Department of Mathematics, University of Antwerp, Belgium(比利时安特卫普大学数学系) Department of Mathematics, KU Leuven, Belgium(比利时库勒万大学数学系)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文研究了信贷风险预测中基础模型的应用,探讨了其在小数据环境下提升预测性能的能力,并通过对比多种方法验证了基础模型在PD和LGD建模任务中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05396 2026-07-16 cs.CL cs.SE 版本更新 87%

FairCoder: Probing LLM Bias in High-Stakes Decision Making via Coding Tasks

FairCoder:通过编码任务探究高风险决策中语言模型的偏差

Yongkang Du, Jen-tse Huang, Jieyu Zhao, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学) University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过FairCoder基准将决策制定设为编码任务,探究LLMs在多领域的偏差,针对现有指标不足提出FairScore指标,经实验揭示了此前未充分探索的偏差模式,凸显LLMs作决策代理的风险并提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12885 2026-07-15 cs.CL 新提交 87%

LLM Judges Can Be Too Generous When There Is No Reference Answer

当没有参考答案时,大语言模型评判可能过于宽松

Chalamalasetti Kranti, Sowmya Vajjala

机构 * University of Potsdam(波茨坦大学) National Research Council(国家研究委员会)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 探讨在无参考答案时大语言模型评判器能否可靠评估。通过校准和敏感性两阶段实验,发现其在无参考答案时易高估错误答案,添加参考答案信息会大幅改变评判结果,且与人类判断相符,强调校准LLM评判器的必要性并提供了方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10235 2026-07-14 cs.CL cs.IR 新提交 87%

Consensus vs. Dissent: Dynamic LLM Modeling of Subjective Preferences in Group Recommenders

共识与异议:群体推荐系统中主观偏好的动态大语言模型建模

Cedric Waterschoot, Nava Tintarev, Francesco Barile

机构 * Maastricht University(马斯特里赫特大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究群体推荐系统中LLMs能否模拟对群体内偏好分布的敏感性并选理想聚合策略。通过微调LLMs、开发模拟模型生成推荐候选并动态选择,经用户研究验证,该方法在满意度和共识方面表现优,凸显LLMs用于适应性调整的优势。

Comments Full paper accepted at the 20th ACM Conference on Recommender Systems (RecSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10059 2026-07-14 cs.AI 新提交 87%

AgentAbstain: Do LLM Agents Know When Not to Act?

AgentAbstain:基于大语言模型的智能体知道何时不行动吗?

Xun Liu, Yi Evie Zhang, Vira Kasprova, Parisa Rabbani, Pardis Sadat Zahraei, Tianyu Zhang, Ali Ebrahimpour-Boroojeny, Varun Chandrasekaran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于大语言模型的智能体何时应弃权的问题,提出AgentAbstain评估框架及AbstainGen全自动管道,通过配对任务基准测试多种前沿LLMs,发现弃权能力与任务解决能力无关,并识别出失败模式,代码和数据集开源。

Comments 56 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏