arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32208 篇

2605.08321 2026-05-12 cs.LG cs.AI cs.CY cs.HC cs.MA 90%

LLM Wardens: Mitigating Adversarial Persuasion with Third-Party Conversational Oversight

LLM卫士:通过第三方对话监督缓解对抗说服

Lennart Wachowiak, Scott D. Blain, David Williams-King, Samuele Marro

机构 * University of Oxford(牛津大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 研究通过引入第三方LLM卫士模型,降低对抗性LLM对用户的操纵成功率,实验显示卫士模型使对手成功率从65.4%降至30.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07342 2026-05-11 cs.LG cs.AI cs.SE 90%

Mage: Multi-Axis Evaluation of LLM-Generated Executable Game Scenes Beyond Compile-Pass Rate

Mage:多轴评估LLM生成的可执行游戏场景超越编译通过率

Hugh Xuechen Liu, Kıvanç Tatar

机构 * Chalmers University of Technology and University of Gothenburg(楚尔姆斯理工大学和哥德堡大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出Mage多轴评估框架,通过编译通过率、运行通过率、结构保真度和机制符合度四个维度评估LLM生成的游戏场景,发现编译通过率与功能正确性反相关,证明多轴评估对检测领域差异的必要性。

Comments Main Content: 10 pages, 1 figure. In total 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05662 2026-05-08 cs.CL cs.AI 90%

XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity

XL-SafetyBench: 一个基于国家的跨文化安全基准,用于LLM安全性和文化敏感性

Dasol Choi, Eugenia Kim, Jaewon Noh, Sang Seo, Eunmi Kim, Myunggyo Oh, Yunjin Park, Brigitta Jesica Kartono, Josef Pichlmeier, Helena Berndt, Sai Krishna Mendu, Glenn Johannes Tungka, Özlem Gökçe, Suresh Gehlot, Katherine Pratt, Amanda Minnich, Haon Park

机构 * AIM Intelligence(AIM智能研究院) Microsoft(微软公司) Korea AISI(韩国人工智能研究所) KT Corporation(KT公司) BMW Group(宝马集团) Coinbase(Coinbase公司) Technical University of Munich(慕尼黑技术大学) Ankara University(安卡拉大学) Cyril Amarchand Mangaldas(Cyril Amarchand Mangaldas法律事务所) Seoul National University(首尔国立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 XL-SafetyBench通过5500个跨10个国家语言对的测试案例,评估LLM在文化敏感性和安全性的表现,揭示了前沿模型的安全性与文化意识无耦合关系,以及本地模型在安全与文化敏感性间的线性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14201 2026-05-04 cs.CR cs.AI cs.CL 90%

ExCyTIn-Bench: Evaluating LLM agents on Cyber Threat Investigation

ExCyTIn-Bench:评估LLM代理在网络安全调查中的表现

Yiran Wu, Mauricio Velazco, Andrew Zhao, Manuel Raúl Meléndez Luján, Srisuma Movva, Yogesh K Roy, Quang Nguyen, Roberto Rodriguez, Qingyun Wu, Michael Albada, Julia Kiseleva, Anand Mudgerikar

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Microsoft Security AI Research(微软安全AI研究) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 ExCyTIn-Bench是首个评估LLM代理在网络安全调查任务中的基准,通过从调查图中生成的安全问题进行测试。该基准利用Azure租户中的SQL环境和Microsoft Sentinel日志构建威胁调查图,并生成问题以评估LLM代理的能力。

Comments Accepted By ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27405 2026-05-01 cs.CL cs.AI 90%

Beyond the Mean: Within-Model Reliable Change Detection for LLM Evaluation

超越平均:LLM评估中的模型内可靠变化检测

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文将临床心理学的可靠变化指数应用于LLM版本比较,发现大多数项目无可靠变化,但部分项目存在双向变化,且领域分解揭示了模型特定的反转现象。

Comments 7 pages, 4 figures, 2 tables. Pre-registered study. Code and data available

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27249 2026-05-01 cs.CL cs.AI 90%

Instruction Complexity Induces Positional Collapse in Adversarial LLM Evaluation

指令复杂性导致对抗性LLM评估中的位置崩溃

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨指令复杂性如何影响对抗性LLM评估中的位置崩溃现象,通过六种条件对抗性指令梯度测试,发现不同指令类型导致不同的响应分布和内容参与度,揭示了指令复杂性对响应机制的影响。

Comments 12 pages, 3 figures, 3 tables. Pre-registered on OSF (osf.io/7p64)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25318 2026-04-29 cs.GR cs.AI cs.CL 90%

Cutscene Agent: An LLM Agent Framework for Automated 3D Cutscene Generation

Cutscene Agent:一种用于自动化3D场景生成的LLM代理框架

Lanshan He, Haozhou Pang, Qi Gan, Xin Shen, Ziwei Zhang, Yibo Liu, Gang Fang, Bo Liu, Kai Sheng, Shengfeng Zeng, Chaofan Li, Zhen Hui, Keer Zhou, Lan Zhou, Shujun Dai

机构 * Kuaishou GameMind Lab(快手游戏大脑实验室)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出Cutscene Agent框架,通过双向集成LLM代理与游戏引擎,实现多代理协作生成可编辑的电影化3D内容,并构建了针对长周期多步骤协作的评估基准。

Comments 27 pages excluding appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24955 2026-04-29 cs.CL cs.AI cs.SE 90%

BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks

BenchGuard:谁守护着基准?对LLM代理基准的自动化审计

Xinming Tu, Tianze Wang, Yingzhou, Lu, Kexin Huang, Yuanhao Qu, Sara Mostafavi

机构 * Allen School, University of Washington(华盛顿大学阿伦学院) Phylo, Inc.(Phylo公司) Genentech, Inc.(基因泰克公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 BenchGuard通过结构化LLM协议交叉验证所有基准制品,发现ScienceAgentBench中的12个问题,并在BIXBench Verified-50子集中准确识别83.3%的问题,证明自动化基准审计的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24710 2026-04-28 cs.AI cs.CL 90%

Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters

针对具体病例的评估量表:方法、验证及LLM与医生一致性的823次病例研究

Aaryan Shah, Andrew Hines, Alexia Downs, Denis Bajet, Paulius Mui, Fabiano Araujo, Laura Offutt, Aida Rutledge, Elizabeth Jimenez

机构 * Canvas Medical Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) XPC (X Primary Care)(XPC(X初级保健)) FCA Consulting(FCA咨询) Department of Pediatrics, University of Nevada, Reno, NV, USA(内华达大学拉斯维加斯分校儿科系)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出针对具体病例的评估量表方法,验证了LLM生成的量表在医生一致性上的有效性,展示了在823次病例中医生与LLM的一致性提升。

Comments 14 pages, 2 figures, 3 tables, submitted to JAMIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10551 2026-04-28 cs.GT cs.AI cs.LG 90%

LLM-Auction: Generative Auction towards LLM-Native Advertising

LLM-Auction: 面向LLM原生广告的生成拍卖

Chujie Zhao, Qun Hu, Shiping Song, Dagui Chen, Han Zhu, Jian Xu, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(淘宝与天猫集团)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出LLM-Auction,首个基于学习的生成拍卖机制,通过整合拍卖与生成过程,优化LLM输出与机制目标的偏好对齐,实现高效分配并满足关键机制属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22861 2026-04-28 cs.IR cs.AI cs.LG 90%

IntrAgent: An LLM Agent for Content-Grounded Information Retrieval through Literature Review

IntrAgent:通过文献综述实现内容导向的信息检索的LLM代理

Fengbo Ma, Zixin Rao, Xiaoting Li, Zhetao Chen, Hongyue Sun, Yiping Zhao, Xianyan Chen, Zhen Xiang

机构 * University of Georgia(佐治亚大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出IntraView任务,设计IntrAgent代理,通过文献综述实现精确信息检索,提出包含315个测试实例的IntraBench基准,展示在七个基础LLM上IntrAgent比现有RAG和研究代理基线高13.2%的跨领域准确性。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08568 2026-04-28 cs.CL cs.AI 90%

Can We Still Hear the Accent? Investigating the Resilience of Native Language Signals in the LLM Era

我们还能听到口音吗?在大语言模型时代探究母语信号的韧性

Nabelanita Utami, Ryohei Sasano

机构 * Graduate School of Informatics, Nagoya University(名古屋大学信息学研究科)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过分析ACL论文集不同时期的母语识别趋势,探讨大语言模型对科研论文同质化的影响,发现后LLM时代出现异常波动,部分语言表现更趋明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17011 2026-04-27 q-fin.CP cs.CE cs.CL cs.LG q-fin.PM 90%

Predicting Liquidity-Aware Bond Yields using Causal GANs and Deep Reinforcement Learning with LLM Evaluation

利用因果生成对抗网络和深度强化学习预测流动性感知的债券收益率

Jaskaran Singh Walia, Aarush Sinha, Naman Saraswat, Srinitish Srinivasan, Srihari Unnikrishnan

机构 * School of Computer Science and Engineering, Vellore Institute of Technology, India(印度维杰雷理工学院计算机科学与工程学院) Indian Institute of Science, Bangalore, India(印度班加罗尔印度科学学院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出利用因果GANs和SAC强化学习生成高保真的合成债券收益率数据,结合LLM评估提升预测性能,通过统计验证和专家评估证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20726 2026-04-24 cs.CL cs.AI 90%

Exploiting LLM-as-a-Judge Disposition on Free Text Legal QA via Prompt Optimization

通过提示优化利用LLM-as-a-Judge在自由文本法律问答中的处置

Mohamed Hesham Elganayni, Runsheng Chen, Sebastian Nagl, Matthias Grabmair

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文研究提示设计和法官选择在LLM-as-a-Judge评估自由文本法律问答中的作用,通过ProTeGi方法优化提示,发现自动优化优于人类设计,宽松反馈的提示在严格法官间转移更有效。

Comments Accepted at the 21st International Conference on Artificial Intelligence and Law (ICAIL 2026), Singapore, June 8-12, 2026. 10 pages, 14 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19984 2026-04-23 cs.CY cs.AI cs.CL 90%

Bias in the Tails: How Name-conditioned Evaluative Framing in Resume Summaries Destabilizes LLM-based Hiring

尾部偏差:姓名条件下的评价框架在简历摘要中如何使基于LLM的招聘不稳定

Huy Nghiem, Phuong-Anh Nguyen-Le, Sy-Tuyen Ho, Hal Daume

机构 * University of Maryland(马里兰大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究探讨了LLM生成的简历摘要中姓名条件下的评价框架如何导致招聘决策的不稳定性,通过大规模实验发现,评价语言在分布极值处存在细微差异,尤其在开源模型中更为明显。

Comments First version, 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08570 2026-04-23 cs.LG cs.AI cs.PL cs.SE quant-ph 90%

QuanBench+: A Unified Multi-Framework Benchmark for LLM-Based Quantum Code Generation

QuanBench+: 一种统一的多框架基准用于基于LLM的量子代码生成

Ali Slim, Haydar Hamieh, Jawad Kotaich, Yehya Ghosn, Mahdi Chehimi, Ammar Mohanna, Hasan Abed Al Kader Hammoud, Bernard Ghanem

机构 * American University of Beirut(贝鲁特美国大学) King Abdullah University of Science and Technology(卡迪夫国王大学科学与技术学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出QuanBench+基准,用于评估LLM在量子代码生成中的多框架性能,通过执行测试和反馈修复机制,展示了不同框架下的代码生成效果及改进。

Comments 24 pages total, 25 figures, 5 tables, including supplementary material. Accepted to the ICLR 2026 Workshop on I Can't Believe It's Not Better

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15702 2026-04-22 cs.CL cs.LG 90%

The Metacognitive Monitoring Battery: A Cross-Domain Benchmark for LLM Self-Monitoring

元认知监控电池:一个跨领域用于LLM自我监控的基准测试

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出一个跨领域评估LLM元认知监控的基准测试,结合人类心理测量方法,通过524项任务测试学习、元认知校准等六个认知领域,揭示LLM在自信度和自我监控上的差异。

Comments 11 pages, 6 figures, 3 tables. Submitted to NeurIPS 2026 Evaluations and Datasets Track. Code, data, and Croissant metadata: https://github.com/synthiumjp/metacognitive-monitoring-battery

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18169 2026-04-21 cs.CL cs.AI 90%

Beyond Reproduction: A Paired-Task Framework for Assessing LLM Comprehension and Creativity in Literary Translation

超越复制:一种配对任务框架用于评估LLM在文学翻译中的理解与创造力

Ran Zhang, Steffen Eger, Arda Tezcan, Wei Zhao, Simone Paolo Ponzetto, Lieve Macken

机构 * Natural Language Learning Group (NLLG) School of Business Informatics and Mathematics University of Mannheim(曼海姆大学自然语言学习组(NLLG)商学院信息与数学学院) University of Technology Nuremberg (UTN), Department Engineering(纽伦堡技术大学(UTN)工程系) University of Gent, Department of Translation, Interpreting and Communication(根特大学翻译、口译与传播系) University of Aberdeen, Department of Computing Science(阿伯丁大学计算科学系) Natural Language Learning and Generation (NLLG) Lab(自然语言学习与生成(NLLG)实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种配对任务框架,评估LLM在文学翻译中的理解与创造力。通过11本书的文学片段,评估模型的文本理解与翻译创造力,发现强理解不等于人类水平的创造力,仅Mistral-Large接近人类水平。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17714 2026-04-21 cs.CL cs.AI 90%

Screen Before You Interpret: A Portable Validity Protocol for Benchmark-Based LLM Confidence Signals

在解释前筛查:一种便携式有效性协议用于基于基准的LLM置信信号

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出一种便携式有效性协议,用于评估基于基准的LLM置信信号,通过临床人格评估中的有效性筛查原则,定义了三个核心指标和结构指标,验证了20个前沿LLM在524个项目上的有效性。

Comments 25 pages, 6 figures, 8 tables, 2 appendices. Companion to arXiv:2604.15702

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13061 2026-04-20 cs.CL cs.AI 90%

Token Statistics Reveal Conversational Drift in Multi-turn LLM Interaction

令牌统计揭示多轮LLM交互中的对话漂移

Wael Hafez, Amir Nazeri

机构 * Semarx Research LLC(Semarx研究公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过令牌频率统计监测对话一致性,提出Bipredictability指标,验证其在多轮交互中的有效性,显示结构监控可补充语义评估。

Comments 13 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15859 2026-04-20 cs.LG cs.AI 90%

QuantSightBench: Evaluating LLM Quantitative Forecasting with Prediction Intervals

QuantSightBench:评估LLM定量预测的预测区间

Jeremy Qin, Maksym Andriushchenko

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出QuantSightBench基准,评估LLM在连续量数值预测中的表现,发现现有模型在90%覆盖率目标上普遍不足,且置信度校准随极端值恶化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15915 2026-04-17 cs.LG cs.CL 90%

AccelOpt: A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization

AccelOpt:一种自我改进的LLM代理系统,用于AI加速器内核优化

Genghan Zhang, Shaowei Zhu, Anjiang Wei, Zhenyu Song, Allen Nie, Zhen Jia, Nandita Vijaykumar, Yida Wang, Kunle Olukotun

机构 * Anonymous Authors(匿名作者)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 AccelOpt通过迭代生成探索内核优化空间,利用优化记忆库提升AI加速器内核性能,实验证明其能力随时间提升,且成本效益高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23636 2026-04-16 cs.LG cs.AI 90%

FlexGuard: Continuous Risk Scoring for Strictness-Adaptive LLM Content Moderation

FlexGuard: 严格度自适应的连续风险评分用于LLM内容审核

Zhihao Ding, Jinming Li, Ze Lu, Jieming Shi

机构 * The Hong Kong Polytechnic University(香港理工大学) ByteDance(字节跳动)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出FlexGuard,一种基于LLM的连续风险评分系统,通过风险对齐优化提升审核准确性和在不同严格度下的鲁棒性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00954 2025-10-24 cs.CL cs.AI 90%

Annotation Guidelines-Based Knowledge Augmentation: Towards Enhancing Large Language Models for Educational Text Classification

Shiqi Liu, Sannyuya Liu, Lele Sha, Zijie Zeng, Dragan Gasevic, Zhi Liu

机构 * National Engineering Research Center of Educational Big Data, Faculty of Artificial Intelligence in Education, Central China Normal University(国家教育大数据工程研究中心,教育人工智能学院,中央财经大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments The manuscript has been accepted for publication in IEEE Transactions on Learning Technologies. https://doi.org/10.1109/TLT.2025.3570775

Journal ref Liu, S., Liu, S., Sha, L., Zeng, Z., Gasevic, D., & Liu, Z. (2025). Annotation Guideline-Based Knowledge Augmentation: Towards Enhancing Large Language Models for Educational Text Classification. IEEE Transactions on Learning Technologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19475 2025-09-30 cs.CL cs.AI 90%

Automatic Question & Answer Generation Using Generative Large Language Model (LLM)

Md. Alvee Ehsan, A. S. M Mehedi Hasan, Kefaya Benta Shahnoor, Syeda Sumaiya Tasneem

专题命中 评测与基准 :LLM(title,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09053 2025-08-06 cs.AI cs.GT cs.LG 90%

Game Theory Meets Large Language Models: A Systematic Survey with Taxonomy and New Frontiers

Haoran Sun, Yusen Wu, Peng Wang, Wei Chen, Yukun Cheng, Xiaotie Deng, Xu Chu

机构 * CFCS, School of Computer Science, Peking University(计算机科学系,北京大学) School of Business, Jiangnan University(商学院,江南大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Comments A shorter conference version is published in IJCAI 2025, titled 'Game Theory Meets Large Language Models: A Systematic Survey'

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20921 2025-05-30 cs.CL cs.AI 90%

Automatic Transmission for LLM Tiers: Optimizing Cost and Accuracy in Large Language Models

Injae Na, Keonwoong Noh, Woohwan Jung

机构 * Department of Applied Artificial Intelligence, Hanyang University(应用人工智能系,翰阳大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

Comments ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01330 2024-12-03 cs.CL cs.AI 90%

The "LLM World of Words" English free association norms generated by large language models

Katherine Abramski, Riccardo Improta, Giulio Rossetti, Massimo Stella

专题命中 评测与基准 :LLM(title,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

Comments 16 pages, 11 figures, associated Github page with dataset available at: https://github.com/LLMWorldOfWords/LWOW

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07635 2023-08-16 cs.CL cs.AI 90%

LLM-Mini-CEX: Automatic Evaluation of Large Language Model for Diagnostic Conversation

Xiaoming Shi, Jie Xu, Jinru Ding, Jiali Pang, Sichen Liu, Shuqing Luo, Xingwei Peng, Lu Lu, Haihong Yang, Mingtao Hu, Tong Ruan, Shaoting Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23395 2026-08-25 cs.MA cs.AI cs.SE 新提交 90%

Right-Sizing LLM-Agent Decomposition in VAT Determination: A Pilot Controlled Sweep

增值税判定(VAT Determination)中大型语言模型智能体(LLM-Agent)分解的规模适配:一项试点控制扫描研究

Pedro Santos

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本试点研究在带反向收费的跨境增值税判定场景中,对比不同LLM智能体分解配置,发现中间配置准确率领先但未达标准,提出分解规模适配启发式方法并发布相关资源。

Comments 29 pages, 4 figures. Code, data, and traces: https://github.com/pedro-santos-eng/Right-sizing-LLM-agent-decomposition-in-VAT-determination

详情

展开后加载摘要…

URL PDF HTML 收藏