arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32413 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32413 篇

2311.00286 2023-12-12 cs.CL cs.AI cs.CR cs.LG 86%

JADE: A Linguistics-based Safety Evaluation Platform for Large Language Models

Mi Zhang, Xudong Pan, Min Yang

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

Comments A preprint work. Benchmark link: https://github.com/whitzard-ai/jade-db. Website link: https://whitzard-ai.github.io/jade.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04578 2023-12-11 cs.AI cs.CL cs.LG 86%

Towards a Psychological Generalist AI: A Survey of Current Applications of Large Language Models and Future Prospects

Tianyu He, Guanghui Fu, Yijing Yu, Fan Wang, Jianqiang Li, Qing Zhao, Changwei Song, Hongzhi Qi, Dan Luo, Huijing Zou, Bing Xiang Yang

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13172 2023-12-01 cs.CL cs.AI cs.CV cs.IR cs.LG 86%

Editing Large Language Models: Problems, Methods, and Opportunities

Yunzhi Yao, Peng Wang, Bozhong Tian, Siyuan Cheng, Zhoubo Li, Shumin Deng, Huajun Chen, Ningyu Zhang

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2023. Updated with new experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01026 2023-10-03 cs.AI cs.CL cs.IR cs.LG cs.MM 86%

Zero-Shot Recommendations with Pre-Trained Large Language Models for Multimodal Nudging

Rachel M. Harrison, Anton Dereventsov, Anton Bibin

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.04960 2022-12-12 cs.CY 86%

BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model

Christopher Akiki, Giada Pistilli, Margot Mieskes, Matthias Gallé, Thomas Wolf, Suzana Ilić, Yacine Jernite

专题命中 评测与基准 :language model(title,abstract);large language model(title)

Comments Presented at the 2022 NeurIPS Workshop on Broadening Research Collaborations in ML

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04363 2025-10-10 cs.SE cs.AI cs.CL 86%

MacroBench: A Novel Testbed for Web Automation Scripts via Large Language Models

Hyunjun Kim, Sejong Kim

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI;LLM(comments)

Comments NeurIPS 2025 Workshop on Lock-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04963 2025-07-15 cs.CL cs.AI 86%

An In-depth Evaluation of Large Language Models in Sentence Simplification with Error-based Human Assessment

Xuanxin Wu, Yuki Arase

机构 * Graduate School of Information Science and Technology, The University of Osaka(信息科学与技术研究生学校,大阪大学) School of Computing, Institute of Science Tokyo(计算学院,科学研究所东京)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI;LLM(comments)

Comments Accepted by ACM Transactions on Intelligent Systems and Technology. Our human evaluation corpus is available at: https://github.com/WuXuanxin/human-eval-llm-simplification

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27146 2026-08-28 cs.AI cs.SE 新提交 85%

When Tool Outputs Become Commands: Separating Action Induction from Runtime Authorization in Tool-Augmented LLM Agents

当工具输出成为命令:在工具增强型大语言模型智能体中分离动作诱导与运行时授权

Xiaokun Guo, Zhen Xu, Dongdong Huo, Yanqiu Zhang, Wei Wang, Qinfu Yang, Dongjin Yu, Yu Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究针对工具增强型LLM智能体中工具输出成为命令的风险,提出SARA框架分离动作诱导与执行授权,在AgentDojo等数据集上有效限制攻击成功率并保持任务效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21929 2026-08-25 cs.CR cs.CL 新提交 85%

SkillBloat: Token Amplification Attacks via Skill Injection in LLM Coding Agents

SkillBloat:通过大语言模型编码智能体中的技能注入实现的令牌放大攻击

Yuanjin Zheng, Jingbang Chen

机构 * CUHK-Shenzhen(香港中文大学(深圳)) SLAI(深圳市人工智能与机器人研究院)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 本文提出SkillBloat两阶段框架,通过技能注入对LLM编码智能体实施令牌放大攻击,在真实基准上实现5.4184x-10.1455x平均最佳放大,揭示了技能生态系统的新型资源攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17445 2026-08-25 cs.CR cs.CL 版本更新 85%

Decomposition Attacks Across Unlinkable Identities: Limits of Stateful Defenses for LLM Services

跨不可链接身份的分解攻击:大语言模型服务的有状态防御的局限性

Bowen Sun, Zhengyue Zhao, Xiaogeng Liu, Yinzhi Cao, Chaowei Xiao

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 评测与基准 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究发现,针对跨不可链接身份的分解攻击,现有有状态防御策略在攻击者可重试学习时无法有效阻止攻击,需引入身份链接等额外分组相关机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18466 2026-08-25 cs.CL 85%

Purdah and Patriarchy: Evaluating and Mitigating South Asian Biases in Open-Ended Multilingual LLM Generations

Mamnuya Rinki, Chahat Raj, Anjishnu Mukherjee, Ziwei Zhu

机构 * George Mason University(乔治·马歇尔大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to TrustNLP at ACL (Association for Computational Linguistics) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13605 2026-08-21 cs.CL 85%

KorNAT: LLM Alignment Benchmark for Korean Social Values and Common Knowledge

Jiyoung Lee, Minwoo Kim, Seungho Kim, Junghwan Kim, Seunghyun Won, Hwaran Lee, Edward Choi

机构 * KAIST AI(韩国科学技术院人工智能学院) DATUMO Inc.(DATUMO公司) Seoul National University Bundang Hospital(首尔大学盆唐医院) NAVER AI Lab(NAVER人工智能实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at ACL 2024 Findings (35 pages, 7 figures, 16 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16416 2026-08-18 cs.LG cs.NE 新提交 85%

Evolving Executable Pipeline Programs for AutoML with Language Models

用语言模型演化用于自动机器学习的可执行流水线程序

Sofoklis Kitharidis, Cor J. Veenman, Jan N. van Rijn, Thomas Bäck, Niki van Stein

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 LACE是首个以代码形式构建通用表格型AutoML的框架,用语言模型演化可执行流水线,在68个OpenML分类任务上表现优异,其核心贡献是提供可直接复用的代码级搜索空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14797 2026-08-18 cs.CL 新提交 85%

Beyond Tokens: A Survey on Decoding Methods for Large Language and Vision-Language Models

超越令牌:大型语言与视觉-语言模型的解码方法综述

Haoran Wang, Xiongxiao Xu, Philip S. Yu, Kai Shu

机构 * Emory University(埃默里大学) Illinois Institute of Technology(伊利诺伊理工大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 该综述针对LLMs与LVLMs,梳理其解码方法的三种新兴范式,强调解码方法在确保模型输出与用户意图一致上的高效性,同时指出挑战并展望未来方向。

Comments ACM SIGKDD Explorations Newsletter, Volume 28, Issue 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13326 2026-08-14 cs.CL 新提交 85%

Beyond Local Accuracy: A Protocol-Level Identifiability Audit for Controlled LLM Reasoning Evaluation

超越局部准确率:面向受控大语言模型推理评估的协议级可识别性审计

Junhao Luo, Ning Huang, Ziqi Sha, Wenxuan Tang, Wei Deng

机构 * School of Statistics and Data Science, Southwestern University of Finance and Economics(西南财经大学统计与数据科学学院)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究提出协议级可识别性审计方法,无需调用模型即可验证LLM评估协议的有效性,发现基础准确率与选择性响应保真度存在显著差异,还确定了冻结策略类的最小识别支持。

Comments 15 pages, 9 figures. Ning Huang, Ziqi Sha, and Wenxuan Tang contributed equally as second authors. Wei Deng is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05031 2026-08-14 cs.SE cs.AI 版本更新 85%

LLM-Based Test Oracles: Source-of-Authority Taxonomy -- A Systematic Literature Review

基于大语言模型的测试预言机:权威来源分类法——一项系统文献综述

Ali Hassaan Mughal, Muhammad Bilal

机构 * Independent Researcher, USA(美国独立研究员) Technical University of Munich, Germany(德国技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过系统文献综述,沿权威来源、形式及裁决机制三轴分析相关研究,刻画领域、语言等情况,指出规范衍生权威最常见但仅占约一半研究,还报告了评估及失败情况并提出研究议程。

Comments 21 pages, 10 figures, 11 tables. Systematic literature review of 83 studies, reported under PRISMA 2020. Submitted to IEEE Access. Replication package: https://doi.org/10.5281/zenodo.21194940

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01910 2026-08-14 cs.AI 版本更新 85%

DomusFM: A Foundation Model for Event-Based Behavioral Monitoring in Smart-Homes

DomusFM: 一个面向智能家居传感器数据的基础模型

Michele Fiori, Gabriele Civitarese, Flora D. Salim, Claudio Bettini

机构 * University of Milan(米兰大学) University of New South Wales(新南威尔士大学)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract_cn);language model(abstract);分类 cs.AI

AI总结 DomusFM是首个专为智能家居传感器数据设计的基础模型,通过自监督双对比学习范式实现语义和时间依赖性的建模,有效提升活动识别任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09900 2026-08-13 cs.CL 版本更新 85%

Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness

解码层面禁忌:大语言模型鲁棒性的诊断压力测试

Tadanobu Chuyo Kamijo, Ori Rottenstreich, Javier Conde, Gonzalo Martínez, Pedro Reviriego

机构 * University of the Ryukyus(琉球大学) Technion(以色列理工学院) Universidad Polécnica de Madrid(马德里理工大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出Decoding-Level Taboo这一零提示诊断压力测试,通过干预logit空间迫使大语言模型偏离标称路径,评估发现其鲁棒性与参数规模、指令对齐正相关,该测试还可用于生成合成数据集等场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05353 2026-08-12 cs.CL 版本更新 85%

Evidence Lock Before Commitment: A Frozen Interface Degrades LLM-as-Judge Evaluation

提交前的证据锁定:冻结界面会降低“大模型作为评判者”的评估效果

Divyansh Singh

机构 * University of Florida(佛罗里达大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究测试了证据锁定等不同LLM-as-Judge评估方案,发现证据锁定会降低与人类偏好的一致性、增加答案顺序不一致性,而结构化证据引出效果接近标准评判,持久化证据可支持审计但不应替代源答案。

Comments Withdrawn due to an error identified in the code during debugging. The error affects the reported results

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07517 2026-08-11 cs.HC cs.CL stat.AP 新提交 85%

The Judge Knows When It Knows: Calibrated Abstention for LLM-Based A/B-Test Prediction

法官知道自己何时知晓:基于大语言模型的A/B测试预测的校准弃权(不执行)

Tyler Dooskin, Squoosh Technical Staff

机构 * Squoosh

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究探究多模态LLM能否仅通过网页截图预测A/B测试结果,发现Gemini 3 Flash法官表现不佳,提出投票边际关卡隔离置信判断可提升性能,还在人类中重现了共识与真实结果脱节的现象,并发布了相关研究资源。

Comments 15 pages. Pre-registered experimental program with a public, tiered claims ledger; includes powered negative results, a label-validity audit, a cross-judge shared-prior measurement (n_eff ~ 2 of 16 votes), and a first-party 15-expert human baseline. Pre-registrations, statistical harness, human responses, and the full experiment ledger are released

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07490 2026-08-11 cs.HC cs.AI 新提交 85%

Experience-Sensitive Game Learning: A Behavioral Study of Humans and Language Agents

经验敏感型游戏学习:人类与语言智能体的行为研究

Yingying Guo, Zhuoxuan Ju, Ruibo Ming, Ruicheng Feng, Jinjin Gu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Georgetown University(乔治城大学) INSAIT, Sofia University “St. Kliment Ohridski”(索菲亚大学“圣·克利门特·奥赫里德斯基”分校INSAIT)

专题命中 评测与基准 :language agent(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究构建经验敏感型游戏学习框架,通过交互式游戏及相关指标分析人类与自进化语言智能体的游戏决策行为,发现人类会稳定转向全局策略,而自进化智能体的行为转变仍有局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12843 2026-08-11 cs.CL 版本更新 85%

Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration

成长之痛:通过固定参数校准实现可扩展且高效的LLM基准测试

Eliya Habba, Itay Itzhak, Asaf Yehudai, Yotam Perlitz, Elron Bandel, Michal Shmueli-Scheuer, Leshem Choshen, Gabriel Stanovsky

机构 * The Hebrew University of Jerusalem(海法大学) IBM Research(IBM研究院) MIT(麻省理工学院) Technion(技术学院) Allen Institute for AI(人工智能研究院)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 本文提出基于多维项目反应理论的框架,利用锚定项目校准新基准,保持原有参数固定,实现随时间扩展基准测试的同时保持评分可比性,且评估成本恒定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18852 2026-08-11 cs.CL 版本更新 85%

FanarGuard: A Culturally-Aware Moderation Filter for Arabic Language Models

FanarGuard: 一种文化感知的阿拉伯语言模型审查过滤器

Masoomali Fatehkia, Enes Altinisik, Husrev Taha Sencar

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 FanarGuard是一种双语审查过滤器,通过评估阿拉伯语和英语中的安全性和文化对齐性,提升内容审查的准确性与文化敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05960 2026-08-07 cs.CV cs.AI 新提交 85%

Big, Bright, or Invisible: A Frozen-Feature Benchmark of 3D CT Foundation Models

大的、明亮的还是不可见的:3D CT基础模型的冻结特征基准测试

Maulik Chevli, Johannes Brandt, Rickmer Braren, Daniel Rueckert, Philip Müller

机构 * Technical University of Munich (TUM)(慕尼黑工业大学(TUM)) TUM University Hospital(慕尼黑工业大学医院) Imperial College London(伦敦帝国理工学院) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) UKE Hamburg(汉堡大学医院)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);prompting(abstract);分类 cs.AI

AI总结 本研究对10个冻结CT编码器开展基准测试,发现性能主要取决于异常的对比度与空间范围,小型低对比度病变仍是挑战,需区域或病变级预训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11522 2026-08-07 cs.SD cs.LG cs.MM eess.AS 85%

Leveraging LLM Embeddings for Cross Dataset Label Alignment and Zero Shot Music Emotion Prediction

Renhang Liu, Abhinaba Roy, Dorien Herremans

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Journal ref Proc. of Conference on AI Music Creativity (AIMC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04899 2026-08-06 cs.CL 新提交 85%

Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification

基于大语言模型的分类置信度估计中的评估缺陷与稀疏性限制

Elena Merdjanovska, Omar Zaidan, Andreas Rücklé

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学) Amazon(亚马逊公司)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究指出 LLM 分类置信度估计中 verbalization 方法存在稀疏性缺陷,AUARC 评估的插值选择会影响排名,提出 verbalization logprobs 方法可解决稀疏性并提升 AUARC 且无额外推理成本。

Comments Published at Findings of ACL 2026

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 33424-33435

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03884 2026-08-05 cs.CV cs.CL 新提交 85%

BanglaWild: An In-the-Wild Bengali Scene Text Recognition Benchmark for OCR and Vision-Language Models

BanglaWild:面向OCR和视觉-语言模型的野外孟加拉语场景文本识别基准

Sadab Shiper, Tawsif Tashwar Dipto, Mir Md Inzamam, Eshat Tanzeem

专题命中 评测与基准 :language model(title);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 研究发现现有孟加拉语场景文本识别基准的不足,推出含2535张图像的BanglaWild基准,评估15个VLMs和3个OCR系统等,揭示视觉误识别为主要错误来源等结论,代码数据将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03071 2026-08-05 cs.AI 新提交 85%

Getting the Parameters Right: A Difficulty-Graded Benchmark and Probe-Guided Training for LLM Tool Calls

参数优化:面向大语言模型工具调用的难度分级基准与探测引导训练

Guoyao Yu, Xiaoqing Sun, Ziqi Huang, Shaojing Fan, Zhongyi Zhang, Xiaomeng Hu, Xiaobo Xue, Yangyang Shi, Xiong Xiao, Yang Song, Biao Lyu, Rong Wen, Xing Li, Qinming He, Shunming Zhu, Zhenguang Liu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型工具调用参数填写关注度不足的问题,提出含PBT和PGR的探测引导框架,发布ParamBench基准,使5个开放模型在多基准上的参数生成平均精确匹配率从19.7%升至59.6%。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28956 2026-08-05 cs.AI 版本更新 85%

MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations

MerchantBench:面向电商运营中长期一致性的大语言模型智能体基准测试

Qiming Shi, Yulong Tao, Linbo Jin, Zhaolu Kang, Yibo Dou, Jiawen Zhu, Tianjun Pan, Shaokang Fu, Chengyu Wang, Siyue Li, Yaping Cheng, Di Weng, Chengfu Huo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究推出MerchantBench电商运营基准测试,通过365天订单级模拟评估大语言模型智能体的中长期一致性,发现其与人类参与者存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02444 2026-08-04 cs.AI 新提交 85%

ParEvalLayer: When Partial LLM-Agent Evaluations Support a Decision

ParEvalLayer:当部分大语言模型智能体评估支持决策时

Wei-Jung Huang, Bonan Shen

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究提出ParEvalLayer决策层,可基于部分任务结果判断LLM智能体比较结论,部分基准仅需15%-25%任务结果即可得出与完整评估一致的决策。

Comments Accepted at the 2026 ACM International Conference on AI-ML Systems (AIMLSystems)

详情

展开后加载摘要…

URL PDF HTML 收藏