arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32208 篇

2607.22883 2026-07-28 cs.SE cs.AI cs.LG 新提交 88%

Evaluating and Mitigating the Misguidance Effect of Buggy Code in LLM-Generated Unit Tests

评估和减轻大语言模型生成单元测试中错误代码的误导效应

Junda Zhao, Shurui Zhou, Eldan Cohen

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型生成单元测试时错误代码的误导效应,提出新指标衡量,分析其双重影响,引入基于规范的单元测试生成范式,有效减少误导性测试,增加有效测试,改善测试生成管道,适用于各类代码。

Comments 24 pages, 7 figures, 12 tables. Accepted at ISSTA 2026; to appear in Proceedings of the ACM on Software Engineering (PACMSE), Vol. 3, No. ISSTA, Article ISSTA113

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19361 2026-07-23 cs.CL cs.AI 新提交 88%

Stateful Guardrails for Multi-Turn LLM Systems: A Conversational Risk Accumulation Framework

多轮大语言模型系统的有状态防护栏:一个对话风险累积框架

Sanjay Mishra, Divya Chukkapalli, Ganesh R. Naik

机构 * College of Medicine and Public Health, Flinders University(弗林德斯大学医学与公共卫生学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究多轮大语言模型系统的对话风险累积问题,提出会话层CRA框架,跟踪三个轨迹信号,提供评分方法,发布多个基准测试集及评估协议,重点在于分布内会话评分,为大语言模型安全防护提供新方法。

Comments 45 pages, 10 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19219 2026-07-22 cs.CL cs.AI 新提交 88%

Beyond Score Prediction: LLM-Based Essay Scoring and Feedback Generation via Reinforcement Learning with Rubric Rewards

超越分数预测:基于强化学习和评分标准奖励的基于大语言模型的作文评分与反馈生成

Xuefeng Jin, Jiashuo Zhang, Teng Cao, Bin Yang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究基于大语言模型的作文评分与反馈生成,提出RLAES框架,通过强化学习联合优化。引入RFE评估框架,提出AGFO和ACR方法。实验表明RFE能捕捉一致性,RLAES-AGFO在评分性能上最佳,保持反馈质量同时避免反馈退化。

Comments 12 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09497 2026-07-21 cs.CL cs.AI 版本更新 88%

BERT-as-a-Judge: A Robust Alternative to Lexical Methods for Efficient Reference-Based LLM Evaluation

BERT-as-a-Judge: 一种更稳健的替代方法,用于高效参考基于的大语言模型评估

Hippolyte Gisserot-Boukhlef, Nicolas Boizard, Emmanuel Malherbe, Céline Hudelot, Pierre Colombo

机构 * Artefact Research Center(Artefact 研究中心) Diabolocom Cohere

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BERT-as-a-Judge,通过编码器驱动的方法评估参考基于的生成结果,克服了传统词汇方法的局限,提供高效且可靠的评估方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14108 2026-07-17 cs.CL cs.AI cs.SE 新提交 88%

Eta Given Delta: Defining LLM Tool Efficiency With Marginal Tool Utility

给定增量的埃塔:用边际工具效用定义大语言模型工具效率

Nyx Iskandar

机构 * Foam(泡沫)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 研究提出用于评估LLM智能体轨迹中工具调用率的工具效率及边际工具效用指标,用LLM-as-a-Judge确定边际工具效用符号,区别于间接测效率的 prior work,直接测效率,为LLM评估研究及相关工程做贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13801 2026-07-16 cs.CR cs.AI cs.LG 新提交 88%

Traffic-Aware Randomized Smoothing for LLM-Based Network Intrusion Detection

基于大语言模型的网络入侵检测的流量感知随机平滑

Zhenpeng Li

机构 * Guangzhou Health Science College(广州健康科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究基于大语言模型的网络入侵检测系统对流量操纵的鲁棒性,提出流量感知随机平滑方法TA-RS,通过在特定子空间注入噪声,提升认证准确率,不同数据集表现有差异,还探究了方法局限性及改进策略。

Comments 44 pages, 14 figures, 14 tables. Submitted to Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08143 2026-07-10 cs.CL cs.AI cs.IR 新提交 88%

ICDAR 2026 HIPE-OCRepair Competition on LLM-Assisted OCR Post-Correction for Historical Documents

ICDAR 2026关于历史文档的大语言模型辅助OCR后校正的HIPE-OCRepair竞赛

Maud Ehrmann, Emanuela Boros, Juri Opitz, Andrianos Michail, Florian Wagner, Simon Clematide

机构 * École Polytechnique Fédérale de Lausanne (EPFL), Switzerland(瑞士联邦理工学院洛桑分校) University of Zurich, Switzerland(苏黎世大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 ICDAR 2026的HIPE-OCRepair竞赛旨在评估大语言模型辅助历史文档OCR后校正系统能力,提供可重现评估框架。四支队伍提交不同策略系统,结果显示虽能提高OCR质量,但性能因多种因素而异,还存在过度校正问题,相关资源已发布供后续研究。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00292 2026-07-02 cs.NI cs.AI cs.CL 新提交 88%

An LLM-Based Framework for Intent-Driven Network Topology Design

基于LLM的意图驱动网络拓扑设计框架

Kholoud El-Habbouli, Fen Zhou, Stephane Huet

机构 * CERI-LIA, University of Avignon(阿维尼翁大学CERI-LIA实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一个结合分层建模和系统验证的约束驱动流水线,利用大语言模型从自然语言需求生成结构有效且符合约束的网络拓扑,并通过多模型对比评估其正确性和弹性。

Comments submitted to IEEE CNSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29719 2026-06-30 cs.LG cs.CL 88%

A Diagnostic Framework and Multi-Evaluator Audit of Evaluator-Driven Preference Dynamics in Self-Adapting LLM Agents

自适应LLM代理中评估器驱动偏好动态的诊断框架与多评估器审计

Liu Zewen

机构 * Qilu Institute of Technology, School of Software Engineering(青岛理工大学软件学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 提出EPC诊断框架,包含多模态偏好崩溃指数、评估器索引耦合矩阵和JS散度,通过8个实验条件揭示GPT-4o版本漂移导致评估结论反转,证明单一快照评估研究不可靠。

Comments 9 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27226 2026-06-26 cs.AI cs.CL 新提交 88%

Ask, Don't Judge: Binary Questions for Interpretable LLM Evaluation and Self-Improvement

询问而非评判:用于可解释的LLM评估和自我改进的二元问题

Sangwoo Cho, Kushal Chawla, Pengshan Cai, Zefang Liu, Chenyang Zhu, Shi-Xiong Zhang, Sambit Sahu

机构 * Capital One, AI Foundations(Capital One人工智能基础)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出BINEVAL框架,将评估标准分解为原子二元问题,聚合为可解释的多维分数,在多项基准上匹配或超越强基线,并支持迭代提示优化。

Comments Acceepted to the Second Workshop on Compositional Learning at ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26429 2026-06-26 cs.LG cs.CL 新提交 88%

DualEval: Joint Model-Item Calibration for Unified LLM Evaluation

DualEval: 联合模型-项目校准的统一LLM评估

Aaron J. Li, Hao Huang, Youngmin Park, Yitong Ma, Wei-Lin Chiang, Li Chen, Cho-Jui Hsieh, Bin Yu, Ion Stoica

机构 * University of California, Berkeley(加州大学伯克利分校) Arena University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 提出DualEval框架,通过联合模型-项目校准统一静态基准和竞技场式评估,生成可靠模型排名并支持基准压缩和异常检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23915 2026-06-24 cs.CL cs.IR cs.LG 新提交 88%

Do LLM Attribution Metrics Transfer? Auditing Retrieval-Augmented Generation Evaluation Across Datasets and Constructs

LLM归因指标是否可迁移?跨数据集和构念的检索增强生成评估审计

Tianyu Ding, Aditya Nannapaneni, Juan Pablo De la Cruz Weinstein

机构 * Amazon Web Services(亚马逊云服务)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本研究审计了八种自动归因评分器在三个评估构念上的表现,发现没有评分器能在所有数据集上保持最佳性能,指标排名会反转,且简单选择最佳平均评分器会导致显著遗憾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23127 2026-06-23 cs.AI cs.CL cs.SE 新提交 88%

Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation

管理LLM智能体中的程序性记忆:控制、适应与评估

Julia Belikova, Rauf Parchiev, Evgeny Egorov, Grigorii Davydenko, Gleb Gusev, Andrey Savchenko, Maksim Makarenko

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出AFTER基准(382个企业任务,22种程序性技能),评估技能在任务、角色和模型间的迁移,实验表明程序性记忆可提升3.7-6.7点性能,跨模型准确率达73.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22329 2026-06-23 cs.CL cs.AI 新提交 88%

BabelJudge: Measuring LLM-as-a-Judge Reliability Across Languages and Agent Trajectories

BabelJudge: 跨语言和智能体轨迹中LLM作为评判者可靠性的测量

Shreyas KC

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出BabelJudge基准,通过受控扰动生成已知标签的成对样本,无监督地测量评判模型的位置偏差、冗长偏差、顺序不一致和跨语言退化,发现Swahili顺序一致性接近随机。

Comments 8 pages, 4 figures. Source code, benchmark toolkit, and reproduction scripts at https://github.com/Shreyaskc/BabelJudge

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20631 2026-06-23 cs.AI cs.LG 新提交 88%

Harnessing Agent Skills: Architectural Patterns and a Reference Architecture for Skill-Mediated LLM Agents

驾驭智能体技能:技能中介LLM智能体的架构模式与参考架构

Boming Xia, Liming Zhu, Zhenchang Xing, Qinghua Lu, Dino Sejdinovic, Xiwei Xu

机构 * Responsible AI Research (RAIR) Centre(负责任人工智能研究中心) Adelaide University(阿德莱德大学) University of New South Wales(新南威尔士大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出十种经验性架构模式(五种核心、五种辅助)用于技能中介,并综合成包含供应链、中介、执行控制、证据与反馈四层的参考架构,通过跨实例化评估提供分析框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20629 2026-06-23 cs.MA cs.AI cs.LG 新提交 88%

Specialize Roles, Mix Deployments: Pushing the Cost-Accuracy Frontier of LLM Agent Teams

专业化角色,混合部署:推动LLM代理团队的成本-精度前沿

Yinsicheng Jiang, Liang Cheng, Yeqi Huang, Yufan Zhao, Zhan Lu, Li Dong, Wenda Li, Edoardo Ponti, Luo Mai

机构 * University of Edinburgh(爱丁堡大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出AgentCARD基准,通过角色感知评估和帕累托前沿分析,发现异构团队在成本-精度前沿上优于同构团队,混合部署可降低12倍成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00326 2026-06-23 cs.AI cs.CL cs.IR 88%

Agent-OM: Leveraging LLM Agents for Ontology Matching

Agent-OM:利用大语言模型代理进行本体匹配

Zhangcheng Qiang, Weiqing Wang, Kerry Taylor

机构 * Australian National University(澳大利亚国立大学) Monash University(墨尔本大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Agent-OM框架,结合检索与匹配代理及OM工具,有效提升复杂和少样本本体匹配任务性能,接近传统最佳表现。

Comments 31 pages - VLDB 2025 (Page 1-20), OM 2025 (Page 21-31)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16988 2026-06-15 cs.CL cs.AI cs.MA 版本更新 88%

MASLab: A Unified and Comprehensive Codebase for LLM-based Multi-Agent Systems

MASLab:基于LLM的多智能体系统的统一全面代码库

Rui Ye, Keduan Huang, Qimin Wu, Yuzhu Cai, Tian Jin, Xianghe Pang, Xiangrui Liu, Jiaqi Su, Chen Qian, Bohan Tang, Kaiqu Liang, Jiaao Chen, Yue Hu, Zhenfei Yin, Rongye Shi, Bo An, Yang Gao, Wenjun Wu, Lei Bai, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Princeton University(普林斯顿大学) Meta University of Michigan(密歇根大学) The University of Sydney(悉尼大学) Beihang University(北航) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出MASLab代码库,集成20余种方法,提供统一环境与标准化评估,降低研究门槛,覆盖10+基准测试和8种模型。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11517 2026-06-10 cs.CL cs.DC cs.LG 88%

Learning to Keep a Promise: Scaling Language Model Decoding Parallelism with Learned Asynchronous Decoding

学习承诺:通过学习异步解码扩展语言模型解码并行性

Tian Jin, Ellie Y. Cheng, Zack Ankner, Nikunj Saunshi, Blake M. Elias, Amir Yazdanbakhsh, Jonathan Ragan-Kelley, Suvinay Subramanian, Michael Carbin

机构 * DeepMind, London, UK(深度思维公司,伦敦,英国) Google Research, New York, NY, USA(谷歌研究院,纽约,纽约州,美国) Stanford University, Stanford, CA, USA(斯坦福大学,斯坦福,加利福尼亚州,美国) University of Toronto, Toronto, Ontario, Canada(多伦多大学,多伦多,安大略省,加拿大) University of Washington, Seattle, WA, USA(华盛顿大学,西雅图,华盛顿州,美国)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出PASTA系统,通过学习使语言模型识别语义独立性,提升解码并行性,实验证明在解码速度和响应质量上优于现有方法。

Comments 15 pages

Journal ref Proceedings of the 42nd International Conference on Machine Learning (ICML), PMLR 267:27941-27956, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08036 2026-06-09 cs.IR cs.AI cs.CL 新提交 88%

GIScholarBench: Benchmarking LLM Overconfidence in GIS Research

GIScholarBench: 在GIS研究中评估大语言模型的过度自信

Zongrng Li, Mingzheng Yang, Lei Zou, Hongxu Ma, Hao Tian, Siqi Zhou, Wenjing Gong, Kaili Zhang, Bingqian Chen, Mitch Zhang, Yifan Yang

机构 * Texas A&M University(德克萨斯理工大学) Google(谷歌) Department of Geography(地理系) Department of Landscape Architecture and Urban Planning(景观建筑与城市规划系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在学术研究中的过度自信问题,构建了包含10865篇论文的GIScholarBench基准,通过元数据检索、文献链接和研究方向生成三项任务评估模型表现,发现所有模型均存在任务不变的过度自信现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03019 2026-06-03 cs.LG cs.AI 88%

Distribution-Calibrated Inference Time Compute for Thinking LLM-as-a-Judge

分布校准的推理时间计算用于思考型LLM作为评判者

Hamid Dadkhahi, Firas Trabelsi, Parker Riley, Juraj Juraska, Mehdi Mirzazadeh

机构 * University of California, Berkeley(加州大学伯克利分校) DeepMind(深Mind) University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对思考型大语言模型作为评判者时单样本噪声和聚合不一致问题,提出基于Bradley-Terry-Davidson模型的分布校准聚合方案,利用极性(非平局边际)和决定性(非平局率)区分微弱多数与强共识,显著降低MAE并提高成对准确率,匹配或超越人类评判者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02423 2026-06-02 cs.CL cs.LG 88%

Investigating and Alleviating Harm Amplification in LLM Interactions

调查和缓解大语言模型交互中的危害放大

Ruohao Guo, Wei Xu, Alan Ritter

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出HarmAmp基准和TrajSafe监控器,用于评估和缓解多轮对话中大语言模型对危害的放大效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00334 2026-06-02 cs.CL cs.AI 88%

Isolating LLM Lexical Bias: A Curation-Free Triangulated Metric for Preference-Stage Learning

隔离LLM词汇偏差:一种无人工标注的三角化偏好学习阶段度量

Xiaoyang Ming, Jose Hernandez, Thomas Stephan Juzek

机构 * Florida State University(佛罗里达州立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种无需人工标注的三角化偏好偏移分数(Triangulated Preference Shift score),通过对比人类标准、基础模型和指令变体,量化偏好学习阶段引入的词汇偏差。

Comments 7 pages, 2 figures, 1 table

Journal ref The International FLAIRS Conference Proceedings, 39(1) (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29018 2026-05-29 cs.AI cs.CL 88%

Adopt $\neq$ Adapt: Longitudinal Analyses of LLM Conversations in the Wild

采用 ≠ 适应:野外LLM对话的纵向分析

Rebecca M. M. Hicke, Kiran Tomlinson

机构 * Cornell University(康奈尔大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 通过分析约12,000名Microsoft Bing Copilot用户的对话轨迹及WildChat-4.8M数据,发现用户行为高度固化,活跃用户更倾向复杂专业任务,且WildChat数据集偏向高熟练度“超级用户”,表明现有用户行为难以改变并揭示用户异质性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24636 2026-05-27 cs.AI cs.CL 88%

GlobalDentBench: A Multinational Benchmark for Evaluating LLM Clinical Reasoning in Dentistry with Expert Calibration

GlobalDentBench:一个用于评估牙科领域大语言模型临床推理能力并包含专家校准的多国基准

Junjie Zhao, Jingyi Liang, Zhenyang Cai, Jiaming Zhang, Zhenwei Wen, Shuzhi Deng, Wenjing Yi, Chunfeng Luo, Hexian Zhang, Junying Chen, Tianrui Liu, Zhuhui Bai, Zixu Zhang, Pradeep Singh, Xiang Liu, Jianquan Li, Nhan L Tran, Falk Schwendicke, Zuolin Jin, Lijian Jin, Liangyi Chen, Wei-fa Yang, Benyou Wang, Junwen Wang, Shan Jiang

机构 * Division of Applied Oral Sciences and Community Dental Care, Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院应用口腔科学与社区牙科护理系) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) Department of Periodontology, Shenzhen Stomatology Hospital (Pingshan) of Southern Medical University, Shenzhen, China(南方医科大学深圳口腔医院(平山)牙周科) Beijing Institute of Collaborative Innovation(北京协同创新研究院) Department of Orthodontics, Shenzhen Stomatology Hospital (Pingshan) of Southern Medical University, Shenzhen, China(南方医科大学深圳口腔医院(平山)正畸科) Shenzhen Stomatology Hospital (Pingshan) of Southern Medical University, Shenzhen, China(南方医科大学深圳口腔医院(平山)) College of Future Technology, Peking University(北京大学未来技术学院) Freedom AI New Cornerstone Science Laboratory, National Biomedical Imaging Center, State Key Laboratory of Membrane Biology, Institute of Molecular Medicine, Peking-Tsinghua Center for Life Sciences, College of Future Technology, Peking University, Beijing 100871, China(新基石科学实验室、国家生物医学成像中心、膜生物学国家重点实验室、分子医学研究院、北京大学未来技术学院、生命科学中心,北京大学,北京100871,中国) IDG/McGovern Institute for Brain Research, Peking University, Beijing 100871, China(IDG/ McGovern脑科学研究院,北京大学,北京100871,中国) Division of Oral and Maxillofacial Surgery, Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院口腔颌面外科系) Shenzhen Loop Area Institute(深圳河套学院) Department of Cancer Biology, Mayo Clinic Arizona, 5777 E. Mayo Blvd., IERB-3-504A, Phoenix, Arizona, 85054, USA(梅奥诊所亚利桑那分部癌症生物学部门,5777 E. Mayo Blvd., IERB-3-504A, Phoenix, Arizona, 85054, USA) Department of Conservative Dentistry, Periodontology and Digital Dentistry, LMU University Hospital, LMU Munich, Munich, Germany(慕尼黑大学医院保守牙科、牙周病学和数字牙科部门,慕尼黑,德国,慕尼黑大学) Division of Periodontology & Implant Dentistry, Faculty of Dentistry, The University of Hong Kong, Hong Kong, SAR, China(香港大学牙科学院牙周病学与种植牙科系,香港,中国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出首个跨国牙科基准GlobalDentBench,包含14个专科、88个国家的8978道专家验证题目,评估三种推理层次,揭示当前大语言模型在牙科临床推理中性能随复杂度下降且存在高风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25658 2026-05-26 cs.CL cs.AI 88%

AutoSG: LLM-Driven Solver Generation Solely from Task Prompts for Expensive Optimization

AutoSG: 仅从任务提示出发的LLM驱动的昂贵优化求解器生成

Haoran Gu, Handing Wang, Yi Mei, Mengjie Zhang

机构 * Xidian University(西安电子科技大学) Victoria University of Wellington(威灵顿维多利亚大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出AutoSG框架,通过检索增强生成、单步自优化和无实例评估机制,从自然语言提示直接生成可执行定制求解器,解决昂贵优化中的幻觉、结构破坏和评估成本问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20087 2026-05-25 cs.CL cs.AI 88%

ThoughtTrace: Understanding User Thoughts in Real-World LLM Interactions

ThoughtTrace: 理解真实世界LLM交互中的用户想法

Chuanyang Jin, Binze Li, Haopeng Xie, Cathy Mengying Fang, Tianjian Li, Shayne Longpre, Hongxiang Gu, Maximillian Chen, Tianmin Shu

机构 * Johns Hopkins University(约翰霍普金斯大学) Massachusetts Institute of Technology(麻省理工学院) Google Research(谷歌研究)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ThoughtTrace,首个大规模数据集,通过配对真实多轮人机对话与用户自述想法(提示原因和对助手回复的反应),揭示用户认知动态,并展示其在行为预测和个性化对齐中的价值。

Comments 53 pages, 23 figures, 4 tables. Project website: https://thoughttrace-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11053 2026-05-25 cs.CR cs.AI cs.LG 88%

Content-Aware Attack Detection in LLM Agent Tool-Call Traffic: An Empirical Study of Features, Architectures, and Evaluation Protocols

LLM Agent工具调用流量中的内容感知攻击检测:特征、架构与评估协议的实证研究

Sultan Zavrak

机构 * Department of Computer Engineering, Duzce University(杜兹大学计算机工程系)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对MCP工具调用流量,提出基于图神经网络的攻击检测框架,通过内容嵌入和任务分离评估协议,实现AUROC超过0.89的检测性能,并揭示随机分割评估导致的高估问题。

Comments v2: renamed manuscript (brand removed; descriptive title). No changes to methodology, results, tables, or figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22612 2026-05-22 cs.CY cs.AI cs.LG 88%

Healthcare LLM Benchmarks Are Only as Good as Their Explicit Assumptions

医疗LLM基准测试的可靠性仅取决于其显式假设

Naveen Raman, Santiago Cortes-Gomez, Mateo Dulce Rubio, Fei Fang, Bryan Wilder

机构 * Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出医疗LLM基准测试的评估-部署差距源于隐式假设,而非基准设计问题,并通过BenchmarkCards和分阶段评估方法来解决这一问题。

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14654 2026-05-21 cs.CV cs.AI cs.CL 88%

Beyond Words: Multimodal LLM Knows When to Speak

超越词语:多模态大语言模型何时说话

Zikai Liao, Yi Ouyang, Yi-Lun Lee, Chen-Ping Yu, Yi-Hsuan Tsai, Zhaozheng Yin

机构 * Department of Computer Science, Stony Brook University(石溪大学计算机科学系) Atmee AI

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种多模态策略,通过同步视频、音频和文本线索提高对话中的响应时机意识,从而提升大语言模型在对话中的响应准确性。

Comments Project page: https://github.com/lzk901372/MM-When2Speak

详情

展开后加载摘要…

URL PDF HTML 收藏