arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2606.06869 2026-06-08 cs.AI 新提交 88%

Evidence-Based Intelligent Diagnostic and Therapeutic Visualization System with Large Language Models: Multi-Turn Interaction and Multimodal Treatment Plan Generation

基于证据的智能诊断与治疗可视化系统与大语言模型:多轮交互与多模态治疗方案生成

Yunhan Wang, Yuda Wang, Zhiying Tu, Mingqiang Song, Li Song, Kun Li, Dianhui Chu, Bolin Zhang

机构 * Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院) Shandong Key Laboratory of Digital Service Computing Technology and Systems(山东省数字服务计算技术与系统重点实验室) Weihai Municipal Hospital(威海市人民医院) Shanghai Taizhu Technology Co., Ltd(上海泰山技术有限公司) Tianjin Zhifu Qihuang Medical Technology Co., Ltd(天津中孚启黄医疗技术有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出知识增强的可视化诊断系统,通过知识图谱约束、信息增益驱动提问和多模态治疗呈现,提升中医辨证透明度和治疗可解释性。

Comments 29 pages, 9 figures, 5 tables, including supporting information

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23204 2026-06-08 cs.AI 版本更新 88%

TSAQA: Time Series Analysis Question And Answering Benchmark

TSAQA:时间序列分析问答基准

Baoyu Jing, Sanhorn Chen, Lecheng Zheng, Boyu Liu, Zihao Li, Jiaru Zou, Tianxin Wei, Zhining Liu, Zhichen Zeng, Ruizhong Qiu, Xiao Lin, Yuchen Yan, Dongqi Fu, Jingchao Ni, Jingrui He, Hanghang Tong

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Virginia Polytechnic Institute and State University(弗吉尼亚理工学院和州立大学) Amazon(亚马逊) Meta AI University of Houston(休斯顿大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 提出TSAQA基准,涵盖6种时间序列分析任务(含新型PZ格式),评估LLM在13领域21万样本上的表现,最佳模型仅65.08分。

Comments Comments: 35 pages, 7 figures. Accepted to the GEM Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05874 2026-06-05 cs.CL 88%

Evaluating Stochastic Collapse and Implicit Bias in Multimodal Large Language Models

评估多模态大语言模型中的随机坍缩与隐式偏差

Huiyuan Zheng, Houtao Zhang, Boyang Wang, Qingyi Si, Hongcheng Guo

机构 * Fudan University(复旦大学) Beihang University(北航) JD.com(京东)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出RandomBench基准测试,通过熵和分布偏差指标揭示多模态大语言模型在逻辑中性场景下存在随机坍缩现象,即无法维持均匀随机性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01703 2026-06-02 cs.SD cs.AI cs.CV 88%

JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions

JenBridge: 跨场景转换的自适应长视频配乐

Jiashuo Yu, Yao Yao, Boyu Chen, Alex Wang

机构 * Jen Music AI

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出JenBridge框架,通过基于Transformer的生成模型、双文本-视觉条件对齐和LLM代理驱动的自适应过渡机制,实现长视频配乐的高保真生成与场景转换自然连贯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07356 2026-06-02 cs.LG 88%

Controllable Value Alignment in Large Language Models through Neuron-Level Editing

大语言模型中通过神经元级编辑的可控价值对齐

Yonghui Yang, Yihui Wang, Junwei Li, Jilong Liu, Fengbin Zhu, Weibiao Huang, Le Wu, Richang Hong, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Hefei University of Technology(合肥工业大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ST Engineering Ltd.(ST工程有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 提出NeVA框架,通过识别稀疏价值相关神经元并进行推理时激活编辑,实现细粒度可控价值对齐,减少价值泄漏并保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31251 2026-06-01 cs.CV cs.AI 88%

ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models

ERGeoBench:多模态大语言模型中具身推理与地理定位的综合基准

Kaiwen Xue, Tao Wei, Guoxin Zhang, Zhonghong Ou, Kaoyan Lu, Yu Feng, Yifan Zhu, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) School of Materials Science and Engineering(材料科学与工程学院) China Mobile Research Institute(中国移动研究院) College of Computing and Data Science(计算与数据科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出ERGeoBench基准,通过单视图、全景视图和具身视图三种渐进设置评估多模态大语言模型在视觉驱动的具身地理定位中的能力,发现当前模型在高层次地理语义推理上表现良好,但在细粒度感知、度量定位和视图间空间一致性上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26947 2026-05-29 cs.CL 88%

KZ-SafetyPrompts: A Kazakh Safety Evaluation Prompt Dataset for Large Language Models

KZ-SafetyPrompts:用于大型语言模型的哈萨克语安全评估提示数据集

Wajdi Zaghouani, Shimaa Amer Ibrahim, Aruzhan Muratbek, Olzhasbek Zhakenov, Adiya Akhmetzhanova

机构 * Northwestern University in Qatar(卡塔尔西北大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对哈萨克语在大型语言模型安全评估中资源不足的问题,构建了一个包含11个风险类别、5717条原生哈萨克语提示的数据集,并基于GPT-4o基线测试发现跨类别拒绝率差异显著,揭示了仅英语评估无法捕获的类别特定安全漏洞。

Comments Accepted at the SIGUL2026 Workshop co-located with LREC2026

Journal ref In Proceedings of the SIGUL2026 Workshop co-located with LREC 2026, Palma de Mallorca, Spain, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28515 2026-05-28 cs.SE cs.AI 88%

Do LLMs Favor Their Providers? Measuring Vertical Integration Bias in Code Generation

LLM 是否偏袒其提供商?测量代码生成中的垂直整合偏差

Melih Catal, Alex Wolf, Tiago Ferreiro Matos, Pooja Rani, Harald Gall

机构 * University of Zurich(苏黎世大学) University of Mannheim(曼海姆大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出 VIBench 基准,通过 20 个提供商可选的软件集成场景,测量前沿 LLM 在直接和代理代码生成中的垂直整合偏差,发现六成关联模型存在显著偏差,代理工作流加剧偏差至 +39.2 个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28032 2026-05-28 cs.AI 88%

PetroBench: A Benchmark for Large Language Models in Petroleum Engineering

PetroBench:石油工程大语言模型基准测试

Xiang Wang, Tingting Zhang, Sen Wang, Ying Wu, Heng Meng, Peng Zhou, Peng Li

机构 * School of Petroleum and Natural Gas Engineering, Changzhou University(常州大学石油与天然气工程学院) China University of Petroleum (East China)(中国石油大学(华东))

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对石油工程领域,构建包含1200道题目的标准化题库,评估8种主流大语言模型,发现模型在主观题上表现优于客观题,中国模型在选择题上有优势,国际模型在简答题上略优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27631 2026-05-28 cs.CR cs.LG 88%

Poison with Style: A Practical Poisoning Attack on Code Large Language Models

风格投毒:针对代码大语言模型的实用投毒攻击

Khang Tran, Yazan Boshmaf, Issa Khalil, NhatHai Phan, Ting Yu, Md Rizwan Parvez

机构 * Department of Data Science, New Jersey Institute of Technology, New Jersey, U.S.A.(新泽西理工学院数据科学系) Qatar Computing Research Institute, HBKU, Doha, Qatar(卡塔尔计算研究所) Mohamed Bin Zayed University of Artificial Intelligence, Abu Dhabi, United Arab Emirates(马尔代夫人工智能大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 提出 Poison-with-Style (PwS) 攻击,利用开发者代码风格作为隐蔽触发器,通过两步训练策略微调代码大语言模型,使其在触发风格下生成漏洞代码,同时保持正常行为。

Comments Accepted to the Forty-Third International Conference on Machine Learning 2026 (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21666 2026-05-28 cs.AI cs.CV 88%

SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding

SONIC-O1:用于评估多模态大语言模型在音视频理解上的真实世界基准

Ahmed Y. Radwan, Christos Emmanouilidis, Hina Tabassum, Deval Pandya, Shaina Raza

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究所) University of Groningen(Groningen大学) York University(约克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出SONIC-O1基准,包含60小时人工验证的音视频数据,评估多模态大语言模型在开放摘要、多项选择问答和时序定位上的能力,发现模型在时序定位上存在显著性能差距和人口统计偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17620 2026-05-28 cs.CL 88%

Forget to Know, Remember to Use: Context-Aware Unlearning for Large Language Models

忘记知识,记住使用:面向大型语言模型的上下文感知遗忘

Yuefeng Peng, Parnian Afshar, Megan Ganji, Thomas Butler, Amir Houmansadr, Mingxian Wang, Dezhi Hong

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Amazon(亚马逊)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对现有遗忘方法损害上下文可用性的问题,提出一种插件式目标项,在保持遗忘效果和保留集性能的同时恢复模型对已遗忘知识的上下文使用能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26079 2026-05-27 cs.CL 88%

Automated Benchmark Auditing for AI Agents and Large Language Models

AI智能体与大语言模型的自动化基准审计

Junlin Wang, Federico Bianchi, Shang Zhu, Fan Nie, Yongchan Kwon, Bhuwan Dhingra, James Zou

机构 * Duke University(杜克大学) Together AI Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出自动化基准审计框架ABA,系统审计基准任务中的隐藏环境依赖、规范缺失和评分逻辑问题,在168个基准中发现25.7%的任务存在关键问题,过滤后模型排名变化且性能提升约10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21106 2026-05-27 cs.CL cs.IR 88%

BESPOKE: Benchmark for Search-Augmented Large Language Model Personalization via Diagnostic Feedback

BESPOKE:通过诊断反馈进行搜索增强型大语言模型个性化的基准测试

Hyunseo Kim, Sangam Lee, Kwangwook Seo, Dongha Lee

机构 * Department of Artificial Intelligence, Yonsei University, Seoul, Republic of Korea(人工智能系,延世大学,首尔,大韩民国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出BESPOKE基准,通过收集真实用户历史并配对细粒度偏好分数与反馈,系统评估搜索增强型大语言模型在个性化信息检索任务中的表现。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23332 2026-05-25 cs.CL 88%

Cultural Adaptation in Large Language Models for Political Discourse

大型语言模型在政治话语中的文化适应

Wajdi Zaghouani

机构 * Northwestern University in Qatar(卡塔尔西北大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文探讨大型语言模型在政治话语分析中的文化适应问题,提出通过翻译、话语和本体层面的形式化框架及评估矩阵,确保跨文化部署的可靠性和民主安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17015 2026-05-25 cs.CV cs.CL 88%

Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models

Multi-SpatialMLLM: 多模态大语言模型的多帧空间理解

Runsen Xu, Weiyao Wang, Hao Tang, Xingyu Chen, Xiaodong Wang, Fu-Jen Chu, Matt Feiszli, Kevin J. Liang

机构 * FAIR, Meta(FAIR,Meta) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出一种框架,通过整合深度感知、视觉对应和动态感知等基本空间技能,使多模态大语言模型具备多帧空间理解能力,并构建MultiSPA数据集和基准测试,模型Multi-SpatialMLLM在多项任务上取得显著提升。

Comments CVPR 2026 Camera Ready. 27 pages. Project page: https://runsenxu.com/projects/Multi-SpatialMLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22047 2026-05-22 cs.AI 88%

Active Evidence-Seeking and Diagnostic Reasoning in Large Language Models for Clinical Decision Support

大语言模型在临床决策支持中的主动证据获取与诊断推理

Chen Zhan, Xihe Qiu, Xiaoyu Tan, Xibing Zhuang, Gengchen Ma, Yue Zhang, Shuo Li, Peifeng Liu, Xiaoxiao Ge, Liang Liu, Lu Gan

机构 * Tencent Youtu Lab(腾讯优图实验室) Case Western Reserve University(凯斯西储大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究探讨了大语言模型在临床决策支持中的主动证据获取与诊断推理问题,提出了一种基于OSCE的标准化患者模拟器和可控可复现的基准测试,发现多轮证据获取会降低诊断准确性并降低支持证据质量,表明静态全上下文基准可能高估交互证据获取场景中的性能,需引入互补的交互评估以提高临床决策安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21543 2026-05-22 cs.LG 88%

Provable Joint Decontamination for Benchmarking Multiple Large Language Models

可证明的多语言模型基准测试去污染

Zhenlong Liu, Hao Zeng, Hongxin Wei

机构 * Department of Statistics and Data Science, Southern University of Science and Technology Shanghai Innovation Institute(统计与数据科学系,南方科技大学上海创新研究院)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出了一种可证明的多语言模型基准测试去污染方法,通过联合选择过程实现全局污染率控制,提升跨模型比较的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10075 2026-05-20 cs.AI 88%

Active Testing of Large Language Models via Approximate Neyman Allocation

通过近似奈曼分配主动测试大型语言模型

Zeli Liu, Jiancheng Zhang, Cong Liu, Yinglun Zhu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种针对生成任务的主动测试算法,利用语义熵进行分层并基于代理模型提取的信号进行近似奈曼分配,从而在多个语言和多模态基准测试中显著提升性能,实现高达28%的均方误差降低和22.9%的预算节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17044 2026-05-19 cs.AI 88%

PersonaArena: Dynamic Simulation for Evaluating and Enhancing Persona-Level Role-Playing in Large Language Models

PersonaArena: 用于评估和提升大语言模型层面角色扮演的动态模拟

Wenlong Shi, Jianxun Lian, Mingqi Wu, Haiming Qin, Mingyang Zhou, Xing Xie, Naipeng Chao, Hao Liao

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Microsoft Research Asia(微软亚洲研究院) Microsoft Gaming(微软游戏) Provincial Key Laboratory of Intelligent Communication and Digital Society Governance, Shenzhen University(深圳大学省级智能通信与数字社会治理重点实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出PersonaArena框架,通过动态模拟评估和提升大语言模型在角色扮演层面的能力,利用用户生成的社会内容构建细致的个性库,并在模拟社交环境中进行多轮上下文丰富的交互,通过多代理辩论裁判实现全面公正的评估。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05465 2026-05-15 cs.CL 88%

Small Language Models (SLMs) Can Still Pack a Punch: A survey (updated 2026)

小型语言模型 (SLMs) 仍能大放异彩:一篇综述(更新 2026)

Akanksha Gupta, Bijo Thomas, Harshita Asnani, Phanindra Reddy Madduru, Samia Feroze, Shreyas Subramanian, Vikram Elango, Mecit Gungor

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);分类 cs.CL

AI总结 本文综述了160篇论文,探讨小型语言模型在1-80亿参数范围内如何在性能、效率、可扩展性和成本之间取得平衡,展示小型模型可媲美甚至超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23023 2026-05-15 cs.AI 88%

Deceive, Detect, and Disclose: Large Language Models Play Mini-Mafia

欺骗、检测与揭露:大型语言模型扮演迷你黑帮

Davi Bastos Costa, Renato Vicente

机构 * TELUS Digital Research Hub(TELUS数字研究中心) Center for Artificial Intelligence and Machine Learning(人工智能与机器学习中心) Institute of Mathematics, Statistics and Computer Science(数学、统计与计算机科学研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出迷你黑帮游戏,通过分析语言模型在社交推理中的表现,揭示了模型在欺骗、检测和揭露能力上的差异,并展示了其作为评估语言模型交互能力的基准。

Comments Adds a validation section for the theoretical model and restructures the presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23887 2026-05-14 cs.CR cs.AI 88%

Evaluation of Prompt Injection Defenses in Large Language Models

对大型语言模型中提示注入防御措施的评估

Priyal Deep, Shane Emmons, Amy Fox, Kyle Bacon, Kelley McAllister, Peter Ortiz, Krisztian Flautner

机构 * Swept AI University of Michigan(密歇根大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究通过构建自适应攻击者测试了九种防御配置,发现依赖模型自我保护的防御均失效,而输出过滤通过硬编码规则在应用代码中检查响应,实现了零泄露。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02623 2026-05-12 cs.CL 88%

The Realignment Problem: When Right becomes Wrong in LLMs

重排问题:当正确变为错误时在大语言模型中

Aakash Sen Sharma, Debdeep Sanyal, Manodeep Ray, Vivek Srivastava, Shirish Karande, Murari Mandal

机构 * Birla AI Labs(比拉人工智能实验室) TCS Research(塔塔咨询服务研究) Kalinga Institute of Industrial Technology, Bhubaneswar(比拉工业技术学院,巴布尔萨瓦尔)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出TRACE框架,通过结构化优化解决LLM在动态标注政策下的重排问题,无需新标注即可提升对齐效果。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08942 2026-05-12 cs.CL 88%

Decomposing and Steering Functional Metacognition in Large Language Models

分解与引导大型语言模型中的功能元认知

Yanshi Li, Xueru Bai, Shuman Liu, Haibo Zhang, Anxiang Zeng

机构 * Shopee Shanghai China(Shopee上海中国) Shopee Beijing China(Shopee北京中国) Shopee Singapore Singapore(Shopee新加坡新加坡)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究通过分析大型语言模型的内部激活,揭示功能元认知状态的可分解性,并展示如何通过引导激活方向来调控推理行为。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07635 2026-05-11 cs.CL 88%

Multi-Dimensional Evaluation of LLMs for Grammatical Error Correction

大维度评估用于语法纠错的LLM

Adnan Labib, Qiao Wang, Yixuan Huang, Zheng Yuan

机构 * King's College London(伦敦国王学院) Hosei University(Hosei大学) Waseda University(早稻田大学) University of Sheffield(谢菲尔德大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估最新LLM在语法纠错中的表现,发现微调后的GPT-4o在编辑精度、流畅度保持和意义保留上表现最佳,同时揭示参考基度量低估GEC性能的问题。

Comments 9 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01333 2026-05-11 cs.CL 88%

OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice

OralMLLM-Bench: 评估多模态大语言模型在牙科实践中的认知能力

Rongyang Wang, Shuang Zhou, Jiashuo Wang, Wenya Xie, Xiaoxia Che

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出OralMLLM-Bench,通过27个临床任务评估多模态大语言模型在牙科影像分析中的认知能力,揭示模型与牙科医生的性能差异及改进方向。

Comments 21 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21471 2026-05-08 cs.AI 88%

SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition

SpatialBench: 多模态大语言模型空间认知的基准测试

Peiran Xu, Sudong Wang, Yao Zhu, Jianing Li, Gege Qi, Yunjian Zhang

机构 * Sun Yat-Sen University(中山大学) HKUST (GZ)(香港科技大学) Zhejiang University(浙江大学) Peking University(北京大学) CAICT(中国科学院电子技术研究所) UCAS(中国科学技术大学) CUC(中国科学技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出SpatialBench基准,通过五级空间认知框架评估多模态大语言模型的空间能力,揭示模型在感知与符号推理间的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01394 2026-05-05 cs.SE cs.AI 88%

LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation

LiveFMBench: 揭示代理工作流在规范生成中的力量与局限

Dong Xu, Jialun Cao, Guozhao Mo, Junjie Hu, Cheng Wen, Hongyu Lin, Xianpei Han, Shengchao Qin, Cong Tian, Shing-Chi Cheung, Le Sun, Yaojie Lu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) The Hong Kong University of Science(香港科学与技术大学) Guangzhou Institute of Technology, Xidian University(西安电子科技大学广州研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过LiveFMBench系统研究LLM和代理在C程序形式化规范生成中的能力与失败模式,发现直接提示和代理流程显著提升成功率,但需排除不忠实行为以准确评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00689 2026-05-04 cs.CL cs.CR 88%

ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models

ML-Bench&Guard: 政策导向的多语言安全基准与大型语言模型的防护机制

Yunhan Zhao, Zhaorun Chen, Xingjun Ma, Yu-Gang Jiang, Bo Li

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Fudan University(复旦大学) University of Chicago(芝加哥大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出ML-Bench和ML-Guard,通过区域法规构建多语言安全基准,并开发基于扩散模型的防护系统,实现文化与法律一致的多语言安全评估。

详情

展开后加载摘要…

URL PDF HTML 收藏