arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-13 至 2026-02-13 共收录 43 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 43 篇

2511.00772 2026-02-13 cs.DB cs.LG stat.AP 90%

Reliable Curation of EHR Dataset via Large Language Models under Environmental Constraints

通过环境约束下的大型语言模型可靠地整理EHR数据集

Raymond M. Xiong, Panyu Chen, Tianze Dong, Jian Lu, Louis Hu, Nathan Yu, Benjamin Goldstein, Danyang Zhuo, Anru R. Zhang

机构 * Duke University(杜克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 CELEC通过环境约束下的大型语言模型可靠地整理EHR数据集,提升数据提取和分析的准确性和隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11911 2026-02-13 cs.SE 90%

Improving Code Generation via Small Language Model-as-a-judge

通过小型语言模型作为评判者改进代码生成

Giuseppe Crupi, Rosalia Tufano, Gabriele Bavota

专题命中 评测与基准 :language model(title,abstract);small language model(title);large language model(abstract);SLM(abstract)

AI总结 通过训练小型语言模型作为代码正确性评判者,改进代码生成性能,展现其在无需执行信息时优于现有方法,并以更低成本接近大规模模型表现。

Comments Accepted to the 48th International Conference on Software Engineering (ICSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16390 2026-02-13 cs.CL cs.AI cs.LG 90%

A Large-Scale Benchmark for Evaluating Large Language Models on Medical Question Answering in Romanian

面向罗马尼亚语医疗问答的大型基准测试

Ana-Cristina Rogoz, Radu Tudor Ionescu, Alexandra-Valentina Anghel, Ionut-Lucian Antone-Iordache, Simona Coniac, Andreea Iuliana Ionescu

机构 * University of Bucharest(布加勒斯特大学) Colţea Clinical Hospital(科尔切亚临床医院) Hospice Hope Bucharest(希望临终关怀布加勒斯特医院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出首个罗马尼亚语医疗问答基准测试MedQARo,评估了多种LLM在医疗问答任务中的表现,发现微调模型在泛化能力上优于零样本模型。

Comments Accepted in npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11305 2026-02-13 cs.CL 89%

Are Aligned Large Language Models Still Misaligned?

对齐的大型语言模型仍然存在偏差吗?

Usman Naseem, Gautam Siddharth Kashyap, Rafiq Ali, Ebad Shabbir, Sushant Kumar Ray, Abdullah Mohammad, Agrima Seth

机构 * Macquarie University(麦考瑞大学) DSEU-Okhla University of Delhi(德里大学) Microsoft(微软公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出Mis-Align Bench基准测试,通过统一评估安全、价值和文化维度的偏差,揭示单维度模型在联合条件下的高覆盖率与高假失败率问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11588 2026-02-13 cs.CV 89%

A Large Language Model for Disaster Structural Reconnaissance Summarization

一种用于灾害结构侦察总结的大型语言模型

Yuqing Gao, Guanren Zhou, Khalid M. Mosalam

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出一种基于大型语言模型的灾害结构侦察总结框架,通过整合视觉数据与文本元数据,提升灾后结构评估的效率和准确性。

Comments 8 pages, 4 figures. Presented at the 18th World Conference on Earthquake Engineering (18WCEE 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10664 2026-02-13 cs.CL cs.AI 88%

Evaluating Modern Large Language Models on Low-Resource and Morphologically Rich Languages:A Cross-Lingual Benchmark Across Cantonese, Japanese, and Turkish

评估现代大语言模型在低资源和形态丰富的语言上的表现:跨语言基准测试在粤语、日语和土耳其语之间

Chengxuan Xia, Qianye Wu, Hongbin Guan, Sixuan Tian, Yilun Hao, Xiaoyu Wu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文评估了七种先进LLMs在粤语、日语和土耳其语上的表现,发现专有模型在多语言任务中表现优异,但文化理解和形态泛化仍有不足。

Comments This paper requires XeLaTeX for proper Unicode rendering of Japanese and Cantonese text

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11939 2026-02-13 cs.CL 86%

Do Large Language Models Adapt to Language Variation across Socioeconomic Status?

大型语言模型是否在社会经济地位上适应语言变异?

Elisa Bassignana, Mike Zhang, Dirk Hovy, Amanda Cercas Curry

机构 * IT University of Copenhagen(丹麦技术大学) Pioneer Center for AI(先锋人工智能中心) University of Copenhagen(哥本哈根大学) Bocconi University(博科尼大学) CENTAI Institute(CENTAI研究所)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 研究发现大型语言模型在不同社会经济地位社区中适应语言风格有限,可能加剧语言层级差异并影响社会模拟研究的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02182 2026-02-13 cs.CL 86%

Evaluating Metalinguistic Knowledge in Large Language Models across the World's Languages

在世界各语言中评估大型语言模型的元语言知识

Tjaša Arčon, Matej Klemen, Marko Robnik-Šikonja, Kaja Dobrovoljc

机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学学院) University of Ljubljana, Faculty of Arts(卢布尔雅那大学艺术学院) Jožef Stefan Institute(乔塞夫·斯塔芬研究所)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 本研究通过跨语言评估揭示LLM在元语言知识上的局限性,发现其表现受数据可用性和语言资源影响,而非广泛语法能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11179 2026-02-13 cs.CL cs.AI 86%

From Instruction to Output: The Role of Prompting in Modern NLG

从指令到输出:提示在现代自然语言生成中的作用

Munazza Zaib, Elaf Alhazmi

机构 * Faculty of Information Technology, Monash University(莫纳什大学信息科技学院) School of Computer, Data and Mathematical Sciences, Western Sydney University(西澳大学计算机、数据与数学科学学院) School of Computing, Macquarie University(麦考瑞大学计算学院)

专题命中 评测与基准 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了提示工程在自然语言生成中的作用,提出了提示范式的分类和决策框架,旨在提升NLG的可控性和可推广性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19905 2026-02-13 cs.LG cs.AI 86%

Demystifying LLM-as-a-Judge: Analytically Tractable Model for Inference-Time Scaling

解析LLM作为裁判:用于推理时间扩展的可分析模型

Indranil Halder, Cengiz Pehlevan

机构 * John A. Paulson School of Engineering And Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) Center for Brain Science, Harvard University(哈佛大学脑科学中心) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个可分析的模型,用于推理时间扩展,通过奖励加权采样器和贝叶斯线性回归,分析推理时间样本与一般化误差的关系,并展示在任务难度增加时该优势的退化。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04860 2026-02-13 cs.LG cs.AI 86%

Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails

对齐倾倒过程:自我进化如何推动LLM代理偏离轨道

Siwei Han, Kaiwen Xiong, Jiaqi Liu, Xinyu Ye, Yaofeng Su, Wenbo Duan, Xinyuan Liu, Cihang Xie, Mohit Bansal, Mingyu Ding, Linjun Zhang, Huaxiu Yao

机构 * Rutgers University(罗切斯特大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示了自我进化LLM代理在部署后因持续互动而偏离对齐约束的风险,通过自我利益探索和模仿策略扩散两种范式分析,发现对齐优势会迅速衰减,现有对齐方法难以有效防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12424 2026-02-13 cs.SE cs.AI 85%

EvoGPT: Leveraging LLM-Driven Seed Diversity to Improve Search-Based Test Suite Generation

EvoGPT:利用LLM驱动的种子多样性改进基于搜索的测试套件生成

Lior Broide, Roni Stern, Argaman Mordoch

机构 * Faculty of Computer and Information Science(计算机与信息科学系) Ben-Gurion University of the Negev(内盖夫本·古里安大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EvoGPT结合LLM生成与进化算法优化,通过强制多样性提升测试套件生成的覆盖率和突变分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11340 2026-02-13 cs.AI 85%

Bi-Level Prompt Optimization for Multimodal LLM-as-a-Judge

双层提示优化用于多模态LLM作为裁判

Bo Pan, Xuan Kan, Kaitai Zhang, Yan Yan, Shunwen Tan, Zihao He, Zixin Ding, Junjie Wu, Liang Zhao

机构 * Meta AI Emory University(埃默里大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出BLPO框架,通过双层优化提升多模态LLM在评估AI生成图像时的提示效果,解决上下文限制导致的优化瓶颈问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17061 2026-02-13 cs.MA cs.AI cs.IR 85%

Parallelism Meets Adaptiveness: Scalable Documents Understanding in Multi-Agent LLM Systems

并行与适应性:多智能体大语言模型系统中的可扩展文档理解

Chengxuan Xia, Qianye Wu, Sixuan Tian, Yilun Hao

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种多智能体大语言模型系统协调框架,通过动态任务路由、双向反馈和并行评估机制,提升文档理解的适应性和效率。

Comments Accepted at AAAI 2026 Workshop on WoMAPF, Camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11877 2026-02-13 cs.CL cs.AI 84%

Towards Fair and Comprehensive Evaluation of Routers in Collaborative LLM Systems

迈向协作大语言模型系统中路由器的公平且全面评估

Wanxing Wu, He Zhu, Yixia Li, Lei Yang, Jiehui Zhao, Hongru Wang, Jian Yang, Benyou Wang, Bingyi Jing, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Institut Polytechnique de Paris(巴黎政治学院) Peking University(北京大学) Deepexi Technology Co. Ltd.(深醒科技有限公司) University of Edinburgh(爱丁堡大学) Beihang University(北航) Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RouterXBench框架和ProbeDirichlet路由器,通过内部隐藏状态提升路由能力与跨领域鲁棒性,实现对协作大语言模型系统中路由器的公平全面评估。

Comments Our code is publicly available at https://github.com/zhuchichi56/RouterXBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11558 2026-02-13 cs.LG 83%

Brain4FMs: A Benchmark of Foundation Models for Electrical Brain Signal

Brain4FMs: 一种用于电气脑信号基础模型的基准测试

Fanqi Shen, Enhong Yang, Jiahe Li, Junru Hong, Xiaoran Pan, Zhizhang Yuan, Meng Li, Yang Yang

机构 * Zhejiang University(浙江大学) Shanghai Institute of Microsystem and Information Technology, CAS(上海微系统与信息工程研究所,中国科学院)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 Brain4FMs提出了一种开放评估平台,用于评估和比较脑基础模型在电气脑信号处理中的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07497 2026-02-13 cs.CL 83%

From Native Memes to Global Moderation: Cross-Cultural Evaluation of Vision-Language Models for Hateful Meme Detection

从本土迷因到全球监管:跨文化评估视觉-语言模型在仇恨迷因检测中的应用

Mo Wang, Kaixuan Ren, Pratik Jalan, Ahmed Ashraf, Tuong Vy Vu, Rahul Seetharaman, Shah Nawaz, Usman Naseem

机构 * Macquarie University(麦考瑞大学) Nile University(尼罗大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Johannes Kepler University(约翰尼斯·开普勒大学)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文通过跨文化评估揭示视觉-语言模型在仇恨迷因检测中的文化偏见问题,并提出本土语言提示和一样本学习等改进策略以提升模型的公平性和鲁棒性。

Comments 12 pages, 5 figures, Proceedings of the ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11230 2026-02-13 cs.HC 82%

DiSCoKit: An Open-Source Toolkit for Deploying Live LLM Experiences in Survey Research

DiSCoKit:一种用于在调查研究中部署实时大语言模型体验的开源工具包

Jaime Banks, Jon Stromer-Galley, Samiksha Singh, Collin Capano

专题命中 评测与基准 :LLM(title,abstract);language model(abstract)

AI总结 DiSCoKit是一种开源工具包,旨在通过JavaScript支持的调查平台部署实时大语言模型体验,以促进人类-人工智能交互动态的社会科学研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06111 2026-02-13 cs.AI 81%

SKATE, a Scalable Tournament Eval: Weaker LLMs differentiate between stronger ones using verifiable challenges

SKATE,一种可扩展的锦标赛评估:较弱的LLM通过可验证的挑战区分更强的LLM

Dewi S. W. Gould, Bruno Mlodozeniec, Samuel F. Brown

机构 * The Alan Turing Institute(阿尔文·图灵研究所) University of Cambridge(剑桥大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Independent(独立研究者)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 SKATE通过让LLM相互生成和解决可验证任务,实现可扩展的评估框架,揭示模型间的细微能力差异。

Comments 7 pages and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11960 2026-02-13 cs.CV cs.CL cs.LG 81%

Benchmarking Vision-Language Models for French PDF-to-Markdown Conversion

对法语PDF到Markdown转换的视觉语言模型进行基准测试

Bruno Rigal, Victor Dupriez, Alexis Mignon, Ronan Le Hy, Nicolas Mery

机构 * Probayes, La Poste(Probayes公司) OpenValue, La Poste(OpenValue公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究针对法语PDF到Markdown转换,评估了视觉语言模型在处理复杂文档中的表现,发现专有模型在手写和表单处理上更具鲁棒性,而开源系统在标准打印布局上表现良好。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11886 2026-02-13 cs.CL 79%

LLM-based Triplet Extraction from Financial Reports

基于大语言模型的财务报告三元组提取

Dante Wesslund, Ville Stenström, Pontus Linde, Alexander Holmberg

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出基于大语言模型的财务报告三元组提取方法,通过自动本体诱导和混合验证策略,提升提取准确率并减少幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11583 2026-02-13 cs.AI cs.LG 79%

The Five Ws of Multi-Agent Communication: Who Talks to Whom, When, What, and Why -- A Survey from MARL to Emergent Language and LLMs

多智能体通信的五个W:谁与谁沟通,何时沟通,沟通什么,为何沟通——从MARL到涌现语言和LLMs的综述

Jingdi Chen, Hanqing Yang, Zongjun Liu, Carlee Joe-Wong

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了多智能体通信的五个W,探讨了从MARL到涌现语言和LLM的发展,分析了不同范式下的通信设计、权衡与挑战。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11244 2026-02-13 cs.CV 78%

Stress Tests REVEAL Fragile Temporal and Visual Grounding in Video-Language Models

压力测试揭示视频-语言模型中脆弱的时间与视觉基础

Sethuraman T, Savya Khosla, Aditi Tiwari, Vidya Ganesh, Rakshana Jayaprakash, Aditya Jain, Vignesh Srinivasakumar, Onkar Kishor Susladkar, Srinidhi Sunkara, Aditya Shanmugham, Rakesh Vaideeswaran, Abbaas Alif Mohamed Nishar, Simon Jenni, Derek Hoiem

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(Adobe研究) Qualtrics iManage NVIDIA Amazon Science(亚马逊科学) Capital One

专题命中 评测与基准 :language model(title,abstract)

AI总结 REVEAL{}通过五个压力测试揭示视频-语言模型在时间与视觉基础方面的脆弱性,展示其在处理视频内容、时间序列和运动方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12049 2026-02-13 cs.LG 77%

Improving HPC Code Generation Capability of LLMs via Online Reinforcement Learning with Real-Machine Benchmark Rewards

通过实时强化学习与真实机器基准奖励提升LLM的HPC代码生成能力

Ryo Mikasa, Shun-ichiro Hayashi, Daichi Mukunoki, Tetsuya Hoshino, Takahiro Katagiri

机构 * Department of Computer Science, Nagoya University(名古屋大学计算机科学系) Graduate School of Informatics, Nagoya University(名古屋大学信息科学研究生院) Information Technology Center, Nagoya University(名古屋大学信息技术中心)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究通过实时强化学习与真实机器基准奖励提升LLM在HPC领域的代码生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11904 2026-02-13 cs.SE cs.AI 77%

Leveraging LLMs to support co-evolution between definitions and instances of textual DSLs: A Systematic Evaluation

利用LLMs支持文本DSL定义与实例的共演化:系统评估

Weixing Zhang, Bowen Jiang, Yuhong Fu, Anne Koziolek, Regina Hebig, Daniel Strüber

机构 * MCSE Group(MCSE研究组) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Engineering and Information Technology(工程与信息技术) Adelaide University(阿德莱德大学) Institute of Computer Science(计算机科学研究所) University of Rostock(罗斯托克大学) Department of Computer Science and Engineering(计算机科学与工程系) Chalmers University of Technology and University of Gothenburg(楚科斯技术大学和哥德堡大学) Department of Software Science(软件科学系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文利用LLMs评估文本DSL定义与实例的共演化,发现其在小规模案例中表现良好,但随着规模增大性能下降,且语法复杂性和删除粒度影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13220 2026-02-13 cs.CR cs.AI 77%

MCPSecBench: A Systematic Security Benchmark and Playground for Testing Model Context Protocols

MCPSecBench: 一个系统化的安全基准和测试平台用于测试模型上下文协议

Yixuan Yang, Cuifeng Gao, Daoyuan Wu, Yufan Chen, Yingjiu Li, Shuai Wang

机构 * Lingnan University(岭南大学) University of Oregon(俄勒冈大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MCPSecBench是一个系统化的安全基准和测试平台,用于评估模型上下文协议的安全性,揭示了不同攻击面和模型中的核心漏洞及保护机制的不足。

Comments This is a technical report from Lingnan University, Hong Kong. Code is available at https://github.com/AIS2Lab/MCPSecBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01835 2026-02-13 cs.CR 75%

From CVE Entries to Verifiable Exploits: An Automated Multi-Agent Framework for Reproducing CVEs

从CVE条目到可验证的漏洞利用:一种自动化多智能体框架用于重现CVE

Saad Ullah, Praneeth Balasubramanian, Wenbo Guo, Amanda Burnett, Hammond Pearce, Christopher Kruegel, Giovanni Vigna, Gianluca Stringhini

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出CVE-GENIE框架,通过自动化多智能体方法重现CVE漏洞,生成高质量可验证漏洞利用数据集,用于安全研究与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13779 2026-02-13 cs.CL cs.AI cs.LG 75%

NewsInterview: a Dataset and a Playground to Evaluate LLMs' Ground Gap via Informational Interviews

NewsInterview: 一个用于通过信息性访谈评估LLM地面间隙的数据集和游乐场

Alexander Spangher, Michael Lu, Sriya Jeslyn Kalyan, Hyundong Justin Cho, Weiyan Shi, Jonathan May

机构 * University of California, Berkeley(加州大学伯克利分校) University of Southern California(南加州大学) Information Sciences Institute(信息科学研究所) Northeastern University(东北大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 NewsInterview通过信息性访谈数据集和模拟环境,揭示LLMs在战略对话和多轮规划方面的能力不足,强调需提升其对话策略与说服力。

Comments Accepted at ACL 2025: https://aclanthology.org/2025.acl-long.1580/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12196 2026-02-13 cs.CL cs.AI 73%

Visual Reasoning Benchmark: Evaluating Multimodal LLMs on Classroom-Authentic Visual Problems from Primary Education

视觉推理基准:评估多模态大语言模型在小学课堂真实视觉问题上的能力

Mohamed Huti, Alasdair Mackintosh, Amy Waldock, Dominic Andrews, Maxime Lelièvre, Moritz Boos, Tobias Murray, Paul Atherton, Robin A. A. Ince, Oliver G. B. Garrod

机构 * Fab AI

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出视觉推理基准,用于评估多模态大语言模型在小学课堂真实视觉问题上的能力,揭示模型在静态与动态任务上的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12092 2026-02-13 cs.CL cs.AI cs.CR cs.CV 73%

DeepSight: An All-in-One LM Safety Toolkit

DeepSight: 一个全方位的大型模型安全工具包

Bo Zhang, Jiaxuan Guo, Lijun Li, Dongrui Liu, Sujin Chen, Guanxu Chen, Zhijie Zheng, Qihao Lin, Lewen Yan, Chen Qian, Yijin Zhou, Yuyao Wu, Shaoxiong Guo, Tianyi Du, Jingyi Yang, Xuhao Hu, Ziqi Miao, Xiaoya Lu, Jing Shao, Xia Hu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DeepSight是一个开源工具包,旨在通过整合安全评估与诊断,提升大型模型的安全性与可解释性。

Comments Technical report, 29 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏