Byam: Fixing Breaking Dependency Updates with Large Language Models
Byam:利用大型语言模型修复破坏性依赖更新
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 本文利用大型语言模型自动修复因依赖更新导致的客户端代码问题,通过BUMP数据集验证,o3-mini模型在修复构建和编译错误方面表现最佳。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
Byam:利用大型语言模型修复破坏性依赖更新
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 本文利用大型语言模型自动修复因依赖更新导致的客户端代码问题,通过BUMP数据集验证,o3-mini模型在修复构建和编译错误方面表现最佳。
窥视屏障之后:大型语言模型中的屏障识别
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 本文提出AP-Test方法,通过对抗性提示检测黑盒AI代理中的屏障,解决安全对齐LLM和缺乏决策策略的问题,实验显示其在多种场景下实现完美分类准确率。
Comments To Appear in the 64th Annual Meeting of the Association for Computational Linguistics, July 2-7, 2026. ACL Findings
提前预警:敏感提示作为大语言模型公平性的早期预警
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 本文提出敏感提示作为公平性评估的新方法,通过构建SensY数据集评估LLM对敏感提示的响应,发现模型虽能提供事实正确答案,但常忽视伦理和情境影响,开发自动分类器预测提示敏感性,强调提前预警公平风险的重要性。
从预训练模型到大语言模型:人工智能驱动的心理计算全面综述
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 本文综述了人工智能与心理学交叉领域的发展,系统分类了心理计算任务,探讨了从特征工程到迁移学习的方法演变,揭示了可转移的方法论模式。
Comments 56 pages, Psychological Computing with AI
VMAD:视觉增强的多模态大语言模型用于零样本异常检测
机构 * University of Science and Technology of China(中国科学技术大学) ; Northeastern University(东北大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 VMAD通过结合视觉信息与多模态大语言模型,提升零样本异常检测的精度与分析能力,提出缺陷敏感结构学习和局部增强令牌压缩等方法,结合RIAD数据集验证了其有效性。
OddGridBench: 暴露多模态大语言模型在细粒度视觉差异敏感性方面的不足
机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) ; Shenzhen Technology University(深圳技术大学) ; Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) ; Meituan(美团)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 本文提出OddGridBench基准,评估多模态大语言模型的视觉差异敏感性,发现其检测能力远低于人类,提出OddGrid-GRPO框架提升模型细粒度视觉辨别能力。
Comments accepted by CVPR 2026
一种评估开源视频大语言模型在新闻视频自动字幕生成中性能的基准方法
机构 * Universidad de los Andes, Chile(智利洛斯安第斯大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 本文提出评估开源视频大语言模型在自动新闻视频字幕生成中的方法,使用两个基准数据集评估八种最新模型,发现传统指标在新闻视频字幕生成中表现有限,提出新的主题和实体忠实度指标,结果显示Gemma~3在两个数据集和多数评估维度上表现最佳。
通过分层全局-局部骨架-语言模型增强动作识别
机构 * Northwestern Polytechnical University(西北工业大学) ; Shandong University of Finance and Economics(山东财经大学)
专题命中 评测与基准 :language model(title,abstract);LLM(title);SLM(abstract)
AI总结 本文提出HocSLM模型,通过分层全局-局部网络和大视觉-语言模型融合骨架与文本信息,提升动作识别的语义表达和跨模态理解能力,实验表明在三个主流数据集上达到最佳性能。
性别化提示与大语言模型代码审查:提示中的性别线索如何影响代码质量和评估
专题命中 评测与基准 :LLM(title,abstract);prompting(title,abstract)
AI总结 研究探讨性别化提示对代码生成和审查的影响,发现性别线索在代码质量上影响有限,但对代码审查存在系统性偏见。
ENC-Bench:用于评估多模态大语言模型在电子航海图理解中的基准
机构 * National University of Defense Technology(国防科技大学) ; Intelligent Game and Decision Lab(智能游戏与决策实验室) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 ENC-Bench是首个专注于专业电子航海图理解的基准,包含20490个经过专家验证的样本,评估了10种先进多模态大语言模型在符号识别、空间推理和航海决策中的表现,揭示了模型在符号 grounding、空间计算和多约束推理方面的系统性挑战。
Comments Accepted to CVPR 2026, Project page: https://qingyonghu.github.io/ENC-Bench/
LMOD+: 一个全面的多模态数据集和基准,用于开发和评估眼科中的多模态大语言模型
机构 * School of Medicine, Yale University(耶鲁大学医学院) ; School of Computing, Australian National University(澳大利亚国立大学计算机学院) ; School of Engineering, Imperial College London(伦敦帝国理工学院工程学院) ; School of Computing, University of Georgia(佐治亚大学计算机学院) ; Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学杨秀隆医学学院) ; National Eye Institute, National Institutes of Health(美国国立卫生研究院眼科研究所) ; National Library of Medicine, National Institutes of Health(美国国立卫生研究院国家医学图书馆) ; School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算机技术学院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 本文提出一个包含32633个实例的多模态眼科基准数据集,涵盖12种常见眼科疾病和5种成像模态,通过扩展数据集、扩展任务覆盖和系统评估24种最先进的MLLMs,推动眼科AI应用发展。
Comments ACM Transactions on Computing for Healthcare
多模态大语言模型作为图像分类器
机构 * Visual Recognition Group, Czech Technical University in Prague(捷克技术大学普拉茨视觉识别组)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 本研究通过修正评估协议和真实标签问题,发现多模态大语言模型在图像分类中的表现受注释质量影响显著,且能辅助人类注释者提升数据集整理效率。
利用多模态大语言模型生成合成缺陷图像用于电力线路绝缘子检测
机构 * Department of Electrical and Computer Engineering, Wayne State University(电气与计算机工程系,韦恩州立大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 利用多模态大语言模型生成合成缺陷图像,提升电力线路绝缘子缺陷识别的准确率和数据效率。
Comments Submitted to Engineering Applications of Artificial Intelligence, Feb. 16, 2026
InterMind:由大型语言模型赋能的医生-患者-家庭交互式抑郁症评估系统
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 InterMind利用大型语言模型,通过医生、患者和家庭的互动提升抑郁症评估的精确性和效率。
Comments Accepted at ACM Multimedia 2025
超越判断:探索大型语言模型作为非评判性支持的母婴心理健康支持
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 本研究探讨了母亲如何利用LLMs作为非评判性支持来缓解育儿焦虑,发现尽管LLMs能提供快速信息和安慰,但大多数母亲仍更看重人类温暖,尤其在联合家庭中,部分人认为LLMs能避免人类评判。
用大语言模型变革科学:一项关于人工智能辅助科学发现、实验、内容生成和评估的综述
机构 * University of Technology Nuremberg (UTN)(图恩大学(UTN)) ; University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) ; TIB Leibniz Information Centre for Science and Technology(莱比锡信息科学与技术研究中心) ; Austrian Research Institute for Artificial Intelligence(奥地利人工智能研究所) ; IT:U Interdisciplinary Transformation University Austria(奥地利 interdisciplinary transformation 大学) ; University of Hamburg(汉堡大学) ; University of Manchester(曼彻斯特大学) ; University of Sheffield(谢菲尔德大学) ; University of Aberdeen(阿伯丁大学) ; University of Manitoba(曼尼托巴大学)
专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG
AI总结 本文综述了大语言模型在科学发现、实验、内容生成和评估中的应用,探讨了相关技术、数据集和伦理问题,旨在为AI辅助科学研究提供指导。
Comments 46 pages, 7 figures, 7 tables
基于大语言模型的行为驱动开发场景生成
专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);prompting(abstract)
AI总结 本文研究了三种大语言模型在BDD场景生成中的表现,发现Claude 3在人类和模型评估中表现最佳,提示技术和输入质量对生成质量有显著影响。
Venus: 多模态大语言模型在审美指导与裁剪中的基准测试与赋能
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究所)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 Venus通过两阶段框架提升多模态大语言模型的审美指导与裁剪能力,实现可解释的审美优化。
Comments Accepted by CVPR 2026
评估一种用于小型语言模型、提示和评估指标的进化搜索引擎
专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract)
AI总结 本文提出一种双目标进化搜索引擎,用于优化小型语言模型、提示和评估指标之间的性能与效率平衡。
Comments 14 pages, 1 figure, 1 table
Journal ref Intelligent Systems. BRACIS 2025. Lecture Notes in Computer Science
大语言模型理解数据可视化规则吗?
机构 * Universidad Torcuato Di Tella(托科托迪特拉大学) ; Consejo Nacional de Investigaciones Científicas y Técnicas(国家科学与技术研究院) ; Universidad de Buenos Aires(布宜诺斯艾利斯大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 本文评估了大语言模型在数据可视化规则检测中的性能,发现其在基本规则上表现良好,但在复杂规则上存在局限。
大语言模型理解数据可视化原则吗?
机构 * Universidad Torcuato Di Tella(托科托迪泰拉大学) ; Consejo Nacional de Investigaciones Científicas y Técnicas(阿根廷国家科学与技术研究院) ; Universidad de Buenos Aires(布宜诺斯艾利斯大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 本文首次系统评估大语言模型和视觉-语言模型在推理数据可视化原则方面的能力,通过严格验证数据揭示了模型在检测和纠正可视化违规方面的表现及局限性。
基于大语言模型的网页测试用例自动生成方法
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 本文研究了利用大语言模型自动生成网页测试用例页面对象的可行性,通过实证分析展示了其在准确性与元素识别率上的表现。
Comments In proceedings of the 19th IEEE International Conference on Software Testing, Verification and Validation 2026 (ICST '26)
金融大语言模型与代理的评估与基准测试套件
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 本文提出了一套评估和基准测试套件,用于评估和比较金融大语言模型与代理,促进更稳健的FinAI生态系统。
Comments 13 pages, 13 figures
缩小大型语言模型评估中的复杂性差距
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 GeneBench通过增加编程基准的复杂性,揭示了LLMs在真实世界任务中的表现下降,证明了其评估的挑战性。
对大型语言模型在知识图谱验证中的基准测试
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 本文提出FactCheck基准,评估大型语言模型在知识图谱验证中的性能,发现其在稳定性、可靠性及多模型共识策略上的不足,强调了建立系统评估框架的重要性。
Comments Accepted paper by the 29th International Conference on Extending Database Technology (EDBT'26)
VideoSTF: 视频大语言模型中输出重复性压力测试
机构 * National University of Singapore(新加坡国立大学) ; University of New South Wales(新南威尔士大学) ; CSIRO’s Data61(CSIRO数据61)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 VideoSTF通过系统测量和压力测试揭示视频大语言模型中普遍存在的输出重复问题,发现其对时间扰动高度敏感,并暴露了其作为安全漏洞的风险。
SWE-Bench Mobile: 大语言模型代理能否开发行业级移动应用?
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 SWE-Bench Mobile评估大语言模型代理在开发行业级移动应用中的能力,发现商业代理表现优于开源替代品,且简单提示策略更有效。
InternSVG:通过多模态大语言模型实现统一的SVG任务
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanjing University(南京大学) ; Donghua University(东华大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 InternSVG通过多模态大语言模型实现统一的SVG任务建模,结合大规模数据集和两阶段训练策略,提升SVG理解、编辑和生成性能。
当Elo谎言:基于Codeforces的大型语言模型评估中的隐藏偏见
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 本文研究了基于Codeforces的Elo评分中隐藏的偏见因素,发现提交顺序、比赛难度选择和LLM运行稳定性显著影响评分结果,指出直接比较Elo分数缺乏可靠性。
大语言模型在软件文档和建模中的应用:文献综述与发现
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 本文综述了大语言模型在软件文档和建模中的应用,分析了相关任务、提示技术、评估方法及数据集。
Comments This is a preprint of a paper that was presented at the IEEE 24th World Symposium on Applied Machine Intelligence and Informatics (SAMI 2026)