llm-japanese-dataset v0: Construction of Japanese Chat Dataset for Large Language Models and its Methodology
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
Comments 12 pages
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
Comments 12 pages
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
Eloquence团队针对MLC-SLM挑战赛任务1的提交
机构 * Fondazione Bruno Kessler(布鲁诺·科塞拉基金会) ; Telefónica Innovación Digital, Scientific Group(电信创新数字公司,科学小组) ; University of Essex(埃塞克斯大学)
专题命中 评测与基准 :SLM(title,title_cn);language model(abstract);foundation model(abstract);分类 cs.CL
AI总结 该研究针对MLC-SLM挑战赛任务1,探索三种多语言ASR方法,评估基线、利用SLAM-ASR框架训练投影器并研究对比学习与会话上下文的作用。
Comments Technical Report for MLC-SLM Challenge of Interspeech2025
Prompting-MammAlps:用于相机陷阱数据的细粒度文本到视频检索
机构 * Ecole Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) ; Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所) ; University of Konstanz(康斯坦茨大学)
专题命中 评测与基准 :prompting(title,title_cn);LLM(abstract);language model(abstract);分类 cs.AI
AI总结 针对相机陷阱数据自动检索视频的难题,提出Prompting-MammAlps基准及细粒度可解释TVR方法,训练视觉变压器并结合大语言模型处理查询,在基准测试中取得较好成绩,优于零样本VLM。
Comments Accepted at ECCV 2026; Project page: https://cnai.epfl.ch/prompting-mammalps
重新评估大规模抽取式问答数据集:LLM作为评判者与深入分析
机构 * National Institute of Informatics, Japan(日本国立信息研究所) ; The University of Tokyo, Japan(东京大学) ; Inria, LS2N, Nantes Université, France(法国Inria、LS2N、南特大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究系统性地使用LLM作为评判者评估四个抽取式问答数据集,发现其与人类评价的相关性远高于EM和F1,并分析了答案类型敏感性、提示变化和自偏好偏差等因素。
Comments GEM Workshop at ACL 2026; code and data are available at https://github.com/Alab-NII/llm-judge-extract-qa
DetectRL-X: 向可靠多语言和真实世界LLM生成文本检测迈进
机构 * NLP2 CT Lab, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学学院NLP2 CT实验室) ; Alibaba Group(阿里巴巴集团) ; Xiamen University(厦门大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出DetectRL-X,一个综合性的多语言基准,用于评估先进检测器在8个维度上的性能,通过8种常见商业语言和6种易受LLM滥用的领域人类文本,结合4种流行商业LLM生成文本及润色、扩展和缩写等AI辅助写作操作,分析不同语言、领域、生成器、攻击策略、文本长度和润色操作对检测器性能的影响,以强化多语言和语言特定检测器。
Comments ACL 2026 Main. Code and data are available at https://github.com/AIDC-AI/Marco-LLM/tree/main/DetectRL-X
谁的事实获胜?在知识冲突下LLM的来源偏好
机构 * Heidelberg University(海德堡大学) ; Heidelberg Institute for Theoretical Studies(海德堡理论研究所)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究探讨了LLM在知识冲突中的来源偏好,发现其更倾向于机构证实的信息,但可通过重复低可信度来源信息逆转。提出方法减少重复偏差,同时保持大部分偏好。
Comments Data and code: https://github.com/JaSchuste/llm-source-preference
炒作与现实的碰撞:大型语言模型作为基于搜索的Simulink-Stateflow模型自动化程序修复中的变异器
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)
AI总结 本文以Simulink/Stateflow建模的CPS为研究对象,扩展FlowRepair方法用LLM生成的变异替换部分算子,受控实验发现该方法大幅降低修复性能,分析指出盲目集成LLM到基于搜索的APR存在根本局限,需发展混合方法。
训练大型语言模型助教以保留答案:一种用于调整苏格拉底式行为的监督架构与证据驱动方法
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)
AI总结 本研究提出一种监督架构与证据驱动方法,训练LLM助教执行答案保留,通过自动评估调整苏格拉底式行为,使其在全部四个接受标准上达到完全合规。
基于大语言模型的汽车软件验证传感器级故障诊断
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)
AI总结 该研究提出两阶段框架,用经4-bit低秩适配的LLM对HIL平台的汽车传感器记录做故障诊断,最小模型准确率达81.6%,适配循环可在单商用加速器运行。
Doc2CI:基于大语言模型的CI配置生成多服务研究
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract_cn);language model(title,abstract_cn)
AI总结 本文通过构建DOC2CI基准评估LLM生成CI配置的能力,发现其结构有效性不足,提出无需训练的模式引导修复方法提升有效性,为相关工具开发提供依据。
用于软件工程图的大语言模型:UML与ER建模的系统综述
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)
AI总结 该系统综述分析64项2023-2025年研究,指出LLM在UML/ER建模中存在领域失衡、GPT依赖、评估不规范等问题,提出需标准化基准等改进方向。
基于大语言模型的可靠同构物理问题生成
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)
AI总结 研究利用大语言模型代理工作流程生成同构物理问题,通过结合提示链等技术,在公共网站实现。开发评分标准并测试,89%生成问题可直接用,虽有局限,但显示出基于LLM系统在教学问题生成上的潜力与挑战。
参数多于总体:调查研究中的大语言模型系统文献综述
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)
AI总结 通过系统文献综述,评估大语言模型在调查研究三个阶段(数据收集前、中、后)的应用,讨论其潜力与陷阱,并展望调查研究对LLM发展的贡献。
Comments This working paper is outdated as of June 2026 - please refer to the full version with substantive changes here: https://doi.org/10.31235/osf.io/eubj4_v1 This work was presented at NLPOR 2025 (non-archival): https://openreview.net/forum?id=0Hxhwa56Yg
SLMJury:小型语言模型能否像大型模型一样进行评判?
机构 * LNMIIT ; Virginia Tech(弗吉尼亚理工大学)
专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn);large language model(abstract)
AI总结 提出SLMJury框架,评估小型语言模型作为评判者的能力,发现领域依赖的过度思考效应、领域泛化差异、闭端与开端评判能力分离,以及多智能体辩论降低准确性。
通过大语言模型的视角重新思考代码复杂度
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)
AI总结 针对传统复杂度指标与LLM感知难度不匹配的问题,提出基于语义非线性的熵引导语义组合层次复杂度度量LM-CC,实验证明其与LLM性能强相关且语义保持的复杂度降低能提升下游任务表现。
Comments accepted by ICML2026
如果你能说服我:评估大型语言模型说服效果与易受影响性的框架
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出PMIYC框架,通过多智能体对话自动评估LLM的说服效果与易受影响性,发现不同模型在说服力和抗说服性上存在显著差异。
Comments Paper published at the ACM Conference on AI and Agentic Systems 2026
在大型语言模型上进行深度数据研究:评估深度数据研究
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出深度数据研究(DDR)任务和DDR-Bench基准,评估大型语言模型的探索智能,发现有效探索需要内在策略而非单纯扩展。
Comments 14 pages, 7 tables, 8 figures, accepted by ICML 2026
基于上下文和像素的大型语言模型用于视频质量评估
机构 * City University of Hong Kong(香港城市大学) ; Google Inc.(谷歌公司)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)
AI总结 本文提出CP-LLM,通过双视觉编码器和语言解码器同时生成视频质量评分和可解释描述,提升对像素失真敏感度,实验显示其在视频质量评估基准上表现优异。
Comments Accepted to ICIP 2026
对对抗性代码混淆和加密下大型语言模型进行IoC恢复的基准测试
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)
AI总结 本文提出一个系统性基准测试,评估LLM在对抗性代码转换下恢复隐藏的IoC能力,发现加密技术显著降低检测性能,揭示LLM在代码分析中的局限性及改进方向。
Comments 11 pages, 2 figures, 8 tables
超越排行榜:重新思考大型语言模型的医疗基准
机构 * Stanford University(斯坦福大学) ; Shenzhen University(深圳大学) ; The Chinese University of Hong Kong(香港中文大学) ; City University of Hong Kong(香港城市大学) ; Renmin University of China(中国人民大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)
AI总结 本文提出MedCheck框架,用于评估医疗领域大型语言模型的基准,揭示现有基准在临床相关性、数据完整性及安全性方面的系统性问题。
Comments Accepted by ACL 2026
在现实世界设置下评估大型语言模型的代码推理能力
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)
AI总结 本文通过构建包含1200个问题的 dataset,评估 LLM 在现实复杂性下的代码推理能力,采用静态和动态分析方法,分类问题难度为 LC 或 HC,揭示现有评估方法主要偏向低复杂度问题。
理解大型语言模型中的利他主义机制
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)
AI总结 研究通过稀疏自编码器揭示LLM利他行为的内部机制,识别出与行为变化相关的神经网络特征,并验证其对分配决策的影响,为对齐LLM行为与人类价值观提供框架。
机构 * The University of New South Wales(新南威尔士大学) ; The University of Technology Sydney(技术大学悉尼分校) ; University of Technology Sydney(技术大学悉尼分校) ; Duke University(杜克大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
Comments Surveys and overviews; Natural language processing; Knowledge representation and reasoning; Graph algorithms
机构 * Department of Computer Science, Virginia Tech, USA(弗吉尼亚理工大学计算机科学系) ; Department of Physics, Clarendon Laboratory, University of Oxford, UK(牛津大学物理系,克伦德尔实验室) ; NVIDIA Corporation(英伟达公司)
专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)
Comments Accepted to EMNLP 2025 Main Conference
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)
Comments Project page, code & data: https://machine-bullshit.github.io
专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
用于大规模推荐解释的LLM评判模型的生命周期
机构 * Netflix(网飞公司)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究提出用于Netflix大规模推荐解释评估的LLM评判模型生命周期框架,经五周A/B测试证实,其对齐的解释可提升会员对新颖内容的观看及浏览到播放会话量。
工作进展:LLM奥德赛:一个基于游戏的LLM工程概念教学平台
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究介绍开源游戏平台LLM奥德赛,含13个交互式游戏,覆盖LLM工程多主题,按布鲁姆分类设三个学习层级,已在加拿大学院初步部署,将开展50人混合方法评估。
Comments 5 pages, 4 figures. Accepted at the 2026 IEEE Frontiers in Education Conference (FIE 2026), Work in Progress track