Large Language Models for Departmental Expert Review Quality Scores
大型语言模型用于部门专家评审质量评分
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 本研究探讨了大型语言模型在内部部门评审中预测学术文章质量评分的能力,发现其与专家评分存在中等相关性,但报告质量低于人类专家。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
大型语言模型用于部门专家评审质量评分
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 本研究探讨了大型语言模型在内部部门评审中预测学术文章质量评分的能力,发现其与专家评分存在中等相关性,但报告质量低于人类专家。
一种面向上下文的双指标框架用于大型语言模型中的置信度估计
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG
AI总结 CRUX是一种面向上下文的双指标框架,通过上下文熵减少和统一一致性检验提升大型语言模型的置信度估计效果。
心理测试在大语言模型中是否有效?对性别歧视、种族主义和道德的测试评估
机构 * University of Mannheim(曼海姆大学) ; GESIS - Leibniz Institute for the Social Sciences(莱比锡社会科学研究所) ; Complexity Science Hub Vienna(维也纳复杂科学中心)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 本研究评估了心理测试在大语言模型上的有效性,发现其在性别歧视、种族主义和道德方面的测试分数与模型行为不一致,表明需进一步调整以适应LLMs。
LLM生成的解释不足以实现超强机器学习
机构 * Department of Computing, Imperial College London(帝国理工学院计算系)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本研究提出LENS框架,通过神经符号方法生成逻辑程序解释,发现LLM生成的解释在人类学习中效果有限,需结合人类认知约束实现超强机器学习。
BTCChat: 通过多模态大语言模型推进遥感双时相变化描述
机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Aerospace Information Research Institute(航天信息研究所) ; Chinese Academy of Sciences(中国科学院) ; School of Geographical Sciences(地理科学学院) ; Hunan Normal University(湖南师范大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 BTCChat通过多模态大语言模型提升遥感双时相变化描述能力,引入变化提取模块和提示增强机制,实现更精确的视觉-语义对齐和更优的性能表现。
Comments 5 pages, 2 figures; Accepted by ICASSP 2026
Tricky$^2$:面向评估人类与LLM错误交互的基准
机构 * William and Mary(威廉玛丽学院)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 Tricky$^2$是一个混合数据集,用于评估人类和LLM错误交互,包含人类和LLM生成的错误,支持混合错误行为分析和修复鲁棒性研究。
DiaDem: 促进音频视频字幕中的对话描述以提升多模态大语言模型
机构 * New Laboratory of Pattern Recognition, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; Peking University(北京大学) ; Nanjing University(南京大学)
专题命中 评测与基准 :large language model(title);language model(title);SFT(abstract);分类 cs.CL
AI总结 DiaDem通过合成高质量数据集和难度分区的两阶段GRPO策略,提升了音频视频字幕中的对话描述准确性,并在多种基准测试中表现出色。
Comments Project webpage: https://diadem-captioner.github.io/
在大语言模型生成响应中插入广告
机构 * University of Michigan(密歇根大学) ; Peking University(北京大学) ; The University of Hong Kong(香港大学)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了解耦广告插入与响应生成、以及竞价与用户查询的框架,通过基于类型拍卖机制实现近最优的社会福利,同时提高计算效率和上下文一致性。
Comments 31 pages, 8 figures
TextMineX: 用于人道主义排雷行动的数据集、评估框架及基于本体的LLM流水线
机构 * NEC Laboratories Europe(NEC欧洲实验室) ; University of Stuttgart(斯图加特大学) ; VAGO Solutions(VAGO解决方案) ; Zurich University of Applied Sciences(苏黎世应用科学大学) ; CAIR, Ss. Cyril and Methodius University of Skopje, North Macedonia(CAIR,斯科普耶塞尔维亚·梅托迪乌斯大学,北马其顿)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 TextMineX通过构建首个HMA领域数据集和基于本体的LLM流水线,提升文本中领域知识的提取准确性与一致性。
通过搜索空间划分改进基于LLM的全局优化
机构 * University of Freiburg(弗赖堡大学) ; ELLIS Institute Tübingen(图宾根ELLIS研究所) ; Prior Labs(Prior实验室)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 HOLLM通过搜索空间划分提升LLM在高维优化中的性能,有效平衡探索与利用,优于现有全局优化方法。
Comments 31 pages, 19 figures, 7 tables
对Oncotimia的评估:一种基于LLM的系统,用于支持肿瘤板
机构 * Innovation Department, Bahía Software SLU(Bahía Software SLU创新部)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 Oncotimia通过LLM自动完成肺癌肿瘤板表单,提高了效率并减少了文档负担。
Comments 9 pages, 2 figures
HELM:一种面向LLM推荐系统的以人为本的评估框架
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 HELM框架通过五个以人为本的维度评估LLM推荐系统,揭示传统指标无法捕捉的关键质量维度,并展示GPT-4在解释质量与交互自然性上的优势及流行度偏差。
通过确定性AST分析检测和纠正LLM生成的代码中的幻觉
机构 * William & Mary(威廉玛丽大学)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出通过确定性AST分析检测并纠正LLM生成代码中的知识冲突幻觉,实现高精度和召回率的自动修复。
Comments Accepted to FORGE 2026
基于大语言模型的连续优化问题可控高阶属性设计
机构 * Machine Learning and Optimization, Paderborn University, Germany(机器学习与优化,帕德博恩大学,德国) ; Leiden Institute of Advanced Computer Science, Leiden University, The Netherlands(莱顿先进计算机科学研究所,莱顿大学,荷兰) ; Data Management and Biometrics, University of Twente, The Netherlands(数据管理与生物特征,埃因霍温大学,荷兰)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出利用大语言模型设计具有可控高阶属性的连续优化问题,通过生成函数并验证其结构特征,扩展了基准测试空间。
Comments 17 pages, accepted at EvoApplications 2026
DSSmoothing:通过双空间平滑实现预训练语言模型的认证数据集所有权验证
机构 * North China Electric Power University(华北电力大学) ; Research Institute, China Unicom(中国联合研究院) ; Wuhan University(武汉大学) ; Beihang University(北京航空航天大学) ; Nanyang Technological University(南洋理工大学)
专题命中 评测与基准 :language model(title,abstract);分类 cs.AI
AI总结 DSSmoothing通过双空间平滑在灰盒设置下实现预训练语言模型的数据集所有权验证,提供可证明的鲁棒性保证。
Comments To appear in WWW 2026. 12 pages
在LLM多智能体系统中,社会学习和集体规范形成促进合作的作用
机构 * Center for Humans and Machines(人类与机器中心) ; Max-Planck Institute for Human Development(人类发展马克斯·普朗克研究所)
专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI
AI总结 本文提出了一种无显式奖励信号的CPR模拟框架,通过社会学习和规范惩罚机制研究LLM多智能体系统中合作与规范的内生形成。
Comments Accepted at the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)
基于大语言模型的智能体的自动化结构测试:方法、框架与案例研究
机构 * Amazon Web Services(亚马逊网络服务)
专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI
AI总结 本文提出基于大语言模型的智能体结构测试方法,通过跟踪、模拟和断言实现自动化测试,提升测试效率与质量。
Comments 10 pages, 5 figures. Preprint of an accepted paper at IEEE BigData 2025 (main track). Source code for the introduced methods and framework available at https://github.com/awslabs/generative-ai-toolkit
MobileSafetyBench: 评估移动设备控制自主代理的安全性
专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG
AI总结 MobileSafetyBench通过Android模拟器评估移动设备控制自主代理的安全性,揭示基于LLMs的代理在安全任务中存在缺陷,提出提示方法提升安全性。
迈向面向架构的LLM代理评估指标
专题命中 评测与基准 :LLM(title,abstract)
AI总结 本文提出了一种面向架构的LLM代理评估方法,通过连接代理组件与可观察行为及评估指标,提升评估的针对性和透明度。
Comments Accepted at CAIN 2026 (IEEE/ACM 5th International Conference on AI Engineering)
基于大语言模型的项目级漏洞检测:一项实证研究
专题命中 评测与基准 :LLM(title,abstract)
AI总结 本文研究了基于LLM的项目级漏洞检测方法,发现其在召回率低的情况下仍能发现更多漏洞,但存在高误报率和计算成本问题。
Comments 19 pages, 13 figures, 11 tables
音频基础模型在钢琴演奏评估中优于符号表示
专题命中 评测与基准 :foundation model(title,abstract)
AI总结 本文提出使用音频基础模型在钢琴演奏评估中优于符号表示,通过实验验证音频模型在19个维度上的优越性。
Comments 6 pages, 4 figures, 2 tables. Code available at https://github.com/Jai-Dhiman/crescendai
PROPHET:一个基于因果干预似然估计的可推断未来预测基准
机构 * Peking University(北京大学) ; Wuhan University(武汉大学) ; Beihang University(北京航空航天大学)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 PROPHET引入了基于因果干预似然估计的可推断未来预测基准,通过CIL评估预测问题的可推断性,提升未来事件预测的准确性与可靠性。
探索纯大语言模型在图学习任务中的应用:全面的基准测试与调查
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Michigan State University(密歇根州立大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Rensselaer Polytechnic Institute(纽约理工学院)
专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.LG
AI总结 本研究探讨纯大语言模型在图学习任务中的应用,通过全面的基准测试与分析,发现指令微调的LLMs在少样本设置中表现优异,具备强大的领域迁移能力和良好的泛化与鲁棒性。
人类认知基准揭示大规模多模态语言模型中的基础视觉缺陷
机构 * CUHK(香港中文大学) ; PKU(北京大学) ; CUHKSZ(香港中文大学深圳分校) ; RUC(中国人民大学) ; Tencent(腾讯) ; SHLab(深圳实验室)
专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL
AI总结 人类认知基准揭示大规模多模态语言模型在基础视觉能力上的不足,通过VisFactor评估发现模型在关键视觉任务上表现不佳。
Comments Update: Evaluated 23 SOTA MLLMs
利用大语言模型减少静态bug检测中的误报:一项行业内的实证研究
机构 * Fudan University(复旦大学) ; Tencent(腾讯)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究利用大语言模型在腾讯企业环境中减少静态代码分析中的误报,通过实证研究展示LLM在工业场景下的高效性和成本效益。
语言模型在算术中是符号学习者
机构 * Department of Computer Science(计算机科学系) ; Rice University(里士满大学) ; College of Computing(计算学院) ; Georgia Institute of Technology(佐治亚理工学院) ; Duke University(杜克大学)
专题命中 评测与基准 :language model(title);分类 cs.CL、cs.LG
AI总结 本文研究语言模型在算术运算中通过学习符号捷径而非算法来掌握算术能力。
Comments TMLR 2026. Code at https://github.com/chili-lab/Symbolic-Arithmetic
基准在模型比裁判更智能时达到饱和
机构 * Data Analytics Lab, Vrije Universiteit Brussel(自由大学布鲁塞尔数据分析实验室) ; imec-SMIT, Vrije Universiteit Brussel(imec-SMIT,自由大学布鲁塞尔) ; School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现当模型比裁判更智能时,基准测试的准确性下降,强调了高质量数据集和可靠裁判的重要性。
Comments 17 pages, 10 figures, 3 tables
理解代理AI生成代码的主导主题
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文研究了代理AI生成代码的评审主题,通过大规模实证分析发现,评审主要关注文档、重构和格式问题,而非功能正确性。
意义并非一种度量:利用大语言模型在大规模AI社会技术系统中使文化背景可理解
机构 * The Alan Turing Institute(艾伦·图灵研究所) ; University of Edinburgh(爱丁堡大学) ; University of Colorado Boulder(科罗拉多大学丹佛分校) ; University of Chicago(芝加哥大学) ; University of Exeter(埃克塞特大学) ; University of Southampton(南安普顿大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文探讨了利用大语言模型在大规模AI系统中通过厚描述使文化背景可理解的挑战与方向。
迈向自动智能合约生成:评估、基准测试与检索增强修复
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Sun Yat-sen University(中山大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出SolBench和RAR框架,通过基于执行的基准测试和检索增强修复方法,提升Solidity智能合约生成的准确性和效率。
Comments Accepted by FSE 2026