Why Machines Misread Pedagogical Quality: Human-Machine Alignment in LLM-Based Pretest Question Evaluation
为什么机器误读教学质量:基于LLM的前测问题评估中的人机对齐
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 针对大规模前测问题设计挑战,提出AI辅助工作流,通过2x2实验发现人机分歧具有系统性,且评分标准修订比对齐效果更大,两者互补。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
为什么机器误读教学质量:基于LLM的前测问题评估中的人机对齐
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 针对大规模前测问题设计挑战,提出AI辅助工作流,通过2x2实验发现人机分歧具有系统性,且评分标准修订比对齐效果更大,两者互补。
重新思考突发缓冲区优化:通过混合分析和LLM指导实现布局异构性
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 提出Proteus系统,通过结合静态代码结构和轻量级运行时信号重建I/O意图,在无需训练或详尽分析的情况下优化突发缓冲区的数据布局,实现高达3.24倍和2.9倍的写密集和元数据密集工作负载加速。
胸部X光片的视觉-语言模型并不总是需要图像
机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔朗根-纽伦堡大学模式识别实验室) ; Department of Diagnostic and Interventional Radiology, TUM University Clinic, School of Medicine and Health, Klinikum rechts der Isar, Technical University of Munich(慕尼黑工业大学医学院与健康学院伊萨尔河右岸医院诊断与介入放射学系) ; Lab for AI in Medicine, RWTH Aachen University(亚琛工业大学医学人工智能实验室) ; Department of Diagnostic and Interventional Radiology, University Hospital RWTH Aachen(亚琛工业大学医院诊断与介入放射学系)
专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过因果审计方法,发现许多医学视觉-语言模型在胸部X光片任务中依赖文本先验而非图像,纯文本模型与多模态模型性能接近,并提出了基于图像依赖性的评估框架。
视觉-语言模型作为组织病理学中的零标注预言机
机构 * Imperial College London(帝国理工学院) ; Leiden University Medical Center(莱顿大学医学中心) ; KU Leuven(鲁汶大学) ; University Hospitals Leuven(鲁汶大学医院) ; University Medical Center Utrecht(乌得勒支大学医学中心) ; Friedrich-Alexander University Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)
专题命中 评测与基准 :language model(title,abstract);prompting(abstract)
AI总结 提出一种粗到细方法,利用通用视觉-语言模型作为零标注预言机进行前景分割,在特殊染色上优于监督基线,并通过伪标签蒸馏轻量学生模型。
Comments 11 pages, 1 figure, 6 tables. Code available at https://github.com/VishalJ99/vlm-wsi-auto-context
基于反馈驱动多轮精化的二进制反编译大语言模型
专题命中 评测与基准 :LLM(title,abstract)
AI总结 提出AutoDecompiler,利用强化学习进行反馈驱动的多轮二进制反编译,通过编译、执行和I/O测试反馈迭代改进代码,显著提升行为可重执行性。
多模态大语言模型评判器的对抗鲁棒性
机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; State Key Laboratory of Virtual Reality Technology and System, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) ; State Key Laboratory of Software Development Environment, Jiangxi Research Institute, Beihang University(北京航空航天大学江西研究院软件开发环境国家重点实验室) ; School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算机与信息系统学院)
专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)
AI总结 提出RobustMLLMJudge框架评估多模态大语言模型作为评判器时的对抗鲁棒性,并设计MGSIA攻击方法,通过语义诱导和高分流形对齐生成可迁移的分数膨胀扰动,揭示其脆弱性。
图基础模型在节点属性预测中的公平评估
机构 * HSE University(俄罗斯高等经济学院) ; Yandex Research(Yandex研究院)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文对9种图基础模型进行公平评估,发现仅基于先验数据拟合网络的最新模型在预测性能上优于调优的图神经网络,但推理成本更高。
Comments Accepted at The Workshop on Graph Foundation Models at ICML 2026
药物难治性癫痫中致痫区识别的基础模型
机构 * McGill University(麦吉尔大学) ; Mila-Quebec AI Institute(米拉-魁北克人工智能研究所) ; Montreal Neurological Institute and Hospital, McGill University(蒙特利尔神经学研究所与医院,麦吉尔大学) ; Institute of Scientific Instruments, The Czech Academy of Sciences(捷克科学院科学仪器研究所) ; Brno Epilepsy Center, Department of Neurology, St Anne’s University Hospital(布尔诺癫痫中心,圣安妮大学医院神经内科) ; Faculty of Medicine, Masaryk University(马萨里克大学医学院) ; Duke University Medical Center(杜克大学医学中心) ; Duke Pratt School of Engineering(杜克普拉特工程学院)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出EpiiSLM双基础模型系统,通过信号基础模型和语言基础模型整合sEEG与临床信息,在接触级PPV上超越传统方法15.1%,仅需一夜发作间期睡眠数据。
Comments Keywords: drug-resistant epilepsy, epileptogenic zone, stereo-electroencephalography, signal foundation models, language foundation models
自然语言引导的、与生成器无关的蛋白结合剂筛选
机构 * Kim Jaechul Graduate School of AI, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院金在哲人工智能研究生院) ; LG AI Research(LG人工智能研究院) ; Seoul National University(首尔大学) ; Korea Electronics Technology Institute (KETI)(韩国电子技术研究院)
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 该研究提出用LLM生成排序策略,从已生成的蛋白结合剂池中筛选候选,在10目标和3目标测试中均优于基线,为蛋白结合剂筛选提供了可解释的后处理方法。
Comments Accepted at ICML 2026 Workshop on Generative and Agentic AI for Biology
先澄清再搜索:面向端到端 nugget 恢复的深度搜索澄清基准
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 该研究提出 Clarify-Then-Search 基准,评估 LLM 生成的澄清问题对深度搜索效用的提升,实验显示 k=1 时澄清优于基线,GPT-5.2 和 ERNIE-4.5-Turbo-128K 分别在 k=1、k=3 时表现最佳。
Comments Accepted to KDD 2026 Datasets and Benchmarks Track. 12 pages, 4 figures, 11 tables
合规性、能力与冲突:基于系统消息的多模态大语言模型基准测试
机构 * NAVER Cloud(NAVER云) ; KAIST AI(韩国科学技术院人工智能)
专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL
AI总结 该研究构建基准VSysBench测试多模态大语言模型在系统消息下的合规性,发现施加系统消息会降低任务准确率,开放权重模型易受用户冲突影响,视觉约束最难。
通过上下文感知的NLP流水线将专家审议转化为金融信号
机构 * Franklin Templeton Investments(富兰克林邓普顿投资公司) ; Blend360(Blend360公司) ; Santa Clara University(圣克拉拉大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 该研究提出CDSP流水线将投资委员会会议记录转化为金融特征,经实验其结合句子嵌入与CDSP特征的模型预测准确率达73%,证实专家审议含前瞻性金融信息。
评估德语文本自然语言生成中的体验质量
机构 * Technische Universität Berlin(柏林工业大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究针对德语NLG,构建了含人工评分的TextQ-German数据集,开发出混合等自动QoE预测模型,为NLG评估提供了公开资源与基线,助力贴合人类感知的NLG系统开发。
Comments Dataset available at https://github.com/DFKI-NLP/TextQ/
可验证弃权使AI在供水管网泄漏诊断中具备可问责性
机构 * School of Municipal Engineering and Environment, Shenyang Jianzhu University(沈阳建筑大学市政工程与环境学院) ; Guangzhou Institute of Industrial Intelligence(广州工业智能研究院) ; College of Environment, Shenyang University(沈阳大学环境学院) ; Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) ; College of Environmental Science and Engineering, State Environmental Protection Engineering Center for Pollution Treatment and Control in Textile Industry, Donghua University(东华大学环境科学与工程学院(国家环境保护纺织污染防治工程技术中心)) ; School of Information Science and Engineering, Shenyang University of Technology(沈阳工业大学信息科学与工程学院)
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 该研究针对供水管网泄漏诊断中AI缺乏问责性的问题,提出结合执行器智能体、监督智能体与LLM审计员的可验证弃权决策方法,提升了决策精度与挖掘正确性,为自主水基础设施运营提供可行路径。
Comments 42 pages, 5 main figures, 1 main table, 2 extended data figures, 3 supplementary figures, 15 supplementary tables. Code and data availability described in the paper
协作虚拟现实中团队过程阶段动态的计算测量
机构 * School of Business, Technical University of Applied Sciences Augsburg(奥格斯堡应用技术大学商学院) ; Data Science und Autonome Systeme Technologietransferzentrum (TTZ)(数据科学与自主系统技术转移中心)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 该研究提出计算框架,从协作VR游戏带时间戳对话检测团队过程阶段,经评估其可识别连贯阶段结构,为分析协作活动提供透明可迁移方法。
自进化智能体作为动态图变换:一项综述与新视角
机构 * School of Computer Science and Engineering, The University of New South Wales(新南威尔士大学计算机科学与工程学院) ; Faculty of Engineering and Information Technology, University of Technology Sydney(悉尼科技大学工程与信息技术学院) ; School of Data Science, The Chinese University of Hong Kong-Shenzhen(香港中文大学(深圳)数据科学学院) ; Zhejiang Gongshang University(浙江工商大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本综述将自进化智能体建模为动态图变换,梳理相关动态图方法分类,提出动态图学习作为智能体可复用基础设施,探讨图感知评估协议,为自进化智能体设计治理提供结构性视角。
Comments Project: https://github.com/LuckyGirl-XU/Awesome-Agent-Dynamic-Graphs.git
FrenchNews-7:跨出版商法国新闻编辑部分类基准
机构 * Le French News Lab(法国新闻实验室)
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL
AI总结 本研究构建了跨出版商法语新闻编辑部分类基准FrenchNews-7,采用微调CamemBERT分类器,实验显示其在召回率上优于零样本LLM基线,为新闻分类研究提供了可靠基准。
Comments 15 pages, 5 figures, includes appendices. Model and dataset available on HuggingFace
当写作风格发生漂移:在体裁、时间与AI时代的分布偏移下对作者验证进行基准测试
机构 * University of Technology Nuremberg (UTN)(纽伦堡工业大学(UTN))
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL
AI总结 本研究推出首个德语作者验证基准AVShift,对跨体裁、时间及AI时代分布偏移下的作者验证进行基准测试,发现微调LLM跨体裁泛化最佳,时间漂移是影响作者验证的最强因素之一,未观测到可测量的AI时代分布偏移。
GoalEvolve:从手工设计的算法先验到物理设计算法的目标驱动演化
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 GoalEvolve是一个目标驱动的物理设计算法演化框架,通过LLM教师与并行学生智能体协同,在8个ASAP7设计及Codex目标模式下,显著提升了TNS并降低了功耗。
IndicQE-APE:印度语言质量估计与自动后编辑基准
机构 * IIT Bombay(印度理工学院孟买分校) ; University of Oslo(奥斯陆大学) ; Lancaster University(兰卡斯特大学) ; INESC-ID ; Instituto de Telecomunicações(电信研究所) ; Instituto Superior Técnico(高等技术学院) ; University of Lisbon(里斯本大学) ; Sword Health ; Tilburg University(蒂尔堡大学) ; Zoom Communications(Zoom通信公司) ; Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) ; Apple(苹果公司) ; Bodhan AI ; IIT Madras(印度理工学院马德拉斯分校) ; University of Surrey(萨里大学)
专题命中 评测与基准 :LLM(summary_cn,abstract_cn);prompting(abstract);分类 cs.CL
AI总结 本研究构建了涵盖9个方向对的IndicQE-APE基准,对LLM、COMET指标及APE系统进行QE与APE基准测试,揭示质量信号冲突等因素对文本段排名的影响。
Comments Submitted to WMT 2026 for review
先跑再走:数据探索对数据分析智能体的重要性
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 该研究指出LLM数据分析工具存在忽视数据探索步骤的差距,引入两个基准评估数据集理解,发现强模型仍会遗漏逻辑结构,显式数据探索可提升下游任务性能。
Comments 9 pages, 6 figures. Accepted to VLDB 2026 Workshop: DASHSys: Systems for Data-centric Agents with Human-in-the-loop
评估分布式系统中智能体的代码修复能力
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 该研究推出分布式系统代码修复基准DDBench,评估10个LLM的代码修复能力,发现调试上下文可提升准确率且对强弱模型影响不同,分布式调试能凸显单进程基准未体现的推理能力。
Comments Under submission
当智能体执行失败时:从遥测数据中检测和定位运行时故障
机构 * University of Toronto(多伦多大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 该研究提出 AGENTCHAOSBENCH 基准,在智能体系统遥测数据中检测定位运行时故障,实验显示现有 LLM 基线对该任务的解决效果仍远未达标。
TimeSage-EV:面向动态环境下智能体时间序列分析的实时基准测试集
机构 * Eindhoven University of Technology(埃因霍温理工大学) ; University of Oxford(牛津大学) ; VulpiVox Intelligence(VulpiVox智能公司) ; Squirrel Ai Learning(Squirrel AI学习公司) ; Griffith University(格里菲斯大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对现有时间序列基准未评估时间有效性等问题,推出动态环境智能体时间序列分析基准TimeSage-EV,含多领域真实场景,实验揭示模型性能差距及失败模式,提供研究资源。
RAIL:一种人工智能就绪水平的自动分类器
机构 * CIETEC-IPN ; Instituto Politécnico Nacional(墨西哥国立理工学院) ; CICATA-QRO ; UPIITA
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出RAIL分类器,将三类AI就绪框架统一为AIRL量表,通过大语言模型智能体小组裁决实现自动评估,测试显示其一致性好且避免高估。
Comments Under review at journal
RippleMem:从孤立检索到智能体长期记忆的关联回忆
机构 * Communication University of China(中国传媒大学) ; Zhilian Yinghe Technology Co., Ltd.(智联映和科技有限公司) ; State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室)
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL
AI总结 RippleMem是一种智能体长期记忆系统,以自适应关联回忆替代孤立检索,在LoCoMo、LongMemEval-S数据集上提升LLM-as-a-Judge准确率并降低图构建成本,性能优于现有方法。
Comments 22 pages, 4 figures
面向自动化安全决策的非退化风险认证:以适配ATT&CK的分类为实例的决策契约理论
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG
AI总结 本文提出决策契约理论用于自动化安全决策的非退化风险认证,以适配ATT&CK的LLM入侵检测警报分类为实例,实验验证了该方法可有效控制风险并实现较高的正确自动化率。
Comments 17 pages, 2 figures, 10 tables
TRACE:可信赖的检索增强对话引擎
机构 * Wichita State University(威奇托州立大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究人员提出TRACE框架,通过强化检索提升公共服务对话系统的约束满足度、减少幻觉,降低对模型规模的依赖,证实检索质量是系统稳健性的关键。
如何内部试用你的AI聊天智能体:一种结合目标导向NPC模拟的三层评估框架
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 该研究提出三层评估框架,结合NPC模拟器验证LLM聊天智能体的多轮对话目标达成能力,其模拟器成本低、效率高,可用于CI/CD集成,相关资源已公开供其他团队使用。
Comments 24 pages, 11 tables, 3 figures
ActBench:协作智能体行为安全的自演进基准
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 该研究提出自演进行为安全基准ActBench,结合奖励引导束搜索与双证据验证机制,评估协作智能体风险,在24000条轨迹上测试15个LLM和6个开源智能体,发现模型间攻击成功率差异更大。
Comments Benchmark and Code is available https://github.com/zjuicsr/ActBench