Can LLMs Credibly Transform the Creation of Panel Data from Diverse Historical Tables?
LLM能否可信地转换来自不同历史表格的面板数据?
专题命中 评测与基准 :LLM(title_cn,summary_cn)
AI总结 提出基于多模态LLM的管道,以低成本从历史表格中提取面板数据,在车辆登记数据上达到95.4%精确匹配率,成本仅为传统方法的1/50。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
LLM能否可信地转换来自不同历史表格的面板数据?
专题命中 评测与基准 :LLM(title_cn,summary_cn)
AI总结 提出基于多模态LLM的管道,以低成本从历史表格中提取面板数据,在车辆登记数据上达到95.4%精确匹配率,成本仅为传统方法的1/50。
LLMs中的心理引导:有效性与可信度评估
专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 提出PsySET基准,评估提示、微调和表示工程等策略在控制LLM情绪和人格方面的效果与可信度,发现提示有效但强度控制有限,向量注入控制更精细但输出质量略降,且情绪引导可能产生副作用。
Comments Accepted at ACL 2026. Camera-ready version
AGC-Bench:衡量人工通用创造力
机构 * Pennsylvania State University(宾夕法尼亚州立大学) ; University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校) ; University of Amsterdam(阿姆斯特丹大学) ; Amazon AGI(亚马逊AGI) ; Dartmouth College(达特茅斯学院)
专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL
AI总结 提出AGC-Bench基准,通过系统文献综述和标准化框架评估LLM创造力,发现单一创造力因子'c',并验证提示'要有创造力'比推理更有效。
物理基础模型能否学习可泛化的物理?一种跨物理机制和分布偏移的偏差感知基准
机构 * The Ohio State University(俄亥俄州立大学) ; Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)
专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 通过构建包含8种物理动力学、3种训练数据混合和25种测试机制的基准,评估五种物理基础模型架构,发现当前模型是条件性而非通用性泛化者,其泛化能力依赖于物理机制、时间尺度、初始条件、预训练、模型大小和架构,并指出改进需超越缩放模型或扩展数据,转向学习跨机制、时间尺度和分布偏移的可迁移物理知识。
Comments 26 pages, 31 figures
AgenticDataBench:数据智能体的综合基准
机构 * Tsinghua University(清华大学) ; Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出AgenticDataBench基准,通过覆盖15个垂直领域(含5个真实B2B用例)的细粒度任务,评估基于大语言模型的数据智能体在自动化数据科学工作流中的表现。
办公室理解基准
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Office Comprehension Bench,首个联合评估LLM对Word Excel和PowerPoint文件理解的基准,包含文件保真度问答和领域问答两个赛道,测试结构与视觉感知及多领域推理能力。
HAL: 通过对齐引导LLM的人类相似性
机构 * University of Rochester(罗切斯特大学)
专题命中 评测与基准 :LLM(title_cn);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出HAL框架,利用可解释的数据驱动奖励信号,通过对比对话数据提取显式会话特征并优化偏好,使模型在对话中更常被视为类人,同时保持整体性能。
AIriskEval-edu: 用于AI辅助K-12教育解释风险评估的新数据集
机构 * Cátedra ENIA UAM-VERIDAS en IA Responsable(ENIA UAM-VERIDAS负责任人工智能教席) ; NextGenerationEU PRTR(下一代欧盟复苏计划) ; MICIU/FEDER(西班牙科学、创新与大学部/欧洲区域发展基金) ; MICIU/AEI(西班牙科学、创新与大学部/国家研究机构) ; Comunidad de Madrid(马德里自治区) ; MINECO/FEDER(西班牙经济与竞争力部/欧洲区域发展基金)
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 提出AIriskEval-edu-db2数据集,包含1639条解释及结构化可解释性标注,用于训练基于LLM的审计员评估K-12教学内容中的教学风险,涵盖五个维度。
Comments 6 pages, 2 figures. Accepted at the IEEE International Carnahan Conference on Security Technology (ICCST 2026), October 14, 2026
MedCase-Structured:用于在临床真实EHR环境中基准测试诊断推理的文本到FHIR数据集
机构 * System Inc.(系统公司)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出一个从非结构化文本生成临床真实HL7 FHIR R4数据集的流水线,构建MedCase-Structured数据集,发现LLMs在结构化FHIR输入上的诊断准确性低于纯文本,强调部署对齐基准测试的重要性。
Comments Accepted to ICML 2026 Structured Data for Health Workshop
将智能搜索引入地球观测数据发现
机构 * University of Maryland, College Park(马里兰大学学院公园分校)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出一个基于智能搜索的系统,利用知识图谱和大型语言模型,从自然语言查询中返回匹配的地球科学数据集和工具,显著提升检索性能。
Comments 19 pages, 1 figure, 6 tables
通过大语言模型将自然语言翻译为策略时序规范
机构 * University of Naples Federico II(那不勒斯费德里科二世大学) ; LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信,巴黎理工学院)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出利用大语言模型将自然语言描述的策略需求翻译为ATL/ATL*公式,构建专家验证数据集,通过领域内微调小模型达到与强少样本专有API基线相当的语义准确性(0.84 vs 0.86),并集成到模型检查器中支持非专家用户。
ClawArena-Team: 语言模型智能体中子智能体编排与动态工作流的基准测试
机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) ; University of California, Berkeley(加州大学伯克利分校) ; University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 提出ClawArena-Team基准,通过41个多轮多模态多目录场景,评估单个LLM作为管理者编排子智能体的能力,发现管理瓶颈在于权限授予而非感知,且成本与质量解耦。
Comments 24 pages, 10 figures, website: https://www.clawarena.cc/
表面礼貌,实践错误:一个用于修复多语言孟加拉语生成中敬语失误的定制数据集
机构 * United International University(国际大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出了一个定制数据集BLADE,用于改进多语言孟加拉语生成中敬语处理的准确性,通过系统微调和评估领先的开源架构,如DeepSeek-8B和LLaMA-3.2-3B,以提高结构忠实度和敬语对齐度。
跨文化价值观意识在大型视觉-语言模型中的体现
机构 * Thoughtworks ; University of Ottawa(渥太华大学)
专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本文研究了图像中文化背景如何影响大型视觉-语言模型对人物道德、伦理和政治价值观的判断,通过多维分析揭示模型对文化价值观差异的认知。
伪装与引爆:技能型恶意软件的扫描规避与动态检测
专题命中 评测与基准 :LLM(summary_cn,abstract)
AI总结 针对LLM编码代理技能市场中的恶意技能,提出两种规避静态扫描的方法(结构混淆和自提取技能打包),并设计基于沙箱运行时行为审计的检测系统SkillDetonate,实现97%检测率与2%误报率。
使用渐进式、自适应和交互式反馈对代码改进进行基准测试
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出PAIR-Bench基准,通过渐进式提示和结构化反馈协议,细粒度评估大语言模型在代码改进中的修复能力、泛化能力和所需辅助程度。
STRUCTSURVEY: 结构化智能检索用于自动生成综述论文
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出STRUCTSURVEY分层多智能体框架,通过动态构建实体、关系和主题分类的图表示,将结构推理从生成阶段转移到检索阶段,在ACL综述基准上相比嵌入检索基线平均提升ROUGE-1召回率2.9、ROUGE-2召回率1.0,且不降低精确度。
Comments 8 pages, 1 figure, appendices, SurgeLLM, RAG4Reports, ACL
ARES: 一种用于人类-人工智能游戏中基于角色的社会工程风险自适应评估平台
专题命中 评测与基准 :LLM(summary_cn,abstract)
AI总结 提出ARES平台,通过可控社交游戏审计LLM中介的社会决策中的自适应社会工程风险,支持人-人、人-AI和AI-AI设置,并收集多模态数据集以评估风险。
Comments 6 pages, 2 figures. Accepted at the IEEE International Carnahan Conference on Security Technology (ICCST 2026), October 14, 2026
Omni-DuplexEval: 评估实时双工全模交互
机构 * Tsinghua University(清华大学) ; Tongji University(同济大学) ; ModelBest Inc.(ModelBest公司)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出Omni-DuplexEval基准,用于系统评估实时双工交互能力,通过两个互补场景评估模型生成连续响应和主动提醒的能力,并揭示现有模型在平衡响应及时性和内容连贯性方面的局限性。
Comments 21 pages, 6 figures
RealBench: 一个与真实世界软件开发实践对齐的仓库级代码生成基准测试
专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract)
AI总结 RealBench通过结合自然语言需求和UML图,评估LLM在结构化设计下的代码生成能力,揭示了LLM在仓库级代码生成中的性能差距和优化策略。
为Android应用程序自动生成高质量的缺陷报告
专题命中 评测与基准 :LLM(summary_cn,abstract)
AI总结 本文提出通过提供具体应用相关信息帮助LLM自动生成清晰详细的缺陷报告,提出BugScribe方法,通过评估显示其生成的报告质量更高且更准确。
Comments 12 pages, 6 figures
ForeSea:面向视频监控的多模态查询AI取证搜索
机构 * Qualcomm AI Research(高通人工智能研究)
专题命中 评测与基准 :LLM(summary_cn,abstract)
AI总结 针对监控视频中多模态查询与时间定位难题,提出ForeSea系统,采用三阶段即插即用流程,结合跟踪、多模态嵌入和视频LLM,在ForeSeaQA基准上准确率提升3.1%,时间IoU提升10.1%。
Comments ECCV2026
语言模型作为文化测量仪器
机构 * School of Information University of California, Berkeley(信息学院加州大学伯克利分校)
专题命中 评测与基准 :language model(title,abstract);分类 cs.CL
AI总结 本文提出语言模型的文化测量是物质-话语实践,通过Karen Barad的能动切割概念,论证模型设计选择构成所测量的文化现实,并通过三个案例和三个仪器检查展示这一观点。
Comments Accepted to the Big Picture workshop co-located with ACL 2026. This version expands the camera-ready (adding Fig. 3 and section 6.3, as well as correcting minor typos) in Proceedings of The Big Picture v2: Crafting a Research Narrative, pp. 131--143, San Diego, CA, USA. Association for Computational Linguistics
AnyGroundBench: 视觉语言模型中视频定位的专业领域基准
机构 * Keio University(庆应大学) ; Keio AI Research Center(庆应人工智能研究中心) ; Keio University School of Medicine(庆应大学医学部) ; NVIDIA(英伟达)
专题命中 评测与基准 :language model(title,abstract);分类 cs.AI
AI总结 提出AnyGroundBench基准,将STVG评估从零样本转向领域适应,涵盖五个专业领域,评估15个VLM的零样本和上下文学习能力,发现现有模型在专业领域表现不佳。
基于时间序列基础模型的概率低压峰值负荷预测及其面向应用的评估指标
机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) ; Netze BW GmbH(Netze BW有限公司)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG
AI总结 本研究评估时间序列基础模型在200个实际低压馈线短期净负荷预测中的性能,提出面向应用的指标连接峰值预测与电网资产规划中的成本-风险权衡。
Comments A poster abstract of this publication will be available at the 15th DACH+ Conference on Energy Informatics (2026 in Linz, Austria)
金融服务大语言模型评估的元基准
机构 * Commonwealth Bank of Australia(澳大利亚联邦银行)
专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI
AI总结 针对公共排行榜忽略金融服务特定认知需求的问题,提出元基准框架,将452个基准映射到41个O*NET工作活动和38个BIAN银行业务领域,采用乘法加权方案和Elo锦标赛生成可比较的工作活动与业务领域得分。
Comments 27 pages, 13 figures, 3 tables
面向生物标志物评估的病理基础模型中的细胞级可解释性
机构 * Institute of Pathology, Technical University of Munich(慕尼黑技术大学病理学研究所) ; School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Computer Aided Medical Procedures (CAMP), Technical University of Munich(慕尼黑技术大学计算机辅助医疗程序中心) ; School of Biomedical Engineering, Faculty of Medicine, Dalian University of Technology(大连理工大学医学院生物医学工程学院) ; Affiliated Hospital of Chifeng University(赤峰大学附属医院) ; Center for Medical Imaging, Robotics, and Analytic Computing & Learning (MIRACLE), Suzhou Institute for Advanced Research, USTC, Suzhou, China(苏州先进研究院医学影像、机器人与分析计算与学习中心) ; Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) ; The First Hospital and the College of Basic Medical Sciences of China Medical University(中国医科大学第一医院及基础医学科学学院) ; Munich Data Science Institute (MDSI)(慕尼黑数据科学研究所)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI
AI总结 提出Hireca病理基础模型和CytoMap可解释性模块,在10项生物标志物任务中多数领先,提供细胞级证据定位,实现透明可审查的生物标志物评估。
生成式人工智能与联邦学习在入侵检测系统中的应用:综述
机构 * Department of Computer Science, New Mexico State University(新墨西哥州立大学计算机科学系) ; University of Hartford(哈特福德大学) ; DEVCOM Analysis Center(DEVCOM分析中心)
专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文综述了生成式AI和联邦学习在入侵检测中的应用,涵盖模型分类、任务目标及集成方法,并讨论了数据质量、对抗风险等挑战。
PreScience:一个用于科学预测的数据集和基准
机构 * Allen Institute for Artificial Intelligence(Allen人工智能研究所) ; Knowledge Lab, University of Chicago(芝加哥大学知识实验室) ; School of Computer Science and Engineering, Hebrew University of Jerusalem(耶路撒冷希伯来大学计算机科学与工程学院) ; Northwestern University(西北大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出PreScience数据集和基准,包含98K篇AI论文及关联数据,设计7项预测任务,开发基线方法及LACER评估指标,发现合成论文多样性低于人类。
Comments 11 pages (70 with bibliography and appendix), 3 figures (14 with appendix), 5 tables (18 with appendix), 1 algorithm in appendix
3D植物表型分析的转折点:3D基础模型实现分钟到秒级的跨作物重建及更多
机构 * Northwest A&F University(西北农林科技大学) ; Huazhong University of Science and Technology(华中科技大学) ; Wuhan Institute of Technology(武汉工程大学)
专题命中 评测与基准 :foundation model(title,abstract)
AI总结 提出基于3D基础模型的跨作物表型分析框架,用前馈几何恢复替代COLMAP,结合3D高斯泼溅实现少视图重建,将重建时间从6.52分钟降至1.58秒,保持高质量与高精度。
Comments 39 pages, 6 figures, 3 tables