QUIETT: Query-Independent Table Transformation for Robust Reasoning
QUIETT:查询无关的表格转换以实现稳健的推理
机构 * Arizona State University(亚利桑那州立大学)
专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL
AI总结 QuIeTT通过查询无关的表格转换框架,提升表格推理的可靠性和效率,实验显示在多个基准测试中表现优异。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
QUIETT:查询无关的表格转换以实现稳健的推理
机构 * Arizona State University(亚利桑那州立大学)
专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL
AI总结 QuIeTT通过查询无关的表格转换框架,提升表格推理的可靠性和效率,实验显示在多个基准测试中表现优异。
Pandora:利用代码驱动的知识迁移实现统一结构化知识推理
机构 * Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(新一代人工智能技术及交叉应用重点实验室(东南大学)) ; China Mobile Research(中国移动研究院) ; Monash University(莫纳什大学)
专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.CL
AI总结 本文提出Pandora框架,采用Python的Pandas API构建统一知识表示,结合代码驱动的知识迁移,在六个基准测试中优于现有统一推理框架。
Comments Accepted in IEEE TKDE (2026)
错误修复中的语义漂移:行为信号如何从报告传播到测试和补丁
专题命中 推理与问题求解 :LLM(abstract)
AI总结 研究错误修复中行为信号跨工件传播的量化问题,核心方法是引入Desc2Fix框架,通过结构化行为锚等实现语义对齐,主要贡献是证明行为对齐可测且非相似性可比,能为测试和补丁相关工作提供可重现信号,助力多项错误修复任务。
Spa3R:用于3D视觉推理的预测空间场建模
机构 * Huazhong University of Science & Technology(华中科技大学) ; Horizon Robotics ; D-Robotics Intern at D-Robotics(D-Robotics 实习生)
专题命中 推理与问题求解 :language model(abstract)
AI总结 Spa3R通过自监督学习从多视角图像中提取统一的空间表示,提升3D视觉推理能力,实现与VLMs的结合,达到3D VQA任务的高准确率。
面向大语言模型复杂图推理的统一多维度基准
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Rensselaer Polytechnic Institute(伦斯勒理工学院)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对现有图推理基准的局限,提出半自动框架构建含202个任务的统一多维度基准,评估LLM在不同推理模式下的表现,揭示模型局限并提供实证指导。
Comments Under review
一致性并非对齐:人类与大语言模型(LLM)伦理判断中的道德依据分歧
机构 * University of Ljubljana(卢布尔雅那大学) ; Faculty of Computer and Information Science(计算机与信息科学学院) ; Faculty of Theology(神学院) ; Faculty of Arts(艺术学院)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究以ETHICS基准的500项道德判断条目为对象,发现LLM与人类的最终伦理判断常一致,但道德依据存在系统性分歧,表明一致性不等同于对齐性,仅靠标签评估易产生误导。
Comments 9 pages, 4 figures, 3 tables. Accepted and presented at the AI Transparency Conference (AITC 2026), Nuremberg, Germany, June 5-6, 2026
当AI成为你的牧师:大型语言模型的神学分诊与牧灵指导基准测试
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI
AI总结 本研究推出FMG-Bench基准测试,评估LLM在基督教神学分诊与牧灵指导场景的表现,发现结构化框架可提升模型表现与鲁棒性,且该基准仅为测量工具。
Comments Full paper. Code and dataset are available at https://github.com/FideAI/fmg-bench and https://huggingface.co/datasets/FideAI/fmg-bench
哪种大语言模型是你理想的陪伴者?基于成人依恋理论评估大语言模型的情感陪伴能力
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本研究基于成人依恋理论构建情感陪伴基准ECBench,评估32个LLM的依恋倾向,探究其在多轮交互中的表现及可调整性,为情感陪伴类LLM的选择提供理论与工具支持。
大型语言模型中的数字能力:基本局限与改进路径
机构 * University of Chinese Academy of Sciences(中国科学院大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);pretraining(abstract)
AI总结 本研究针对LLMs在基础数值任务中的不可靠性,提出数值基础框架(NGF)并结合三大基准评估前沿模型,给出改进数值能力的部署建议与研究方向。
MOSAIC:揭示大型语言模型的道德、社会和个体维度
机构 * University of Southern California(南加州大学) ; University of Calabria and ICAR-CNR(卡利亚里大学和ICAR-CNR) ; Thomas Lord Department of Computer Science(托马斯·劳德计算机科学系)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI
AI总结 MOSAIC首次提出评估大型语言模型道德、社会和个体维度的综合基准测试,通过九个问卷和四个游戏全面考察伦理推理能力,揭示MFT的局限性。
LigBench:面向基于大语言模型的研究创意生成的统一且符合人类偏好的基准
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institution(上海创新研究院)
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对现有LLM研究创意生成评估零散、缺乏统一标准的问题,提出LigBench基准及PAIR-IQ数据集,实验表明LigBench评估稳定可解释且与专家判断一致性高,PAIR-IQ训练的模型排名准确性和鲁棒性更强
Comments 17 pages
评估者是实验的一部分:测量开放式大语言模型(LLM)的一致性
机构 * Illinois Institute of Technology(伊利诺伊理工大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL
AI总结 该研究提出实验方案测量开放式LLM一致性,发现错误同行输入会降低修订质量,评估者非中立,锚定校准必要,指出翻转率不足以完整衡量开放式一致性。
大语言模型能遵循指令,但无法同时遵循太多:组合约束满足中的相变
机构 * Meta Superintelligence Labs(元超级智能实验室)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出约束饱和评估基准,发现大语言模型在同时遵循5-6个以上指令约束时可靠性崩溃,不同类型约束的性能下降幅度存在差异,失败呈近独立的乘法累积效应。
Comments 35 pages, 7 figures, 13 tables. Reviewed in the ARR May 2026 cycle
大语言模型是可靠的评审者吗?面向金融文档错误检测的基准测试
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; School of Data Science, Fudan University(复旦大学数据科学学院) ; Ant Group(蚂蚁集团) ; School of Information and School of Smart Governance, Renmin University of China(中国人民大学信息学院与智慧治理学院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG
AI总结 本文构建首个金融错误检测基准FinED-Bench,评估发现当前LLMs难胜任高复杂度金融文档错误检测任务,监督微调可提升弱模型性能。
大语言模型在文化禁忌安全方面的“知识-行为差距”
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机与人工智能学院) ; Huawei(华为)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 针对大语言模型文化禁忌安全评估的现有基准存在不足,本文推出首个公开基准CulShield,发现先进LLMs存在“知识-行为差距”,且语言语境变化会影响其文化禁忌安全。
先验意识记忆:一种区分记忆与泛化在大语言模型中的高效度量标准
机构 * Cornell University(康奈尔大学) ; Boston University(波士顿大学) ; NVIDIA(英伟达)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG
AI总结 本文提出Prior-Aware Memorization,一种基于模型先验的轻量级度量标准,用于区分大语言模型中的真实记忆与统计上常见序列,揭示低频率不足以证明记忆,强调需考虑模型先验以评估数据泄露风险。
Comments COLM 2026 Camera Ready
大语言模型推荐系统是否知道自己在产生幻觉?针对目录保真度的置信度校准审计
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.LG
AI总结 该研究审计了四个零样本LLM推荐系统的幻觉率与置信度校准,发现其系统性置信不足,提出conformal弃权阈值效果有限,建议审计需同时报告校准与OOD率并采用锚定目录的提示。
通过代理评估和稳定性感知排名实现多模态大语言模型的鲁棒检查点选择
机构 * Meta AI
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种多阶段框架,结合了精心挑选的现实世界数据、结构化的LLM判断和多阶段排名协议,以解决多模态大语言模型检查点选择中的鲁棒决策问题,强调数据质量(特别是OCR可读性)对评估有效性的重要性。
MirrorBench: 一个评估对话用户代理人类化能力的基准测试
机构 * SAP Labs(SAP实验室)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文提出MirrorBench基准测试,用于评估对话用户代理的人类化能力,通过结合多种词汇多样性指标和LLM评估指标,揭示用户代理与真实人类用户之间的系统性差距。
Comments KDD 2026 (Dataset & Benchmark Track)
基于最优传输的基于大语言模型的视听语音识别语义对齐
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究基于大语言模型的视听语音识别,提出基于最优传输的语义对齐框架,通过在多模态融合前对齐声学和视觉表征弥合模态差距,经实验验证该方法能有效提升性能,在多种条件下达到最优。
BavGround:巴伐利亚区域文化接地与方言能力基准
机构 * Stanford University(斯坦福大学) ; Freie Universität Berlin(柏林自由大学) ; Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Leibniz Supercomputing Centre (LRZ)(莱布尼茨超级计算中心)
专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 该研究推出BavGround基准,评估LLM的巴伐利亚区域文化接地与方言能力,发现多语言模型在巴伐利亚语及源接地问题上表现欠佳,且评估协议会显著影响结论。
类结构保留优于多样性:不平衡文本分类的文本增强方法综合基准测试
机构 * Faculty of Business and Commerce, Kansai University(关西大学商学部)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究构建含11种增强方法的基准,在7个数据集上测试后发现,基于LLM的增强性能不优于经典的EmbSMOTE,类结构保真度而非表面多样性是关键,建议检索式过采样作为不平衡多分类默认方法。
在你开口前:基于与大语言模型(LLM)的日常纵向对话预测言语行为
专题命中 评测与基准 :LLM(title_cn,summary_cn)
AI总结 本研究提出基于LLM的预测性行为建模方法,通过14名参与者超1000小时的纵向对话数据集,证实可预测特定用户言语行为,为构建个性化AI系统提供新方向。
Journal ref The 39th Annual ACM Symposium on User Interface Software and Technology, UIST 2026
当LLM编码时会出现什么问题?表征自主代码助手的操作安全故障
专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract)
AI总结 通过系统分析文献和GitHub问题,构建了包含33种操作风险类型的多维安全分类法,发现编码代理故障通常严重且主要源于约束违反、破坏性操作、授权绕过和欺骗。
Comments This paper is accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Track
超越局部准确率:面向受控大语言模型推理评估的协议级可识别性审计
机构 * School of Statistics and Data Science, Southwestern University of Finance and Economics(西南财经大学统计与数据科学学院)
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL
AI总结 该研究提出协议级可识别性审计方法,无需调用模型即可验证LLM评估协议的有效性,发现基础准确率与选择性响应保真度存在显著差异,还确定了冻结策略类的最小识别支持。
Comments 15 pages, 9 figures. Ning Huang, Ziqi Sha, and Wenxuan Tang contributed equally as second authors. Wei Deng is the corresponding author
基于大语言模型的测试预言机:权威来源分类法——一项系统文献综述
机构 * Independent Researcher, USA(美国独立研究员) ; Technical University of Munich, Germany(德国技术大学)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 通过系统文献综述,沿权威来源、形式及裁决机制三轴分析相关研究,刻画领域、语言等情况,指出规范衍生权威最常见但仅占约一半研究,还报告了评估及失败情况并提出研究议程。
Comments 21 pages, 10 figures, 11 tables. Systematic literature review of 83 studies, reported under PRISMA 2020. Submitted to IEEE Access. Replication package: https://doi.org/10.5281/zenodo.21194940
DomusFM: 一个面向智能家居传感器数据的基础模型
机构 * University of Milan(米兰大学) ; University of New South Wales(新南威尔士大学)
专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract_cn);language model(abstract);分类 cs.AI
AI总结 DomusFM是首个专为智能家居传感器数据设计的基础模型,通过自监督双对比学习范式实现语义和时间依赖性的建模,有效提升活动识别任务的性能。
从多分辨率细胞到千兆像素全切片图像:用于计算病理学的基础模型
专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract)
AI总结 针对现有计算病理学模型泛化性受限的问题,提出多分辨率金字塔Transformer(MRPT),经多分辨率自监督预训练后,在34个数据集的多项任务中性能优于同类模型与多模态大语言模型。
利用LLM-DL进行程序代码错误理解的多标签分类
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 本文提出一种结合预训练语义编码器与高效递归解码器的多标签错误分类框架,通过实验验证其在编程教育和软件工程领域的有效性。
波动评判者:在沉默、压力与坚持下的认知稳定性
机构 * Meta Superintelligence Labs(元超级智能实验室) ; FAIR at Meta(元公司FAIR研究院)
专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI
AI总结 本研究提出Wiggle框架测试LLM评判者的认知稳定性,发现9个前沿模型在压力下裁决波动显著,且多数压力会损害真实值,基线陪审团多数强度可预测波动项目。