Measuring Product Quality Using Images: The CLIP Q-Score and an Application to Real Estate
利用图像衡量产品质量:CLIP Q分数及其在房地产中的应用
专题命中 评测与基准 :LLM(summary_cn,abstract)
AI总结 该研究提出CLIP Q分数这一基于对比语言-图像预训练的开源图像产品质量衡量方法,其可预测房地产市场价格与流动性,且与LLM评估结果一致。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
利用图像衡量产品质量:CLIP Q分数及其在房地产中的应用
专题命中 评测与基准 :LLM(summary_cn,abstract)
AI总结 该研究提出CLIP Q分数这一基于对比语言-图像预训练的开源图像产品质量衡量方法,其可预测房地产市场价格与流动性,且与LLM评估结果一致。
从田间尺度到大规模光谱库:土壤光谱学中的表格基础模型
机构 * Osnabrück University(奥斯纳布吕克大学) ; Leibniz Institute for Agricultural Engineering and Bioeconomy (ATB)(莱布尼茨农业工程与生物经济研究所) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG
AI总结 该研究针对土壤光谱预测难题,对比多种模型与降维方法,发现结合偏最小二乘潜在变量的表格基础模型TabPFN在田间及大规模光谱库任务中表现最优,为光谱校准模型选择提供了循证指导。
StructureClaw:用于结构工程工作流程的可追溯大语言模型智能体及可执行基准测试
专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI
AI总结 针对结构工程请求评估中难以验证完整证据链的问题,提出StructureClaw及可执行基准测试StructureClaw-Bench,通过工件中心评估提高成功率,发现交互式和多模态评估的挑战,为评估改进结构工程智能体提供更严格基础。
Comments 21 pages, 9 figures
MetaHOPE:面向隐喻的评估框架用于分析机器翻译和大语言模型翻译错误
机构 * Centre for Linguistics, Humanities, Leiden University(莱顿大学人文学院语言学中心) ; LIACS, Leiden University(莱顿大学LIACS) ; BDS, Leiden University Medical Centre(莱顿大学医学中心BDS)
专题命中 评测与基准 :LLM(title,abstract_cn);分类 cs.CL
AI总结 提出MetaHOPE框架,基于错误严重性标注隐喻翻译错误,通过人工标注语料评估GoogleMT、GPT5.4和Hunyuan-7b在英汉互译中的表现,并构建双语平行资源。
Comments To appear in the Proceedings of the 9th International Conference on Natural Language and Speech Processing (ICNLSP 2026), Trento, Italy, September 2026
代理是否准备好教学?一个多阶段基准用于现实世界教学工作流程
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Qwen Team, Alibaba Group(阿里集团通义实验室)
专题命中 评测与基准 :language agent(title,abstract);分类 cs.AI
AI总结 本文提出EduAgentBench基准,用于评估教学代理的全面能力,发现当前模型在教学任务中的表现有限,但仍为开发未来教学代理提供了测量基础。
Comments Under review
通用视觉语言模型(VLM)可指导天文基础模型更好地识别星系形态
机构 * Stony Brook University(石溪大学) ; University of Technology Sydney(悉尼科技大学) ; Futurewei Technologies(华为主机技术公司)
专题命中 评测与基准 :foundation model(title,abstract)
AI总结 该研究提出用通用视觉语言模型(VLM)作为弱监督教师,指导天文基础模型Zoobot提升星系形态识别性能,可高效适配未来大型天文巡天任务。
Comments 12 pages, 5 figures
FairForensics:基于视觉-语言建模的通用公平深度伪造检测——表情感知与人口统计解析
机构 * Shenzhen University(深圳大学) ; Shandong Artificial Intelligence Institute(山东省人工智能研究院) ; Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院)) ; Tianjin University of Technology(天津理工大学)
专题命中 评测与基准 :language model(title,abstract)
AI总结 本文构建人口统计平衡的深度伪造检测基准,提出FairForensics视觉-语言模型,通过表情感知与人口统计正则化实现通用公平检测,在基准上达到泛化与公平性的SOTA。
观察与回溯:用于全景SLAM的冻结基础模型中的隐式注意力与潜在方向
专题命中 评测与基准 :foundation model(title,abstract)
AI总结 该研究针对全景SLAM的相机倾斜、尺度漂移等问题,基于冻结全景几何基础模型的隐式线索提出HALO-SLAM,在五个基准的125个序列上实现100%序列成功率,ATE显著优于现有方法。
文档与代码模式:什么驱动基于大语言模型的异常预言生成?
专题命中 评测与基准 :LLM(title,abstract)
AI总结 该研究通过干预式与归因引导的替换消融实验,发现基于大语言模型的异常预言生成(TOG)的高准确率多源于捷径信号而非结构化异常文档,挑战了准确率反映语义稳健性的假设,提出需从证据依据角度评估TOG系统。
语言模型在软件仓库挖掘中的兴起:综述
专题命中 评测与基准 :language model(title,abstract)
AI总结 本文综述了语言模型在软件仓库挖掘中的应用,分析了85篇论文,探讨了模型的应用方式、分析的 artifacts 类型、模型演变及可重复性,提出分类并指出未来研究方向。
TreeProbe:面向大型语言模型文化偏见的藏医药基准测试集
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Tibet University(西藏大学) ; Peking University(北京大学) ; Southwest Jiaotong University(西南交通大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL
AI总结 本研究针对大型语言模型的藏医药文化偏见问题,构建了首个基于藏医药“医学之树”框架的基准测试集TreeProbe,发现现有模型存在系统性本体漂移,为公平医疗AI开发提供了诊断基准。
RamanPFN:基于表格基础模型学习拉曼光谱结构
机构 * Beihang University(北京航空航天大学) ; Cleer Science(Cleer科技公司)
专题命中 评测与基准 :foundation model(title);分类 cs.AI、cs.LG
AI总结 RamanPFN在TabPFN推理前编码拉曼光谱依赖关系,经74个公开拉曼数据集的150项任务评估,可降低回归与分类误差,是高维拉曼测量与可复用表格推理的有效接口。
HIERA:面向内容发现系统的分层多智能体相关性评估框架
专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)
AI总结 该研究针对内容发现系统人工标注的问题,提出分层多智能体相关性评估框架HIERA,通过四个专用智能体的分层协调,在五个数据集上较11个基线方法取得显著性能提升。
儿童步态行为解码
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; PediaMed AI ; Shenzhen Children’s Hospital(深圳市儿童医院) ; Hong Kong Polytechnic University(香港理工大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 针对儿童步态分析的临床需求,本文构建含110名受试者的1100余条高帧率视频数据集,指出现有先进模型难以解析其临床细节,提出统一端到端框架并建立自动化儿童步态评估基线。
Journal ref ECCV 2026
OpenDebateEvidence:一个大规模论证挖掘与摘要数据集
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究推出源自美国竞技辩论界的大规模OpenDebateEvidence数据集,经实验验证微调大语言模型可实现论证性抽象摘要,旨在推进计算论证并公开数据集供研究使用。
Comments Published to the 38th Conference on Neural Information Processing Systems (NeurIPS 2024) Track on Datasets and Benchmarks
TIDES:用于建模多方社会动态的纵向双语数据集
机构 * KAIST(韩国科学技术院) ; SkillBench
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究针对现有群体对话数据集无法捕捉团队长期社会动态的问题,推出TIDES纵向双语数据集,基于其微调模型提升下一个说话人预测性能,同时发现预测效果与话语自然度存在潜在不匹配。
Comments The first two authors hold equal contribution. Accepted to COLM 2026. Project website: https://tides.cstlab.org/
智能体在19:05能看到什么?从真实研究生成时间化企业场景并回放以评估智能体
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本研究提出从真实研究生成时间化企业场景并回放的系统,用于解决现有离线评估智能体仅基于最终静态快照的问题,可在任意时刻评估可插拔智能体。
Comments 6 pages, 3 figures, 4 tables. Accepted as a poster at SERI 2026
哪些应该进入评估集?面向智能体可扩展性平台的、基于能力分类法的回归评估集编建流水线
机构 * Microsoft(微软) ; Indian Institute of Technology Roorkee(鲁尔基印度理工学院)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 针对智能体可扩展性平台的回归评估集编建问题,提出基于能力分类法的流水线,通过三个组件实现查询决策,可适配带类型化能力分类法的各类编建场景。
Comments Extended abstract accepted at the SERI 2026 Industry Track
CurveShift:智能体的进展是标量吗?区分水平与形态
机构 * University of Southern California(南加利福尼亚大学) ; University of Chicago(芝加哥大学) ; University of California, Berkeley(加利福尼亚大学伯克利分校) ; Massachusetts Institute of Technology(麻省理工学院) ; Stanford University(斯坦福大学) ; University of California, Davis(加利福尼亚大学戴维斯分校) ; Pennsylvania State University(宾夕法尼亚州立大学) ; Harvard University(哈佛大学) ; University of Oxford(牛津大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 该研究针对大型语言模型进展的标量总结问题,通过LiveCodeBench基准分离混淆,发现2024年9月后发布的模型在竞赛编程难任务上有超出预期的增益,发布了相关数据集与代码。
Comments 25 pages, 4 figures, 7 tables. Data and code: https://github.com/harvenstar/CurveShift
courtroom 风格多智能体辩论与渐进式 RAG 和角色切换用于争议性主张验证
机构 * Systems and Software Lab (SSL), Department of Computer Science and Engineering(系统与软件实验室(SSL),计算机科学与工程系)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出 PROClaim 框架,通过结构化对抗辩论和角色切换提升争议性主张验证的可靠性,实验显示其在 Check-COVID 数据集上准确率达 81.7%。
Comments Under review, 29 pages, 7 figures, 17 tables
评估用于基于自然语言的SQL和API调用生成的检索增强生成变体
机构 * IU International University of Applied Sciences(国际应用科学大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文评估了三种RAG变体在生成SQL和API调用任务中的性能,发现CoRAG在混合文档环境下表现最佳,检索策略设计对自然语言接口至关重要。
Comments preprint of conference submission
大语言模型中无训练与基于训练的意图分类:准确性、鲁棒性与失败模式
机构 * Johns Hopkins University(约翰斯·霍普金斯大学)
专题命中 评测与基准 :language model(abstract,comments);large language model(abstract);分类 cs.CL
AI总结 本研究系统对比LLMs中无训练与基于训练的意图分类方法,发现两类方法在简单基准上性能饱和,基于训练的方法在难分类任务占优,无训练方法对混合与对抗性提示更鲁棒。
Comments Accepted at the Conference on Language Modeling (COLM 2026)
MolecularCanvas:基于结构引导约束的大语言模型辅助小分子药物发现
专题命中 评测与基准 :LLM(title)
AI总结 该研究针对现有GenAI分子设计工具与专家工作流程适配差的问题,推出交互式系统MolecularCanvas,整合多类约束与工具,经用户验证可有效辅助小分子药物的迭代优化。
AtumAI:一种用于智能体生成数据中心控制平面策略的原则性框架
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 AtumAI是一种用于智能体生成数据中心控制平面策略的框架,通过任务编译器和进化设计循环实现形式化、可迁移、系统化的策略生成,其生成的策略在三类任务上均优于专家基线。
PredAct-Bench:可控工具噪声下的工具增强对话基准
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究推出PredAct-Bench基准,以教育为测试平台评估带噪声工具的对话智能体,扩展信任校准指标并评估13种LLMs,发现当前模型无法在工具噪声下为教师提供足够可见性,助力构建更优AI决策支持系统。
编码智能体作为测试套件审计器:在接近官方测试套件检测能力的同时发现官方套件遗漏的问题
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究提出编码智能体作为测试套件审计器,结合认证链识别官方套件遗漏的缺陷提交,在接近官方套件覆盖度的同时,无官方套件时其构建的套件表现最优。
Comments 24 pages, 4 figures
ProtoAct:将湿实验室协议转化为具身机器人动作
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对湿实验室协议难转化为机器人动作的问题,提出ProtoAct框架,结合ProtoRAG、RefineChecker、ActSchema处理协议,引入BioP2E数据集,经多模型评估与消融实验验证,可实现仿真及真实机器人的协议执行。
Comments 15 pages, 13 figures
CraftAlign:面向AI故事的基于特征的评估与修订指导
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 CraftAlign是对齐AI故事与人类叙事技巧的框架,含特征估计器与能量模型,可评估写作模式并生成修订指导,实验显示其区分能力及指导效果优于基线。
Comments 17 pages, 5 figures, includes appendix
PATH-Bench:面向终身智能体的路径依赖评估基准
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本研究构建了面向终身智能体路径依赖评估的基准PATH-Bench,评估8个智能体后提出SEU机制,该机制可减少遗忘、提升正向迁移,为设计更优终身智能体提供指导。
当协作成为触发因素:多智能体系统中的集体证据阈值后门
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 针对多智能体系统的新型集体证据阈值后门威胁,提出BCBI注入后门、LATTE防御方法,在基准测试中实现高效后门激活与低干扰防御效果。
Comments 26 pages,11 figures