arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-31 至 2026-08-31 共收录 346 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 75 篇

2606.12451 2026-08-31 cs.AI cs.IR cs.LG 版本更新 90%

ToolSense: A Diagnostic Framework for Auditing Parametric Tool Knowledge in LLMs

ToolSense: 审计LLM中参数化工具知识的诊断框架

Ashutosh Hathidara, Sai Shruthi Sistla, Sebastian Schreiber, Sahil Bansal

机构 * SAP Labs(SAP实验室)

专题命中 评测与基准 :LLM(title_cn,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出ToolSense诊断框架,自动生成三类基准测试,揭示参数化工具检索中知识-检索分离现象,发现模型在模糊查询下性能显著下降。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27734 2026-08-31 q-fin.ST 新提交 89%

What survives honest evaluation? Leakage-safe, search-aware assessment of LLM-driven trading strategy discovery

经得住诚实评估的是什么?针对大语言模型驱动的交易策略发现的防泄漏、感知搜索的评估方法

Eray Gençay

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对LLM发现交易策略时的前瞻偏差与搜索强度未校正问题,提出防泄漏的结构防护及基于试验次数的性能调整系统,经实证验证其可诚实评估策略并量化可信验证所需样本量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12474 2026-08-31 cs.CL cs.AI 版本更新 88%

Evaluating the Performance of Large Language Models on GAOKAO Benchmark

评估大型语言模型在高考基准测试上的性能

Xiaotian Zhang, Chunyang Li, Yi Zong, Zhengyu Ying, Liang He, Xipeng Qiu, Tianxiang Sun, Peng Li, Shiqiao Meng, Yanjun Zheng, Jun Zhan, Zhangyue Yin, Xiannian Hu, Guofeng Quan, Qixiang Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究推出基于中国高考试题的GAOKAO-Bench基准测试,采用零样本设置评估LLMs,发现其高考成绩有竞争力但科目间差异大,模型主观题评分与人类评分中度一致,为LLMs评估提供了可靠基准。

Comments Updated the author metadata to match the manuscript and added Qixiang Wang in recognition of his contribution to data collection and curation. Results and conclusions are unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28053 2026-08-31 cs.CL 新提交 88%

CNeo-Bench: Diagnosing Large Language Models on Chinese Neologisms

CNeo-Bench:针对中文新词汇的大语言模型诊断基准

Kaiyan Zhao, Zhongtao Miao, Zheyong Xie, Shaosheng Cao, Yoshimasa Tsuruoka

机构 * The University of Tokyo(东京大学) Xiaohongshu Inc.(小红书公司) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract_cn);prompting(abstract)

AI总结 本研究构建了含4759个中文新词汇的基准CNeo-Bench,搭配两层评估框架评估18个大语言模型,发现模型在定义生成上表现差,存在识别-操作差距,少样本提示仍无法解决部分难题。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06869 2026-08-31 cs.AI 版本更新 88%

Evidence-Based Intelligent Diagnostic and Therapeutic Visualization System with Large Language Models: Multi-Turn Interaction and Multimodal Treatment Plan Generation

基于证据的智能诊断与治疗可视化系统与大语言模型:多轮交互与多模态治疗方案生成

Yunhan Wang, Yuda Wang, Zhiying Tu, Mingqiang Song, Li Song, Kun Li, Dianhui Chu, Bolin Zhang

机构 * Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院) Shandong Key Laboratory of Digital Service Computing Technology and Systems(山东省数字服务计算技术与系统重点实验室) Weihai Municipal Hospital(威海市人民医院) Shanghai Taizhu Technology Co., Ltd(上海泰山技术有限公司) Tianjin Zhifu Qihuang Medical Technology Co., Ltd(天津中孚启黄医疗技术有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出知识增强的可视化诊断系统,通过知识图谱约束、信息增益驱动提问和多模态治疗呈现,提升中医辨证透明度和治疗可解释性。

Comments 29 pages, 9 figures, 5 tables, including supporting information

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00292 2026-08-31 cs.NI cs.AI cs.CL 版本更新 88%

An LLM-Based Framework for Intent-Driven Network Topology Design

基于LLM的意图驱动网络拓扑设计框架

Kholoud El-Habbouli, Fen Zhou, Stephane Huet

机构 * CERI-LIA, University of Avignon(阿维尼翁大学CERI-LIA实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一个结合分层建模和系统验证的约束驱动流水线,利用大语言模型从自然语言需求生成结构有效且符合约束的网络拓扑,并通过多模型对比评估其正确性和弹性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27463 2026-08-31 cs.AI 新提交 87%

Rating the Raters: Rasch Measurement Theory for LLM Evaluation

评估评估者:用于大语言模型评估的拉施测量理论

Pratik S. Sachdeva, Nathan Boudol

机构 * D-Lab, University of California, Berkeley(加州大学伯克利分校D-Lab) Grenoble INP(格勒诺布尔国立综合理工学院)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究将拉施测量理论应用于LLM评估,通过多维度拉施模型分析发现LLM与人类评估者存在系统性差异,提出RMT适用于各类LLM评估范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28241 2026-08-31 cs.AI 新提交 86%

Beyond Task-Only Matching: Personalized Skill Routing with Counterfactual Evaluation

超越仅任务匹配:基于反事实评估的个性化技能路由

Tianle Wang, Yanghe Zou, Xiang Liu, Ziyao Huang, Chenchen Fu, Weiwei Wu

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) College of Software Engineering, Southeast University(东南大学软件学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程学系) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有LLM智能体技能路由仅匹配任务的缺陷,提出SkillFeed渐进式检索-重排序框架,在自主构建的反事实基准上大幅提升了满足用户约束的技能检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27984 2026-08-31 cs.AI 新提交 86%

When Evidence Shapes Collaboration: Knowledge-Conditioned Topology Generation for Multi-Agent Systems

当证据塑造协作:面向多智能体系统的知识条件拓扑生成

Yangxiao Jiang, Jiarun Fan, Mingcong Xu, Yanxi Guo, Jiwen Feng, Shanqing Xu, Mengchen Qian, Wei Chen, Xiaojin Zhang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对多智能体系统拓扑生成的结构-知识错位问题,提出K-GAT框架,在GPQA数据集上较LLM-Debate基线准确率提升15.7%且计算开销更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03162 2026-08-31 cs.AI cs.HC 版本更新 86%

APeB: Benchmarking Personalization Ability of Large Language Model Agents

APeB:大型语言模型智能体个性化能力基准测试

Garry Yang, Zizhe Chen, Xinru Chen, Yongqiang Chen, Jianxiang Wang, Deyu Zou, Linyi Ding, Jialiang Wu, Yunzhong He, Yu Gong, James Cheng, Huaixiao Tou

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 研究大型语言模型智能体在处理原始、未明确查询时的个性化问题,通过引入个性化产品搜索测试平台构建基准测试,评估发现模型处理明确查询较好,但早期查询有困难,简单方法能提升性能。

Comments NA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05122 2026-08-31 cs.CL 版本更新 86%

Self-Evaluation Is Already There: Eliciting Latent Judge Calibration in Base LLMs with Minimal Data

自我评估已然存在:用最少数据激发基础LLM中的潜在评判校准

XiuYu Zhang, Yi Shan, Junfeng Fang, Zhenkai Liang

机构 * National University of Singapore(新加坡国立大学) Beijing University of Technology(北京理工大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出自我评估激发(SEE)方法,通过少量数据(160个示例)结合校准耦合强化学习和掩码蒸馏,激发基础LLM中已有的预测外部评判者评分能力,在保持答案质量的同时显著提升校准性能。

Comments Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01017 2026-08-31 cs.CL 版本更新 86%

Psychologically Potent, Computationally Invisible: LLMs Generate Social-Comparison-Eliciting Posts They Fail to Detect

心理上有效,计算上不可见:LLM 生成引发社会比较的帖子但无法检测

Hua Zhao, Jiapei Gu, Michelle Mingyue Gu

机构 * Department of English Language Education(英语语言教育系) Analytics/Assessment Research Centre(分析/评估研究中心)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 本研究通过构建小红书社会比较读者诱发基准(XHS-SCoRE),发现 LLM 在生成引发社会比较的帖子时存在生成-检测不匹配,即该信号在领域内可学习但无法通过提示分类稳健访问。

Comments Accepted at the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026). 20 pages; 1 figure and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28042 2026-08-31 cs.CL cs.AI 新提交 86%

SimpCue: Cue-Based Prompting for Multilingual Text Simplification

SimpCue:面向多语言文本简化的基于提示的线索方法

Mehrzad Tareh, Horacio Saggion, Stefan Bott

机构 * Universitat Pompeu Fabra (UPF)(庞培法布拉大学)

专题命中 评测与基准 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对加泰罗尼亚语、西班牙语、意大利语的多语言易读性文本简化任务,以Qwen3-8B为模型,对比不同提示方式的效果,发现预测线索提示表现最优但提升有限。

Comments Accepted at CLEAR-TEXT 2026: Readability and text simplification workshop at the International Conference Computational Linguistics in Bulgaria (CLIB 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26192 2026-08-31 cs.CL cs.AI 版本更新 85%

Comparing Chunking and Embedding Strategies for Turkish RAG Systems

土耳其检索增强生成(RAG)系统的分块与嵌入策略比较

Mustafa Sertaç Türkel, Fatma Nur Korkmaz, Ahmet Tuğrul Bayrak

机构 * Data Science and Innovation Ata Technology Platforms(阿塔技术平台数据科学与创新部门)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对土耳其语RAG系统,对比三种分块策略、五种嵌入模型和两种生成器LLM,发现布局感知分块可压缩嵌入模型差异,最优配置依内容类型而定,最佳单个组件无法组合出最优整体配置,准确率达87.0%。

Comments Accepted to INTCEC 2026. This is the author's pre-print version. The final authenticated version will be available through the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27661 2026-08-31 cs.CL cs.AI 新提交 84%

Knowing Before Answering: Decoding Language Models for Reliable RAG

先知后答:为可靠检索增强生成(RAG)解码语言模型

Syed Mahbubul Huq, Christopher Child, Tillman Weyde, Pranava Madhyastha

机构 * City St George’s, University of London(伦敦城市圣乔治大学) The Alan Turing Institute(阿兰·图灵研究所)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对RAG中检索信息不足或冲突的问题,构建标注数据集,利用语言模型的隐藏激活等特征训练线性分类器,实现可靠的RAG分类,性能优于基线及专用RAG模型。

Comments Accepted at the Third Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20607 2026-08-31 cs.CL cs.AI cs.LG 版本更新 83%

JuryProbe: An Empirical Consensus-Risk Diagnostic for Routing Reference-Free Factuality Judge Panels to Grounded Verification

JuryProbe:用于将无参考事实性评判小组路由至基于事实的验证的经验共识风险诊断方法

Tianxin Zhou, Ruixi Lin

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对无参考事实性LLM评判小组的共识风险诊断方法JuryProbe,通过校准路由策略减少假阴性盲区导致的错误,在FEVER数据上验证了其有效性,可降低假接受并减少参考获取。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 08/2026. 21 pages, 1 figure, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28021 2026-08-31 cs.CR cs.AI cs.MA cs.SE 新提交 83%

Compared to What? A Human-Anchored Security Benchmark for LLM-Generated Infrastructure-as-Code

与什么相比?面向大语言模型生成基础设施即代码的人类锚定安全基准

Animesh Shaw

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究推出GenIaC-SecBench基准,对比大语言模型与人类生成IaC的漏洞密度,发现模型漏洞密度为人类的3.21-3.87倍,供应商扩展思维表现优于提示思维链,还得出可部署性与漏洞无关联等结论,相关代码数据已公开。

Comments 12 pages, 11 figures, 9 tables. Code: this https URL (https://github.com/AnimeshShaw/GenIaC-SecBench) Data: this https URL (https://huggingface.co/datasets/AnimeshShaw/GenIaC-SecBench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27831 2026-08-31 cs.AI cs.LG 新提交 82%

RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests

RealSWE:面向真实用户请求的编码智能体组合式评估

Gyuhyeong Kim, Hyojung Gwon, Jeonghyeon Kim, Kyuhong Shim, Sunjae Lee

机构 * Sungkyunkwan University(成均馆大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对编码智能体评估基准与真实用户请求的差异,构建了新基准sys并评估7种LLM,发现真实输入降低解决率且改变模型排名,明确陈述期望行为和动机可提升LLM软件工程性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28394 2026-08-31 cs.CR cs.CL 新提交 81%

BEACON: Behavior-Anchored Cross-Source Knowledge Graph Construction for Cyber Threat Intelligence

BEACON:面向网络威胁情报的行为锚定跨源知识图谱构建

Changze Li, Yutong Cheng, Tsania Camila Finnisa, Qian Cui, Wei Ding, Peng Gao

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 该研究提出BEACON框架,基于LLM结合MITRE ATT&CK实现跨源CTI知识图谱构建,构建了两个标注数据集,性能优于基线方法至少9%至23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28383 2026-08-31 cs.CV cs.CL 新提交 81%

Semantic Head Specialization Guides Hybrid ViT Attention for Multimodal LLMs

语义头专业化指导多模态大语言模型的混合视觉Transformer注意力机制

Chenhong He, Lei Li, Shicheng Li, Hanglong Lv, Lingpeng Kong, Qi Liu, Tong Yang, Shuhuai Ren

机构 * Peking University(北京大学) Xiaomi Corporation(小米公司) The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 该研究针对多模态LLM中混合ViT注意力设计不足的问题,提出语义头专业化(SHS)概念,据此设计Ariadne注意力机制,在22项图像视频任务上性能与全注意力相当,计算量降低6.5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28027 2026-08-31 cs.AI 新提交 81%

String: An Agentic OS Where Every App Is a Markdown File

一种智能体操作系统:每个应用都是一个 Markdown 文件

Jookyung Song, Nojun Kwak, Simyung Chang

机构 * Seoul National University(首尔大学) H1R.AI

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出开源智能体操作系统 String,将应用定义为 SFMD 文档,通过分阶段视图和权限机制提升 LLM 智能体操作效率,在 87 任务基准测试中减少 token 消耗并保持良好成功率。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27844 2026-08-31 cs.CL 新提交 81%

EvoHarmBench: Breaking Content Moderation with Iterative Human-Like Evasion

EvoHarmBench:通过类人迭代规避突破内容审核

Ruijie Jian, Benlei Cui, Ting Ma, Haidong Ding, Kangwei Liu, Ziwen Xu, Longtao Huang, Hui Xue, Ziqiang Zhu, Junjie Li, Haiwen Hong

机构 * Yuvion Team, Alibaba Group(阿里巴巴集团Yuvion团队) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 该研究提出首个动态对抗评估框架EvoHarmBench,针对5类违规229个语义子簇的5002个样本评估LLM审核模型,发现SOTA模型经12次迭代后规避成功率达80.3%,将推动内容安全评估转向动态模式。

Comments Accepted to the Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27889 2026-08-31 cs.SE 新提交 80%

Decoupling is a Necessity: Transformation-Agnostic Decompiled Code Recovery under Optimization and Obfuscation

解耦是必要之举:优化与混淆下的变换无关反编译代码恢复

Zhiping Zhou, Xiaohong Li, Ruitao Feng, Yao Zhang, Yuekang Li, Wenbu Feng

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 针对优化与混淆导致的反编译代码结构崩溃和语义幻觉问题,提出多阶段LLM框架ReSource,通过解耦词汇、句法、语义层级恢复,在大规模基准上实现83% Top-5准确率,为安全分析提供可靠基础。

Comments Preprint. 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27487 2026-08-31 cs.SE 新提交 80%

Grounded Checklist Partial Credit for Agent Skill Trajectories

智能体技能轨迹的基于接地检查表的部分 credit 评估

Suliu Qin, Lu Yin, Xilu Wang

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 针对智能体轨迹评估的二元评分缺陷,提出 GCPC 方法,结合人工规则与 LLM 生成检查表,在 SkillsBench 等数据集上验证其评估区分度、与人类评估一致性及跨数据集迁移性更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21919 2026-08-31 cs.CV cs.AI 版本更新 79%

SDGBiasBench: Benchmarking and Mitigating Vision--Language Models' Biases in Sustainable Development Goals

SDGBiasBench: 评估和减轻可持续发展目标中视觉-语言模型的偏见

Zihang Lin, Huaiyuan Qin, Muli Yang, Hongyuan Zhu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出SDGBiasBench,一个用于评估和减轻可持续发展目标中视觉-语言模型偏见的大型基准测试集,通过分析模型在决策和估计层面的偏见,提出CADE方法以减少偏见,提高模型的准确性和可靠性。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22737 2026-08-31 cs.CV cs.AI 版本更新 79%

CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models

CompareBench: 一个用于评估视觉比较推理能力的视觉-语言模型基准

Jie Cai

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 CompareBench是一个用于评估视觉-语言模型中视觉比较推理能力的基准,揭示了当前模型在时间排序、空间关系和基本计数上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27902 2026-08-31 cs.CL cs.AI 新提交 79%

LandingAgent: A Reference-Annotated Dataset and Agentic Generation Framework for Landing Pages

LandingAgent:用于落地页的参考标注数据集与智能体生成框架

Injun Baek, HyeongSeok Lee, Yearim Kim, Junhoo Lee, Nojun Kwak

机构 * Seoul National University(首尔大学) Samsung Electronics(三星电子)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 针对落地页生成中通用模板与无依据主张的问题,本文提出智能体框架LandingAgent,结合参考标注数据集LandingBench,实验验证其在目标适配性、呈现质量等方面优于直接生成方法。

Comments 30 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18154 2026-08-31 cs.CL cs.AI cs.DB 版本更新 79%

FENCE: A Financial and Multimodal Jailbreak Detection Dataset

FENCE:一个金融和多模态越狱检测数据集

Mirae Kim, Seonghun Jeong, Youngjun Kwak

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对金融领域多模态越狱检测资源匮乏的问题,提出FENCE数据集,包含韩英双语文本和图像,用于训练和评估检测器,实验表明基线检测器准确率达99%。

Comments lrec 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27716 2026-08-31 cs.AI 新提交 77%

PCFBench: A Diagnostic Benchmark for Product Carbon Footprint Estimation

PCFBench:产品碳足迹估算的诊断基准

Krishna Rao, Andrew Dumit, Shaena Ulissi, Jacob Feintzeig, P. James Joyce, Daniel Frank, Steven Watson, Jonathan Glidden, Gizem Ilayda Dinc, Travis M. Kwee

机构 * Watershed Technology, Inc.(沃特斯hed科技公司)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 该研究推出PCFBench基准,针对现有PCF评估的缺陷,通过含614个条目的6项任务评估前沿LLM,发现其逐步生成PCF的准确率及质量守恒符合率均较低,将发布相关资源推动该领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27461 2026-08-31 cs.CL cs.AI cs.LG 新提交 75%

SciReC: Diagnostic Evaluation of Multimodal, Multi-Turn Relational Reasoning with Adaptive Interaction

SciReC:基于自适应交互的多模态多轮关系推理诊断评估

Nilay Yilmaz, Naga Sai Abhiram Kusumba, Stella Wenxing Liu, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学) Capital One(第一资本金融公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究构建了多模态学术对话基准SciReC,提出缺陷诊断框架DMRA评估多模态大语言模型的关系推理能力,发现不同模型在各类关系及领域上的表现差异,明确错误的主要来源。

详情

展开后加载摘要…

URL PDF HTML 收藏