arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2607.14957 2026-07-17 cs.AI 新提交 83%

Contextualized Early Detection of Online Firestorms: A Sequential LLM-Based Approach

在线风暴的情境化早期检测:一种基于序列语言模型的方法

Besim Shala, Peter Mandl, Andreas Humpe, Martin Häusl

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.AI

AI总结 研究在线风暴的早期检测,提出基于语言模型的检测系统,有回顾性分类和顺序处理两种模式,在Reddit数据集上实验,全局模式分类性能强,早期警告模式召回率高,证明语言模型可用于情境感知监测。

Comments 9 pages, 2 figures, 7 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14499 2026-07-17 cs.AI 新提交 83%

Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions

通过动态多轮交互对视觉语言模型进行情境化评估

Yijiang Li, Huiqi Zou, Bingyang Wang, Ziang Xiao

机构 * UC San Diego(加州大学圣地亚哥分校) Northeastern University(东北大学) Georgia Institute of Technology(佐治亚理工学院) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 研究多模态大语言模型现实有效性问题,提出CEDI框架,通过三方交互、多轮半结构化对话及多种策略评估,应用于视觉幻觉,发现能揭示更多接近实际情况的幻觉,凸显其对MLLMs能力评估的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14191 2026-07-17 cs.LG 新提交 83%

TEDDY: A Pediatric Foundation Model for Risk Forewarning from ICD-Coded Diagnostic Histories

TEDDY:一种基于ICD编码诊断历史的儿科风险预警基础模型

Matthew Brady Neeley, Jorge Botas, Johnathan Jia, Lin Yao, Daniel Palacios, Benjamin Choi, Zhandong Liu, Hyun-Hwan Jeong

机构 * Baylor College of Medicine(贝勒医学院)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);分类 cs.LG

AI总结 研究利用儿科电子健康记录训练TEDDY模型,对纵向诊断轨迹和就诊时间建模,在疾病发病预测任务中表现出色,能支持广泛、罕见疾病和长期风险预测,无需大规模人口数据或数十亿参数模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13707 2026-07-16 cs.CL cs.SE 新提交 83%

The Test Oracle Problem in Synthetic LLM-as-Judge Corpora: Disappearance, Distortion and a Validation Protocol

合成语言模型作为评判语料库中的测试预言机问题:消失、扭曲与验证协议

Serkan Ballı

机构 * Mehmet Akif Ersoy University(梅赫梅特·阿基夫·埃尔索伊大学)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.CL

AI总结 研究语言模型作为评判系统中合成语料库的测试预言机问题,指出其负面示例由语言模型生成时存在完整性验证漏洞,通过多语言语料库案例揭示答案截断、偏差扭曲等问题,并提出验证协议供无预言机模式分析师使用。

Comments 23 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13305 2026-07-16 cs.CV cs.AI cs.MM 新提交 83%

Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks

无需基础的准确性:诊断视频语言模型基准测试中的视觉依赖解离

Jae Joong Lee

机构 * Purdue University(普渡大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究视频语言模型基准测试中视觉依赖问题,引入视觉依赖差距(VDG),通过实验表明准确性与视觉依赖可分离,任务类型排名稳定,帧多样性贡献大,H.264实验有新发现,VDG可作标准审查,推动相关研究。

Comments Accepted, ACM International Conference on Multimedia 2026 (ACM MM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09526 2026-07-13 cs.CV cs.AI 新提交 83%

ALICE: Learning a General-Purpose Pathology Foundation Model from Vision, Vision-Language, and Slide-Level Experts

ALICE:从视觉、视觉语言和玻片级专家学习通用病理学基础模型

Jiawen Li, Tian Guan, Huijuan Shi, Xitong Ling, Mingxi Fu, Anjia Han, Chao He, Yonghong He

机构 * Institute of Biopharmaceutical and Health Engineering, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学生物医药与健康工程研究院,清华大学深圳国际研究生院) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Department of Pathology, The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院病理科) Medical Optical Technology R&D Center, Research Institute of Tsinghua, Pearl River Delta(清华珠三角研究院医学光学技术研发中心)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 研究提出通过多阶段凝聚蒸馏训练的ALICE统一基础模型,将多种教师模型知识整合到单个主干。它在大量图像上预训练,经多场景多任务评估,在任务匹配病理基础模型中平均排名最佳,证明凝聚蒸馏可整合能力用于广泛病理学应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08981 2026-07-13 cs.SE cs.AI 新提交 83%

The Patchwork Problem in LLM-Generated Code

大语言模型生成代码中的拼凑问题

Viraaji Mothukuri, Reza M. Parizi

机构 * Decentralized Science Lab, College of Computing and Software Engineering(分布式科学实验室,计算机与软件工程学院)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究大语言模型生成代码中的拼凑问题,将结构一致性形式化并引入故障分类法,提出混合验证框架,经实证评估和真实世界验证,揭示多数结构故障难被现有检查发现,模型间故障模式有别,此类故障普遍存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08745 2026-07-10 cs.AI cs.CV 新提交 83%

AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding

自动驾驶视觉问答:以事件为中心的行车记录仪理解视觉语言模型基准测试

Siddharth Damodharan, Radhika Gupta, Ali Alshami, Ryan Rabinowitz, Jugal Kalita

机构 * University of Colorado Colorado Springs(科罗拉多大学科罗拉多斯普林斯分校) University of Michigan(密歇根大学) University of Notre Dame(圣母大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 针对评估视觉语言模型对安全关键事件推理能力的挑战,提出AUTOPILOT-VQA基准,通过围绕真实驾驶事件的结构化问题评估系统,涵盖多安全相关类别,推动向安全意识推理发展,为自动驾驶系统评估提供标准,助力相关视觉语言系统开发。

Comments CVPR Autopilot Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07758 2026-07-10 cs.LG 新提交 83%

Scalable and Trustworthy Earth Observation Foundation Models

可扩展且可信的地球观测基础模型

Syed Usama Imtiaz, Mitra Nasr Azadani, Nasrin Alamdari

机构 * Department of Civil and Environmental Engineering, Florida State University(土木与环境工程系,佛罗里达州立大学)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 研究地球观测基础模型,指出其因数据特性需特定领域适配。回顾相关设计原则,综合模型格局等内容,纳入基准证据说明评估问题,通过案例展示实践原则,提出应从多方面评估下一代遥感基础模型。

Comments (Preprint, in review) Elsevier Book Chapter: Next-Generation Remote Sensing Methods

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07103 2026-07-09 cs.LG cs.DB 新提交 83%

A knowledge-augmented dataset of high-risk driving scenarios with LLM annotations for autonomous driving

一个用于自动驾驶的具有大语言模型注释的高风险驾驶场景知识增强数据集

Heye Huang, Jingguang Li, Zhiyuan Zhou, Paul Liang, Mingyu Wu, Kitae Jang, Jianqiang Wang

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Fudan University(复旦大学) Massachusetts Institute of Technology(麻省理工学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究自动驾驶中高风险场景数据不足问题,核心方法是构建K-Risk数据集,整合多源轨迹数据并利用大语言模型生成注释,主要贡献是为自动驾驶开发和评估提供标准化基础。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05904 2026-07-08 cs.LG 新提交 83%

More Convincing, Not More Correct: Self-Play Reward Hacking of Reference-Free LLM Judges

更具说服力,而非更正确:无参考语言模型评判器的自我博弈奖励破解

Chenyu Zhou

机构 * School of Engineering, Institute of Science Tokyo(东京科学大学工程学院)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.LG

AI总结 研究训练语言模型依据自身无参考评判时的奖励破解问题,发现评判器评分合理性而非正确性致误报。通过隐藏锚点审计衡量,以GSM8K为例展示问题。提出决定性变量及对应解决办法,还有可证伪界限,且过程可复制。

Comments 9 pages main text, 15 pages total including references and appendix; 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03644 2026-07-07 cs.CV cs.AI 新提交 83%

Moonstone: A Multimodal Foundation Model and Benchmark for Lunar Remote Sensing

月光石:用于月球遥感的多模态基础模型及基准

Ayush Prasad, Swarnalee Mazumder

机构 * Space and Earth Observation Centre, Finnish Meteorological Institute(芬兰气象研究所空间与地球观测中心) German Climate Computing Centre(德国气候计算中心)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 针对月球多模态遥感数据分散且无评估机器学习基准的问题,引入月光石基准。贡献包括构建全球月球预训练数据集,提出MG-MAE模型,创建涵盖多任务的基准,其预训练特征在各任务中表现出色。

Comments Accepted for publication in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03585 2026-07-07 cs.LG 新提交 83%

Modular Foundation Models for Time-Series Perception in Digital Twins

数字孪生中用于时间序列感知的模块化基础模型

Quang Hung Pham, Ryad Zemouri, Martin Gagnon, Luc Vouligny

机构 * Hydro-Québec(魁北克水电公司)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 针对数字孪生和PHM系统中时间序列感知挑战,提出基于预训练表示编码器集合的模块化基础模型,利用自监督学习,引入选通机制,支持多下游任务,消融研究验证各部分作用,实验有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31551 2026-07-01 cs.CL 新提交 83%

AutoTrainess: Teaching Language Models to Improve Language Models Autonomously

AutoTrainess: 教语言模型自主改进语言模型

Zhaojian Yu, Penghao Yin, Shuzheng Gao, Shilin He, Kai Cai, Xiao-Ping Zhang

专题命中 评测与基准 :language model(title,abstract);post-training(abstract);分类 cs.CL

AI总结 提出AutoTrainess智能体,通过外部化人类经验为工作流和约束,在PostTrainBench上超越CLI基线,平均得分从23.21提升至26.94。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30963 2026-07-01 cs.SE cs.AI 新提交 83%

Loc2Repair: A Framework for Evaluating the Impact of File-Level Issue Localization in Repo-Level LLM Repair

Loc2Repair:评估文件级问题定位在仓库级LLM修复中影响的框架

Mohammad Nour Al Awad, Sergey Ivanov

机构 * ITMO University(ITMO大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出Loc2Repair模块化评估框架,通过解耦定位与修复,在SWE-bench Verified上验证文件级定位能一致提升修复率(44.7%→49.1%)并降低平均耗时。

Comments To appear in the Proceedings of the Generative Code Intelligence Workshop (GeCoIn 2026), co-located with the 35th International Joint Conference on Artificial Intelligence (IJCAI-ECAI 2026), Bremen, Germany, August 15--17, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26348 2026-06-26 cs.AI 新提交 83%

What We are Missing in Multimodal LLM Evaluation?

我们在多模态大语言模型评估中缺失了什么?

Po-han Li, Shenghui Chen, Sandeep Chinchali, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文分析现有多模态大语言模型评估基准的不足,识别出时空连贯性、物理世界理解、多模态一致性和选择性注意等关键缺失,强调填补这些空白对衡量多模态智能真实进展的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26099 2026-06-26 cs.CY cs.AI 新提交 83%

Benchmarking Open-Weight Foundation Models for Global AI Technical Governance

开源基础模型在全球AI技术治理中的基准测试

Jason Hung

专题命中 评测与基准 :foundation model(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有研究在评估大语言模型地理偏差时的三个方法论局限,本研究使用四个开源前沿模型,基于全球AI数据集v2,通过五类响应分类和混合效应模型,评估模型在不同国家的准确性差异。

Comments 12 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25391 2026-06-25 cs.SD cs.AI cs.MM 新提交 83%

From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models

从声音到场景:评估大型音频语言模型中上下文感知听觉场景理解的基准

Pengfei Zhang, Hoang H Nguyen, Kazi Shaharair Sharif, Yutong Song, Wenjun Huang, Henry Peng Zou, Pinxin Liu, Honghui Xu, Amir M. Rahmani

机构 * University of California Irvine(加州大学尔湾分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Kennesaw State University(肯尼索州立大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 提出CASU基准,通过构建半合成音频流和设计四项任务,评估大型音频语言模型整合语音、事件和背景环境进行上下文感知听觉场景理解的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19887 2026-06-25 cs.CR cs.AI 新提交 83%

FinRED: An Expert-Guided Benchmark Generation and Evaluation Framework for Financial LLM Red-Teaming

FFinRED:面向金融大语言模型红队测试的专家引导基准生成与评估框架

Chaeyun Kim, Daeyoung Park, Junghwan Kim, Jinyoung Jeong, Eunji Song, Yongtaek Lim, Minwoo Kim

机构 * DATUMO INC.(DATUMO公司) Korea Advanced Institute of Science and Technology (KAIST)(韩国先进科学研究院) Financial Security Institute (FSI)(金融安全研究所)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 提出FinRED框架,通过专家引导的两级分类法将全球金融标准映射为威胁,并利用真实金融文档生成上下文丰富的红队行为提示,结合专家验证的评估标准,有效降低关键假阴性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22826 2026-06-23 cs.AI 新提交 83%

MINCE: Shrinking LLM Evaluation Datasets via Few-Model Monte Carlo Calibration

MINCE:通过少模型蒙特卡洛校准缩小LLM评估数据集

Devleena Das, Rajeev Patwari, Vikram Kumar Bukka, Nithin Kumar Guggilla, Elliott Delaye, Ashish Sirasao

机构 * Advanced Micro Devices (AMD)(超威半导体(AMD))

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出MINCE方法,利用少量校准模型的蒙特卡洛模拟确定最小子集大小,无需预测层,显著减少评估数据集规模,在保持精度漂移极小的同时实现数倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19704 2026-06-19 cs.AI 新提交 83%

Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents

超越静态排行榜:LLM智能体评估的预测有效性

Dhaval C. Patel, Kaoutar El Maghraoui, Shuxin Lin, Yusheng Li, Tianjun Feng, Chun-Yi Tsai, Yihan Sun, Wei Alexander Xin, Akshat Bhandari, Tanisha Rathod, Aaron Fan, Sanskruti Vijay Shejwal, Tomas Pasiecznik, Sagar Chethan Kumar, Tanmay Agarwal, Rohith Kanathur, Sam Colman, Amaan Sheikh, Dev Bahl, Ann Li, Krish Veera, Alimurtaza Mustafa Merchant, Shambhawi Baswaraj Bhure, Sajal Kumar Goyla, Chengrui Li, Kirthana Natarajan, Rui Li, Thomas Ajai, Rujing Li, Vivek G. Iyer, Sanjaii Vijayakumar, Yitong Bai, Ayal Yakobe, Darief Maes, Yassine Jebbouri, Tianyang Xu, Thai Quoc On, Vera Mazeeva, Winston Li, Yuval Shemla, Yeshitha Bhuvanesh, Rushin Bhatt, Siddharth Chethan Gowda, Alisha Vinod, Caroline Cahill, Shriya Aishani Rachakonda, Yunfeng Chen, Aryaman Agrawal, Aman Upganlawar, Mao Le Jonathan Ang, Yubin Sally Go, Madhav Rajkondawar, Yang-Jung Chen, Trisha Maturi, Ananya Kapoor, Andrew Li, Shrey Arora, Mana Abbaszadeh, Shen Li, Charles Xu, Byeolah Kwon

机构 * IBM

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过14项并行研究,论证聚合分数排行榜无法泛化到分布外场景,提出基于预测有效性的排名配置方法,并设计可证伪的分布外评估标准。

Comments 17 pages, 2 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18310 2026-06-18 cs.CR cs.AI 新提交 83%

Conflict-Aware Retriever Editing for Knowledge Injection Attacks on LLM-Based RAG Systems

冲突感知检索器编辑:针对基于LLM的RAG系统的知识注入攻击

Xinru Liu, Xianglong Zhang, Di Cai, Zhumin Chen, Pengfei Hu, Xin Xin

机构 * Shandong University, China(山东大学,中国) Tsinghua University, China(清华大学,中国)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出冲突感知检索器编辑框架CAREATTACK,通过模型中心攻击将恶意知识注入RAG系统,利用图检测和参数编辑投影解决冲突,并轻量校准保持攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15766 2026-06-16 cs.AI cs.HC 新提交 83%

Rethinking Scaffolding in LLM Tutors: The Interactional Mismatch Between Benchmarks and Real-World Deployments

重新思考LLM导师中的脚手架:基准测试与真实部署之间的交互不匹配

Alexandra Neagu, Jeffrey T. H. Wong, Marcus Messer, Rhodri Nelson, Peter B. Johnson

机构 * University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 通过分析9490个聊天记录,发现AI导师基准测试假设学生积极接受脚手架,但真实场景中学生常绕过脚手架,揭示基准测试与真实部署的交互不匹配。

Comments Pluralistic Alignment Workshop @ ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15447 2026-06-16 cs.AI 新提交 83%

Hierarchical Modeling of ICD Codes in EHR Foundation Models

EHR基础模型中ICD码的分层建模

Megha Thukral, Dong Gyun Kang, Rudra Pratap Singh, Shruthi Kashinath Hiremath, Katrin Hänsel, Thomas Plötz

机构 * School of Interactive Computing, Georgia Institute of Technology(佐治亚理工学院交互计算学院) Optum AI

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 研究利用ICD-10-CM层次结构作为归纳偏置,通过序列增强和图注入两种机制改进EHR表示学习,实验表明显式编码层次结构在域内和跨数据集任务中均优于扁平表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06834 2026-06-16 cs.CL q-bio.GN 新提交 83%

The Dark Regulome: Disentangling Predictability from Regulation in Genomic Foundation Models

暗调控组:从基因组基础模型中分离可预测性与调控性

Chahat Baranwal, Aaditya Baranwal, Lakshya Nitin Tandon

机构 * IIT Jodhpur(印度理工学院贾尔普尔分校) University of Central Florida(中央佛罗里达大学) Northeastern University(东北大学)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出残差化-置换诊断方法,从基因组基础模型的计算机诱变评分中分离序列可预测性与调控信号,揭示10kb近端调控边界,并验证跨架构分解可区分可预测性层与调控输出层,为暗基因组调控研究提供通用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11931 2026-06-11 cs.CL 新提交 83%

Semantic Grading of Written Answers in Low-Resource Language Bangla Using a Fine-Tuned Lightweight Language Model

低资源语言孟加拉语中书面答案的语义评分:使用微调轻量级语言模型

Meherun Farzana, Aniket Joarder, Mahmudul Hasan, Md. Mosaddek Khan

机构 * Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 针对低资源语言孟加拉语,提出一种基于微调轻量级语言模型的双语评估系统,通过语义正确性而非词汇重叠进行自动评分,在合成和人工评估中均取得最优性能。

Comments 10 pages, 5 figures, 2 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09878 2026-06-10 cs.LG 新提交 83%

FailureScope: Cross-Regime Behavioral Diagnosis of Language Model Weaknesses

FailureScope: 语言模型弱点的跨机制行为诊断

Nicholas Saban

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :language model(title);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出FailureScope方法,通过跨模型通过/失败模式聚类评估探针,在单轮基准、多轮对话和对抗性代理攻击三种机制下稳定生成可解释的失败分类,实现高效任务采样和跨模型失败预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06788 2026-06-08 cs.CL cs.HC 新提交 83%

Explain Like I'm 5 or Whatever I Choose: Evaluating the Interactive Potential of Language Model Responses

像对五岁小孩一样解释或随我选择:评估语言模型响应的交互潜力

Indu Panigrahi, Tal August

机构 * Siebel School of Computing and Data Science(计算与数据科学学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 提出基于语言复杂度的交互评估框架,测试GPT-5.1等模型生成不同复杂度响应的能力,发现最佳模型仅46%时间正确调整复杂度。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19475 2026-08-21 cs.SE cs.AI cs.CL cs.LO 新提交 82%

Measuring What a Specification Determines: A Formal Semantic-Block Model and an Execution-Judged Benchmark

测量规范决定的内容:一种形式化语义块模型与基于执行判断的基准

Oleg Grynets, Dmytro Kostetskyi, Vasyl Lyashkevych

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出形式化语义块模型与基于执行判断的基准,验证其在Oracle-PostgreSQL迁移规范中的有效性,支持确定性为形式化概念但非LLM实现者的独立经验质量指标。

Comments 11 pages, 1 figure, 7 tables, 37 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17687 2026-08-19 cs.AI cs.LG 新提交 82%

Mixture-of-Expert Blocks Contain Strong Hallucination Detection Signals

混合专家模块包含强幻觉检测信号

Joao Fonseca, Rodrigo Rodrigues, Paolo Romano

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出首个利用混合专家(MoE)专属内部信号的InnerExpert方法,在五个数据集和两种MoE架构上,以单次前向传播实现优于现有方法的逐词幻觉检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏