arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-11 至 2026-08-11 共收录 752 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 173 篇

2506.00549 2026-08-11 cs.CL cs.AI 84%

Towards Multi-dimensional Evaluation of LLM Summarization across Domains and Languages

Hyangsuk Min, Yuho Lee, Minjeong Ban, Jiaqi Deng, Nicole Hee-Yeon Kim, Taewon Yun, Hang Su, Jason Cai, Hwanjun Song

机构 * Korea Advanced Institute of Science and Technology(韩国先进科学研究院) AWS AI Labs(AWS人工智能实验室)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 34 pages, 6 figures

Journal ref ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03162 2026-08-11 cs.CY cs.AI cs.CL cs.LG 版本更新 83%

MateInfoUB: A Real-World Benchmark for Testing LLMs in Competitive, Multilingual, and Multimodal Educational Tasks

MateInfoUB:用于测试大型语言模型(LLMs)在竞争性、多语言及多模态教育任务中表现的真实世界基准

Adrian Marius Dumitran, Theodor-Pierre Moroianu, Mihnea-Vicentiu Buca

机构 * University of Bucharest Faculty of Mathematics and Computer Science(布加勒斯特大学数学与计算机科学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究构建了双语多模态计算机科学竞赛题数据集,评估当前最先进LLMs在该数据集上的表现,揭示其优劣势及语言选择的影响,还发布了教育应用以支持罗马尼亚学生自我评估。

Comments 14 pages (9 paper, 2 references, 3 annexes). Accepted for BEA 2025!

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09285 2026-08-11 eess.SP cs.AI 新提交 83%

GLocFM: A Geometry-Aware Foundation Model for 3D Indoor Wireless Localization

GLocFM:面向三维室内无线定位的几何感知基础模型

Chenghong Bian, Chaozheng Wen, Hongze Chen, Jun Zhang

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 该研究针对现有学习式无线定位器无法利用环境几何信息的问题,提出GLocFM模型,联合利用WiFi测量与三维点云场景几何,在两类数据集上较基线降低近50%定位误差,鲁棒性与有效性经消融实验验证。

Comments 13 pages, single column

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08227 2026-08-11 cs.CL cs.HC 新提交 83%

Focus particles and scalar inferences across humans and language models

人类与语言模型的焦点小品词及标量推理

Catherine M. Brousse, Nelu D. Radpour

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本研究测试人类与大型语言模型能否从含焦点小品词的句子构建稳定标量表征,发现二者相似输出或源于不同底层机制。

Comments 3 pages, 1 figure, presented at 9th annual Conference on Cognitive Computational Neuroscience

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07631 2026-08-11 cs.SD cs.AI cs.MM 新提交 83%

PACE: A Playback-Aligned Context Engine for LLM-Based Full-Duplex Voice Dialogue

PACE:面向基于大语言模型的全双工语音对话的播放对齐上下文引擎

Shibo Wang, Zicheng Zhang, Libo Wang, Junfeng Ma

机构 * Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 该研究针对全双工语音对话的生成上下文错位问题,提出了中间件层PACE,通过将模型上下文锚定到客户端播放边界解决该问题,在GCM-Bench等数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07523 2026-08-11 cs.CY cs.AI cs.PL 新提交 83%

From Evaluated Models to Evaluation Aids: A Multi-Evidence Study of LLM-Based Difficulty Calibration for Programming Examinations

从被评估模型到评估辅助工具:面向编程考试的基于大语言模型的难度校准多证据研究

Hongfei Yan, Jiangkai Xiong, Yiqing Li, Chong Chen

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究将大语言模型作为编程考试难度校准的辅助证据,结合多类数据验证其与考试难度的相关性,可用于题目验证等场景,但存在应用限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22665 2026-08-11 cs.CV cs.AI 版本更新 83%

SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery

SARVLM:一种用于SAR图像语义理解的视觉语言基础模型

Qiwei Ma, Xukun Lu, Wang Liu, Puhong Duan, Xudong Kang, Shutao Li

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Yuelushan Center for Industrial Innovation(岳麓山创新中心) School of Medical Information Engineering, Jining Medical University(济南医学院医学信息工程学院)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SARVLM,一种专为SAR图像设计的视觉语言基础模型,通过多阶段领域迁移策略和集成策略提升跨场景泛化能力,在多个基准测试中表现优异。

Comments 13 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09254 2026-08-11 cs.AI cs.CL 新提交 82%

Business Truth, not SQL Accuracy: A Rule-Gated 7B Analytics Agent Outperforms a Direct-Prompted 32B Baseline

业务真值,而非SQL准确率:规则门控的7B分析智能体优于直接提示的32B基线

Morris Lee

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM分析智能体的评估缺陷,提出WarehouseReliabilityBench基准,开发规则门控的7B智能体QueryProof,其业务真值率优于直接提示的32B基线,且成本显著降低,假成功比例大幅下降。

Comments 20 pages, 7 figures, 11 tables. Benchmark, code, run records, pre-registration and one-command reproduction: https://github.com/k-w-lee/query_proof

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08975 2026-08-11 cs.CL cs.AI 新提交 82%

How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review

如何对AI审稿人进行修辞奖励黑客攻击?剖析基于AI的同行评审中的修辞敏感性

Ming Li, Chenguang Wang, Xirui Li, Xinyue Zeng, Dianqi Li, Peng Shi, Dawei Zhou, Tianyi Zhou

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对基于AI的同行评审,构建受控语料库测试修辞选择对AI审稿判断的影响,明确修辞敏感性的层级结构及工作流程效果,为开发鲁棒评估系统提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07827 2026-08-11 cs.LG cs.CL 新提交 82%

From token probabilities to calibrated confidence: An empirical study of mathematical question answering

从token概率到校准置信度:数学问答的实证研究

Avery Ma, Lorne Schell, Vin Bhaskara, Leila Pishdad

机构 * RBC Borealis(加拿大皇家银行博雷利斯(RBC Borealis))

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究针对数学问答任务,探究token概率能否用于生成校准置信度,对比单遍与多遍估计器,评估多种校准方法,发现序列聚合token概率可提升置信度质量,事后校准能降低域内误差但迁移性存在非对称问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03685 2026-08-11 cs.LG cs.AI stat.ML 版本更新 82%

Universal One-third Time Scaling in Learning Peaked Distributions

学习尖峰分布中的普适三分之一时间缩放

Yizhou Liu, Ziming Liu, Cengiz Pehlevan, Jeff Gore

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过理论分析和实验验证,揭示了使用softmax和交叉熵学习尖峰分布时,损失和梯度呈幂律衰减,导致损失时间缩放指数为1/3的普适瓶颈,为神经缩放现象提供了机理解释。

Comments Camera-ready version, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09068 2026-08-11 cs.SE 新提交 82%

Pseudo2CodeQA: A Benchmark for LLM-Based Structured Algorithmic Reasoning in Code Generation

Pseudo2CodeQA:面向基于大语言模型的代码生成中结构化算法推理的基准测试

Shadikur Rahman, Umme Ayman Koana, Syed Muhammad Danish

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出Pseudo2Code基准测试及Pseudo2Code Agentic Framework,实验表明该框架性能优于现有基线,验证了结构化伪代码对代码生成的提升作用。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27519 2026-08-11 cs.CV 版本更新 82%

SPROUT: A Scalable Diffusion Foundation Model for Agricultural Vision

SPROUT:一种用于农业视觉的可扩展扩散基础模型

Shuai Xiang, James Burridge, Shouyang Liu, Hao Lu, Tokihiro Fukatsu, Yinqiang Zheng, Wei Guo

机构 * Graduate School of Agricultural and Life Sciences, The University of Tokyo(东京大学大学院农学生命科学研究科) National Key Laboratory of Multispectral Information Intelligent Processing Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学多谱信息智能处理技术全国重点实验室、人工智能与自动化学院) Institute of Agricultural Machinery, NARO(日本国立研究开发法人农业·食品产业技术综合研究机构农业机械研究所) Institute of Life and Environmental Sciences, University of Tsukuba(筑波大学生命环境科学研究所)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)

AI总结 SPROUT是一种基于扩散去噪的多作物多任务农业基础模型,通过大规模未标注数据预训练,在多种下游任务中表现优异,且预训练成本较低。

Comments Code: https://github.com/UTokyo-FieldPhenomics-Lab/SPROUT Dataset: https://huggingface.co/datasets/XIANG-Shuai/MCD-2.6m

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16085 2026-08-11 cs.CV 版本更新 82%

Ensemble learning of pathology foundation models for precision oncology

面向精准肿瘤学的病理基础模型集成学习

Xiangde Luo, Xiyue Wang, Feyisope Eweje, Xiaoming Zhang, Juan Luis Gomez Marti, Sarah Cascarino, Sen Yang, Yuchen Li, Ryan Quinton, Jinxi Xiang, Yuanfeng Ji, Zhe Li, Yijiang Chen, Colin Bergstrom, Ted Kim, Francesca Maria Olguin, Kelley Yuan, Matthew Abikenari, Andrew Heider, Sierra Willens, Sanjeeth Rajaram, Robert West, Joel Neal, Adam Schoenfeld, Maximilian Diehn, Chad Vanderbilt, Ruijiang Li

机构 * Department of Radiation Oncology, Stanford University School of Medicine(放射肿瘤科,斯坦福大学医学院) Department of Pathology, Stanford University School of Medicine(病理学系,斯坦福大学医学院) Department of Medicine (Oncology), Stanford University School of Medicine(医学系(肿瘤学),斯坦福大学医学院) Department of Neurosurgery, Stanford University School of Medicine(神经外科,斯坦福大学医学院) Stanford Institute for Human-Centered Artificial Intelligence(斯坦福大学人本人工智能研究所)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 该研究针对现有病理基础模型性能不一致、泛化有限的问题,提出ELF集成学习框架,整合5个预训练病理基础模型,在5万余张WSIs上训练后,在多种肿瘤相关任务中性能优于单模型,为病理应用提供新方案。

Comments In this version, we fixed some issues and updated some results

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09476 2026-08-11 cs.CR cs.AI 新提交 81%

ActBench: Self-Evolving Benchmark of Behavioral Safety in Cowork Agents

ActBench:协作智能体行为安全的自演进基准

Hongwei Yao, Yiming Liu, Meihui Chen, Jieling Chen, Zikun Chen, Yiling He, Wangze Ni, Cong Wang, Kui Ren

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出自演进行为安全基准ActBench,结合奖励引导束搜索与双证据验证机制,评估协作智能体风险,在24000条轨迹上测试15个LLM和6个开源智能体,发现模型间攻击成功率差异更大。

Comments Benchmark and Code is available https://github.com/zjuicsr/ActBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09289 2026-08-11 cs.CL 新提交 81%

Accurate but Natural? Diagnosing Grammatical and Idiomatic Gaps in Japanese EFL Writing

准确但自然?诊断日本英语作为外语写作中的语法与习语差距

Steve Woollaston, Brendan Flanagan, Hiroaki Ogata

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本研究提出分层LLM修正流水线,结合CEFR-J语法提取器,诊断日本初中生英语写作的语法准确性与习语性差距,为个性化教学反馈提供循证支持。

Comments APCLC submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08691 2026-08-11 cs.AI 新提交 81%

EnergyBridge: Benchmarking Household Energy Management, User Participation, and Grid Flexibility

EnergyBridge:家庭能源管理、用户参与度与电网灵活性基准测试

Xudong Wu, Zeqing Wu, Jiarui Zhang, Xuhao Fan, Ziang Ding, Yuming Zhuang, Mingqi Yuan, Yilun Du, Hongjie Jia, Yunfei Mu, Jiayu Chen

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究提出EnergyBridge基准框架,结合特定区域EnergyPlus环境与LLM用户模拟器,在含584组人类角色扮演判断的实验中,实现了更高授权率、更低能耗与更可靠容量承诺,推动以人为本的电网灵活性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08027 2026-08-11 cs.CR cs.LG 新提交 81%

BASIS: Breach-Aware Selective Prompt Injection Shielding with Prefill Attention Probes

BASIS:基于预填充注意力探测的漏洞感知选择性提示注入防护

Laiqiao Qin, Tianqing Zhu, Longxiang Gao, Wanlei Zhou

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 BASIS是一种基于预填充注意力探测的提示注入防御方法,通过级联门控的稀疏线性探测器实现精准检测,可在保持高注入检测率的同时减少不必要的过度拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07497 2026-08-11 cs.HC cs.CL 新提交 81%

EvalConvoLearn: An Open-Source Framework for Evaluating Grounded Learner Simulations in Tutoring Conversations

EvalConvoLearn:一个用于评估辅导对话中具身学习者模拟的开源框架

Baptiste Moreau-Pernet

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 EvalConvoLearn是评估辅导对话中学习者模拟的开源框架,从学习行为与对话质量两个维度开展评估,验证了其在辅导对话数据集上的有效性并公开了代码。

Comments Poster at the Impactful and Responsible AI Systems for Education workshop, as part of the Festival of Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20739 2026-08-11 cs.CR cs.LG cs.SE 版本更新 81%

Learning to Triage Vulnerability Reports from Program Analysis: An Empirical Study in Node.js

学习对程序分析生成的漏洞报告进行分类:针对Node.js的实证研究

Ronghao Ni, Aidan Z. H. Yang, Min-Chien Hsu, Nuno Sabino, Limin Jia, Ruben Martins, Darion Cassel, Kevin Cheang

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文针对Node.js,基于程序分析工具数据训练机器学习模型,实现漏洞报告优先级排序,最优模型在召回90%可利用报告时可排除75%良性报告,具备实用潜力。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). The version of record is available at https://doi.org/10.1145/3832783.3837503

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16481 2026-08-11 cs.LG 版本更新 81%

Benchmarking the Robustness of Agentic Systems to Adversarially-Induced Harms

评估智能体系统对抗恶意诱导危害的鲁棒性

Jonathan Nöther, Adish Singla, Goran Radanovic

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 该研究提出智能体系统危害分类法与BAD-ACTS基准,评估LLM类智能体对抗恶意诱导的鲁棒性,发现其攻击成功率达40%-90%,并提出零样本消息监控防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08989 2026-08-11 cs.CL cs.AI 新提交 81%

How Far Do Foundation Models Transfer to Infant Signals? A Cross-Dataset Transfer Audit with a Unified Need Ontology

基础模型在婴儿信号上的迁移能力如何?基于统一需求本体的跨数据集迁移审计

Wu Hangyu

专题命中 评测与基准 :foundation model(title);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对婴儿哭声语料库的标签不兼容等问题,通过多级审计探究基础模型的跨数据集迁移能力,提出实用方案并发布工具将不兼容语料库转为联合训练资源。

Comments 18 pages, 7 figures. Under review at AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05550 2026-08-11 cs.SD cs.CL cs.LG 版本更新 81%

Assessing Factual Music Comprehension in Large Audio Language Models

评估大型音频语言模型中的事实音乐理解能力

Daniel Chenyu Lin, Michael Freeman, John Thickstun

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 针对现有MusicQA数据集无法衡量模型回答事实正确性的问题,提出基于可验证信息的评估协议,通过精确率、召回率和F1分数客观评估模型,并在三个数据集上定义六项事实检索任务,对九个最新LALM进行基准测试。

Comments 17 pages; ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09145 2026-08-11 cs.CV 新提交 80%

Right Answer, Wrong Heat: Explanation-Aware Evaluation and Thermal-Grounded Feedback for MLLMs on Infrared Images

正确答案,错误依据:面向红外图像多模态大语言模型的感知感知评估与热基础反馈机制

Yongsong Huang, Xiaofeng Liu, Tomo Miyazaki, Yaohou Fan, Shinichiro Omachi

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对红外图像多模态大语言模型仅以答案准确率评估的问题,提出感知感知评估框架与无需训练的热基础反馈机制,可提升解释热基础度,为可信红外场景理解模型的开发提供了方向。

Comments This manuscript is currently under peer review. Copyright may subsequently be transferred to the publisher, after which the availability of this version may be subject to the publisher's policy

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07018 2026-08-11 cs.HC 版本更新 80%

Designing Youth Social Media through Problem Space Attunement

青少年社交媒体设计中的问题空间调适

JaeWon Kim

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文通过三种问题空间失调(概念性、定义性、评价性)分析青少年社交媒体设计中的权力失衡,并提出虚构探究工作坊、Discord异步社区和LLM代理模拟沙盒等干预方法,以建立以青少年为中心的关系支持型社交媒体设计准则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09853 2026-08-11 cs.RO cs.CV cs.LG 新提交 79%

RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance

RynnValue:基于时间距离扩展机器人价值基础模型

Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo, Tong Lu, Zhaofeng Xu, Jiahao Tang, Jianfei Yang, Donglin Wang, Peixi Peng, Mingxiu Chen, Deli Zhao, Xin Li

机构 * DAMO Academy, Alibaba Group(达摩院(阿里巴巴集团)) Hupan Lab(湖畔实验室)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 该研究提出开源机器人价值基础模型 RynnValue,以时间距离为监督目标,在多维度超越现有方法,可提升机器人策略的真实世界任务成功率并实现零样本泛化。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08654 2026-08-11 cs.AI 新提交 79%

The Scaffolding Matters More Than the Interface: A Controlled Comparison of MCP and CLI Tool Use Across Seven Agent Scaffoldings, Five Language Models, and One Software Task

脚手架比接口更重要:在七种智能体脚手架、五种语言模型和一项软件任务中对MCP与CLI工具使用的对照比较

Marc Alier Forment, María José Casañ Guerrero, Francisco José García-Peñalvo, Juanan Pereira

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 该研究通过对照实验发现,智能体脚手架对AI编码智能体的工具使用成本影响远大于接口,MCP并非必要,且智能体常忽略分配的接口,相关数据已开源。

Comments 29 pages, 4 figures, 8 tables. Companion methodology paper: arXiv:2606.11869. Dataset and measurement harness (open source, GPL-3.0): https://doi.org/10.5281/zenodo.21851992

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08244 2026-08-11 cs.AI 新提交 79%

FemWear: A Specialized Wearable Foundation Model for Women's Health

FemWear:面向女性健康的专用可穿戴设备基础模型

Yifan Wang, Chenzhong Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出面向女性健康的专用可穿戴基础模型FemWear,通过参数高效方式改造预训练主干,在女性健康相关指标上取得性能提升,但未确立普遍优势与临床有效性。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07617 2026-08-11 cs.AI 新提交 79%

TeXFix-Bench: An Empirically Grounded Multi-Format Benchmark for LLM-Based Document Source Repair

TeXFix-Bench:面向基于大语言模型的文档源代码修复的经验驱动多格式基准

Prajwal S. Venkateshmurthy

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 该研究构建了基于经验故障分类法的多格式文档修复基准TeXFix-Bench,通过实验发现仅编译成功率会高估修复质量,Typst修复难度高于LaTeX和Markdown,并发布了相关分类法与工具。

Comments 9 pages, 4 figures, 9 tables. Artifacts: https://doi.org/10.5281/zenodo.21831797

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02587 2026-08-11 cs.SE cs.LG 版本更新 79%

The Moving Target: A Longitudinal Audit of Trust-Benchmark Score Drift Across Open-Source Chat LLM Release Lines

移动目标:对开源聊天语言模型十二个检查点的可信度漂移进行纵向审计

Zhichao Fan, Yanhang Li, Zexin Zhuang, Xian Sun, Yingshuo Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南方 Methodist 大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

AI总结 通过对四个开源版本系列在多提示模板下的信任基准测试,发现相邻版本间存在显著漂移,结论是发布线的信任分数应重新测量,而非沿用,应作为检查点相关的日期化工件报告。

Comments 6 pages, 1 figure; accepted at IEEE ICMLA 2026; title, presentation, and formatting revised from v1; empirical results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏