arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1448 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1448 篇

2603.02001 2026-07-24 cs.DB 版本更新 75%

Bespoke OLAP: Synthesizing Workload-Specific One-size-fits-one Database Engines

定制OLAP:合成工作负载特定的定制数据库引擎

Johannes Wehrstein, Timo Eckmann, Matthias Jasny, Carsten Binnig

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract)

AI总结 Bespoke OLAP通过自动化合成流程,生成针对特定工作负载的高性能数据库引擎,实现比通用系统高多个数量级的性能提升。

Comments Accepted to VLDB'26 (Boston)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13144 2026-07-22 cs.SE 版本更新 75%

A Grey Literature Review of AI-Native Applications

人工智能原生应用的灰色文献综述

Lingli Cao, Shanshan Li, Ying Fan, Danyang Li, Chenxing Zhong

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 该研究通过灰色文献综述,整合多方见解,识别出人工智能原生应用的定义特征、关键质量属性与典型技术栈等,揭示其核心支柱,为全面理解该应用提供了系统认识,还首次提出双层工程蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22683 2026-07-21 cs.SE 版本更新 75%

Identifying Quality Indicators in Student Self-Reflections in Software Engineering

软件工程学生自我反思中的质量指标识别

Matthew Minish, Matthias Galster, Fabian Gilson

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究基于反思写作框架,提出八指标评估方案,并验证了基于RoBERTa的自动分类器在软件工程学生反思评估中的有效性,实现快速结构化反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29573 2026-07-20 cs.CV 版本更新 75%

Reliability-Prioritized Fine-Grained Generation in Multimodal Large

多模态大模型中可靠性优先的细粒度生成

Xiaomeng Fan, Wei Wu, Yuwei Wu, Zhi Gao, Shiyu Luo, Mingyang Gao, Haoyu Zhao, Zhenxin Diao, Yuxuan Ba, Lijia Feng, Yunde Jia, Mehrtash Harandi

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(广东机器感知与智能计算实验室,深圳MSU-BIT大学) Department of Electrical and Computer System Engineering, Monash University(电子与计算机系统工程系,莫纳什大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 针对多模态大模型细粒度生成易出错的问题,提出GranFact基准和层次感知评估算法,并基于直接偏好优化提出可靠性优先的偏好优化方法,提升细粒度生成同时保持可靠性。

Comments Equal contribution: Xiaomeng Fan and Wu Wei. Corresponding authors: Zhi Gao and Yunde Jia

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24009 2026-07-20 cs.CR cs.AI cs.CL cs.LG 版本更新 75%

Jailbreak Foundry: From Papers to Runnable Attacks for Reproducible Benchmarking

Jailbreak Foundry: 从论文到可运行攻击的可重复基准测试

Zhicheng Fang, Jingjie Zheng, Chenxu Fu, Wei Xu

机构 * Shanghai Qi Zhi Institute(上海启智研究院) Tsinghua University(清华大学) University of Melbourne(墨尔本大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 JAILBREAK FOUNDRY通过多代理工作流将论文转换为可执行模块,实现可重复基准测试的标准化评估和自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12254 2026-07-17 cs.CV 版本更新 75%

Self-Aware Recursively Self-Improving Agents for Personal Singularity: A Goal-, Scope-, Tool-, and Benchmark-Driven Multi-Agent Architecture

如何实现递归式自我提升智能体与个人奇点:一种目标、范围、工具和基准驱动的多智能体架构

Chengshuai Yang

机构 * NextGen PlatformAI C Corp.(下一代平台人工智能C公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究大型语言模型智能体进步引发的问题,提出受治理多智能体架构实现递归式自我提升,以个人奇点为目标,详细介绍智能体各要素及架构组成,形式化多种机制并提供设计与路线图。

Comments 28 pages, 5 figures, 7 tables, and 5 algorithms. Position and systems-design paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20867 2026-07-15 cs.IR 版本更新 75%

E-GEO: A Testbed for Generative Engine Optimization in E-Commerce

E-GEO:电子商务中生成引擎优化的测试平台

Puneet S. Bagga, Vivek F. Farias, Tamar Korkotashvili, Tianyi Peng, Yuhang Wu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究电子商务中生成引擎优化问题,引入E-GEO数据集,对多种生成引擎、重写器和启发式方法进行大规模实证研究,将GEO公式化并开发优化算法,通过攻击验证其有效性,揭示存在通用有效GEO策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13723 2026-07-10 cs.SE 版本更新 75%

Compiling Large Multi-Modal Requirement Documents into Runnable Software Systems: From an Agentic Test-Driven Perspective

ARC:将大型多模态需求文档编译为可运行软件系统

Weiyu Kong, Yun Lin, Xiwen Teoh, Duc-Minh Nguyen, Ruofei Ren, Jiaxin Chang, Haoxu Hu, Haoyu Chen

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 提出Agentic需求编译(ARC)技术,通过双向测试驱动智能体循环,将多模态DSL文档直接编译为可运行Web系统,在GUI测试通过率上平均提升50.6%。

Comments This work is accepted at issta'26 (SIGSOFT International Symposium on Software Testing and Analysis)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06683 2026-07-08 cs.SE 版本更新 75%

Benchmarking Requirement-to-Architecture Generation with Hybrid Evaluation

基于混合评估的软件需求到架构生成基准测试

Minxiao Li, Li Zhang, Shuying Yan, Fang Liu, Liehao Li, Yang Liu, Xiaoli Lian

专题命中 评测与基准 :LLM(summary_cn,abstract_cn)

AI总结 本文提出R2ABench基准,包含真实软件项目及PRD和PlantUML图,通过多维混合评估框架评估生成架构,发现LLM在关系推理上存在不足,代码专用模型和代理框架各有优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16560 2026-07-08 cs.LG cs.AI cs.CL 版本更新 75%

Sparse but Wrong: Incorrect L0 Leads to Incorrect Features in Sparse Autoencoders

稀疏但错误:稀疏自编码器中不正确的L0导致特征错误

David Chanin, Adrià Garriga-Alonso

机构 * University College London(伦敦大学学院) MATS Research(MATS研究)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究稀疏自编码器中L0对特征提取的影响,指出L0设置不当会致SAE无法解开潜在特征,提出代理指标指导寻找正确L0,发现多数常用SAEs的L0过低,强调正确设置L0对训练具有单语义特征SAEs的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07591 2026-07-07 cs.LG cs.AI cs.CL 版本更新 75%

ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research

ResearchClawBench: 端到端自主科学研究基准

Wanghan Xu, Shuo Li, Tianlin Ye, Qinglong Cao, Yixin Chen, Hengjian Gao, Yiheng Wang, Qi Li, Kun Li, Sheng Xu, Shengdu Chai, Fangchen Yu, Xiangyu Zhao, Zhangrui Zhao, Weijie Ma, Zijie Guo, Koutian Wu, Haoyu Zhou, Haoxiang Yin, Lixue Cheng, Chaofan Hu, Haoxuan Li, Lu Mi, Xuxuan Xie, Yifan Zhou, Ruizhe Chen, Zhiwang Zhou, Xingjian Guo, Yuhao Zhou, Xuming He, Shengyuan Xu, Xinyu Gu, Jiamin Wu, Mianxin Liu, Chunfeng Song, Fenghua Ling, Dongzhan Zhou, Shixiang Tang, Yuqiang Li, Mao Su, Peng Ye, Siqi Sun, Bin Wang, Xue Yang, Zhenfei Yin, Tianfan Fu, Guangtao Zhai, Wanli Ouyang, Bo Zhang, Lei Bai, Wenlong Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ResearchClawBench基准,包含10个领域40个任务,通过多模态评分标准评估自主科研能力,最强智能体仅得21.5分,揭示当前系统在实验协议、证据匹配和科学核心方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17418 2026-07-07 eess.SY cs.SY 版本更新 75%

PowerDAG: Supervisory Agentic AI System for Automating Distribution Grid Analysis

PowerDAG:用于自动化配电网络分析的可靠代理AI系统

Emmanuel O. Badmus, Amritanshu Pandey

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出PowerDAG,一种用于自动化复杂配电网络分析的代理AI系统,通过自适应检索和即时监督机制提升可靠性,实验显示其在未见查询上表现优异,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16584 2026-06-23 cs.CL cs.AI cs.LG 版本更新 75%

Measuring Intent Comprehension in LLMs

测量LLMs中的意图理解

Nadav Kunievsky, James A. Evans

机构 * Knowlesdge Lab, University of Chicago, Chicago, Illinois, USA(知识实验室,芝加哥大学,芝加哥,伊利诺伊州,美国) Knowledge Lab, Data Science Institute, Department of Sociology, University of Chicago, Chicago, Illinois, USA(知识实验室,数据科学学院,社会学系,芝加哥大学,芝加哥,伊利诺伊州,美国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一个形式化框架,通过方差分解评估LLMs对用户意图的理解能力,发现更大模型通常将更多输出方差归因于意图差异,表明意图理解更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07226 2026-06-16 cs.LG cs.AI cs.CL 版本更新 75%

DEFINED: A Data-Efficient Computational Framework for Fine-Grained Creativity Assessment in Debate Scenarios

DEFINED: 辩论场景中细粒度创造力评估的数据高效计算框架

Tongzhou Yu, Mingjia Li, Hong Qian, Wenkai Wang, Zongbao Zhang, Yaoyu Jiang, Xiangfeng Wang, Aimin Zhou, Jiajun Guo

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DEFINED框架,通过层次化八维指标体系、预训练语言模型和混合粒度训练策略,在辩论场景中实现数据高效的细粒度创造力自动评估,优于现有方法。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04646 2026-06-15 cs.IR cs.AI cs.CL cs.LG 版本更新 75%

Succeeding at Scale: Enterprise Retrieval Benchmark Construction and Index-Preserving Query Adaptation for Multi-Tenant Search

规模化成功:面向多租户搜索的企业检索基准构建与索引保持查询适配

Prateek Jain, Shabari S Nair, Ritesh Goru, Prakhar Agarwal, Ajay Yadav, Yoga Sri Varshan Varadharajan, Constantine Caramanis

机构 * Prateek Jain Shabari S Nair Ritesh Goru Prakhar Agarwal Ajay Yadav Yoga Sri Varshan Varadharajan Constantine Caramanis

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对多租户检索系统中标注数据匮乏和模型更新成本高的问题,提出全自动构建基准DevRev-Search,并研究仅微调查询编码器而保持文档索引不变的索引保持查询适配策略,实现质量与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06142 2026-06-15 cs.PL cs.AI cs.CL cs.LG cs.PF 版本更新 75%

Protean Compiler: An Agile Framework to Drive Fine-grain Phase Ordering

Protean Compiler: 一种驱动细粒度阶段排序的敏捷框架

Amir H. Ashouri, Shayan Shirahmad Gale Bagi, Kavin Satheeskumar, Tejas Srikanth, Jonathan Zhao, Ibrahim Saidoun, Ziwen Wang, Bryan Chan, Tomasz S. Czajkowski

机构 * Huawei Technologies Canada(华为技术加拿大)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Protean Compiler框架,在LLVM中内置细粒度阶段排序能力,通过140多种静态特征收集方法和机器学习优化,平均加速4.1%,最高15.7%。

Comments Version 3: Preprint version of the accepted work at ACM TACO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13379 2026-06-12 cs.CR cs.AI cs.CL cs.LG cs.SE 版本更新 75%

Unsafer in Many Turns: Benchmarking and Defending Multi-Turn Safety Risks in Tool-Using Agents

多轮交互中的安全隐患:工具使用智能体的多轮安全风险基准与防御

Xu Li, Simon Yu, Minzhou Pan, Yiyou Sun, Bo Li, Dawn Song, Xue Lin, Weiyan Shi

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出多轮工具使用安全基准MT-AgentRisk,发现多轮设置下攻击成功率平均增加16%,并设计无训练、与工具无关的自探索防御方法ToolShield,平均降低30%攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04464 2026-06-09 cs.CY econ.GN q-fin.EC 版本更新 75%

Bounded by Risk, Not Capability: Quantifying AI Occupational Substitution Rates via a Tech-Risk Dual-Factor Model

受风险限制而非能力:通过技术-风险双因素模型量化AI职业替代率

Shuyao Gao, Minghao Huang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文通过技术-风险双因素模型量化AI职业替代率,揭示了职业替代并非瞬间发生,而是渐进过程,并指出算法概率无法涵盖专家受专业责任限制的'机构溢价'。

Comments 32 pages, 4 figures. v2: added link to the reproducibility repository (https://github.com/ShuyaoGao/bounded-risk-oai), updated author email, and updated several references

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06609 2026-08-11 cs.AI 版本更新 74%

Automated item evaluation: Predicting item acceptance and rejection using LLM-generated critiques

自动化项目评估:利用大语言模型生成的评语预测项目的接受与拒绝

Hotaka Maeda, Yikai Lu

机构 * Smarter Balanced, University of California-Santa Cruz(加州大学圣克鲁兹分校 Smarter Balanced) University of Minnesota-Twin Cities(明尼苏达大学双城分校)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 本研究利用大规模标准化测试的项目数据,通过融合DeBERTa分类器与Qwen3生成的项目评语,构建AIE模型预测项目接受/拒绝,可减轻人工评审负担,但对公平性相关项目的识别仍需人工评审。

Comments 19 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10202 2026-08-11 cs.LG 版本更新 74%

When Counterbalancing Hides the Bias: Access-Conditioned Position Lock in Forced-Choice LLM Evaluation

跨模型价值比较中的两个混淆因素:响应确定性和访问约束

Hong-In Won, Jinseok Jang, Hyoseop Kim

机构 * KITECH(韩国产业技术评价院) National Research Council of Science and Technology (NST)(韩国国家科学技术研究院)

专题命中 评测与基准 :LLM(title);分类 cs.LG

AI总结 研究跨模型价值比较中的两个混淆因素,提出无规则价值困境等方法分离并校正响应确定性,还发现访问约束影响模型价值概况,贡献了确定性校正分解,识别出部署约束是独特价值混淆因素。

Comments 16 pages, 3 figures, 7 tables. Substantially revised: reframed around an identifiability result for the counterbalanced concentration index, with access configuration presented as one generator of the failure rather than a separate confound. Code and data are included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03230 2026-07-17 cs.CL 版本更新 74%

PERL: Pinyin Enhanced Rephrasing Language Model for Chinese ASR N-best Error Correction

PERL:用于中文语音识别N-best纠错的拼音增强改写语言模型

Junhong Liang, Bojun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 评测与基准 :language model(title);分类 cs.CL

AI总结 针对中文语音识别纠错难题,提出PERL受限改写管道,通过预测目标长度、掩码预算及融合语义与拼音表示来纠错,在Aishell-1和DoAD实验中持续降低字符错误率且保持低延迟,还分析了相关交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27232 2026-07-16 cs.CL 版本更新 74%

Targeted Linguistic Analysis of Sign Language Models with Minimal Translation Pairs

基于最小翻译对的手语语言模型目标语言分析

Serpil Karabüklü, Kanishka Misra, Shester Gueuwou, Diane Brentari, Greg Shakhnarovich, Karen Livescu

机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Linguistics Department, The University of Texas at Austin(德克萨斯大学奥斯汀分校语言学系) Linguistics Department, The University of Chicago(芝加哥大学语言学系)

专题命中 评测与基准 :language model(title);分类 cs.CL

AI总结 针对手语翻译模型,通过构建美国手语最小翻译对数据集(ASL-MTP)并消融输入线索,分析模型对不同手语现象(尤其是非手动线索)的捕捉能力。

Comments It is accepted to CVPR 2026 Workshop GenSign: Generative AI for Sign Language

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25937 2026-06-17 cs.RO cs.LG 版本更新 74%

Can Vision Foundation Models Navigate? Zero-Shot Real-World Evaluation and Lessons Learned

视觉基础模型能否导航?零样本真实世界评估与经验教训

Maeva Guerrier, Karthik Soma, Jana Pavlasek, Giovanni Beltrame

机构 * Polytechnique Montreal(蒙特利尔理工学院)

专题命中 评测与基准 :foundation model(title);分类 cs.LG

AI总结 本文对五种视觉导航模型在真实环境中进行零样本评估,发现其存在几何理解不足、感知混淆和分布漂移等系统性问题,并公开评估代码与数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12323 2026-08-21 cs.CL cs.AI cs.CY 版本更新 73%

Why Do AI Agents Break Rules? How Framing, Context, and Social Signals Shape Compliance

AI智能体为何违反规则?框架、情境与社会信号如何影响合规性

Mika Okamoto, Ansel Kaplan Erol, Kutluhan Erol

专题命中 评测与基准 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 该研究运用法律与经济学的合规理论,发现安全微调AI模型大体合规,任务优化与智能体模型会在低惩罚等条件下违规,且引入经济激励等会导致大规模合规失败,指出模型选择与合规性评估需改进。

Comments Published at 2026 AAAI/ACM Conference on AI, Ethics, and Society and 2026 COLM Workshop on Agent Behavior

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16645 2026-08-20 cs.AI cs.CL cs.MA 版本更新 73%

Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies

重构:从预发表参考文献中恢复研究思路的盲基准

Shaolong Chen, Yanlin Fei, Nazhou Liu, Xinmiao Yu, Lei Li, Rahul Thapa, Madalina Ciobanu, Qingqing Mao, Ritankar Das

机构 * Stanford University(斯坦福大学) Titan Holdings(泰坦控股公司) Prentis AI(普伦蒂斯人工智能公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Reconstruction盲基准,测试语言模型从预发表参考文献恢复论文思路的能力,发现多智能体流水线可将匹配率提升约2.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06185 2026-08-19 cs.CY cs.AI cs.CL cs.HC 版本更新 73%

Hidden Prompts in Manuscripts Exploit AI-Assisted Peer Review

手稿中的隐藏提示利用AI辅助同行评审

Zhicheng Lin

机构 * Department of Psychology, Yonsei University(延世大学心理学系) Department of Psychology, University of Science and Technology of China(中国科学技术大学心理学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了手稿中隐藏指令对AI同行评审的影响,分析了提示注入技术及学术出版物政策的不一致,指出需加强技术筛查与政策协调。

Journal ref Communications of the ACM, 69(7), 53-56 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04495 2026-08-13 cs.CL cs.AI 版本更新 73%

CAR: Query-Guided Confidence-Aware Reranking for Retrieval-Augmented Generation

CAR:面向检索增强生成的查询引导置信感知重排序

Zhipeng Song, Yizhi Zhou, Xiangyu Kong, Jiulong Jiao, Xuezhou Ye, Chunqi Gao, Xueqing Shi, Yu Wang, Yuhang Zhou, Heng Qi

专题命中 评测与基准 :LLM(summary_cn);分类 cs.CL、cs.AI

AI总结 针对RAG现有重排序仅关注相关性的问题,提出无需训练的CAR框架,通过查询引导的答案稳定性校正排名,在多数据集实验中实现稳健性能提升,可用于黑盒LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08283 2026-08-13 cs.CL cs.AI 版本更新 73%

Do Evaluation Metrics Detect Errors in Classical Chinese to English Translations?

评估指标能否检测古文汉英翻译中的错误?

Osvaldo Quinjica, Eric Bennett, Xinchen Yang, Andrew Schonebaum, Marine Carpuat

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究以古文汉英翻译为测试案例,引入诊断框架探查现有翻译评估指标的可靠性,发现MetricX24整体表现最佳,凸显需开发更适配历史文化独特场景的翻译评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13201 2026-08-12 cs.CL cs.AI 版本更新 73%

InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis

InfiniteScienceGym:一个无界的、程序生成的科学分析基准

Oliver Bentham, Vivek Srikumar

机构 * Kahlert School of Computing(卡勒特计算学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出InfiniteScienceGym,通过程序生成科学仓库和可验证问答任务,评估证据推理、回避和工具分析能力,发现现有模型在回答不可答问题上存在显著缺陷。

Comments 31 pages, 5 figures, 8 tables. Accepted to COLM 2026. See https://infinitesciencegym.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23804 2026-08-11 cs.CL cs.AI 版本更新 73%

How Context Attribution Handles What the Model Already Knows

上下文归因如何处理模型已有的知识

Quoc-Huy Trinh, Lin Zhu, Sebastian Szyller

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型上下文归因方法在上下文与训练数据重叠时的问题,引入新评估协议和基准数据集,通过实验证明现有方法在知识重叠时归因不准确,且用于源分离时无法基于贡献分数区分。

详情

展开后加载摘要…

URL PDF HTML 收藏