arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-02 至 2026-02-02 共收录 43 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 43 篇

2507.22911 2026-02-02 cs.CL cs.AI 90%

ElectriQ: A Benchmark for Assessing the Response Capability of Large Language Models in Power Marketing

ElectriQ:一个评估大型语言模型在电力营销中响应能力的基准

Jinzhi Wang, Qingke Peng, Haozhou Li, Zeyuan Zeng, Jiangbo Zhang, Kaixuan Yang, Ningyong Wu, Qinfeng Song, Ruimeng Li, Biyi Zhou

机构 * Systems Engineering Institute, Xi’an Jiaotong University(系统工程研究所,西安交通大学) State Key Laboratory of Multiphase Flow in Power Engineering, School of Energy and Power Engineering, Xi’an Jiaotong University(电力工程多相流国家重点实验室,能源与动力工程学院,西安交通大学) School of Electronic Science and Engineering, Xi'an Jiaotong University(电子科学与工程学院,西安交通大学) Organizational Management Department, School of Management, Xi’an Jiaotong University(组织管理部,管理学院,西安交通大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 ElectriQ是一个用于评估大型语言模型在电力营销中响应能力的基准,通过结合人类评分、自动指标和合规测试,提出SEEK-RAG方法提升领域知识注入,实现高效且合规的电力营销助手部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22921 2026-02-02 cs.CR cs.AI cs.LG 88%

Evaluating Large Language Models for Security Bug Report Prediction

评估大型语言模型用于安全漏洞报告预测

Farnaz Soltaniani, Shoaib Razzaq, Mohammad Ghafari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文评估了基于提示和微调方法在预测安全漏洞报告中的性能,发现提示方法在召回率上表现更好但精度较低,而微调方法在精度上更优但召回率下降,且推理速度更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06307 2026-02-02 cs.AI 88%

Can AI Make Energy Retrofit Decisions? An Evaluation of Large Language Models

人工智能能做出能源改造决策吗?大型语言模型的评估

Lei Shu, Dong Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文评估了大型语言模型在住宅能源改造决策中的表现,发现其在技术目标上表现较好,但在社会技术决策上受限于经济权衡和本地环境,需进一步提升准确性与上下文处理能力。

Journal ref Buildings 2025, 15(22), 4081

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13524 2026-02-02 cs.CL 88%

OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models

OMGEval: 一种开放的多语言生成评估基准用于大型语言模型

Yang Liu, Meng Xu, Shuo Wang, Liner Yang, Haoyu Wang, Zhenghao Liu, Cunliang Kong, Yun Chen, Yang Liu, Maosong Sun, Erhong Yang

机构 * Beijing Language and Culture University(北京语言大学) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Northeastern University(东北大学) Shanghai University of Finance and Economics(上海金融学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 OMGEval是一个开放的多语言生成评估基准,通过提供多种语言的开放性问题,评估大型语言模型在不同文化背景下的能力,旨在提升多语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22811 2026-02-02 astro-ph.SR 88%

Operational Solar Flare Forecasting System Using an Explainable Large Language Model

基于可解释大型语言模型的操作性太阳耀斑预报系统

Xuebao Li, Yongshang Lv, Jinfang Wei, Yanfang Zheng, Ting Li, Rui Wang, Zixian Wu, Hongwei Ye, Pengchao Yan, Zamri Zainal Abidin, Noraisyah Mohamed Shah, Changtian Xiang, Shunhuang Zhang, Xiaojia Ji, Xusheng Huang, Xiaotian Wang, Honglei Jin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出基于可解释大型语言模型的操作性太阳耀斑预报系统,通过SHAP分析揭示关键物理特征,实现优于现有系统的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09957 2026-02-02 cs.DC cs.CR cs.SE 88%

CloudFix: Automated Policy Repair for Cloud Access Control Policies Using Large Language Models

CloudFix: 利用大语言模型实现云访问控制策略的自动化修复

Bethel Hall, Owen Ungaro, William Eiers

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 CloudFix利用大语言模型和形式方法,实现云访问控制策略的自动化修复,提高修复准确性和效率。

Comments 12 pages

Journal ref SANER 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22759 2026-02-02 cs.HC cs.AI cs.SE 85%

Qualitative Evaluation of LLM-Designed GUI

大型语言模型设计的图形用户界面定性评估

Bartosz Sawicki, Tomasz Les, Dariusz Parzych, Aleksandra Wycisk-Ficek, Pawel Trebacz, Pawel Zawadzki

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了LLM在设计GUI时的可用性和适应性,发现其在结构布局方面有效,但在可访问性和交互功能上存在挑战,需人类干预以确保用户体验。

Comments 12 pages, presented on conference PP-RAI 2025, Katowice-Poland

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22433 2026-02-02 cs.AI cs.SE 85%

When LLM meets Fuzzy-TOPSIS for Personnel Selection through Automated Profile Analysis

当LLM遇见模糊-TOPSIS用于通过自动化资料分析的人事选拔

Shahria Hoque, Ahmed Akib Jawad Karim, Md. Golam Rabiul Alam, Nirjhar Gope

机构 * BRAC University Department of Computer Science and Engineering(布拉克大学计算机科学与工程系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究结合LLM与模糊TOPSIS方法,开发自动化人事选拔系统,提升招聘的可扩展性、一致性和公平性。

Comments 10 pages, 8 figures. This paper has been peer-reviewed and published in IEEE Access. The arXiv version corresponds to the accepted author manuscript (AAM)

Journal ref IEEE Access, vol. 14, 2026, Article ID 3658575

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20886 2026-02-02 cs.SE cs.LG 84%

IDE-Bench: Evaluating Large Language Models as IDE Agents on Real-World Software Engineering Tasks

IDE-Bench:通过IDE原生工具接口评估大型语言模型作为IDE代理在真实软件工程任务中的表现

Spencer Mateega, Jeff Yang, Tiana Costello, Shaurya Jadhav, Nicole Tian, Agustin Garcinuño

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.LG

AI总结 IDE-Bench通过IDE原生工具接口评估大型语言模型作为IDE代理在真实软件工程任务中的表现,提供首个系统性的多语言全栈环境评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22290 2026-02-02 cs.AI 83%

The Six Sigma Agent: Achieving Enterprise-Grade Reliability in LLM Systems Through Consensus-Driven Decomposed Execution

六西格玛代理:通过共识驱动的分解执行实现企业级可靠性

Khush Patel, Siva Surendira, Jithin George, Shreyas Kapale

机构 * Lyzr Research(Lyzr研究)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 六西格玛代理通过共识驱动的分解执行实现企业级可靠性,显著提升AI系统可靠性并降低成本。

Comments 25 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21800 2026-02-02 cs.LG math.OC stat.ML 81%

MARS-M: When Variance Reduction Meets Matrices

MARS-M:当方差减少与矩阵相遇

Yifeng Liu, Angela Yuan, Quanquan Gu

机构 * Department of Computer Science, University of California, Los Angeles, CA, USA(计算机科学系,加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 MARS-M通过结合MARS的方差减少技术与Muon,实现了更高效的优化收敛速度和更优的训练性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21322 2026-02-02 cs.HC cs.AI cs.CL cs.CY 81%

TALES: A Taxonomy and Analysis of Cultural Representations in LLM-generated Stories

TALES: 关于LLM生成故事中文化表征的分类与分析

Kirti Bhagat, Shaily Bhatt, Athul Velagapudi, Aditya Vashistha, Shachi Dave, Danish Pruthi

机构 * Indian Institute of Science(印度科学研究院) Carnegie Mellon University(卡内基梅隆大学) Cornell University(康奈尔大学) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 TALES通过分类和分析LLM生成故事中的文化误表征,揭示了印度不同文化身份的表征问题,并构建了评估模型文化知识的问题库。

Comments Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13--17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22706 2026-02-02 cs.CR cs.SE 80%

RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories

RealSec-bench:一个评估现实世界仓库中安全代码生成的基准

Yanlin Wang, Ziyao Zhang, Chong Wang, Xinyi Xu, Mingwei Liu, Yong Wang, Jiachi Chen, Zibin Zheng

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 RealSec-bench是一个基于现实世界Java仓库构建的安全代码生成评估基准,通过多阶段流程和专家验证,评估5种LLM在功能正确性和安全性方面的表现。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23183 2026-02-02 cs.CL 79%

JobResQA: A Benchmark for LLM Machine Reading Comprehension on Multilingual Résumés and JDs

JobResQA:一个用于多语言简历和职位描述的LLM机器阅读理解基准

Casimiro Pio Carrino, Paula Estrella, Rabih Zbib, Carlos Escolano, José A. R. Fonollosa

机构 * Avature Machine Learning(Avature 机器学习) Universitat Politècnica de Catalunya(巴塞罗那理工大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 JobResQA是一个用于评估LLM在多语言简历和职位描述上的机器阅读理解能力的基准,揭示了多语言MRC在人力资源应用中的关键差距。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22336 2026-02-02 stat.ML cs.LG stat.ME 79%

Dependence-Aware Label Aggregation for LLM-as-a-Judge via Ising Models

基于Ising模型的依赖感知标签聚合用于LLM作为判断者

Krishnakumar Balasubramanian, Aleksandr Podkopaev, Shiva Prasad Kasiviswanathan

机构 * Department of Statistics, University of California, Davis(加州大学戴维斯分校统计学系) Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

AI总结 本文提出基于Ising模型的依赖感知标签聚合方法,以解决LLM作为判断者时标注者间依赖性问题,通过改进的模型结构和实验验证提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22230 2026-02-02 cs.LG 79%

DAJ: Data-Reweighted LLM Judge for Test-Time Scaling in Code Generation

DAJ:用于代码生成测试时缩放的数据重加权LLM评判器

Peijia Qin, Ruiyi Zhang, Qi Cao, Pengtao Xie

机构 * ucsd(加州大学圣地亚哥分校)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

AI总结 DAJ通过双层数据重加权学习框架,提升LLM评判器在代码生成测试时缩放中的性能,实现对困难问题和轨迹一致数据的自动强调,取得最佳效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23059 2026-02-02 cs.SE cs.AI cs.LG 79%

On the Impact of Code Comments for Automated Bug-Fixing: An Empirical Study

关于代码注释对自动化修复bug的影响:一项实证研究

Antonio Vitale, Emanuela Guglielmi, Simone Scalabrino, Rocco Oliveto

机构 * Politecnico di Torino, University of Molise(托里尼理工大学,莫利塞大学) University of Molise(莫利塞大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究探讨了代码注释对LLM自动化修复bug的影响,发现注释能显著提升修复准确性,且训练时使用注释不影响性能。

Comments Accepted at the 34th IEEE/ACM International Conference on Program Comprehension (ICPC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11854 2026-02-02 cs.CL cs.AI cs.MA 79%

ATOD: An Evaluation Framework and Benchmark for Agentic Task-Oriented Dialogue Systems

ATOD: 一种用于代理任务导向对话系统的评估框架和基准

Yifei Zhang, Hooshang Nayyeri, Rinat Khaziev, Emine Yilmaz, Gokhan Tur, Dilek Hakkani-Tür, Hari Thadakamalla

机构 * Amazon(亚马逊)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ATOD提出了一种评估框架和基准,用于评估代理任务导向对话系统的多目标协调、依赖管理、记忆、适应性和主动性等能力,并通过ATOD-Eval实现了细粒度指标评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26852 2026-02-02 cs.AI cs.CL 79%

CATArena: Evaluating Evolutionary Capabilities of Code Agents via Iterative Tournaments

CATArena: 通过迭代竞技场评估代码代理的进化能力

Lingyue Fu, Xin Ding, Linyue Pan, Yaoming Zhu, Shao Zhang, Lin Qiu, Weiwen Liu, Weinan Zhang, Xuezhi Cao, Xunliang Cai, Jiaxin Ding, Yong Yu

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际 Graduate School)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CATArena通过迭代竞技场评估代码代理的进化能力,揭示了代理在连续优化和多轮迭代开发中的潜力及改进机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22492 2026-02-02 cs.CV 78%

PromptMAD: Cross-Modal Prompting for Multi-Class Visual Anomaly Localization

PromptMAD: 多类视觉异常定位的跨模态提示

Duncan McCain, Hossein Kashiani, Fatemeh Afghah

机构 * Holcombe Department of Electrical and Computer Engineering(电气与计算机工程系) Computer Engineering Clemson University(计算机工程学系 哥伦比亚大学)

专题命中 评测与基准 :prompting(title,abstract)

AI总结 PromptMAD通过跨模态提示和Focal损失函数,在多类视觉异常检测中实现高精度像素级定位与高效性能。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22575 2026-02-02 cs.CV cs.CL 77%

PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios

PhoStream:面向移动场景的多模态助手实时流基准测试

Xudong Lu, Huankang Guan, Yang Bo, Jinpeng Chen, Xintong Guo, Shuhan Li, Fang Liu, Peiwen Sun, Xueying Li, Wei Zhang, Xue Yang, Rui Liu, Hongsheng Li

机构 * CUHK MMLab(CUHK 多模态实验室) Huawei Research(华为研究) City University of Hong Kong(城市大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PhoStream是首个面向移动场景的多模态助手实时流基准测试,通过统一屏幕内外场景评估视频、音频和时间推理能力,揭示了大语言模型在决定何时发言上的局限性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22386 2026-02-02 cs.CL cs.MA 77%

Specialists or Generalists? Multi-Agent and Single-Agent LLMs for Essay Grading

专家还是通才?多智能体与单智能体LLM用于作文评分

Jamiu Adekunle Idowu, Ahmed Almasoud

机构 * Sahel AI, Sahel Group Inc.(Sahel AI,Sahel Group Inc.) University College London (UCL)(University College London(UCL)) Prince Sultan University

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文比较了多智能体与单智能体LLM在作文评分中的表现,发现多智能体系统在识别弱作文方面更优,而单智能体系统在中等质量作文上表现更好,少样本校准对性能影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19494 2026-02-02 cs.SE cs.AI 77%

AACR-Bench: Evaluating Automatic Code Review with Holistic Repository-Level Context

AACR-Bench: 评估自动代码审查的综合仓库级上下文

Lei Zhang, Yongda Yu, Minghui Yu, Xinxin Guo, Zhengqi Zhuang, Guoping Rong, Dong Shao, Haifeng Shen, Hongyu Kuang, Zhengfeng Li, Boge Wang, Guoan Zhang, Bangyu Xiang, Xiaobin Xu

机构 * Southern Cross University, Gold Coast, Australia(南方十字大学) TRE, Alibaba Inc., Hangzhou, China(阿里云)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AACR-Bench通过综合仓库级上下文和专家验证流程,提升自动代码审查评估的准确性与全面性,揭示上下文粒度和检索方法对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10909 2026-02-02 cs.AI 77%

PaperArena: An Evaluation Benchmark for Tool-Augmented Agentic Reasoning on Scientific Literature

PaperArena: 一个用于科学文献上工具增强代理推理的评估基准

Daoyu Wang, Mingyue Cheng, Shuo Yu, Zirui Liu, Ze Guo, Xin Li, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Artificial Intelligence Research Institute, iFLYTEK Co., Ltd(人工智能研究院,iFLYTEK有限公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PaperArena提出一个评估基准,用于评估基于LLM的代理在跨多篇论文整合信息并使用外部工具进行推理的能力,实验显示现有代理在复杂任务上的表现有限。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16648 2026-02-02 cs.AI cs.CL cs.LG 75%

FESTA: Functionally Equivalent Sampling for Trust Assessment of Multimodal LLMs

FESTA:用于多模态大语言模型信任评估的功能等效采样

Debarpan Bhattacharya, Apoorva Kulkarni, Sriram Ganapathy

机构 * Indian Institute of Science(印度科学研究院) University of Maryland College Park(马里兰大学学院公园分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FESTA通过功能等效采样技术提升多模态大语言模型的预测选择性性能,实现33.3%和29.6%的改进。

Comments Accepted in the Findings of EMNLP, 2025

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22162 2026-02-02 q-fin.GN cs.AI cs.CL 73%

UniFinEval: Towards Unified Evaluation of Financial Multimodal Models across Text, Images and Videos

UniFinEval: 向跨文本、图像和视频的金融多模态模型统一评估迈进

Zhi Yang, Lingfeng Zeng, Fangqi Lou, Qi Qi, Wei Zhang, Zhenyu Wu, Zhenxiong Yu, Jun Han, Zhiheng Jin, Lejie Zhang, Xiaoming Huang, Xiaolong Liang, Zheng Wei, Junbo Zou, Dongpo Cheng, Zhaowei Liu, Xin Guo, Rongjunchen Zhang, Liwen Zhang

机构 * SUFE(上海财经大学) Tencent(腾讯) Gatech(佐治亚理工学院) HiThink Research(慧图研究)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 UniFinEval提出首个统一多模态基准,用于评估金融领域高信息密度下的多模态模型能力,通过五个真实金融场景和大规模数据集验证模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23092 2026-02-02 cs.CR cs.AI 70%

WiFiPenTester: Advancing Wireless Ethical Hacking with Governed GenAI

WiFiPenTester: 通过受控生成式AI推进无线道德黑客技术

Haitham S. Al-Sinani, Chris J. Mitchell

机构 * Diwan of Royal Court, Muscat, Oman.(阿曼穆斯cat王室法庭) Royal Holloway, University of London, Egham, UK.(伦敦皇家霍洛威大学) German University of Technology in Oman, Muscat, Oman.(阿曼技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 WiFiPenTester通过整合生成式AI提升无线道德黑客的效率与安全性,实现智能目标筛选和策略推荐,同时保障伦理规范和可追溯性。

Comments 35 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20730 2026-02-02 cs.CL 70%

AgentLongBench: A Controllable Long Benchmark For Long-Contexts Agents via Environment Rollouts

AgentLongBench: 通过环境回放构建可控的长上下文代理基准

Shicheng Fang, Yuxin Wang, Xiaoran Liu, Jiahao Lu, Chuanyuan Tan, Xinchi Chen, Yining Zheng, Xuanjing Huang, Xipeng Qiu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AgentLongBench通过模拟环境回放评估代理在长上下文任务中的表现,揭示代理在动态信息综合方面的不足。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01017 2026-02-02 cs.AI 70%

ChartAnchor: Chart Grounding with Structural-Semantic Fidelity

ChartAnchor: 图表接地与结构-语义保真

Xinhang Li, Jingbo Zhou, Pengfei Luo, Yixiong Xiao, Tong Xu

机构 * Baidu Research(百度研究) USTC

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ChartAnchor提出一个综合图表接地基准测试,通过图表到代码生成和受控表格重建任务,评估模型在结构和数值层面的保真度,揭示MLLMs在数值精度和代码合成方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21422 2026-02-02 cs.CL 70%

Automatic Reviewers Fail to Detect Faulty Reasoning in Research Papers: A New Counterfactual Evaluation Framework

自动评审员无法检测研究论文中的错误推理:一种新的反事实评估框架

Nils Dycke, Iryna Gurevych

机构 * UKP Lab, Department of Computer Science and National Research Center for Applied Cybersecurity(UKP实验室、计算机科学系和应用网络安全国家研究中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种反事实评估框架,揭示自动评审系统在检测研究论文中逻辑错误方面的不足,并提出未来研究建议。

Comments accepted to TACL 2026 (presented at EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏