arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-22 至 2025-12-22 共收录 117 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 1 篇

2512.16962 2025-12-22 cs.CR cs.AI cs.LG 86%

MemoryGraft: Persistent Compromise of LLM Agents via Poisoned Experience Retrieval

MemoryGraft: 通过中毒经验检索持续破坏LLM代理

Saksham Sahai Srivastava, Haoyu He

机构 * School of Computing University of Georgia(计算机学院 佐治亚大学)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MemoryGraft 通过在LLM代理的长期记忆中植入恶意经验,实现对代理行为的持续破坏。

Comments 14 pages, 1 figure, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 14 篇

2512.17559 2025-12-22 cs.AI 90%

Towards Explainable Conversational AI for Early Diagnosis with Large Language Models

迈向具有大语言模型的可解释对话AI用于早期诊断

Maliha Tabassum, M Shamim Kaiser

机构 * Department of Information and Communication Technology(信息与通信技术系) Bangladesh University of Professionals(孟加拉专业大学) Institute of Information Technology(信息技术研究所) Jahangirnagar University(贾汗吉尔纳瓦德大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本研究提出基于大语言模型的可解释对话AI,用于提高早期诊断的透明性和互动性,实验显示其在诊断准确性上优于传统机器学习模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16442 2025-12-22 cs.CV cs.AI 88%

EDVD-LLaMA: Explainable Deepfake Video Detection via Multimodal Large Language Model Reasoning

EDVD-LLaMA: 通过多模态大语言模型推理进行可解释的深度伪造视频检测

Haoran Sun, Chen Cai, Huiping Zhuang, Kong Aik Lee, Lap-Pui Chau, Yi Wang

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(电子与电气工程系,香港理工大学) School of Electrical and Electronic Engineering, Nanyang Technological University(电子与电气工程学院,南洋理工大学) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 EDVD-LLaMA通过多模态大语言模型推理实现深度伪造视频检测的可解释性,结合时空特征提取和细粒度推理机制,提升检测准确性与解释可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06813 2025-12-22 cs.AI cs.MA cs.SI 85%

Richelieu: Self-Evolving LLM-Based Agents for AI Diplomacy

Richelieu: 基于大语言模型的自进化AI外交代理

Zhenyu Guan, Xiangyu Kong, Fangwei Zhong, Yizhou Wang

机构 * Institute for Artificial Intelligence(人工智能研究院) Computer School(计算机学院) School of Artificial Intelligence(人工智能学院) Center on Frontiers of Computing Studies(计算前沿研究中心) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) Nat’l Eng. Research Center of Visual Technology(视觉技术国家工程研究中心) State Key Lab of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Richelieu通过整合战略规划、目标导向谈判和自我进化能力,开发出能执行复杂多代理任务的AI外交代理。

Journal ref NuerIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17062 2025-12-22 cs.RO 85%

Lang2Manip: A Tool for LLM-Based Symbolic-to-Geometric Planning for Manipulation

Lang2Manip: 一种基于LLM的符号到几何规划工具用于操作

Muhayy Ud Din, Jan Rosell, Waseem Akram, Irfan Hussain

机构 * Khalifa University Center for Autonomous Robotic Systems (KUCARS)(卡利法大学自主机器人系统中心) Khalifa University(卡利法大学) Institute of Industrial and Control Engineering (IOC)(工业与控制工程研究所) Universitat Politècnica de Catalunya(加泰罗尼亚理工大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Lang2Manip通过结合LLM和Kautham框架,实现通用的符号到几何操作规划,适用于多种机器人和任务。

Comments Submitted to ICARA

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10321 2025-12-22 cs.LG stat.ML 79%

Towards Human-Guided, Data-Centric LLM Co-Pilots

面向人类指导、数据导向的LLM协同助手

Evgeny Saveliev, Jiashuo Liu, Nabeel Seedat, Anders Boyd, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学) Tsinghua University(清华大学) Amsterdam University Medical Centers(阿姆斯特丹大学医学中心)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.LG

AI总结 CliMB-DC是一种结合人类指导和数据导向工具的LLM协同助手框架,旨在提升领域专家在复杂数据处理中的能力。

Comments Saveliev, Liu & Seedat contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17060 2025-12-22 cs.MA cs.AI 79%

On the Role of Contextual Information and Ego States in LLM Agent Behavior for Transactional Analysis Dialogues

在交易分析对话中LLM代理行为中情境信息和自我状态的作用

Monika Zamojska, Jarosław A. Chudziak

机构 * Faculty of Electronics and Information Technology(电子与信息技术学院) Warsaw University of Technology(华沙技术大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出了一种受交易分析理论启发的多代理系统,通过整合情境信息检索来增强LLM代理在交易分析对话中的行为真实性。

Comments Presented at the 39th Pacific Asia Conference on Language, Information and Computation (PACLIC 39)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17079 2025-12-22 cs.LG cs.AI 79%

Can Large Reasoning Models Improve Accuracy on Mathematical Tasks Using Flawed Thinking?

大推理模型能否通过错误推理提升数学任务的准确性?

Saraswathy Amjith, Mihika Dusad, Neha Muramalla, Shweta Shah

机构 * MIT(麻省理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过训练模型处理故意错误推理轨迹,提升其在数学任务中的错误恢复能力,同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17227 2025-12-22 cs.CV 75%

Learning When to Look: A Disentangled Curriculum for Strategic Perception in Multimodal Reasoning

学习何时观察:一种解耦的课程学习框架,用于多模态推理中的战略感知

Siqi Yang, Zilve Gao, Haibo Qiu, Fanfan Liu, Peng Shi, Zhixiong Zeng, Qingmin Liao, Lin Ma

机构 * Meituan(美团) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出了一种解耦课程学习框架,通过分阶段训练提升多模态推理中的抽象推理与战略视觉感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17532 2025-12-22 cs.CV cs.AI 70%

Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding

Robust-R1: 为鲁棒视觉理解的退化感知推理

Jiaqi Tang, Jianmin Chen, Wei Wei, Xiaogang Xu, Runtao Liu, Xiangyu Wu, Qipeng Xie, Jiafei Wu, Lei Zhang, Qifeng Chen

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Robust-R1通过结构化推理链显式建模视觉退化,提升多模态大语言模型在现实世界退化下的鲁棒性与抗干扰能力。

Comments Accepted by AAAI2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17260 2025-12-22 cs.CL 70%

Seed-Prover 1.5: Mastering Undergraduate-Level Theorem Proving via Learning from Experience

Seed-Prover 1.5:通过经验学习掌握本科生级定理证明

Jiangjie Chen, Wenxiang Chen, Jiacheng Du, Jinyi Hu, Zhicheng Jiang, Allan Jie, Xiaoran Jin, Xing Jin, Chenggang Li, Wenlei Shi, Zhihong Wang, Mingxuan Wang, Chenrui Wei, Shufa Wei, Huajian Xin, Fan Yang, Weihao Gao, Zheng Yuan, Tianyang Zhan, Zeyu Zheng, Tianxi Zhou, Thomas Hanwen Zhu

机构 * ByteDance(字节跳动)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Seed-Prover 1.5通过经验学习在形式定理证明中实现高效性能,解决大量本科生及更高难度的数学问题。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15528 2025-12-22 cs.CV 67%

EmoCaliber: Advancing Reliable Visual Emotion Comprehension via Confidence Verbalization and Calibration

EmoCaliber: 通过置信度 verbalization 和校准推进可靠的视觉情绪理解

Daiqing Wu, Dongbao Yang, Can Ma, Yu Zhou

机构 * IIE, Chinese Academy of Sciences(中国科学院信息研究所) Nankai University(南开大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 EmoCaliber通过置信度 verbalization 和校准提升视觉情绪理解的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17455 2025-12-22 cs.SE 67%

An Investigation on How AI-Generated Responses Affect SoftwareEngineering Surveys

对AI生成响应如何影响软件工程调查的探究

Ronnie de Souza Santos, Italo Santos, Maria Teresa Baldassarre, Cleyton Magalhaes, Mairieli Wessel

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本研究探讨AI生成响应对软件工程调查的影响,通过分析发现49份回答存在合成作者身份的模式,强调需结合自动化与解释性验证以提升调查可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17206 2025-12-22 cs.CV 67%

Reasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMs

推理调色板:通过潜在上下文化调节推理以实现可控探索用于(V)LMs

Rujiao Long, Yang Li, Xingyao Zhang, Weixun Wang, Tianqianjin Lin, Xi Zhao, Yuchi Xu, Wenbo Su, Junchi Yan, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :language model(abstract);SFT(abstract)

AI总结 Reasoning Palette通过引入潜在变量调节模型推理策略,提升可控探索和持续学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10501 2025-12-22 cs.AI cs.LG 62%

PASS: Probabilistic Agentic Supernet Sampling for Interpretable and Adaptive Chest X-Ray Reasoning

基于概率代理超网采样的可解释和自适应胸片推理系统

Yushi Feng, Junye Du, Yingying Hong, Qifan Wang, Lequan Yu

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 PASS通过概率代理超网采样实现可解释、自适应和多模态的胸片推理,提升医疗AI的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 评测与基准 38 篇

2512.17028 2025-12-22 cs.CL cs.AI cs.LG 90%

A Women's Health Benchmark for Large Language Models

为大型语言模型建立女性健康基准

Victoria-Elisabeth Gruber, Razvan Marinescu, Diego Fajardo, Amin H. Nassar, Christopher Arkfeld, Alexandria Ludlow, Shama Patel, Mehrnoosh Samaei, Valerie Klug, Anna Huber, Marcel Gühner, Albert Botta i Orfila, Irene Lagoja, Kimya Tarr, Haleigh Larson, Mary Beth Howard

机构 * Lumos AI Medical Oncology, Yale Cancer Center(耶鲁癌症中心医学肿瘤学部) Obstetrics and Gynecology, MGH, Harvard Medical School(妇产科,MGH,哈佛医学院) Obstetrics, Gynecology & Reproductive Sciences, UCSF(妇产科与生殖科学,UCSF) Brown Division of Global Emergency Medicine(全球急诊医学部,布朗分部) Department of Emergency Medicine, Emory University(急诊医学部,埃默里大学) Pharmacy Department, Clinic Ottakring(药学部,克利克诊所) Windrush Surgery, Buckinghamshire, Oxfordshire and Berkshire West Integrated Care Board, NHS(温德许手术,贝肯ham郡,牛津郡和伯克希尔西部整合护理委员会,NHS) Women’s Health Research, Yale School of Medicine(女性健康研究,耶鲁医学院) Johns Hopkins University School of Medicine(约翰霍普金斯大学医学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出女性健康基准,评估LLM在女性健康领域的表现,发现现有模型在关键任务上存在显著缺陷,需进一步改进以提供可靠医疗建议。

Comments 15 pages, 6 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20915 2025-12-22 cs.CR cs.AI cs.LG 90%

ZKPROV: A Zero-Knowledge Approach to Dataset Provenance for Large Language Models

ZKPROV: 一种用于大语言模型数据溯源的零知识方法

Mina Namazi, Alexander Nemecek, Erman Ayday

机构 * Open University of Catalonia(加泰罗尼亚开放大学) Case Western Reserve University(凯斯西储大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 ZKPROV通过零知识证明实现大语言模型的数据溯源验证,保障数据隐私与效率平衡,适用于医疗等敏感领域。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22659 2025-12-22 cs.SE cs.AI 89%

A Systematic Literature Review on Detecting Software Vulnerabilities with Large Language Models

基于大语言模型的软件漏洞检测系统文献综述

Sabrina Kaniewski, Fabian Schmidt, Markus Enzweiler, Michael Menth, Tobias Heer

机构 * Esslingen University(埃斯林根大学) Institute for Intelligent Systems, Esslingen University(智能系统研究所,埃斯林根大学) Chair of Communication Networks, University of Tübingen(通信网络教研室,图宾根大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文系统综述了基于大语言模型的软件漏洞检测研究,分析了263项研究,提出了细粒度分类法,识别关键限制,并为未来研究提供了方向。

Comments 43 pages + 20 pages references, 7 tables, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20900 2025-12-22 cs.CL cs.CY 89%

Large Language Models: A New Approach for Privacy Policy Analysis at Scale

大型语言模型:一种大规模隐私政策分析的新方法

David Rodriguez, Ian Yang, Jose M. Del Alamo, Norman Sadeh

机构 * ETSI Telecomunicación Universidad Politécnica de Madrid Spain(马德里理工大学电信工程学院) School of Computer Science Carnegie Mellon University(计算机科学学院卡内基梅隆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出利用大型语言模型进行大规模隐私政策分析,通过高效提取隐私实践,实现高准确率和低资源消耗。

Journal ref Computing, vol. 106, no. 12, pp. 3879-3903, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17164 2025-12-22 cs.IR 89%

TCDE: Topic-Centric Dual Expansion of Queries and Documents with Large Language Models for Information Retrieval

基于大语言模型的查询与文档主题聚焦双扩展方法用于信息检索

Yu Yang, Feng Tian, Ping Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 TCDE通过大语言模型实现查询与文档的主题聚焦双扩展,提升信息检索的语义对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17308 2025-12-22 cs.AI cs.CL 88%

Large Language Models as Pokémon Battle Agents: Strategic Play and Content Generation

大型语言模型作为宝可梦战斗代理:战略玩法与内容生成

Daksh Jain, Aarya Jain, Ashutosh Desai, Avyakt Verma, Ishan Bhanuka, Pratik Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani, India(比拉理工学院和科学学院,比兰)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型语言模型在宝可梦战斗中的战略决策能力及内容生成能力,展示了其作为动态游戏对手和设计者的潜力。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09147 2025-12-22 cs.CL cs.AI 88%

LLM-as-a-qualitative-judge: automating error analysis in natural language generation

LLM-as-a-qualitative-judge: 自动化自然语言生成中的错误分析

Nadezhda Chirkova, Tunde Oluwaseyi Ajayi, Seth Aycock, Zain Muhammad Mujahid, Vladana Perlić, Ekaterina Borisova, Markarit Vartampetian

机构 * Naver Labs Europe(纳维尔实验室欧洲分公司) Insight Research Ireland Centre for Data Analytics, Data Science Institute, University of Galway(爱尔兰洞察研究数据分析中心、数据科学研究所、Galway大学) University of Amsterdam(阿姆斯特丹大学) University of Copenhagen(哥本哈根大学) STMicroelectronics(STMicroelectronics公司) Télécom Paris(巴黎电信学院) Deutsches Forschungszentrum für Künstliche Intelligenz GmbH (DFKI)(德国人工智能研究中心有限公司) Technische Universität Berlin(柏林技术大学) Univ. Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学、CNRS、格勒诺布尔INP、LIG)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出LLM-as-a-qualitative-judge方法,通过生成结构化报告帮助改进自然语言生成系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17389 2025-12-22 cs.IR 88%

The Mental World of Large Language Models in Recommendation: A Benchmark on Association, Personalization, and Knowledgeability

大语言模型在推荐系统中的心理世界:关联性、个性化与知识性基准测试

Guangneng Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出LRWorld基准,评估大语言模型在推荐系统中的关联性、个性化和知识性能力,发现其在浅层相似性任务上表现良好,但在深度个性化嵌入和多模态推理方面仍有不足。

Comments 21 pages, 13 figures, 27 tables, submission to KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14121 2025-12-22 cs.CV cs.AI 85%

SportsGPT: An LLM-driven Framework for Interpretable Sports Motion Assessment and Training Guidance

SportsGPT: 一种基于大语言模型的可解释性体育动作评估与训练指导框架

Wenbo Tian, Ruting Lin, Hongxian Zheng, Yaodong Yang, Geng Wu, Zihao Zhang, Zhang Zhang

机构 * School of Artificial Intelligence, UCAS, Beijing, China(人工智能学院) MAIS, NLPR, Institute of Automation, CAS, Beijing, China(自动化研究所) College of Education, Beijing Sport University, Beijing, China(北京体育大学) KuTi Sports Technology, Shaanxi, China(KuTi体育科技) Haoxiong Technology, Shanghai, China(浩鸿科技)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SportsGPT通过结合大语言模型和运动分析技术,实现可解释的体育动作评估与专业训练指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10689 2025-12-22 cs.CL 85%

Learning to Contextualize Web Pages for Enhanced Decision Making by LLM Agents

通过LLM代理增强决策的网页上下文化学习

Dongjun Lee, Juyong Lee, Kyuyoung Kim, Jihoon Tack, Jinwoo Shin, Yee Whye Teh, Kimin Lee

机构 * KAIST AI(韩国科学技术院人工智能实验室) University of Oxford(牛津大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 LCoW通过上下文化学习提升LLM代理在网页自动化任务中的决策能力,显著提高闭源和开源模型的成功率。

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03735 2025-12-22 cs.LG cs.AI cs.CR cs.CY 84%

Privacy Bias in Language Models: A Contextual Integrity-based Auditing Metric

语言模型中的隐私偏误:基于情境完整性的一种审计度量

Yan Shvartzshnaider, Vasisht Duddu

机构 * York University(约克大学) University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于情境完整性的方法,用于评估语言模型的隐私偏误,探讨其影响因素及评估方法。

Comments Privacy Enhancing Technologies Symposium (PETS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18883 2025-12-22 cs.SE cs.LG 81%

Predictive Prompt Analysis

预测提示分析

Jae Yong Lee, Sungmin Kang, Shin Yoo

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出预测提示分析方法,通过稀疏自编码器快速分析提示并预测LLM响应,提升LLM在软件开发中的应用效率。

Comments Accepted by FSE 2025, 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17259 2025-12-22 cs.MA cs.AI cs.LG 81%

Verifiability-First Agents: Provable Observability and Lightweight Audit Agents for Controlling Autonomous LLM Systems

可验证性优先代理:可证明的可观测性和轻量级审计代理用于控制自主大语言模型系统

Abhivansh Gupta

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种以可验证性为核心的代理架构,通过加密和符号方法实现运行时认证,嵌入轻量级审计代理并采用挑战-响应协议,以提高自主大语言模型系统的可控性和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15952 2025-12-22 cs.CV cs.AI 79%

VideoGameQA-Bench: Evaluating Vision-Language Models for Video Game Quality Assurance

VideoGameQA-Bench: 评估用于视频游戏质量保证的视觉-语言模型

Mohammad Reza Taesiri, Abhijay Ghildyal, Saman Zadtootaghaj, Nabajeet Barman, Cor-Paul Bezemer

机构 * University of Alberta(阿尔伯塔大学) Sony Interactive Entertainment(索尼互动娱乐)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 VideoGameQA-Bench是一个用于评估视觉-语言模型在视频游戏质量保证中性能的综合基准,涵盖视觉测试、故障检测和bug报告生成等多种任务。

Comments Project website with code and data: https://asgaardlab.github.io/videogameqa-bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12508 2025-12-22 cs.CL cs.AI cs.SD eess.AS 79%

Fun-ASR Technical Report

Fun-ASR 技术报告

Keyu An, Yanni Chen, Zhigao Chen, Chong Deng, Zhihao Du, Changfeng Gao, Zhifu Gao, Bo Gong, Xiangang Li, Yabin Li, Ying Liu, Xiang Lv, Yunjie Ji, Yiheng Jiang, Bin Ma, Haoneng Luo, Chongjia Ni, Zexu Pan, Yiping Peng, Zhendong Peng, Peiyao Wang, Hao Wang, Haoxu Wang, Wen Wang, Wupeng Wang, Yuzhong Wu, Biao Tian, Zhentao Tan, Nan Yang, Bin Yuan, Jieping Ye, Jixing Yu, Qinglin Zhang, Kun Zou, Han Zhao, Shengkui Zhao, Jingren Zhou, Yanqiao Zhu

机构 * Tongyi Fun Team(通义Fun团队)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Fun-ASR 是一种基于大语言模型的语音识别系统,通过整合大量数据、大模型容量和强化学习,实现了在复杂语音识别场景中的最先进性能,并优化了实际部署需求。

Comments Authors are listed in alphabetical order. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏