arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-28 至 2026-01-28 共收录 227 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 54 篇

2601.19435 2026-01-28 cs.GT cs.AI cs.CL 86%

Ad Insertion in LLM-Generated Responses

在大语言模型生成响应中插入广告

Shengwei Xu, Zhaohua Chen, Xiaotie Deng, Zhiyi Huang, Grant Schoenebeck

机构 * University of Michigan(密歇根大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了解耦广告插入与响应生成、以及竞价与用户查询的框架,通过基于类型拍卖机制实现近最优的社会福利,同时提高计算效率和上下文一致性。

Comments 31 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15098 2026-01-28 cs.CL cs.AI 86%

TextMineX: Data, Evaluation Framework and Ontology-guided LLM Pipeline for Humanitarian Mine Action

TextMineX: 用于人道主义排雷行动的数据集、评估框架及基于本体的LLM流水线

Chenyue Zhou, Gürkan Solmaz, Flavio Cirillo, Kiril Gashteovski, Jonathan Fürst

机构 * NEC Laboratories Europe(NEC欧洲实验室) University of Stuttgart(斯图加特大学) VAGO Solutions(VAGO解决方案) Zurich University of Applied Sciences(苏黎世应用科学大学) CAIR, Ss. Cyril and Methodius University of Skopje, North Macedonia(CAIR,斯科普耶塞尔维亚·梅托迪乌斯大学,北马其顿)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TextMineX通过构建首个HMA领域数据集和基于本体的LLM流水线,提升文本中领域知识的提取准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21372 2026-01-28 cs.LG cs.AI 86%

Improving LLM-based Global Optimization with Search Space Partitioning

通过搜索空间划分改进基于LLM的全局优化

Andrej Schwanke, Lyubomir Ivanov, David Salinas, Fabio Ferreira, Aaron Klein, Frank Hutter, Arber Zela

机构 * University of Freiburg(弗赖堡大学) ELLIS Institute Tübingen(图宾根ELLIS研究所) Prior Labs(Prior实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HOLLM通过搜索空间划分提升LLM在高维优化中的性能,有效平衡探索与利用,优于现有全局优化方法。

Comments 31 pages, 19 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19899 2026-01-28 cs.CL 85%

Evaluation of Oncotimia: An LLM based system for supporting tumour boards

对Oncotimia的评估:一种基于LLM的系统,用于支持肿瘤板

Luis Lorenzo, Marcos Montana-Mendez, Sergio Figueiras, Miguel Boubeta, Cristobal Bernardo-Castineira

机构 * Innovation Department, Bahía Software SLU(Bahía Software SLU创新部)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Oncotimia通过LLM自动完成肺癌肿瘤板表单,提高了效率并减少了文档负担。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19197 2026-01-28 cs.IR cs.AI 85%

HELM: A Human-Centered Evaluation Framework for LLM-Powered Recommender Systems

HELM:一种面向LLM推荐系统的以人为本的评估框架

Sushant Mehta

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HELM框架通过五个以人为本的维度评估LLM推荐系统,揭示传统指标无法捕捉的关键质量维度,并展示GPT-4在解释质量与交互自然性上的优势及流行度偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19106 2026-01-28 cs.SE cs.AI 85%

Detecting and Correcting Hallucinations in LLM-Generated Code via Deterministic AST Analysis

通过确定性AST分析检测和纠正LLM生成的代码中的幻觉

Dipin Khati, Daniel Rodriguez-Cardenas, Paul Pantzer, Denys Poshyvanyk

机构 * William & Mary(威廉玛丽大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过确定性AST分析检测并纠正LLM生成代码中的知识冲突幻觉,实现高精度和召回率的自动修复。

Comments Accepted to FORGE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18846 2026-01-28 cs.AI cs.NE 85%

LLM Driven Design of Continuous Optimization Problems with Controllable High-level Properties

基于大语言模型的连续优化问题可控高阶属性设计

Urban Skvorc, Niki van Stein, Moritz Seiler, Britta Grimme, Thomas Bäck, Heike Trautmann

机构 * Machine Learning and Optimization, Paderborn University, Germany(机器学习与优化,帕德博恩大学,德国) Leiden Institute of Advanced Computer Science, Leiden University, The Netherlands(莱顿先进计算机科学研究所,莱顿大学,荷兰) Data Management and Biometrics, University of Twente, The Netherlands(数据管理与生物特征,埃因霍温大学,荷兰)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型设计具有可控高阶属性的连续优化问题,通过生成函数并验证其结构特征,扩展了基准测试空间。

Comments 17 pages, accepted at EvoApplications 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15303 2026-01-28 cs.CR cs.AI cs.CY 79%

DSSmoothing: Toward Certified Dataset Ownership Verification for Pre-trained Language Models via Dual-Space Smoothing

DSSmoothing:通过双空间平滑实现预训练语言模型的认证数据集所有权验证

Ting Qiao, Xing Liu, Wenke Huang, Jianbin Li, Zhaoxin Fan, Yiming Li

机构 * North China Electric Power University(华北电力大学) Research Institute, China Unicom(中国联合研究院) Wuhan University(武汉大学) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 DSSmoothing通过双空间平滑在灰盒设置下实现预训练语言模型的数据集所有权验证,提供可证明的鲁棒性保证。

Comments To appear in WWW 2026. 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14401 2026-01-28 cs.MA cs.AI 79%

The Role of Social Learning and Collective Norm Formation in Fostering Cooperation in LLM Multi-Agent Systems

在LLM多智能体系统中,社会学习和集体规范形成促进合作的作用

Prateek Gupta, Qiankun Zhong, Hiromu Yakura, Thomas Eisenmann, Iyad Rahwan

机构 * Center for Humans and Machines(人类与机器中心) Max-Planck Institute for Human Development(人类发展马克斯·普朗克研究所)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出了一种无显式奖励信号的CPR模拟框架,通过社会学习和规范惩罚机制研究LLM多智能体系统中合作与规范的内生形成。

Comments Accepted at the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18827 2026-01-28 cs.SE cs.AI 79%

Automated structural testing of LLM-based agents: methods, framework, and case studies

基于大语言模型的智能体的自动化结构测试:方法、框架与案例研究

Jens Kohl, Otto Kruse, Youssef Mostafa, Andre Luckow, Karsten Schroer, Thomas Riedl, Ryan French, David Katz, Manuel P. Luitz, Tanrajbir Takher, Ken E. Friedl, Céline Laurent-Winter

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的智能体结构测试方法,通过跟踪、模拟和断言实现自动化测试,提升测试效率与质量。

Comments 10 pages, 5 figures. Preprint of an accepted paper at IEEE BigData 2025 (main track). Source code for the introduced methods and framework available at https://github.com/awslabs/generative-ai-toolkit

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17520 2026-01-28 cs.LG cs.CL 79%

MobileSafetyBench: Evaluating Safety of Autonomous Agents in Mobile Device Control

MobileSafetyBench: 评估移动设备控制自主代理的安全性

Juyong Lee, Dongyoon Hahm, June Suk Choi, W. Bradley Knox, Kimin Lee

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 MobileSafetyBench通过Android模拟器评估移动设备控制自主代理的安全性,揭示基于LLMs的代理在安全任务中存在缺陷,提出提示方法提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19583 2026-01-28 cs.SE 78%

Toward Architecture-Aware Evaluation Metrics for LLM Agents

迈向面向架构的LLM代理评估指标

Débora Souza, Patrícia Machado

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出了一种面向架构的LLM代理评估方法,通过连接代理组件与可观察行为及评估指标,提升评估的针对性和透明度。

Comments Accepted at CAIN 2026 (IEEE/ACM 5th International Conference on AI Engineering)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19239 2026-01-28 cs.SE 78%

LLM-based Vulnerability Detection at Project Scale: An Empirical Study

基于大语言模型的项目级漏洞检测:一项实证研究

Fengjie Li, Jiajun Jiang, Dongchi Chen, Yingfei Xiong

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文研究了基于LLM的项目级漏洞检测方法,发现其在召回率低的情况下仍能发现更多漏洞,但存在高误报率和计算成本问题。

Comments 19 pages, 13 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19029 2026-01-28 cs.SD eess.AS 78%

Audio Foundation Models Outperform Symbolic Representations for Piano Performance Evaluation

音频基础模型在钢琴演奏评估中优于符号表示

Jai Dhiman

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出使用音频基础模型在钢琴演奏评估中优于符号表示,通过实验验证音频模型在19个维度上的优越性。

Comments 6 pages, 4 figures, 2 tables. Code available at https://github.com/Jai-Dhiman/crescendai

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01509 2026-01-28 cs.CL 77%

PROPHET: An Inferable Future Forecasting Benchmark with Causal Intervened Likelihood Estimation

PROPHET:一个基于因果干预似然估计的可推断未来预测基准

Zhengwei Tao, Pu Wu, Zhi Jin, Xiaoying Bai, Haiyan Zhao, Chengfeng Dou, Xiancai Chen, Jia Li, Linyu Li, Chongyang Tao, Wentao Zhang

机构 * Peking University(北京大学) Wuhan University(武汉大学) Beihang University(北京航空航天大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PROPHET引入了基于因果干预似然估计的可推断未来预测基准,通过CIL评估预测问题的可推断性,提升未来事件预测的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18771 2026-01-28 cs.LG cs.SI 77%

Exploring Graph Learning Tasks with Pure LLMs: A Comprehensive Benchmark and Investigation

探索纯大语言模型在图学习任务中的应用:全面的基准测试与调查

Yuxiang Wang, Xinnan Dai, Wenqi Fan, Yao Ma

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Michigan State University(密歇根州立大学) The Hong Kong Polytechnic University(香港理工大学) Rensselaer Polytechnic Institute(纽约理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.LG

AI总结 本研究探讨纯大语言模型在图学习任务中的应用,通过全面的基准测试与分析,发现指令微调的LLMs在少样本设置中表现优异,具备强大的领域迁移能力和良好的泛化与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16435 2026-01-28 cs.CV cs.CL 77%

Human Cognitive Benchmarks Reveal Foundational Visual Gaps in MLLMs

人类认知基准揭示大规模多模态语言模型中的基础视觉缺陷

Jen-Tse Huang, Dasen Dai, Jen-Yuan Huang, Youliang Yuan, Xiaoyuan Liu, Wenxuan Wang, Wenxiang Jiao, Pinjia He, Zhaopeng Tu, Haodong Duan

机构 * CUHK(香港中文大学) PKU(北京大学) CUHKSZ(香港中文大学深圳分校) RUC(中国人民大学) Tencent(腾讯) SHLab(深圳实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 人类认知基准揭示大规模多模态语言模型在基础视觉能力上的不足,通过VisFactor评估发现模型在关键视觉任务上表现不佳。

Comments Update: Evaluated 23 SOTA MLLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18844 2026-01-28 cs.SE cs.AI 77%

Reducing False Positives in Static Bug Detection with LLMs: An Empirical Study in Industry

利用大语言模型减少静态bug检测中的误报:一项行业内的实证研究

Xueying Du, Jiayi Feng, Yi Zou, Wei Xu, Jie Ma, Wei Zhang, Sisi Liu, Xin Peng, Yiling Lou

机构 * Fudan University(复旦大学) Tencent(腾讯)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究利用大语言模型在腾讯企业环境中减少静态代码分析中的误报,通过实证研究展示LLM在工业场景下的高效性和成本效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15580 2026-01-28 cs.LG cs.CL 76%

Language Models are Symbolic Learners in Arithmetic

语言模型在算术中是符号学习者

Chunyuan Deng, Zhiqi Li, Roy Xie, Ruidi Chang, Hanjie Chen

机构 * Department of Computer Science(计算机科学系) Rice University(里士满大学) College of Computing(计算学院) Georgia Institute of Technology(佐治亚理工学院) Duke University(杜克大学)

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.LG

AI总结 本文研究语言模型在算术运算中通过学习符号捷径而非算法来掌握算术能力。

Comments TMLR 2026. Code at https://github.com/chili-lab/Symbolic-Arithmetic

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19532 2026-01-28 cs.AI cs.CL cs.LG 75%

Benchmarks Saturate When The Model Gets Smarter Than The Judge

基准在模型比裁判更智能时达到饱和

Marthe Ballon, Andres Algaba, Brecht Verbeken, Vincent Ginis

机构 * Data Analytics Lab, Vrije Universiteit Brussel(自由大学布鲁塞尔数据分析实验室) imec-SMIT, Vrije Universiteit Brussel(imec-SMIT,自由大学布鲁塞尔) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现当模型比裁判更智能时,基准测试的准确性下降,强调了高质量数据集和可靠裁判的重要性。

Comments 17 pages, 10 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19287 2026-01-28 cs.SE 75%

Understanding Dominant Themes in Reviewing Agentic AI-authored Code

理解代理AI生成代码的主导主题

Md. Asif Haider, Thomas Zimmermann

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了代理AI生成代码的评审主题,通过大规模实证分析发现,评审主要关注文档、重构和格式问题,而非功能正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23785 2026-01-28 cs.CL cs.AI cs.CY 73%

Meaning Is Not A Metric: Using LLMs to make cultural context legible at scale

意义并非一种度量:利用大语言模型在大规模AI社会技术系统中使文化背景可理解

Cody Kommers, Drew Hemment, Maria Antoniak, Joel Z. Leibo, Hoyt Long, Emily Robinson, Adam Sobey

机构 * The Alan Turing Institute(艾伦·图灵研究所) University of Edinburgh(爱丁堡大学) University of Colorado Boulder(科罗拉多大学丹佛分校) University of Chicago(芝加哥大学) University of Exeter(埃克塞特大学) University of Southampton(南安普顿大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了利用大语言模型在大规模AI系统中通过厚描述使文化背景可理解的挑战与方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01098 2026-01-28 cs.SE cs.AI cs.CL 73%

Towards Automated Smart Contract Generation: Evaluation, Benchmarking, and Retrieval-Augmented Repair

迈向自动智能合约生成:评估、基准测试与检索增强修复

Zaoyu Chen, Haoran Qin, Nuo Chen, Xiangyu Zhao, Lei Xue, Xiapu Luo, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Sun Yat-sen University(中山大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SolBench和RAR框架,通过基于执行的基准测试和检索增强修复方法,提升Solidity智能合约生成的准确性和效率。

Comments Accepted by FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19747 2026-01-28 cs.AR cs.AI cs.SE 70%

Veri-Sure: A Contract-Aware Multi-Agent Framework with Temporal Tracing and Formal Verification for Correct RTL Code Generation

Veri-Sure:一种具有时间追踪和形式验证的合同感知多智能体框架,用于正确RTL代码生成

Jiale Liu, Taiyu Zhou, Tianqi Jiang

机构 * School of Physics and Astronomy, The University of Edinburgh, Edinburgh, UK(物理与天文学院,爱丁堡大学,爱丁堡,英国) State Key Laboratory of Analog and Mixed-Signal VLSI, University of Macau, Macau(模拟与混合信号VLSI国家重点实验室,澳门大学,澳门) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, Shenzhen, China(科学与工程学院,香港中文大学(深圳))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Veri-Sure通过合同感知多智能体框架结合时间追踪与形式验证,实现高正确性的RTL代码生成,优于独立LLMs和传统智能体系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19333 2026-01-28 cs.LG cs.DS 70%

Metric $k$-clustering using only Weak Comparison Oracles

使用弱比较 oracle 的度量 k-聚类

Rahul Raychaudhury, Aryan Esmailpour, Sainyam Galhotra, Stavros Sintos

机构 * Duke University(杜克大学) University of Illinois Chicago(伊利诺伊大学香槟分校) Cornell University(康奈尔大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种使用弱比较 oracle 的 k-聚类算法,能够在噪声和成本受限的情况下实现高效的聚类效果。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19264 2026-01-28 cs.SE cs.LG 70%

Whitespaces Don't Lie: Feature-Driven and Embedding-Based Approaches for Detecting Machine-Generated Code

空格并不撒谎:基于特征和嵌入的方法用于检测机器生成的代码

Syed Mehedi Hasan Nirob, Shamim Ehsan, Moqsadur Rahman, Summit Haque

机构 * Computer Science and Engineering(计算机科学与工程) Shahjalal University of Science and Technology(沙赫拉尔大学科学与技术) University of Texas at El Paso(德克萨斯大学埃尔帕索分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于特征和嵌入的方法,用于区分人类和机器生成的代码,实验表明特征方法在可解释性和性能上表现优异,而嵌入方法在语义层面具有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19222 2026-01-28 cs.CV cs.AI 70%

UniPCB: A Unified Vision-Language Benchmark for Open-Ended PCB Quality Inspection

UniPCB: 一个统一的视觉-语言基准用于开放式PCB质量检测

Fuxiang Sun, Xi Jiang, Jiansheng Wu, Haigang Zhang, Feng Zheng, Jinfeng Yang

机构 * Shenzhen Polytechnic University(深圳职业技术大学) Southern University of Science and Technology(南方科技大学) University of Science and Technology Liaoning(辽宁科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 UniPCB提出一个统一的视觉-语言基准用于开放式PCB质量检测,通过系统化流程和PCB-GPT模型提升缺陷定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19189 2026-01-28 cs.LG 70%

Foresight Learning for SEC Risk Prediction

SEC风险预测的前瞻性学习

Benjamin Turtel, Paul Wilczewski, Danny Franklin, Kris Skotheim

机构 * Lightning Rod Labs(Lightning Rod实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究通过前瞻性学习方法,利用公开的SEC文件数据,训练出能预测风险实现概率的领域模型,实现了无需专有数据的自动化训练,并在概率准确性和校准上优于现有通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11478 2026-01-28 cs.HC cs.AI 70%

Designing and Evaluating a Conversational Agent for Early Diagnosis of Alzheimer's Disease and Related Dementias

设计并评估用于阿尔茨海默病及相关痴呆症早期诊断的对话代理

Andrew G. Breithaupt, Nayoung Choi, James D. Finch, Jeanne M. Powell, Arin L. Nelson, Oz A. Alon, Howard J. Rosen, Jinho D. Choi

机构 * Emory University(埃默里大学) University of California, San Francisco(加州大学旧金山分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文设计并评估了基于大型语言模型的对话代理,用于获取阿尔茨海默病及相关痴呆症患者的相关叙述,以支持早期诊断。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07295 2026-01-28 cs.CL 70%

CCFQA: A Benchmark for Cross-Lingual and Cross-Modal Speech and Text Factuality Evaluation

CCFQA:跨语言和跨模态语音与文本事实性评估基准

Yexing Du, Kaiyuan Liu, Youcheng Pan, Zheng Chu, Bo Yang, Xiaocheng Feng, Ming Liu, Yang Xiang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CCFQA是一个用于评估多模态大语言模型跨语言和跨模态事实性能力的基准,通过少样本迁移学习策略在多语言语音问答任务中取得与GPT-4o-mini-Audio相当的性能。

Comments Accepted in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏