arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-04 至 2026-03-04 共收录 55 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 55 篇

2603.02528 2026-03-04 cs.AI cs.RO 92%

LLM-MLFFN: Multi-Level Autonomous Driving Behavior Feature Fusion via Large Language Model

LLM-MLFFN: 通过大语言模型的多级自动驾驶行为特征融合

Xiangyu Li, Tianyi Wang, Xi Cheng, Rakesh Chowdary Machineni, Zhaomiao Guo, Sikai Chen, Junfeng Jiao, Christian Claudel

机构 * Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校土木、建筑与环境工程系) Systems Engineering Program, Cornell University(康奈尔大学系统工程项目) Department of Electrical and Computer Engineering, University of Michigan(密歇根大学电气与计算机工程系) Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) School of Architecture, The University of Texas at Austin(德克萨斯大学奥斯汀分校建筑学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 LLM-MLFFN通过大语言模型的多级特征融合提升自动驾驶行为分类的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02482 2026-03-04 cs.LG cs.CL cs.CV cs.SD eess.AS 90%

MUSE: A Run-Centric Platform for Multimodal Unified Safety Evaluation of Large Language Models

MUSE:一种面向多模态统一安全评估的运行导向平台

Zhongxi Wang, Yueqian Lin, Jingyang Zhang, Hai Helen Li, Yiran Chen

机构 * Duke University(杜克大学) Virtue AI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 MUSE提出一种多模态统一安全评估平台,通过多轮攻击和跨轮模态切换技术,评估大型语言模型在不同模态下的安全性能。

Comments Submitted to ACL 2026 System Demonstration Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17558 2026-03-04 cs.CL 89%

A Survey of Query Optimization in Large Language Models

大型语言模型中查询优化的综述

Mingyang Song, Mao Zheng

机构 * Large Language Model Department(大语言模型部门)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型中查询优化的技术,提出查询优化生命周期框架、查询复杂度分类法及四个基本操作,分析了优化方法和挑战,为研究和实践提供指导。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00582 2026-03-04 cs.CL 89%

Super Research: Answering Highly Complex Questions with Large Language Models through Super Deep and Super Wide Research

超研究:通过超深和超宽研究利用大型语言模型解决高度复杂的问题

Yubo Dong, Nianhao You, Yuxuan Hou, Zixun Sun, Yue Zhang, Liang Zhang, Siyuan Zhao, Hehe Fan

机构 * College of Computer Science and Technology(计算机科学与技术学院) Ant Group(蚂蚁集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 通过超深和超宽研究,利用大型语言模型解决高度复杂问题,提供可验证的报告和审计协议,评估模型在复杂研究任务中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03047 2026-03-04 cs.CL cs.AI 88%

TrustMH-Bench: A Comprehensive Benchmark for Evaluating the Trustworthiness of Large Language Models in Mental Health

TrustMH-Bench: 一个用于评估大语言模型在心理健康领域可信度的综合基准

Zixin Xiong, Ziteng Wang, Haotian Fan, Xinjie Zhang, Wenxuan Wang

机构 * Renmin University of China, China(中国人民大学) Beijing University of Posts and Telecommunications, China(北京邮电大学) Hefei University of Technology, China(合肥工业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 TrustMH-Bench提出了一种综合基准,用于评估大语言模型在心理健康领域的可信度,揭示了现有模型在关键维度上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12843 2026-03-04 cs.CL cs.AI 88%

NutriBench: A Dataset for Evaluating Large Language Models on Nutrition Estimation from Meal Descriptions

NutriBench:一个用于评估大语言模型从餐食描述中估算营养的基准数据集

Andong Hua, Mehak Preet Dhaliwal, Laya Pullela, Ryan Burke, Yao Qin

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 NutriBench通过评估大语言模型在餐食描述中估算营养的能力,为营养估算提供了新的研究方向和应用可能性。

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03002 2026-03-04 cs.AI 88%

SpatialText: A Pure-Text Cognitive Benchmark for Spatial Understanding in Large Language Models

SpatialText: 一种纯文本的认知基准,用于大型语言模型中的空间理解

Peiyao Jiang, Zequn Qin, Xi Li

机构 * Zhejiang University(浙江大学) School of Software Technology, Zhejiang University(软件技术学院,浙江大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 SpatialText通过双源方法为大型语言模型提供纯文本空间认知基准,揭示其在空间推理中的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03174 2026-03-04 cs.HC cs.CY 86%

AI as We Describe It: How Large Language Models and Their Applications in Health are Represented Across Channels of Public Discourse

人工智能如我们所描述:大型语言模型及其在健康领域的应用在公共话语渠道中的表现

Jiawei Zhou, Lei Zhang, Mei Li, Benjamin D Horne, Munmun De Choudhury

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

AI总结 研究分析了大型语言模型在健康领域应用在不同公共话语渠道中的表现,揭示了话语风格、信息内容和象征性表示的差异,强调了风险沟通不足和不同平台对应用和风险的关注差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03116 2026-03-04 cs.AI 85%

Beyond Task Completion: Revealing Corrupt Success in LLM Agents through Procedure-Aware Evaluation

超越任务完成:通过过程感知评估揭示LLM代理中的腐败成功

Hongliu Cao, Ilias Driouich, Eoin Thomas

机构 * Amadeus France(法国阿马代乌斯)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出过程感知评估框架,揭示LLM代理中隐藏的腐败成功,分析不同模型在任务执行中的失败模式及基准设计缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02949 2026-03-04 cs.SE cs.AI 85%

SEALing the Gap: A Reference Framework for LLM Inference Carbon Estimation via Multi-Benchmark Driven Embodiment

填补差距:通过多基准驱动的具身方法构建LLM推理碳估计的参考框架

Priyavanshi Pathania, Rohit Mehra, Vibhu Saujanya Sharma, Vikrant Kaulgud, Tiffani Nevels, Sanjay Podder, Adam P. Burden

机构 * Accenture Labs, India(Accenture实验室,印度) Accenture, India(Accenture,印度) Accenture, USA(Accenture,美国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SEAL通过多基准驱动方法实现LLM推理碳估计,为可持续性评估提供标准化基础。

Comments 5 pages. To be published in the proceedings of 48th International Conference on Software Engineering (ICSE '26), April 12-18, 2026, Rio de Janeiro, Brazil (New Ideas and Emerging Results Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02345 2026-03-04 cs.SE cs.AI cs.MA 85%

RIVA: Leveraging LLM Agents for Reliable Configuration Drift Detection

RIVA: 利用LLM代理进行可靠的配置漂移检测

Sami Abuzakuk, Lucas Crijns, Anne-Marie Kermarrec, Rafael Pires, Martijn de Vos

机构 * EPFL(瑞士洛桑联邦理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RIVA通过多代理系统和交叉验证技术,提高在工具响应错误时的IaC验证可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02297 2026-03-04 cs.CR cs.AI 85%

ZeroDayBench: Evaluating LLM Agents on Unseen Zero-Day Vulnerabilities for Cyberdefense

ZeroDayBench: 评估LLM代理在未见的零日漏洞上的能力以应对网络防御

Nancy Lau, Louis Sloot, Jyoutir Raj, Giuseppe Marco Boscardin, Evan Harris, Dylan Bowman, Mario Brajkovski, Jaideep Chawla, Dan Zhao

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ZeroDayBench评估了前沿LLM在未见零日漏洞上的自主修复能力,揭示了其在主动网络防御中的局限性及改进方向。

Comments Accepted to ICLR 2026 Workshop "Agents in the Wild"

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10902 2026-03-04 cs.LG stat.ML 85%

Auditing Information Disclosure During LLM-Scale Gradient Descent Using Gradient Uniqueness

在大规模语言模型梯度下降过程中通过梯度唯一性审计信息披露

Sleem Abdelghafar, Maryam Aliakbarpour, Chris Jermaine

机构 * Rice University(Rice大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出梯度唯一性指标,用于在大规模语言模型训练过程中审计信息披露风险,通过高效算法减少计算开销,并揭示披露风险的异质性分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02760 2026-03-04 cs.CL cs.AI 84%

Efficient Self-Evaluation for Diffusion Language Models via Sequence Regeneration

通过序列再生实现扩散语言模型的高效自评

Linhao Zhong, Linyu Wu, Wen Wang, Yuling Xi, Chenchen Jing, Jiaheng Zhang, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Zhejiang University of Technology(浙江工业大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DiSE方法,通过序列再生概率实现扩散语言模型的高效自评,提升质量评估的效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26254 2026-03-04 cs.CL 83%

Are Language Models Borrowing-Blind? A Multilingual Evaluation of Loanword Identification across 10 Languages

语言模型是否缺乏借词识别能力?对10种语言中借词识别的多语言评估

Mérilin Sousa Silva, Sina Ahmadi

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文探讨了预训练语言模型在多语言环境下识别借词的能力,发现模型在区分借词与本土词汇方面表现不佳,对少数语言NLP工具开发和语言保护有重要意义。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02540 2026-03-04 cs.AI 83%

A Neuropsychologically Grounded Evaluation of LLM Cognitive Abilities

基于神经心理学的大型语言模型认知能力评估

Faiz Ghifari Haznitrama, Faeyza Rishad Ardi, Alice Oh

机构 * School of Computing, KAIST, Daejeon, South Korea(韩国科学技术院计算机科学学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出NeuroCognition基准测试,通过神经心理学测试评估LLM的认知能力,揭示其在图像和复杂任务上的不足,并展示其改进LLM的潜力。

Comments 26 pages, 2 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03170 2026-03-04 cs.CR cs.AI 81%

AttackSeqBench: Benchmarking the Capabilities of LLMs for Attack Sequences Understanding

AttackSeqBench: 对LLM在攻击序列理解能力的基准测试

Haokai Ma, Javier Yong, Yunshan Ma, Kuei Chen, Anis Yusof, Zhenkai Liang, Ee-Chien Chang

机构 * National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 AttackSeqBench通过系统评估LLM在攻击序列理解中的能力,揭示其在网络安全领域的优势与局限。

Comments 27 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03111 2026-03-04 cs.CL 79%

Evaluating Performance Drift from Model Switching in Multi-Turn LLM Systems

评估多轮LLM系统中模型切换导致的性能漂移

Raad Khraishi, Iman Zafar, Katie Myles, Greig A Cowan

机构 * NatWest AI Research(NatWest人工智能研究院) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 研究评估了多轮LLM系统中模型切换导致的性能漂移,通过switch-matrix基准测试发现切换对对话质量有显著影响,并提出分解漂移因素以监控切换风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02542 2026-03-04 cs.AI 79%

AnchorDrive: LLM Scenario Rollout with Anchor-Guided Diffusion Regeneration for Safety-Critical Scenario Generation

AnchorDrive: 基于锚点引导扩散再生的LLM场景回放用于安全关键场景生成

Zhulin Jiang, Zetao Li, Cheng Wang, Ziwen Wang, Chen Xiong

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University, Shenzhen, China(中山大学智能系统工程学院,深圳,中国)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 AnchorDrive通过结合LLM的可控生成和扩散模型的真实轨迹生成,实现安全关键场景的高效合成,提升场景的真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03191 2026-03-04 cs.LG 79%

Tabular foundation model for GEOAI benchmark problems BM/AirportSoilProperties/2/2025

基于GEOAI基准问题的表格基础模型:BM/AirportSoilProperties/2/2025

Taiga Saito, Yu Otake, Stephen Wu

机构 * Department of Civil and Environmental Engineering, Tohoku University(土屋大学土木环境工程系) Research Organization of Information and Systems, The Institute of Statistical Mathematics(信息与系统研究所,统计数学研究所) The Graduate University for Advanced Studies, Department of Statistical Science(高级研究大学,统计科学系)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出基于TabPFN的表格基础模型,用于解决GEOAI基准问题中的土质现场表征任务,展示了其在预测精度和效率上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02655 2026-03-04 cs.CL cs.AI 79%

Real-Time Generation of Game Video Commentary with Multimodal LLMs: Pause-Aware Decoding Approaches

基于多模态大语言模型的实时游戏视频解说生成:暂停感知解码方法

Anum Afzal, Yuki Saito, Hiroya Takamura, Katsuhito Sudoh, Shinnosuke Takamichi, Graham Neubig, Florian Matthes, Tatsuya Ishigaki

机构 * School of CIT, Technical University of Munich(慕尼黑技术大学计算机信息学院) National Institute of Advanced Industrial Science(国家工业科学与技术研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出两种基于提示的解码方法,利用多模态大语言模型实现实时游戏视频解说生成,通过动态间隔调整提升时间相关性与内容准确性。

Comments Accepted at LREC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02236 2026-03-04 cs.LG cs.AI 79%

CUDABench: Benchmarking LLMs for Text-to-CUDA Generation

CUDABench: 评估用于文本到CUDA生成的LLM

Jiace Zhu, Wentao Chen, Qi Fan, Zhixing Ren, Junying Wu, Xing Zhe Chai, Chotiwit Rungrueangwutthinon, Yehan Ma, An Zou

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CUDABench是一个评估LLM文本到CUDA生成能力的基准测试,通过编译正确性、功能一致性和性能指标评估LLM在生成GPU程序中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03206 2026-03-04 cs.LG cs.AI cs.CL 78%

Understanding and Mitigating Dataset Corruption in LLM Steering

理解并缓解LLM引导中的数据集损坏

Cullen Anderson, Narmeen Oozeer, Foad Namjoo, Remy Ogasawara, Amirali Abdullah, Jeff M. Phillips

机构 * Department of Computer Science, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校计算机科学系) Kahlert School of Computing, University of Utah(犹他大学凯尔特计算学校)

专题命中 评测与基准 :LLM(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究对比引导在数据集损坏下的鲁棒性,发现其对中等损坏较稳健,但恶意篡改会引发副作用,通过替换高维均值计算为鲁棒估计器可缓解影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02926 2026-03-04 cs.CV 78%

GloPath: An Entity-Centric Foundation Model for Glomerular Lesion Assessment and Clinicopathological Insights

GloPath: 一种以实体为中心的肾小球病变评估与临床病理学洞察基础模型

Qiming He, Jing Li, Tian Guan, Yifei Ma, Zimo Zhao, Yanxia Wang, Hongjing Chen, Yingming Xu, Shuang Ge, Yexing Zhang, Yizhi Wang, Xinrui Chen, Lianghui Zhu, Yiqing Liu, Qingxia Hou, Shuyan Zhao, Xiaoqin Wang, Lili Ma, Peizhen Hu, Qiang Huang, Zihan Wang, Zhiyuan Shen, Junru Cheng, Siqi Zeng, Jiurun Chen, Zhen Song, Chao He, Zhe Wang, Yonghong He

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 GloPath是一种以实体为中心的基础模型,通过多尺度和多视角自监督学习,在大规模肾活检数据上训练,实现了肾小球病变的高精度评估和临床病理学洞察发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06567 2026-03-04 cs.CV cs.IR 78%

Leveraging Foundation Models for Content-Based Image Retrieval in Radiology

利用基础模型进行放射学中的基于内容的图像检索

Stefan Denner, David Zimmerer, Dimitrios Bounias, Markus Bujotzek, Shuhan Xiao, Raphael Stock, Lisa Kausch, Philipp Schader, Tobias Penzkofer, Paul F. Jäger, Klaus Maier-Hein

机构 * German Cancer Research Center (DKFZ) Heidelberg, Division of Medical Image Computing(德国癌症研究中心(DKFZ)海德堡分部医学影像计算部门) Faculty of Mathematics and Computer Science, Heidelberg University(海德堡大学数学与计算机科学学院) Medical Faculty Heidelberg, University of Heidelberg(海德堡大学医学学院) Department of Radiology, Charité - Universitätsmedizin Berlin(柏林夏里特医学院放射科) German Cancer Research Center (DKFZ) Heidelberg, Interactive Machine Learning Group(德国癌症研究中心(DKFZ)海德堡交互式机器学习小组)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出利用视觉基础模型进行放射学中的基于内容的图像检索,通过基准测试和深入分析,展示了其在无需额外训练下的有效性与通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00857 2026-03-04 cs.CL 77%

ManagerBench: Evaluating the Safety-Pragmatism Trade-off in Autonomous LLMs

ManagerBench: 评估自主大语言模型中的安全与务实之间的权衡

Adi Simhi, Jonathan Herzig, Martin Tutek, Itay Itzhak, Idan Szpektor, Yonatan Belinkov

机构 * Technion – Israel Institute of Technology(技术学院–以色列理工学院) Google Research(谷歌研究) University of Zagreb(Zagreb大学) Kempner Institute, Harvard University(哈佛大学凯普勒研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ManagerBench评估自主大语言模型在安全与务实权衡中的表现,揭示模型在冲突目标下的决策缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01562 2026-03-04 cs.AI 77%

RubricBench: Aligning Model-Generated Rubrics with Human Standards

RubricBench: 对齐模型生成的评分标准与人类标准

Qiyuan Zhang, Junyi Zhou, Yufei Wang, Fuyuan Lyu, Yidong Ming, Can Xu, Qingfeng Sun, Kai Zheng, Peng Kang, Xue Liu, Chen Ma

机构 * City University of Hong Kong(城市大学) Tencent Hunyuan(腾讯文英) MBZUAI McGill - Mila & Quebec AI Institute(麦吉尔-米拉与魁北克人工智能研究所) University of Illinois Springfield(伊利诺伊大学斯普林菲尔德分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RubricBench通过精心设计的基准测试,评估基于评分标准的评估可靠性,揭示模型生成评分标准与人类标注之间存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21646 2026-03-04 cs.CL 77%

Scalable Multilingual Multimodal Machine Translation with Speech-Text Fusion

可扩展的多语言多模态机器翻译与语音-文本融合

Yexing Du, Youcheng Pan, Zekun Wang, Zheng Chu, Yichong Huang, Kaiyuan Liu, Bo Yang, Yang Xiang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种语音引导的机器翻译框架,通过融合语音和文本提升多语言翻译性能,并在多个基准上取得新突破。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10833 2026-03-04 cs.LG 77%

SURFACEBENCH: A Geometry-Aware Benchmark for Symbolic Surface Discovery

SURFACEBENCH:一种面向几何的符号表面发现基准

Sanchit Kabra, Shobhnik Kriplani, Parshin Shojaee, Chandan K. Reddy

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SURFACEBENCH是一个面向几何的符号表面发现基准,通过多变量耦合、坐标变换和几何结构推断,评估不同方法在符号发现中的性能。

Comments TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02246 2026-03-04 eess.AS cs.SD 75%

Quality of Automatic Speech Recognition -- Polish Language case study -- from Wav2Vec to Scribe ElevenLabs

自动语音识别质量——波兰语言案例研究——从Wav2Vec到Scribe ElevenLabs

Marcin Pietroń, Szymon Piórkowski, Kamil Faber, Dominik Żurek, Michał Karwatowski, Jerzy Duda, Hubert Zieliński, Piotr Lipnicki, Mikołaj Leszczuk

机构 * Institute of Electronics AGH(电子研究所 AGH) Coraz Zdrowiej Department of Computer Science AGH(计算机科学系 AGH) Department of Management AGH(管理系 AGH) Department of Telecommunication AGH(电信系 AGH)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文比较了结合LLM的ASR模型在波兰语言医疗访谈中的表现,发现Whisper和Scribe模型在不同数据集上均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏