arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-11 至 2025-12-11 共收录 33 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 33 篇

2512.08945 2025-12-11 cs.CL cs.AI 90%

The Linguistic Architecture of Reflective Thought: Evaluation of a Large Language Model as a Tool to Isolate the Formal Structure of Mentalization

反思性思维的语言架构:评估一个大语言模型作为隔离心理化形式结构的工具

Stefano Epifani, Giuliano Castigliego, Laura Kecskemeti, Giuliano Razzicchia, Elisabeth Seiwald-Sonderegger

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了大语言模型在再现心理化语言结构方面的能力,发现其在MBT轴线评估中表现出较高的一致性,但在整合内部状态和外部情境方面存在局限。

Comments 18 pages, 1 table, Project coordinator: Stefano Epifani

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09552 2025-12-11 cs.CL 89%

Systematic Framework of Application Methods for Large Language Models in Language Sciences

大型语言模型在语言科学中应用方法的系统框架

Kun Sun, Rong Wang

机构 * Tongji University, China(同济大学) University of Tübingen, Germany(图宾根大学) Institute of Natural Language Processing, University of Stuttgart, Germany(斯图加特大学自然语言处理研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出两个系统框架,指导LLMs在语言科学中的战略应用,通过方法选择和多阶段研究流程提升研究的可重复性和科学性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08936 2025-12-11 cs.HC cs.AI cs.CY 89%

A Principle-based Framework for the Development and Evaluation of Large Language Models for Health and Wellness

基于原则的大型语言模型在健康与健身领域开发与评估框架

Brent Winslow, Jacqueline Shreibati, Javier Perez, Hao-Wei Su, Nichole Young-Lin, Nova Hammerquist, Daniel McDuff, Jason Guss, Jenny Vafeiadou, Nick Cain, Alex Lin, Erik Schenck, Shiva Rajagopal, Jia-Ru Chung, Anusha Venkatakrishnan, Amy Armento Lee, Maryam Karimzadehgan, Qingyou Meng, Rythm Agarwal, Aravind Natarajan, Tracy Giest

机构 * Google Research(谷歌研究)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出基于原则的框架,用于系统评估LLM在健康与健身领域的应用,通过迭代开发生命周期整合综合评估技术,提升系统安全性和用户反馈的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09841 2025-12-11 cs.CL cs.CV cs.MM 88%

ChronusOmni: Improving Time Awareness of Omni Large Language Models

ChronusOmni: 提升 Omni 大语言模型的时间感知能力

Yijing Chen, Yihan Wu, Kaisi Guan, Yuchen Ren, Yuyue Wang, Ruihua Song, Liyun Ru

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光荣人工智能学院) Baichuan Inc.(百川科技公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 ChronusOmni 通过增强时间感知能力,提升音频视觉时间定位任务的性能,实现跨模态统一建模和细粒度推理。

Comments Code available at https://github.com/YJCX330/Chronus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09563 2025-12-11 cs.CL cs.AI 87%

System Report for CCL25-Eval Task 10: Prompt-Driven Large Language Model Merge for Fine-Grained Chinese Hate Speech Detection

CCL25-Eval任务10系统报告:基于提示的大型语言模型融合用于细粒度中文仇恨言论检测

Binglin Wu, Jiaxiu Zou, Xianneng Li

机构 * School of Economics and Management, Dalian University of Technology(经济管理学院,大连理工大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于提示的LLM融合框架,通过三阶段方法提升细粒度中文仇恨言论检测的性能。

Comments Accepted at CCL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04842 2025-12-11 cs.HC 87%

Charts-of-Thought: Enhancing LLM Visualization Literacy Through Structured Data Extraction

图表思维:通过结构化数据提取提升大语言模型的可视化素养

Amit Kumar Das, Mohammad Tarun, Klaus Mueller

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过结构化数据提取方法,图表思维显著提升了大语言模型在可视化任务上的表现,使其超越人类基准,同时为复杂视觉解释任务提供了新的基准。

Comments 11 pages, 8 figures. Accepted at IEEE VIS: Visualization & Visual Analytics 2025 conference, November 2-7, 2025, Vienna, Austria

Journal ref IEEE Transactions on Visualization and Computer Graphics (TVCG), PrePrints 5555, pp. 1-11, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09829 2025-12-11 cs.AI cs.LG 86%

RIFT: A Scalable Methodology for LLM Accelerator Fault Assessment using Reinforcement Learning

RIFT:一种利用强化学习的LLM加速器故障评估可扩展方法

Khurram Khalil, Muhammad Mahad Khaliq, Khaza Anuarul Hoque

机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) University of Missouri-Columbia(密苏里大学哥伦比亚分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 RIFT通过强化学习引导智能故障定位,实现高效LLM加速器故障评估,提升故障覆盖率与成本效益

Comments Accepted in the IEEE DATE 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09662 2025-12-11 cs.CL cs.AI 86%

Can LLMs Evaluate What They Cannot Annotate? Revisiting LLM Reliability in Hate Speech Detection

大语言模型能否评估它们无法标注的内容?重新审视大语言模型在仇恨言论检测中的可靠性

Paloma Piot, David Otero, Patricia Martín-Rodilla, Javier Parapar

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过主观性-aware框架重新评估大语言模型在仇恨言论检测中的可靠性,发现LLM生成的标注能反映模型性能趋势,可作为主观NLP任务的可扩展代理评估者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08934 2025-12-11 cs.HC cs.AI 85%

Motion2Meaning: A Clinician-Centered Framework for Contestable LLM in Parkinson's Disease Gait Interpretation

Motion2Meaning: 一种以临床为中心的可挑战LLM框架,用于帕金森病步态解读

Loc Phuc Truong Nguyen, Hung Thanh Do, Hung Truong Thanh Nguyen, Hung Cao

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学) University of New Brunswick(新 Brunswick大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Motion2Meaning通过结合可解释AI和可挑战LLM,为帕金森病步态解读提供透明、可审计的临床系统。

Comments Accepted at the 9th International Symposium on Chatbots and Human-Centered AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09187 2025-12-11 cs.MA cs.AI 85%

WOLF: Werewolf-based Observations for LLM Deception and Falsehoods

基于狼人游戏的LLM欺骗与虚假信息观测

Mrinal Agarwal, Saad Rana, Theo Sundoro, Hermela Berhe, Spencer Kim, Vasu Sharma, Sean O'Brien, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 评测与基准 :LLM(title,comments);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI

AI总结 WOLF通过狼人游戏构建多智能体社交推理基准,评估LLM在欺骗生成与检测中的能力,展示动态交互提升欺骗识别性能。

Comments Spotlight Multi-Turn Interactions in Large Language Models (MTI-LLM) Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09663 2025-12-11 cs.CV 85%

IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting

IF-Bench:基于生成视觉提示的多模态大语言模型在红外图像上的基准测试与增强

Tao Zhang, Yuyang Hong, Yang Xia, Kun Ding, Zeyu Zhang, Ying Wang, Shiming Xiang, Chunhong Pan

机构 * MAIS, Institute of Automation(自动化研究所信息处理中心) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Research Center of Aerospace Information, Institute of Automation(自动化研究所航空信息研究中心)

专题命中 评测与基准 :prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 IF-Bench通过生成视觉提示方法提升多模态大语言模型对红外图像的理解能力,提供首个高质量基准测试及实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09591 2025-12-11 cs.LG cs.AI 84%

Stanford Sleep Bench: Evaluating Polysomnography Pre-training Methods for Sleep Foundation Models

斯坦福睡眠基准:评估多导睡眠图预训练方法用于睡眠基础模型

Magnus Ruud Kjaer, Rahul Thapa, Gauri Ganjoo, Hyatt Moore, Poul Joergen Jennum, Brandon M. Westover, James Zou, Emmanuel Mignot, Bryan He, Andreas Brink-Kjaer

机构 * Stanford University(斯坦福大学) Technical University of Denmark(技术大学) Danish Center for Sleep Medicine(丹麦睡眠医学中心) University of Copenhagen(哥本哈根大学) Harvard Medical School(哈佛医学院)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 斯坦福睡眠基准通过大规模多导睡眠图数据集评估多种自监督预训练方法,提升睡眠分析的准确性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08959 2025-12-11 cs.LG cs.AI 82%

EEG-Bench: A Benchmark for EEG Foundation Models in Clinical Applications

EEG-Bench: 一个用于临床应用中EEG基础模型的基准测试

Ard Kastrati, Josua Bürki, Jonas Lauer, Cheng Xuan, Raffaele Iaquinto, Roger Wattenhofer

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 EEG-Bench为临床应用中的EEG基础模型提供了一个统一的基准测试框架,评估了11个诊断任务,并展示了简单模型在临床分布偏移下的竞争力。

Comments Foundation Models for the Brain and Body (BrainBodyFM@NeurIPS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23083 2025-12-11 cs.AI cs.LG cs.SE 80%

Smaller Models, Smarter Rewards: A Two-Sided Approach to Process and Outcome Rewards

更小的模型,更聪明的奖励:一种双面方法来处理和结果奖励

Jan Niklas Groeneveld, Xi Qin, Alexander Schaefer, Yaad Oren

机构 * University of California, Irvine(加州大学尔湾分校) SAP Lab(SAP实验室) Stanford Human-Centered AI Institution(斯坦福人本AI机构)

专题命中 评测与基准 :language model(abstract,comments);large language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种双面方法,利用小型语言模型生成高质量代码,通过融合过程和结果奖励,提升了代码生成的搜索能力。

Comments Accepted and presented at NeurIPS 2025 Workshop: Foundations of Reasoning in Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08998 2025-12-11 eess.IV cs.AI cs.CV 79%

DermETAS-SNA LLM: A Dermatology Focused Evolutionary Transformer Architecture Search with StackNet Augmented LLM Assistant

DermETAS-SNA LLM:一种专注于皮肤科的进化Transformer架构搜索与StackNet增强LLM助手

Nitya Phani Santosh Oruganty, Keerthi Vemula Murali, Chun-Kit Ngan, Paulo Bandeira Pinho

机构 * Data Science Program, Worcester Polytechnic Institute, Massachusetts, USA(沃斯特理工学院数据科学项目,马萨诸塞州,美国) Computer Science Department, Worcester Polytechnic Institute, Massachusetts, USA(沃斯特理工学院计算机科学系,马萨诸塞州,美国) PASE Advisory Group, New Jersey, USA(PASE顾问小组,新泽西州,美国)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 DermETAS-SNA LLM结合进化Transformer架构搜索与StackNet增强LLM,旨在提升皮肤病诊断的准确性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09209 2025-12-11 cs.NE 78%

Beyond Algorithm Evolution: An LLM-Driven Framework for the Co-Evolution of Swarm Intelligence Optimization Algorithms and Prompts

超越算法进化:一种基于LLM的群体智能优化算法与提示的协同进化框架

Shipeng Cen, Ying Tan

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出基于LLM的协同进化框架,用于优化群体智能算法与提示,提升复杂环境下的自动设计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17353 2025-12-11 cs.CE 78%

RoadBench: A Vision-Language Foundation Model and Benchmark for Road Damage Understanding

RoadBench: 一种用于道路损伤理解的视觉-语言基础模型和基准

Xi Xiao, Yunbei Zhang, Janet Wang, Lin Zhao, Yuxiang Wei, Hengjia Li, Yanshu Li, Xinyuan Song, Xiao Wang, Swalpa Kumar Roy, Hao Xu, Tianyang Wang

专题命中 评测与基准 :foundation model(title);language model(abstract)

AI总结 RoadBench通过整合视觉与文本信息,提出RoadCLIP模型,显著提升道路损伤识别性能,为基础设施监测提供新基准。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17228 2025-12-11 cs.IR 75%

DSEBench: A Test Collection for Explainable Dataset Search with Examples

DSEBench:一个用于可解释数据集搜索的测试集

Qing Shi, Jing He, Qiaosheng Chen, Gong Cheng

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 DSEBench是一个用于评估可解释数据集搜索任务的测试集,通过提供高质量的数据集和字段级别注释,支持评估DSE和ExDSE方法。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14499 2025-12-11 cs.CL cs.AI cs.LG 75%

Understanding World or Predicting Future? A Comprehensive Survey of World Models

理解世界还是预测未来?世界模型的全面综述

Jingtao Ding, Yunke Zhang, Yu Shang, Jie Feng, Yuheng Zhang, Zefang Zong, Yuan Yuan, Hongyuan Su, Nian Li, Jinghua Piao, Yucheng Deng, Nicholas Sukiennik, Chen Gao, Fengli Xu, Yong Li

机构 * Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(电子工程系,信息科学与技术国家研究中心(BNRist),清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了世界模型在理解与预测方面的功能,探讨了其在多个领域的应用及未来研究方向。

Comments Extended version of the original ACM CSUR paper, 49 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26415 2025-12-11 cs.CL 70%

Automatic Fact-checking in English and Telugu

英语和泰卢固语中的自动事实核查

Ravi Kiran Chikkala, Tatiana Anikina, Natalia Skachkova, Ivan Vykopal, Rodrigo Agerri, Josef van Genabith

机构 * Saarland University(萨尔兰大学) University of the Basque Country(巴斯克大学) German Research Center for Artificial Intelligence, Saarland Informatics Campus(德国人工智能研究中心,萨尔兰信息学校区) Faculty of Information Technology, Brno University of Technology(信息技术学院,布拉格技术大学) Kempelen Institute of Intelligent Technologies(Kempelen智能技术研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种双语事实核查方法,利用大型语言模型在英语和泰卢固语中对事实性声明进行真实性分类并生成证明。

Comments Proceedings of the First Workshop on Advancing NLP for Low Resource Languages associated with RANLP 2025 Varna Bulgaria September 13 2025 pages 140-151

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09573 2025-12-11 cs.CV 67%

Investigate the Low-level Visual Perception in Vision-Language based Image Quality Assessment

研究基于视觉-语言的图像质量评估中的低级视觉感知

Yuan Li, Zitang Sun, Yen-Ju Chen, Shin'ya Nishida

机构 * Graduate School of Informatics, Kyoto University(京都大学信息科学研究生院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文研究了基于视觉-语言模型的图像质量评估中低级视觉感知的问题,发现现有模型在检测基本失真时存在偏差,并通过改进视觉编码器对齐度提升失真识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09271 2025-12-11 cs.CV 67%

LongT2IBench: A Benchmark for Evaluating Long Text-to-Image Generation with Graph-structured Annotations

LongT2IBench: 一个用于评估长文本到图像生成的基准,具有图结构注释

Zhichao Yang, Tianjiao Gu, Jianjie Wang, Feiyu Lin, Xiangfei Sheng, Pengfei Chen, Leida Li

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 LongT2IBench通过图结构注释和LongT2IExpert提出,用于评估长文本到图像生成的对齐和解释能力。

Comments The paper has been accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02022 2025-12-11 cs.CV 67%

Do You See Me : A Multidimensional Benchmark for Evaluating Visual Perception in Multimodal LLMs

你看见我:一个多维基准用于评估多模态大语言模型的视觉感知

Aditya Kanade, Tanuja Ganu

机构 * Microsoft Research India(微软印度研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究提出‘你看见我’基准,评估多模态大语言模型的视觉感知能力,发现其在复杂任务中表现远低于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08965 2025-12-11 cs.LG cs.AI cs.CL 67%

Financial Instruction Following Evaluation (FIFE)

金融指令遵循评估(FIFE)

Glenn Matlin, Siddharth, Anirudh JM, Aditya Shukla, Yahya Hassan, Sudheer Chava

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FIFE是一个用于评估语言模型在金融分析任务中指令遵循能力的高难度基准,通过88个人撰写的提示和可验证约束系统,评估53个模型的性能,揭示了不同模型在复杂金融指令任务中的表现差异。

Comments Accepted at NeurIPS 2025 Generative AI in Finance Workshop (GenAI Finance), San Diego. Camera-ready version. Code and data: https://github.com/gtfintechlab/FIFE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09434 2025-12-11 cs.CL cs.AI 62%

CourtPressGER: A German Court Decision to Press Release Summarization Dataset

CourtPressGER:德国最高法院判决到新闻简报的摘要数据集

Sebastian Nagl, Mohamed Elganayni, Melanie Pospisil, Matthias Grabmair

机构 * Technical University of Munich (TUM)(慕尼黑技术大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 CourtPressGER数据集通过训练LLM生成准确的司法文本摘要,评估不同模型在处理长文本和保持可读性方面的性能差异。

Comments Preprint - This contribution was accepted at JURIX AI4A2J Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.05426 2025-12-11 cs.CL cs.LG 62%

Low-Dimensional Structure in the Space of Language Representations is Reflected in Brain Responses

语言表示空间中的低维结构反映在脑响应中

Richard Antonello, Javier Turek, Vy Vo, Alexander Huth

机构 * UT Austin(德克萨斯大学) Intel Labs(英特尔实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究揭示语言表示空间的低维结构,并通过fMRI验证其与大脑自然语言处理层次的关系。

Comments Accepted to the Advances in Neural Information Processing Systems 34 (2021) Revised to include voxel selection details

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08954 2025-12-11 cs.LG cs.AI 62%

An Electrocardiogram Multi-task Benchmark with Comprehensive Evaluations and Insightful Findings

带有全面评估和深入发现的心电图多任务基准

Yuhao Xu, Jiaying Lu, Sirui Ding, Defu Cao, Xiao Hu, Carl Yang

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) Bakar Computational Health Sciences Institute, University of California, San Francisco(加州大学旧金山分校巴卡计算健康科学研究所) Center for Data Science, School of Nursing, Emory University(埃默里大学护理学院数据科学中心) Department of Computer Science, University of Southern California(南加州大学计算机科学系)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究评估了基础模型在心电图分析中的有效性,发现其在ECG分析中达到80%的高性能,揭示了基础模型在生理波形分析中的潜力和局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11927 2025-12-11 cs.AI cs.CL 62%

Transparent and Coherent Procedural Mistake Detection

透明且一致的程序性错误检测

Shane Storks, Itamar Bar-Yossef, Yayuan Li, Zheyuan Zhang, Jason J. Corso, Joyce Chai

机构 * University of Michigan(密歇根大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种透明且一致的程序性错误检测方法,通过生成视觉自我对话的合理性来提高检测性能,并利用NLI模型制定自动化指标以评估生成的合理性一致性。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09577 2025-12-11 cs.HC cs.AI 57%

Auto-BenchmarkCard: Automated Synthesis of Benchmark Documentation

Auto-BenchmarkCard:自动化生成基准测试文档

Aris Hofmann, Inge Vejsbjerg, Dhaval Salwala, Elizabeth M. Daly

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 Auto-BenchmarkCard通过多智能体数据提取与大语言模型合成,自动化生成准确的AI基准测试文档,提升基准测试的透明性和可比性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14719 2025-12-11 cs.LG cs.AR cs.PL 57%

Tawa: Automatic Warp Specialization for Modern GPUs with Asynchronous References

Tawa: 为现代GPU自动实现扭曲专精与异步引用

Hongzheng Chen, Bin Fan, Alexander Collins, Bastian Hagedorn, Evghenii Gaburov, Masahiro Masuda, Matthew Brookhart, Chris Sullivan, Jason Knight, Zhiru Zhang, Vinod Grover

机构 * Cornell University(康奈尔大学) NVIDIA(英伟达)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 Tawa通过自动编译器实现GPU扭曲专精,利用异步引用抽象,提升LLM内核性能1.1-1.2倍,减少编程努力。

Comments Accepted to CGO'26

详情

展开后加载摘要…

URL PDF HTML 收藏