arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-20 至 2026-08-20 共收录 41 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 41 篇

2608.18503 2026-08-20 cs.LG 新提交 90%

LLM-Powered Predictive Decision-Making for Sustainable Data Center Operations

基于大语言模型的可持续数据中心运行预测决策

Hanzhao Wang, Jingxuan Wu, Yumeng Li, Yu Pan, Guanting Chen

机构 * The University of Sydney Business School, The University of Sydney(悉尼大学商学院,悉尼大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Purdue University(普渡大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究针对数据中心高能耗问题,提出基于LLM的预测调度系统,经合作验证可降低32%能耗、30%等待时间,为数据中心可持续运行提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18645 2026-08-20 cs.SE 新提交 89%

Code Health in LLM-Based Test Generation: Effectiveness and Token Efficiency

基于大语言模型的测试生成中的代码健康度:有效性与标记效率

Freya Wirdemann, Markus Borg, Nadim Hagatulah, Adam Tornhill

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究探究LLM生成单元测试的有效性随CodeScene的CodeHealth水平的变化,发现CH是测试有效性的微弱但一致信号,且与输入标记数负相关,证实可维护性与LLM软件开发存在关联。

Comments Accepted at the Engineering Track of the 26th IEEE International Conference on Source Code Analysis and Manipulation (SCAM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18108 2026-08-20 cs.CL cs.AI cs.HC cs.MA 新提交 89%

Same Facts, Different Updates: Inference Setup Shapes LLM Behavior in Medical Allocation

相同事实,不同更新:推理设置塑造医疗分配场景下大语言模型的行为

Spencer Gibson, Tyler Crosse, Magnus Saebo, Achyutha Menon, Eyon Jang, Diogo Cruz

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现,在医疗资源分配场景中,大语言模型的推理设置会导致其对相同患者信息产生不同的资源分配概率,凸显了谨慎将LLM系统纳入决策的重要性。

Comments Accepted to the AI4GOOD Workshop at ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18827 2026-08-20 cs.LG cs.AI cs.CL 新提交 89%

MLREF: Efficient Module Reuse for Reward Design in Reinforcement Learning via Large Language Models

MLREF:基于大语言模型的强化学习奖励设计中高效模块复用框架

Chenglin Liu, Xun Wang, Ruishuo Chen, Zhuoran Li, Longbo Huang

机构 * Institute for Interdisciplinary Information Sciences Tsinghua University(清华大学交叉信息研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对强化学习奖励设计瓶颈,提出MLREF框架,通过模块池复用奖励组件,结合三种优化机制,在17个任务上实现比强基线更优且更稳定的性能。

Comments 22 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18733 2026-08-20 cs.SE cs.AI cs.LG 新提交 88%

Flama: a Python framework for development and deployment of production-ready APIs, machine learning, and LLM services

Flama:用于开发和部署生产级API、机器学习及大语言模型服务的Python框架

José A. Perdiguero López, Miguel A. Durán-Olivencia

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 Flama是一款开源Python框架,基于ASGI构建,统一REST API开发、ML服务与LLM推理,含七大子系统及多项内置功能,可支持多后端LLM部署等场景。

Comments 83 pages, 6 figures, 1 table. Software available at https://github.com/vortico/flama, up-to-date documentation at https://flama.dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18149 2026-08-20 cs.AR cs.AI cs.DC cs.LG cs.PF 新提交 88%

TokenPowerSandbox: Evidence-Gated CPU-First Screening for Energy-Aware LLM Serving

TokenPowerSandbox:面向能源感知大语言模型服务的证据门控CPU优先筛选

Chenxu Niu

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 TokenPowerSandbox是面向能源感知LLM服务的证据门控CPU优先筛选工作流,结合CPU投影器、GPU探测等技术,在H100上评估Qwen2.5-7B-Instruct,验证了能源与延迟预测的关联及弃权门控的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18933 2026-08-20 cs.SE cs.AI 新提交 86%

SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution

SkillForge:面向项目特定问题解决的自蒸馏智能体

Silin Chen, Han Li, Xiaodong Gu, Yuling Shi, Haibing Guan

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SkillForge是一种主动从代码库获取项目特定知识的自蒸馏框架,通过合成问题蒸馏技能,可提升LLM智能体解决特定代码库软件问题的性能。

Comments Our code and data are available at https://github.com/cslsolow/SkillForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18884 2026-08-20 cs.AI 新提交 86%

Training-Free Inference-Time Self-Reflection and Cost-Bounded Early Stopping for Large Language Models

面向大语言模型的无训练推理时自我反思与成本受限早停机制

Wei Yu, Suxing Liu, Minjie Yu, Jiahao Wang, Zhijian Zheng, Haocheng Deng, Bing Li

机构 * School of Digital Arts, Jiangxi Arts & Ceramics Technology Institute(江西工艺美术职业技术学院数字艺术学院) School of Computing, Universiti Sains Malaysia(马来西亚理科大学计算机学院)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 本文提出无训练的推理时协议EvoResearcher,通过成本受限的自我反思实现大语言模型早停,在多个推理基准上验证其成本受限自我验证的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18263 2026-08-20 cs.LG stat.ML 新提交 86%

SIGMA: Symmetry-aware, Intelligent, Geometric, Multi-objective Adaptive Control for Robust, Dependable Traffic Management

SIGMA:面向鲁棒可靠交通管理的感知对称性、智能型、几何化多目标自适应控制

Pratham Payra, Jagadish B, Tanmay Sen, Tanujit Chakraborty

机构 * Indian Statistical Institute(印度统计研究所) Sorbonne University Abu Dhabi(阿布扎比索邦大学) Sorbonne Center for Artificial Intelligence(索邦人工智能中心) SQC & OR(统计质量控制与运筹学研究室)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出SIGMA框架,结合LLM实现自适应交通信号多目标控制,在SUMO仿真中较基准控制器降低等待与排队时长、提升通行量,且具备鲁棒性与统计可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19147 2026-08-20 cs.DC cs.AI cs.SE 新提交 85%

Pre-Compiled Pipeline Shards for Distributed LLM Inference on Intel AI PC Fleets

面向英特尔AI PC集群的分布式大语言模型推理的预编译流水线分片

Tate Berenbaum, Muthaiah Venkatachalam

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI

AI总结 本文提出基于预编译流水线分片的分布式LLM推理方案,借助OpenVINO优化、投机解码与微批处理,实现AI PC集群高效运行单设备无法承载的大模型,提升了吞吐量与交互速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00350 2026-08-20 cs.SE cs.AI 85%

OrcaLoca: An LLM Agent Framework for Software Issue Localization

Zhongming Yu, Hejia Zhang, Yujie Zhao, Hanxian Huang, Matrix Yao, Ke Ding, Jishen Zhao

机构 * University of California, San Diego, USA(加州大学圣迭戈分校) Intel Corporation(英特尔公司)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18339 2026-08-20 cs.CV cs.AI cs.CL cs.LG 新提交 85%

From Inference to Adaptation: A Unified Optimal Transport View of Vision Language Model

从推理到适应:视觉语言模型的统一最优传输视角

Qi Yu, Zhichen Zeng, Katherine Tieu, Xiyuan Yang, Ruizhong Qiu, Yuchen Yan, Lihui Liu, Yanjun Zhao, Lingjie Chen, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司) Wayne State University(韦恩州立大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出名为algname的VLM测试时适应方法,通过Wasserstein最优传输统一VLM的推理与适应目标,实验显示其性能较最优方法提升7%且效率先进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15509 2026-08-20 cs.CV cs.AI cs.LG 版本更新 84%

LLM-Driven AutoML for Cross-Lingual Handwritten OCR: Closed-Loop Neural Architecture Search with GPT-5, GPT-4o, and Claude Sonnet 4

用于跨语言手写OCR的基于大语言模型驱动的自动化机器学习:使用GPT-5、GPT-4o和Claude十四行诗4的闭环神经架构搜索

Mobina Kashaniyan, Amirhossein Ghassemi, Nasser Mozayani

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对跨语言手写OCR,提出用GPT-5等大语言模型驱动的自动化机器学习框架,能自主生成、训练等优化神经网络架构,经实验评估,该框架无需人工设计等就能发现高效准确模型,实现跨语言手写识别。

Comments 7 pages, 10 figures, and 2 tables. Published in the 2025 15th International Conference on Computer and Knowledge Engineering (ICCKE), IEEE

Journal ref 2025 15th International Conference on Computer and Knowledge Engineering (ICCKE), IEEE, 2025, Article No. 11273810

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18982 2026-08-20 cs.LG q-bio.BM q-bio.QM 新提交 83%

Monroe: A Molecular Foundation Model for In-Context Probabilistic Inference

Monroe:用于上下文概率推理的分子基础模型

Blazej Banaszewski, Andrew W. Fitzgibbon

机构 * Graphcore(格弗科(Graphcore)) Max Planck Institute of Biochemistry(马克斯·普朗克生物化学研究所)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出新的分子基础模型Monroe,通过多方面创新提升性能,在多个基准测试中表现优异,且其下游适应策略可推广至其他模型。

Comments Preprint; Open source weights and code

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18849 2026-08-20 cs.LG stat.ME stat.ML 新提交 83%

GEAR: Generative Expansion and Real Anchoring for Two-Stage Distillation of Tabular Foundation Models

GEAR:面向表格基础模型两阶段蒸馏的生成式扩展与真实锚定

Qi Qin, Jiajie Zhu, Dali Chen, Yuzhao Zhang, Jia-Xing Han, Yu Su, Peng Zhang, Ying Yan, Yifan Sun

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 GEAR是一种两阶段蒸馏框架,可将表格基础模型蒸馏为轻量级预测器,在TALENT和TabArena上的实验显示其能显著降低推理开销并提升AUC,性能优于多种基准模型。

Comments 9 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09253 2026-08-20 cs.CV cs.LG cs.MM 版本更新 83%

On the Robustness of Vision-Language Models in Zero-shot Privacy Classification

零样本隐私分类中视觉语言模型的鲁棒性研究

Alina Elena Baia, Alessio Xompero, Andrea Cavallaro

机构 * Idiap Research Institute(Idiap研究机构) Queen Mary University of London(伦敦女王学院) EPFL(瑞士联邦理工学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 本研究分析零样本设置下视觉语言模型(VLMs)用于图像隐私分类的可靠性,对比三类开源VLMs与专用模型的性能,发现VLMs鲁棒但精度低、速度慢,凸显专用隐私分类模型的优势。

Comments 15 pages, 6 figures, 3 tables. Paper accepted at the TrustDOC Workshop at ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18092 2026-08-20 cs.AI 新提交 81%

Position: Multi-Agent Systems Should Prioritize Concurrency Control

立场:多智能体系统应优先考虑并发控制

Xin Yang, Letian Li, Zimo Ji, Terry Jingchen Zhang, Wenyuan Jiang

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究指出基于LLM的多智能体系统的故障本质是并发控制问题,提出应将显式并发控制机制作为首要设计考量,以解决系统可靠性下降的问题。

Comments 16 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18272 2026-08-20 physics.geo-ph cs.AI cs.NE eess.SP 新提交 81%

SeisEvo: Evolution of Seismic Data Reconstruction Algorithms by Agents

SeisEvo:智能体驱动的地震数据重建算法演化

Yingjie Xu, Siwei Yu, Jianwei Ma

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出SeisEvo,以LLM驱动多智能体搜索演化地震重建算子,发现Evo-POCS、Evo-MSSA等算法,性能优于经典方法及基准,为地震数据处理提供可检查的显式算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19075 2026-08-20 cs.CV cs.AI cs.CL 新提交 81%

ReWEIGH the Evidence: Calibrating Token-Level Ordinal Visual Evidence to Mitigate Hallucinations in Large Vision-Language Models

重新权衡证据:校准令牌级有序视觉证据以减轻大型视觉语言模型的幻觉

Jihae Jeong, Junha Choi, Hwanjo Yu

机构 * Pohang University of Science and Technology (POSTECH)(浦项科技大学(POSTECH))

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 ReWEIGH是一种无需训练的解码干预方法,通过聚合视觉位置的令牌排名并施加有界惩罚,在多个7B至32B规模的LVLM上减少了最多21.3%的幻觉对象提及,且延迟增加极少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18095 2026-08-20 cs.CL cs.AI 新提交 81%

Backdoor Learning in Language Models and Vision-Language Models

语言模型与视觉-语言模型中的后门学习

Weimin Lyu

机构 * Stony Brook University(石溪大学) The Graduate School(研究生院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本论文针对NLP与VLMs面临的后门攻击安全威胁,研究了后门攻击的分析、检测与设计,并开发了适用于临床医学影像的多模态表示方法,助力可信AI与高效多模态学习。

Comments Ph.D. dissertation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18524 2026-08-20 cs.CL cs.AI cs.LG cs.MA 新提交 80%

DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents

DART-SD:面向多轮工具调用智能体自蒸馏的钻石拓扑感知检索与微调

Hangrui Xu, Jiarui Wang, Yang Yang, Chuanbo Zhu, Fangda Chen, Ziqi Wu, Jingming Cai, Yan Song

机构 * ByteDance(字节跳动) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文针对多轮工具调用智能体训练中的拓扑崩溃问题,提出DART-SD框架,通过建模拓扑、检索恢复参考与渐进自蒸馏提升策略多样性,性能优于传统全轨迹基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28147 2026-08-20 cs.CR 版本更新 80%

Agent Harness Distillation: Inference-Time Harness Extraction and Exploitation in Autonomous Multi-Agent Systems

智能体调控蒸馏:自主多智能体系统中的推理时调控提取与利用

Yu Cui, Wuli Yang, Yirui Shi, Junhao Xia, Hui Jiang, Lei Gao, Chenfu Bao

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AHD框架,将AMAS推理时调控提取形式化为新安全问题,实验证实其可提取调控致IP泄露,还提出对应欺骗防御,揭示AMAS新安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08319 2026-08-20 cs.CV cs.LG 版本更新 79%

A continually expandable foundation model for brain MRI

可持续扩展的脑MRI基础模型

Michail Mamalakis, Carmen Jimenez-Mesa, Yonghao Li, Hao Chen, Chao Li, Antonios Mamalakis, John Suckling, Richard Bethlehem, Stephen J. Price, Richard J. Gilbertson, Pietro Lio

机构 * University of Cambridge(剑桥大学) University of Málaga(马拉加大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出可扩展的Alcmaeon脑MRI基础模型,结合体积编码、潜在扩散生成与Graph-Blueprint Pruning,在跨临床领域扩展时遗忘程度更低,可支持多种任务,为持续发展的脑MRI基础模型提供了可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17117 2026-08-20 cs.CL cs.AI cs.IT math.IT 79%

From Tokens to Thoughts: How LLMs and Humans Trade Compression for Meaning

从标记到思考:LLMs和人类如何在压缩与意义之间进行权衡

Chen Shani, Liron Soffer, Dan Jurafsky, Yann LeCun, Ravid Shwartz-Ziv

机构 * Stanford University(斯坦福大学) Tel Aviv University(特拉维夫大学) New York University(纽约大学) Meta - FAIR

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过信息瓶颈框架比较人类与LLMs的概念结构,发现LLMs在压缩效率上优于人类,但牺牲了语义丰富性,揭示了人工与自然智能的本质差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12875 2026-08-20 cs.MA cs.SE 版本更新 78%

MetaInfer: A Knowledge Only LLM Inference Engine Generator SKILL Toolbox

MetaInfer:一个仅基于知识的大语言模型推理引擎生成器SKILL工具包

Zhenwen Miao, Honglin Wang, Mingheng Mi, Pu Wang, Chen Hu, Hai Zhang

专题命中 效率与部署 :LLM(title,abstract)

AI总结 研究针对大语言模型推理框架代码复杂、维护成本高的问题,提出MetaInfer方法,通过用户指定运行时约束,利用大语言模型驱动多智能体协作系统结合契约知识库自动生成定制推理框架,并从多视角评估,实现从显式知识生成可运行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18294 2026-08-20 stat.ME cs.AI cs.CL cs.LG stat.ML 新提交 75%

Debiased Inference for AI-Generated Data without Gold-Standard Labels: Identification via Multiple Imperfect Measurements

无黄金标准标签的AI生成数据的去偏推断:通过多个不完美测量进行识别

Naoki Egami, Sooahn Shin

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对无黄金标准标签的AI生成数据的下游分析偏差问题,提出DMM框架,结合多个不完美AI测量实现有效推断,经模拟验证其有效性与效率提升作用,还开发了条件独立性假设的诊断方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18114 2026-08-20 cs.CL cs.AI cs.LG eess.SP q-bio.NC 新提交 75%

Accurate Decoding of Natural Sentences from Non-Invasive Brain Recordings

从非侵入式脑记录中准确解码自然句子

Mingfang Zhang, Jarod Lévy, Cedric Rommel, Jérémy Rapin, Corentin Bel, Julie Bonnaire, Daniel Nieto, Pierre Bourdillon, Svetlana Pinet, Stéphane d'Ascoli, Thomas Moreau, Jean-Rémi King

机构 * Meta AI École Normale Supérieure(高等师范学院) Université PSL(巴黎文理大学) CNRS(法国国家科学研究中心) Hospital Foundation Adolphe de Rothschild(阿道夫·德·罗斯柴尔德医院基金会) Univ. Lille(里尔大学) Basque Center on Cognition, Brain and Language(巴斯克认知、大脑与语言中心) Paris Cité University(巴黎城市大学) Inria(法国国家信息与自动化研究所) Université Paris-Saclay(巴黎萨克雷大学) INSERM(法国国家健康与医学研究院) CEA(法国原子能和替代能源委员会)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出Brain2Qwerty v2模型,利用MEG记录解码自然句子,平均WER为39%,准确率随数据量提升,通过AI技术缩小非侵入式与颅内脑机接口的性能差距。

Comments Mingfang Zhang and Jarod Lévy contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19115 2026-08-20 cs.LG cs.MM 新提交 74%

Pretraining Reusable Inference Across Views with Synthetic Task Priors

利用合成任务先验预训练跨视图的可复用推理

Jielong Lu, Zhihao Wu, Jiajun Yu, Zhaoliang Chen, Haishuai Wang

机构 * Hong Kong Baptist University(香港浸会大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :pretraining(title);分类 cs.LG

AI总结 本文提出SIMPLE模型,将多视图推理预训练为可复用过程,在多视图与多组学基准上,其冻结变体具竞争力,轻量级适配器校准性能领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17823 2026-08-20 cs.LG cs.AI cs.HC 版本更新 73%

MotoSafety: Edge-AI with Learned Temporal Importance for Two-Wheeler Collision Risk Assessment Under Time Pressure

MotoSafety:结合学习到的时间重要性的边缘AI,用于时间压力下两轮车碰撞风险评估

Sumit S. Shevtekar, Chandresh K. Maurya, Gourab Sil, Subasish Das

机构 * Indian Institute of Technology Indore(印度理工学院印多尔分校) Texas State University(德克萨斯州立大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文针对时间压力下两轮车碰撞风险评估问题,提出基于学习到的时间重要性的边缘AI架构MotoSafety,在多数据集验证下性能优于基线模型,适合低成本边缘部署,还具备跨领域迁移能力。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18656 2026-08-20 cs.LG cs.PF 新提交 70%

FlashAttention for Scalable Vector Architectures

面向可扩展向量架构的FlashAttention

Sonia Rani Gupta, Nikela Papadopoulou, Miquel Pericàs

机构 * Chalmers University of Technology(查尔姆斯理工大学) University of Glasgow(格拉斯哥大学)

专题命中 效率与部署 :language model(abstract);small language model(abstract);分类 cs.LG

AI总结 本文提出面向可扩展向量架构的FlashAttention-V,将其集成到ggml并在多模型与平台上评估,该方法在预填充、解码阶段均实现显著加速,但Q8_0量化线性层的结构性瓶颈制约了长向量可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏