arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12294 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2073 篇

2606.11357 2026-07-03 cs.DC cs.AI cs.AR cs.PF 新提交 90%

TileFuse: A Fused Mixed-Precision Kernel Library for Efficient Quantized LLM Inference on AMD NPUs

TileFuse:用于AMD NPU上高效量化LLM推理的融合混合精度内核库

Wesley Pang, Gregory Hyegang Jun, Feiyang Liu, Deming Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对边缘NPU上量化LLM部署困难,提出TileFuse库,通过融合解包、反量化与GEMM/GEMV内核,并设计交错预分块布局与数据流,在XDNA2上实现AWQ格式原生支持,性能提升最高281%,能耗降低64.6%。

Comments 13 pages excluding reference, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26595 2026-06-26 cs.AI 新提交 90%

LLM-based Models for Detecting Emerging Topics in Service Feedback

基于LLM的服务反馈中新兴主题检测模型

Mahsa Tavakoli, Ruth Bankey, Cristián Bravo

机构 * Department of Statistical and Actuarial Sciences, The University of Western Ontario(西安大略大学统计与精算科学系) Canada Revenue Agency(加拿大税务局)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种结合大语言模型、统计技术和人机协作的方法,用于检测服务反馈中的新兴质量主题,并揭示潜在服务不公,经税务专家评估优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24467 2026-06-24 cs.AI 新提交 90%

CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference

CompressKV: 面向资源高效长上下文LLM推理的语义检索引导KV缓存压缩

Xiaolin Lin, Jingcun Wang, Olga Kondrateva, Yiyu Shi, Bing Li, Grace Li Zhang

机构 * Technical University of Darmstadt(达姆施塔特工业大学) University of Notre Dame(圣母大学) Technical University of Ilmenau(伊尔梅瑙工业大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CompressKV框架,通过识别语义检索头(SRH)选择关键token并分层分配缓存预算,在仅用3% KV缓存时保留97%以上性能。

Comments arXiv admin note: substantial text overlap with arXiv:2508.02401

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23521 2026-06-23 cs.DC cs.LG 新提交 90%

Concordia: JIT-Compiled Persistent-Kernel Checkpointing for Fault-Tolerant LLM Inference

Concordia: 用于容错LLM推理的即时编译持久内核检查点

Yuhang Gan, Yiwei Yang, Yuyi Li, Xiangyu Gao, Yichen Wang, Rain Jiang, Xiaoning Ding, Andi Quinn, Chen Qian

机构 * University of California Santa Cruz(加州大学圣克ruz分校) University of California, Davis(加州大学戴维斯分校) University of Washington(华盛顿大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 针对LLM推理中GPU状态丢失问题,提出Concordia运行时,利用设备驻留持久内核实现JIT编译的增量检查点,支持PTX/SASS级插桩,无需修改应用代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22840 2026-06-23 cs.LG 新提交 90%

RLM-Cascade: Response-Level Speculative Decoding for Cost-Efficient LLM API Serving

RLM-Cascade:用于成本高效LLM API服务的响应级推测解码

Haifeng Wu, Srinivasan Manoharan, Fangbo Tu, Junhua Zhao, Jian Wan

机构 * PayPal

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 提出RLM-Cascade代理层系统,通过响应级推测解码降低LLM API成本,在真实编码工作负载上实现45.8%成本降低和1.83倍延迟加速,同时保持或超越基线质量。

Comments 9 pages, 1 figure, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20591 2026-06-23 cs.NI cs.AI 新提交 90%

Delay-Adaptive Speculation Control for Low-Latency Edge-Cloud LLM Inference

面向低延迟边缘-云LLM推理的延迟自适应推测控制

Kangkang Sun, Jianhua Li, Xiuzhen Chen, Junyi He, Minyi Guo

机构 * Shanghai Key Laboratory of Integrated Administration Technologies for Information Security, School of Computer Science, Shanghai Jiao Tong University(上海信息安全集成管理技术重点实验室,上海交通大学计算机科学学院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(深圳大学理学院,香港中文大学(深圳))

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对分布式边缘-云推理中推测解码的草稿长度在线控制问题,提出延迟单调阈值最优策略,并设计在线算法UCB-SpecStop,在真实测试台上验证了相变预测,延迟降低达22.4%。

Comments 16 pages, 9 figures, submitted to an IEEE journal for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20577 2026-06-23 cs.NI cs.AI cs.DC 新提交 90%

Human-Less LLM Serving: Quantifying the Human Tax on Throughput

无人类交互的LLM服务:量化吞吐量中的人类税

Jianhui Lian, Li Chen, Dan Li, Yong Jiang

机构 * Tsinghua SIGS(清华大学SIGS) Beijing Zhongguancun Laboratory(北京中关村实验室) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究通过系统测量发现,为满足人类感知延迟的SLO(TTFT和TPOT),LLM服务系统在长上下文场景下牺牲了60-93%的吞吐量,并提出无人类交互服务模式以消除这一开销。

Comments 10 pages, 2 figures, 1 table. Preliminary work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20373 2026-06-19 cs.SE cs.AI 新提交 90%

AutoPass: Evidence-Guided LLM Agents for Compiler Performance Tuning

AutoPass:基于证据的LLM智能体用于编译器性能调优

Zepeng Li, Jie Ren, Zhanyong Tang, Jie Zheng, Zheng Wang

机构 * Shaanxi Normal University(陕西师范大学) Northwest University(西北大学) University of Leeds(利兹大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AutoPass多智能体框架,通过查询编译器内部状态和中间表示,利用运行时反馈迭代优化编译选项,无需训练即可提升性能,在x86-64和ARM64上分别实现1.043倍和1.117倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20245 2026-06-19 cs.AI 新提交 90%

Navigating Unreliable Parametric and Contextual Knowledge: Explicit Knowledge Conflict Resolution for LLM Inference

导航不可靠的参数化与上下文知识:面向LLM推理的显式知识冲突解决

Huang Peng, Jiuyang Tang, Weixin Zeng, Hao Xu, Xiang Zhao

机构 * National Key Laboratory of Big Data and Decision, National University of Defense Technology(国防科技大学大数据与决策国家重点实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MACR框架,通过自适应知识评估与多智能体推理,显式解决大语言模型内部参数知识与外部上下文之间的冲突,超越传统二元选择范式。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19755 2026-06-19 cs.CR cs.AI 新提交 90%

SafeSpec: Fast and Safe LLM via Dynamic Reflective Sampling

SafeSpec: 通过动态反射采样实现快速且安全的LLM

Haotian Xu, Zeyang Zhang, Linbao Li, Huadi Zheng, Yu Li, Cheng Zhuo

机构 * Zhejiang University, Hangzhou, China(浙江大学) Huawei(华为) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳))

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SafeSpec框架,将轻量安全头集成到推测解码的验证过程中,通过风险估计和反射采样恢复安全生成,在保持加速的同时显著降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19135 2026-06-18 cs.MA cs.AI cs.NI 新提交 90%

A Technical Taxonomy of LLM Agent Communication Protocols

LLM智能体通信协议的技术分类法

Linus Sander, Habtom Kahsay Gidey, Alexander Lenz, Alois Knoll

机构 * Technische Universität München(慕尼黑技术大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型智能体通信协议碎片化问题,提出包含五个维度的技术分类法,分析九种开源协议,揭示架构模式并预测协议演进趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18650 2026-06-18 cs.LG 新提交 90%

BLADE: Scalable Bi-level Adaptive Data Selection for LLM Training

BLADE: 面向LLM训练的可扩展双层自适应数据选择

Jiaxing Wang, Deping Xiang, Jin Xu, Zirui Liu, Zicheng Zhang, Guoqiang Gong, Jun Fang, Chao Liu, Pengzhang Liu, Tongxuan Liu, Ke Zhang, Qixia Jiang

机构 * University of Oxford(牛津大学) Renmin University of China(中国人民大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出BLADE框架,通过拉格朗日乘子将双层优化转化为单层惩罚目标,避免逆Hessian计算,实现动态参考模型,理论保证一阶收敛,实验优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18431 2026-06-18 cs.LG cs.DC 新提交 90%

Beyond Prediction: Tail-Aware Scheduling for LLM Inference

超越预测:面向LLM推理的尾延迟感知调度

Yueying Li, Yuanfan Chen, Jiayang Chen, Esha Choukse, Haoran Qiu, G. Edward Suh, Rodrigo Fonseca, Ziv Scully, Udit Gupta

机构 * Cornell University, Computer Science Department(康奈尔大学计算机科学系) Cornell University, Electrical and Computer Engineering Department(康奈尔大学电气与计算机工程系) Cornell University, Operations Research and Information Engineering Department(康奈尔大学运筹学与信息工程系) Microsoft Azure System Research(微软Azure系统研究) NVIDIA Corporation(英伟达公司)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 针对LLM推理中长度预测调度在分布偏移和尾延迟控制上的脆弱性,提出无预测的分布感知调度框架,通过轻量统计信号实现软优先级提升,结合缓存感知抢占,在多种工作负载下将P99 TTLT降低35-50%,TTFT降低34-47%。

Journal ref Forty-Third International Conference on Machine Learning (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17915 2026-06-17 cs.MA cs.AI cs.DB cs.SE 新提交 90%

Trustworthy Self-Composable Big-Data-as-a-Service: An LLM-Orchestrated Multi-Agent Framework for Automated Data Engineering, AutoML, MLOps Deployment, and Drift-Aware Lifecycle Optimization

可信赖的自组合大数据即服务:一种LLM编排的多智能体框架,用于自动化数据工程、AutoML、MLOps部署和漂移感知生命周期优化

Aueaphum Aueawatthanaphisut, Badri Raj Lamichhane

机构 * School of Information, Computer, and Communication Technology(信息、计算机与通信技术学院) Sirindhorn International Institute of Technology, Thammasat University(素金国际技术研究所,泰国 Thammasat 大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种基于LLM编排的多智能体BDaaS框架,通过分解生命周期为专用智能体并协调执行,实现自动化数据工程、AutoML、MLOps部署和漂移感知优化,提升生命周期级可靠性。

Comments 7 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17666 2026-06-17 cs.SE cs.AI 新提交 90%

FacProcessTwin: An LLM-Based System for Process Twin Development

FacProcessTwin: 一种基于LLM的流程孪生开发系统

Yash Pulse, Yong-Bin Kang, Abhik Banerjee, Prem Prakash Jayaraman

机构 * Swinburne University of Technology(斯winburne大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出FacProcessTwin系统,利用大语言模型从工厂文档和操作员自然语言输入中自动生成流程模型并绑定实时数据,通过交互式流程图实现人机协同治理,在食品制造案例中准确率达95.2%,开发时间缩短至人工的1/6。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17536 2026-06-17 cs.CV cs.AI 新提交 90%

OmniDrive: An LLM-Choreographed Multi-Agent World Model with Unified Latent Co-Compression for Multi-View Driving Video Generation

OmniDrive: 一种由LLM编排的多智能体世界模型,用于多视角驾驶视频生成的统一潜在协同压缩

Zijie Meng, Yufei Liu, Chengqian Ma, Zhiyu Li, Jiyuan Liu, Wenhua Nie, Bingcai Wei, Shuqin Chen, Weichen Xu, Jiquan Yuan, Miao Zhang

机构 * Peking University(北京大学) Xiamen University(厦门大学) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) National Taiwan University(国立台湾大学) Wuhan University(武汉大学) Wuhan University of Technology(武汉理工大学) Tsinghua University(清华大学) Jimei University(集美大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出DRIVE-CHOREO,一种由LLM编排的多智能体世界模型,通过三个Qwen2.5-VL智能体协同生成位置感知的潜在序列,并利用视图-时间置换与3D VAE协同压缩,实现可控多视角视频生成,在nuScenes上达到SOTA多视角一致性和BEV mAP 21.6。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16813 2026-06-16 cs.AI 新提交 90%

GIST-CMTF: Goal-State Inference for Causal Minimal Tool Filtering in LLM Agents

GIST-CMTF:LLM代理中因果最小工具过滤的目标状态推断

Rahul Suresh Babu, Rohit Shukla

机构 * Rahul Suresh Babu Rohit Shukla

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出GIST-CMTF层,通过预测候选符号目标状态并估计歧义性,解决工具增强LLM代理因用户请求多义性导致的错误目标执行问题,在120个任务上达到97.0%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16332 2026-06-16 cs.DC cs.AI cs.PF 新提交 90%

SMEPilot: Characterizing and Optimizing LLM Inference with Scalable Matrix Extensions

SMEPilot: 利用可扩展矩阵扩展表征和优化LLM推理

Feiyang Chen, Haibo Chen

机构 * IPADS, Shanghai Jiao Tong University(上海交通大学IPADS)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对CPU矩阵扩展单元与核心在LLM推理中的不匹配,提出SMEPilot引擎,通过基于屋顶线的表征指导算子执行选择,实现SME与CPU协同工作,端到端性能提升达3.94倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13968 2026-06-15 cs.DC cs.AI 新提交 90%

STREAM: Multi-Tier LLM Inference Middleware with Dual-Channel HPC Token Streaming

STREAM:具有双通道 HPC 令牌流的多层 LLM 推理中间件

Anas Nassar, Steve Mohr, Leonard Apanasevich, Himanshu Sharma

机构 * Advanced Cyberinfrastructure for Education and Research (ACER) University of Illinois Chicago(高级教育与研究计算基础设施(ACER)伊利诺伊大学芝加哥分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出 STREAM 系统,通过三层路由架构(本地、HPC、云)和双通道 HPC 流(控制平面与数据平面分离)实现亚秒级 TTFT,解决现有系统无法统一三种推理场景的问题。

Comments 6 pages, 1 figure, PEARC '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11806 2026-06-11 cs.CL 新提交 90%

External Experience Serving in Production LLM Systems: A Deployment-Oriented Study of Quality-Cost Trade-offs

生产级LLM系统中的外部经验服务:面向部署的质量-成本权衡研究

Lin Sun, Heming Zhang, Xiangzheng Zhang

机构 * Qiyuan Tech(奇元科技)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 研究生产级LLM系统中注入外部经验的质量-成本权衡,发现选择性检索优于全局注入,且检索质量比增加Top-K更重要,成本效益因任务输出长度而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11379 2026-06-11 cs.AI 新提交 90%

Automated Mediator for Human Negotiation: Pre-Mediation via a Structured LLM Pipeline

人类谈判的自动调解器:通过结构化LLM流水线进行预调解

Jamie Bergen, Sarit Kraus

机构 * University of Washington(华盛顿大学) University of Haifa(海法大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种结构化LLM流水线作为自动调解器,在整合性谈判中支持预调解,通过分解准备任务为专用模块,在短期自我报告结果上与人类调解员相当,并在偏好推理任务上误差降低36%。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10861 2026-06-10 cs.SE cs.AI cs.HC 新提交 90%

From Perception to Action: Can UI Interventions Foster Sustainable LLM Chatbot

从感知到行动:UI干预能否促进可持续的LLM聊天机器人

Nitish Patkar, Pooja Rani, Jack Glässer, Simon Lüscher, Martin Kropp

机构 * University of Applied Sciences and Arts Northwestern Switzerland (FHNW)(瑞士西北应用科学与艺术大学(FHNW)) University of Mannheim(曼海姆大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 研究通过UI干预(如模式切换、能耗反馈)提升用户对LLM聊天机器人能耗的感知,并鼓励节能行为,发现模式切换是主要行为机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09551 2026-06-09 cs.CR cs.AI 新提交 90%

FuseFSS: Efficient Secure LLM Inference with Function Secret Sharing

FuseFSS:基于函数秘密共享的高效安全LLM推理

Yuhan Ma, Yong Li, Stefan Schmid

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出FuseFSS编译器,通过统一编译流水线替代逐算子协议设计,实现安全推理中非线性与辅助操作的高效处理,在BERT和GPT模型上取得1.24-1.50倍加速并减少通信与预处理开销。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09084 2026-06-09 cs.CR cs.AI 新提交 90%

Context-Fractured Decomposition Attacks on Tool-Using LLM Agents: Exploiting Artifact Provenance Gaps

上下文碎片化解构攻击:利用工具使用LLM代理的工件来源鸿沟

Xiaofeng Lin, Yukai Yang, Daniel Guo, Sahil Arun Nale, Charles Fleming, Guang Cheng

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对工具使用LLM代理,提出上下文碎片化解构(CFD)攻击,利用跨上下文工件来源鸿沟实现多步越狱,成功率提升高达28.3个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07846 2026-06-09 cs.DC cs.AI cs.MA 新提交 90%

Cost-Aware Speculative Execution for LLM-Agent Workflows: An Integrated Five-Dimension Method

成本感知的LLM-Agent工作流投机执行:一种综合五维方法

Faisal Fareed

机构 * AWS(亚马逊网络服务)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种五维投机执行方法,通过贝叶斯概率估计和成本定价,在LLM-Agent工作流中平衡延迟与成本,并确保无副作用回滚。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13591 2026-08-17 cs.AI cs.CL 新提交 90%

Stable Miscalibration in Large Language Models: A Practical View of High-Confidence Errors

大语言模型中的稳定校准误差:高置信度错误的实用视角

Akira Okutomi

机构 * ToppyMicroServices OÜ

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出稳定校准误差概念,结合两类诊断方法,发现自我批判提示可降低模型隐藏状态敏感性,但高置信度错误未必是推理脆弱,部分或为稳定校准不当。

Comments Accepted at the 2nd Workshop on Epistemic Intelligence in Machine Learning (EIML)@ICML 2026. 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13580 2026-08-17 cs.CL cs.AI 新提交 90%

Jais 2: A Family of Arabic-Centric Open Large Language Models

Jais 2:以阿拉伯语为核心的开源大语言模型家族

Mohamed Anwar, Abed Alhakim Freihat, George Ibrahim, Mostafa Awad, Abdelrahman Sadallah, Gurpreet Gosal, Gokulakrishnan Ramakrishnan, Sarath Chandran, Biswajit Mishra, Rituraj Joshi, Ahmed Frikha, Etienne Goffinet, Abhishek Maiti, Ali El Filali, Sarah AlBarri, Samujjwal Ghosh, Rahul Pal, Parvez Mullah, Awantika Shukla, Sajid siddiki, Samta Kamboj, Onkar Pandit, Sunil Kumar Sahu, AbdelRahman Elbadawy, Amr Mohamed, Ahmad Chamma, Evan Dufraisse, Abdelaziz Bounhar, Dani Bouch, Hadi Abdine, Guokan Shang, Fajri Koto, Yuxia Wang, Zhuohan Xie, Ali Mekky, Rania Elbadry, Sarfraz Ahmad, Momina Ahsan, Omar El Herraoui, Daniil Orel, Hasan Iqbal, Kareem Elzeky, Mervat Abassy, Kareem Elozeiri, Saadeldine Eletter, Farah Atif, Nurdaulet Mukhituly, Haonan Li, Xudong Han, Aaryamonvikram Singh, Zainul Abedien Ahmed Quraishi, Neha Sengupta, Larry Murray, Avraham Sheinin, Joel Hestness, Natalia Vassilieva, Hector Xuguang Ren, Zhengzhong Liu, Michalis Vazirgiannis, Preslav Nakov

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 Jais 2是MBZUAI等联合开发的以阿拉伯语为核心的开源大语言模型家族,含70B、8B参数变体,在阿拉伯语及文化相关基准上表现领先,已开源并部署为多平台聊天应用,可支撑相关研究开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00019 2026-08-04 cs.LG cs.AI 新提交 90%

Uncertainty-Aware Simulation-Based Inference for Operations Research with Large Language Models

面向运筹学的基于模拟的不确定性感知大语言模型推理

Liang Guo, Lin Shaochong, Shen Zuo-Jun Max, Zhang Kun

机构 * Institute of Statistics and Big Data, Renmin University of China(中国人民大学统计与大数据研究院) The University of Hong Kong(香港大学) School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文针对大语言模型用于运筹学建模时的短视策略易引发下游错误的问题,提出一种不确定性感知无训练推理框架,通过短前瞻模拟与重要性重采样提升OR公式生成的可靠性,在多基准上表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18280 2026-07-22 cs.LG cs.AI 新提交 90%

Beyond Single-Dimensional Compression: The Compound Sparsity Frontier of Large Language Models

超越单维压缩:大语言模型的复合稀疏前沿

Chao Han, Haozhe Hu, Xiaoyu Shen

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究院,东方理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型压缩,提出复合稀疏框架,结合静态参数剪枝和动态令牌级计算,通过低秩近似、通道剪枝及引入轻量级路由器实现。实验表明其在相同总稀疏度下优于单机制压缩,揭示跨维度干扰及有效分配方式,为改进压缩提供实用途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16243 2026-07-21 cs.LG cs.AI 新提交 90%

RobustMAD: Evaluating Real-World Robustness of Multimodal Small Language Models for Deployable Anomaly Detection Assistants

RobustMAD:评估用于可部署异常检测助手的多模态小语言模型的现实世界鲁棒性

Anushiya Arunan, Xin Li, Yan Qin, U-Xuan Tan, Nhu Khue Vuong, Xiaoli Li, Chau Yuen

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) Nanyang Technological University(南洋理工大学) Chongqing University(重庆大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对多模态小语言模型现场部署的鲁棒性评估问题,开发RobustMAD基准测试,通过多种开放式查询评估模型,发现最佳模型虽有潜力但仍存差距及三种失败模式,为下一代多模态工业检测助手设计提供指导。

Comments Accepted for publication in Transactions on Machine Learning Research (TMLR), 2026 at https://openreview.net/forum?id=skrA9UYNIZ

详情

展开后加载摘要…

URL PDF HTML 收藏