arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-04 至 2026-06-04 共收录 353 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 63 篇

2402.02555 2026-06-04 cs.CV cs.CL 70%

High-Quality Entity Segmentation and Grounding

高质量实体分割与定位

Lu Qi, Yi-Wen Chen, Tao Zhang, Xiangtai Li, Xu Yang, Bo Du, Ming-Hsuan Yang

机构 * Wuhan University(武汉大学) Insta360 Research(Insta360研究院) Department of EECS, University of California, Merced(加州大学默塞德分校电子工程与计算机科学系) Nanyang Technological University(南洋理工大学) Institute of Automation of the Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ESG流水线,通过新数据集EntitySeg和两阶段解耦设计(CropFormer高质量分割+GELLA精确名词提取与语义匹配),实现高质量实体分割与定位,在五项任务上有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05023 2026-06-04 cs.HC 67%

Scaling Expert Feedback with Reflective Edit Propagation in Compositional Knowledge Bases

在组合知识库中通过反思性编辑传播扩展专家反馈

Jiajing Guo, Xueming Li, Jorge Piazentin Ono, Wenbin He, Liu Ren

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出RAID系统,通过反思性代理推断专家编辑意图并自动传播到整个知识库,以规模化扩展专家反馈。

Comments Accepted to ACM CAIS '26 Demo Track

Journal ref ACM Conference on AI and Agentic Systems (CAIS '26), May 26-29, 2026, San Jose, CA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04716 2026-06-04 cs.SE 67%

The State of Peer Review in Empirical Software Engineering: A Community Survey on Review Load, Quality, and GenAI Use

实证软件工程中同行评审的现状:关于评审负荷、质量和生成式AI使用的社区调查

Justus Bogner, Roberto Verdecchia

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 通过对实证软件工程社区进行问卷调查(120份回复),研究了同行评审的负荷、质量、生成式AI使用问题及改进建议。

Comments Published in ACM SIGSOFT Software Engineering Notes (SEN), Volume 51, Issue 3, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04282 2026-06-04 cs.CV 67%

FindIt: A Format-Informed Visual Detection Benchmark for Generalist Multimodal LLMs

FindIt:面向通用多模态大语言模型的格式感知视觉检测基准

Eshika Khandelwal, Jingjing Pan, Mingfang Zhang, Quan Kong, Lorenzo Garattoni, Hilde Kuehne

机构 * Tuebingen AI Center, University of Tuebingen(图宾根人工智能中心,图宾根大学) Woven by Toyota, Inc.(丰田公司) Toyota Motor Europe(丰田欧洲公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出首个全面评估通用多模态大语言模型在可提示定位能力上的基准,涵盖四种核心任务,并标准化输入输出格式,揭示模型对格式约束的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03892 2026-06-04 cs.CL cs.AI cs.LG 67%

Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environments

合成与奖励——面向实时环境中多步骤工具使用的强化学习

Ibrahim Abdelaziz, Asim Munawar, Kinjal Basu, Maxwell Crouse, Chulaka Gunasekara, Suneet Katrekar, Pavan Kapanipathi

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PROVE框架,通过20个有状态MCP服务器、自动化数据合成流水线和多组件程序化奖励,解决多步骤工具调用中的环境构建、查询生成和奖励设计问题,在BFCL Multi-Turn、tau2-bench和T-Eval上分别提升最多+10.2、+6.8和+6.5分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01804 2026-06-04 eess.AS cs.SD 67%

SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing

SpeechEditBench:面向指令引导语音编辑的双语多属性基准

Hanlin Zhang, Daxin Tan, Dehua Tao, Xiao Chen, Haochen Tan, Linqi Song

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) AI Lab, Leibniz Research Center, Huawei(华为莱茵研究院人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出SpeechEditBench双语多属性基准,通过锚点评估协议衡量语音编辑中目标属性的修改成功与非目标属性的保持,发现现有模型在组合编辑任务上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04320 2026-06-04 cs.LG cs.AI 62%

OpenRFM: Dissecting Relational In-Context Learning

OpenRFM:剖析关系型上下文学习

Zhikai Chen, Junyu Yin, Jialiang Gu, Siheng Xiong, Xiaoze Liu, Ruowang Zhang, Keren Zhou, Kai Guo

机构 * Michigan State University(密歇根州立大学) Georgia Institute of Technology(佐治亚理工学院) Purdue University(普渡大学) George Mason University(乔治·马歇尔大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析关系型Transformer的模型和数据两方面问题,提出双阶段上下文学习架构和同质性感知预训练混合策略,构建OpenRFM模型,在关系型基础模型上平均任务性能提升约30%。

Comments 25 pages, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13672 2026-06-04 cs.CV cs.AI cs.LG 62%

SpurAudio: A Benchmark for Studying Shortcut Learning in Few-Shot Audio Classification

SpurAudio: 用于研究少样本音频分类中捷径学习的基准

Giries Abu Ayoub, Morad Tukan, Loay Mualem

机构 * Department of Computer Science, University of Haifa(海法大学计算机科学系) Independent Researcher(独立研究者) University of Stuttgart, Germany(斯图加特大学,德国) IMPRS-IS, Germany(智能系统国际Max Planck研究学校,德国)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出SpurAudio基准,通过控制音频中前景与背景的关联,评估少样本分类模型对虚假相关性的敏感性,发现现有方法在背景变化时性能显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05124 2026-06-04 cs.GR cs.CV cs.LG 57%

Geometry Gaussians: Decoupling Appearance and Geometry in Gaussian Splatting

几何高斯:在高斯泼溅中解耦外观与几何

Hongyu Zhou, Zorah Lähner

机构 * University of Bonn(波恩大学) Lamarr Institut(拉马尔研究所)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 针对3D高斯泼溅在几何表示与外观渲染间的冲突,提出通过为每个溅射添加几何不透明度参数并配合透明度优化流程,实现几何与外观的解耦,提升复杂场景(尤其是透明物体)的渲染与几何性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04970 2026-06-04 cs.CV cs.AI 57%

Plan, Watch, Recover: A Benchmark and Architectures for Proactive Procedural Assistance

计划、观察、恢复:主动式程序辅助的基准与架构

Kaustav Kundu, Ritvik Shrivastava, Maxim Arap, Nanshu Wang, Xianhui Zhu, Quintin Fettes, Gautam Tiwari, Parth Suresh, Théo Moutakanni, Alejandro Castillejo Munoz, Allen Bolourchi, Pascale Fung, Pinar Donmez, Babak Damavandi, Anuj Kumar, Seungwhan Moon

机构 * Meta Reality Labs(Meta现实实验室) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 提出EgoProactive数据集和Pro²Bench基准,并设计解耦规划器-交互架构,用于主动式程序辅助中的实时引导和异常恢复。

Comments 53 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04967 2026-06-04 cs.SE cs.AI 57%

From Prompt to Process: a Process Taxonomy and Comparative Assessment of Frameworks Supporting AI Software Development Agents

从提示到流程:支持AI软件开发智能体的框架流程分类与比较评估

Sanderson Oliveira de Macedo

机构 * Federal Institute of Goias(戈亚斯联邦理工学院)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 提出六维流程分类法,对六个AI软件开发框架进行评分比较,揭示流程深度与可移植性之间的结构性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04680 2026-06-04 eess.AS cs.CL cs.SD 57%

Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy

听你所写:基于声学差异的无参考假设评估

Zhihan Li, Hankun Wang, Yiwei Guo, Bohan Li, Xie Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, China(X-LANCE实验室、计算机科学学院、上海交通大学、中国) MoE Key Lab of Artificial Intelligence, Jiangsu Key Lab of Language Computing, China(人工智能MOE重点实验室、江苏省语言计算重点实验室、中国)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出READ指标,利用预训练自回归TTS模型计算语音与文本假设的声学差异,无需参考转录即可评估ASR假设,并在噪声条件下实现高达20%的相对错误率降低。

Comments Submitted to Interspeech 2026. 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05160 2026-06-04 cs.RO 50%

GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors

GRAIL: 从3D资产和视频先验生成人形机器人全身操作

Tianyi Xie, Haotian Zhang, Jinhyung Park, Zi Wang, Bowen Wen, Jiefeng Li, Xueting Li, Qingwei Ben, Haoyang Weng, Yufei Ye, David Minor, Tingwu Wang, Chenfanfu Jiang, Sanja Fidler, Jan Kautz, Linxi Fan, Yuke Zhu, Zhengyi Luo, Umar Iqbal, Ye Yuan

机构 * NVIDIA UCLA(加州大学洛杉矶分校)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出GRAIL全虚拟生成管线,利用3D资产和视频基础模型先验合成人机交互演示,无需物理搭建或遥操作,实现人形机器人全身操作策略的模拟到现实迁移。

Comments Project page: https://research.nvidia.com/labs/dair/grail/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04844 2026-06-04 cs.SD cs.CV 50%

Drift-Augmented Scoring: Text-Derived Noise Robustness for Zero-Shot Audio-Language Classification

漂移增强评分:文本驱动的零样本音频-语言分类噪声鲁棒性

Tu Vo, Sheir Zaheer, Chan Y. Park

机构 * Anonymous Authors(匿名作者)

专题命中 评测与基准 :language model(abstract)

AI总结 提出漂移增强评分(DAS),通过文本生成的噪声条件提示预测音频嵌入漂移方向,为每个类别添加奖励分数,在不增加梯度或测试时批处理的情况下,显著提升零样本音频分类在噪声下的准确率和mAP。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04545 2026-06-04 cs.CV 50%

Impostor: An Agent-Curated Benchmark for Realistic AIGC Manipulation Localization

Impostor:一个用于真实AIGC篡改定位的智能体策划基准

Zhenliang Li, Yutao Hu, Qixiong Wang, Wenpeng Du, Hongxiang Jiang, Jiasong Wu, Xiaolong Jiang, Jungong Han

机构 * Southeast University(东南大学) Xiaohongshu Inc.(小红书公司) Tsinghua University(清华大学)

专题命中 评测与基准 :language model(abstract)

AI总结 为解决现有图像篡改检测与定位基准在视觉真实感、篡改多样性和生成器覆盖方面的局限,提出了Impostor数据集和CraftAgent框架,并设计了PhaseAware-Net方法,在多个基准上取得优异性能。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04414 2026-06-04 cs.CV cs.MM 50%

Motion-Guided Causal Disentanglement for Robust Multi-View Cine Cardiac MRI Diagnosis

运动引导的因果解耦用于鲁棒多视角电影心脏MRI诊断

Chuankai Xu, Cristiane De Carvalho Singulane, Mohammad Abuannadi, Stephen Chandler, Jeremy Slivnick, Karolina Zareba, Jane Cao, Vidya Nadig, Fabio Fernandes, Seth Uretsky, Diego Perez de Arenaza, Amit Patel, Jianxin Xie

机构 * University of Virginia(弗吉尼亚大学) University of Chicago(芝加哥大学) Ohio State University(俄亥俄州立大学) St. Francis Hospital & Heart Center(圣弗朗西斯医院及心脏中心) Hartford HealthCare(哈特福德医疗集团) Instituto do Coração (InCor)(心脏研究所(InCor)) Atlantic Health System(大西洋健康系统) Sociedad Italiana de Beneficencia (Hospital Italiano)(意大利慈善协会(意大利医院))

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出运动引导的视角-疾病解耦框架MoViD,通过双分支监督对比学习和梯度反转对抗约束分离视角特定与疾病判别特征,结合无标注时间运动特征定位心脏区域并缓解类别不平衡,在静脉血栓数据集和两个公开基准上超越标准Transformer基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 64 篇

2510.21459 2026-06-04 cs.CR cs.CL cs.LG 92%

SBASH: a Framework for Designing and Evaluating RAG vs. Prompt-Tuned LLM Honeypots

SBASH:用于设计和评估RAG与提示调优的LLM蜜罐框架

Adetayo Adebimpe, Helmut Neukirchen, Thomas Welsh

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.LG

AI总结 提出SBASH框架,利用轻量级本地LLM和RAG技术构建蜜罐,通过多种指标评估RAG与提示调优对LLM蜜罐真实性和响应延迟的影响。

Comments to be published in: The 3rd International Conference on Foundation and Large Language Models (FLLM2025), IEEE, 2025

Journal ref 2025 3rd International Conference on Foundation and Large Language Models (FLLM), IEEE, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09719 2026-06-04 cs.CL cs.AI 92%

Bounded Hyperbolic Tangent: A Stable and Efficient Alternative to Pre-Layer Normalization in Large Language Models

有界双曲正切:大型语言模型中预层归一化的稳定高效替代方案

Hoyoon Byun, Youngjun Choi, Taero Kim, Sungrae Park, Kyungwoo Song

机构 * Yonsei University(延世大学) Upstage AI

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);LLM(abstract_cn)

AI总结 提出BHyT,通过有界双曲正切和数据驱动的输入约束替代Pre-LN,在保持稳定性的同时提升训练和推理效率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05004 2026-06-04 cs.CR cs.AI 90%

SharedRequest: Privacy-Preserving Model-Agnostic Inference for Large Language Models

SharedRequest: 面向大型语言模型的隐私保护模型无关推理

Peihua Mai, Xuanrong Gao, Youlong Ding, Xianglong Du, Wei Liu, Yan Pang

机构 * National University of Singapore (Chongqing) Research Institute(新加坡国立大学(重庆)研究院) Chongqing Key Laboratory of Trusted Perception and Interaction Technology for Intelligent and Connected Vehicles(重庆智能网联车辆可信感知与交互技术重点实验室) National University of Singapore(新加坡国立大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学) State Key Laboratory of Intelligent Vehicle Safety Technology, Chongqing, China(重庆智能车辆安全技术国家重点实验室) CHONGQING CHANGAN AUTOMOBILE Co., Ltd(重庆长安汽车有限公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出一种模型无关的隐私保护推理框架SharedRequest,通过批量级别混淆和语义分组实现高效隐私保护,相比差分隐私基线效用提升20%以上,查询成本降低5倍。

Comments accepted by ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17709 2026-06-04 cs.CL cs.DC 90%

DeInfer: Efficient Parallel Inferencing for Decomposed Large Language Models

DeInfer:分解式大语言模型的高效并行推理

You-Liang Huang, Xinhao Huang, Chengxi Liao, Zeyi Wen

机构 * Boston University(波士顿大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对分解式大语言模型并行推理性能差的问题,提出DeInfer系统,通过多项优化实现高性能并行推理,实验证明其优越性。

Comments accepted by DAC'26, latest version fixs a minor mistake

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05130 2026-06-04 cs.LG cs.AI 90%

Towards Efficient and Evidence-grounded Mobility Prediction with LLM-Driven Agent

面向高效且基于证据的移动预测:基于LLM驱动的智能体

Linyao Chen, Qinlao Zhao, Zechen Li, Mingming Li, Likun Ni, Jinyu Chen, Yuhao Yao, Xuan Song, Noboru Koshizuka, Hiroki Kobayashi

机构 * The University of Tokyo(东京大学) Huazhong University of Science and Technology(华中科技大学) University of New South Wales, Sydney(新南威尔士大学(悉尼)) LocationMind Inc.(LocationMind公司) Southern University of Science and Technology(南方科技大学) Jilin University(吉林大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出一种无需训练的LLM驱动智能体框架AgentMob,通过自适应证据收集机制解决移动预测中的模糊情况,在多个数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04719 2026-06-04 cs.CL 90%

Query-based Cross-Modal Projector Bolstering Mamba Multimodal LLM

基于查询的跨模态投影器增强Mamba多模态大语言模型

SooHwan Eom, Jay Shim, Gwanhyeong Koo, Haebin Na, Mark A. Hasegawa-Johnson, Sungwoong Kim, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology / Korea, Republic of(韩国科学技术院) University of Illinois in Urbana-Champaign / United States of America(伊利诺伊大学厄巴纳-香槟分校) Korea University / Korea, Republic of(韩国大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出基于查询的跨模态投影器,通过交叉注意力压缩视觉令牌,消除手动设计2D扫描顺序的需求,提升Mamba多模态LLM的性能和吞吐量。

Comments Accepted to EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04594 2026-06-04 cs.DC cs.AI cs.SE 90%

Ekka: Automated Diagnosis of Silent Errors in LLM Inference

Ekka: LLM推理中静默错误的自动诊断

Yile Gu, Zhen Zhang, Shaowei Zhu, Xinwei Fu, Jun Wu, Yida Wang, Baris Kasikci

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出Ekka系统,通过差分调试对齐比较中间执行状态,自动诊断LLM推理框架中的静默错误,在真实错误基准上达到80% pass@1和88% pass@5的诊断准确率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03353 2026-06-04 cs.CR cs.AI 90%

SkCC: Portable and Secure Skill Compilation for Cross-Framework LLM Agents

SkCC:面向跨框架LLM代理的可移植且安全的技能编译

Yipeng Ouyang, Yi Xiao, Yuhao Gu, Xianwei Zhang

机构 * Sun Yat-sen University(中山大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM代理技能在不同框架间缺乏可移植性和安全性的问题,提出SkCC编译器,通过强类型中间表示SkIR解耦语义与格式,实现跨框架部署,并内置静态优化器强制执行安全约束,显著提升性能并降低适配复杂度。

Comments Accepted by the Agent Skills Workshop at ACM CAIS 2026. 20 pages, 6 figures. Project Homepage: https://skcc.nexa-lang.com/ Code Repo: https://github.com/Nexa-Language/Skill-Compiler/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23312 2026-06-04 cs.HC cs.AI cs.LG cs.RO cs.SY eess.SY 90%

Evaluating Zero-Shot and One-Shot Adaptation of Small Language Models in Leader-Follower Interaction

评估小语言模型在领导者-跟随者交互中的零样本和单样本适应

Rafael R. Baptista, André de Lima Salgado, Ricardo V. Godoy, Marcelo Becker, Thiago Boaventura, Gustavo J. G. Lahr

机构 * University of Sao Paulo(圣保罗大学) Federal University of Lavras(拉瓦尔联邦大学) Faculdade Israelita de Ensino e Pesquisa Albert Einstein(亚伯拉罕·林克·埃instein教育与研究学院)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过微调小语言模型(Qwen2.5-0.5B)在领导者-跟随者交互中实现角色分类,零样本微调达到86.66%准确率且延迟低至22.2毫秒,但单样本模式因上下文长度增加导致性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05722 2026-06-04 cs.CL cs.AI 89%

OckBench: Measuring the Efficiency of LLM Reasoning

OckBench:衡量LLM推理效率

Zheng Du, Hao Kang, Song Han, Tushar Krishna, Ligeng Zhu

机构 * Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院) NVIDIA(英伟达)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出OckBench基准,联合评估推理和编码任务中的准确性与token效率,揭示当前模型token利用率低下问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04123 2026-06-04 math.OC cs.AI cs.RO 88%

Semantic Constraint Synthesis for Adaptive Trajectory Optimization via Large Language Models

基于大语言模型的语义约束综合用于自适应轨迹优化

Eleanor Brosius, Yuji Takubo, Daniele Gammelli, Simone D'Amico, Marco Pavone

机构 * Stanford University(斯坦福大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出利用大语言模型将自然语言描述的任务需求转化为可执行的轨迹优化代码和数学公式,在航天器交会场景中实现了从语义需求重构凸轨迹优化问题的高成功率。

Comments 7 pages, 4 figures, Presented as a short paper at IEEE CVPR 2026, AI4Space Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01027 2026-06-04 cs.LG 88%

SFMP: Fine-Grained, Hardware-Friendly and Search-Free Mixed-Precision Quantization for Large Language Models

SFMP:面向大语言模型的细粒度、硬件友好且免搜索的混合精度量化

Xin Nie, Haicheng Zhang, Liang Dong, Beining Feng, Jinhong Weng, Guiling Sun

机构 * College of Electronic Information and Optical Engineering, Nankai University(南开大学电子信息与光工程学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 提出SFMP框架,通过分数位宽、块级混合精度、行列重排序和统一GEMM内核,实现免搜索、硬件友好的混合精度量化,在相同内存约束下优于现有方法。

Comments 30 pages,17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04511 2026-06-04 cs.CL cs.LG 88%

SparDA: Sparse Decoupled Attention for Efficient Long-Context LLM Inference

SparDA: 用于高效长上下文LLM推理的稀疏解耦注意力

Yaosheng Fu, Guangxuan Xiao, Xin Dong, Song Han, Oreste Villa

机构 * NVIDIA Thinking Machines Lab ByteDance Seed MIT

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 提出SparDA架构,通过引入第四投影Forecast实现KV缓存预取与注意力解耦,减少稀疏选择开销,在长上下文推理中实现1.25倍预填充加速和1.7倍解码加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15152 2026-06-04 cs.LG cs.AI 88%

Widening the Gap: Exploiting LLM Quantization via Outlier Injection

扩大差距:通过异常值注入利用LLM量化

Xiaohua Zhan, Kazuki Egashira, Robin Staab, Mark Vero, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出首个针对多种先进量化方法(AWQ、GPTQ、GGUF I-quants)的量化条件攻击,通过注入异常值导致权重塌缩,诱导模型在量化后出现恶意行为。

详情

展开后加载摘要…

URL PDF HTML 收藏