arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2014 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2014 篇

2608.01784 2026-08-04 cs.AI cs.CL 新提交 81%

REFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language Models

REFLEX:将MoE推理重新思考为扩散语言模型中的感知细化的计算分配

Xiang Xia, Cheng Yan, Yiming Zhang, Jiazheng Liu, Hongyu Zhang, Wuyang Zhang

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 REFLEX是一种无需训练的MoE推理方法,通过粗到细的专家预算分配和前沿进度分数,在扩散语言模型中平均减少15%专家计算量,同时保持或提升生成质量,实现更优的质量-计算权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01285 2026-08-04 cs.LG cs.AI 新提交 81%

Stop When Memory Suffices: Evidence-Conditioned Progressive Execution for LLM Agents

当内存充足时停止:面向大语言模型智能体的证据条件渐进式执行

Yidan Lin, Kaixiang Wang, Jiong Lou, Jie Li

专题命中 效率与部署 :LLM(title,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究针对大语言模型智能体记忆系统的延迟与质量矛盾,提出Router-Mem框架,通过证据条件渐进式执行,在降低推理时间的同时保持了优异的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25880 2026-07-29 cs.CR cs.AI cs.CL 新提交 81%

Stemma: Induced Decision Regions Reveal LLM Provenance

Stemma:诱导决策区域揭示大语言模型的来源

Keyu Zhang, Vadim Safronov, Andrew Martin

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型来源测试中现有黑盒方法可靠性不足的问题,引入诱导决策区域,提出Stemma方法,以稳定性等为探针选择原则,在多组源-可疑对测试中表现出色,显著优于基线,对不同部署设置具鲁棒性。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24865 2026-07-29 cs.IR cs.AI cs.LG 新提交 81%

Tokens are All You Need: Dual-purpose Semantic IDs for Achieving LLM-Level I/O Efficiency in recommendation systems

令牌即所需:用于在推荐系统中实现大语言模型级I/O效率的双用途语义ID

Baolei Li, Yiping Yuan, Yilin Zheng, Likang Yin, Ling Liu, Fabio Soldo, Romer Rosales, Xinyang Yi, Lichan Hong

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对大规模推荐系统的“内存墙”瓶颈,受计算机视觉数据压缩启发,提出双用途语义ID,用分层量化将连续嵌入压缩为离散语义ID执行协作身份和内容重建角色,经实验验证该方法能有效减少系统开销和数据占用,实现高效推荐。

Comments RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24440 2026-07-28 cs.CV cs.CL cs.LG 新提交 81%

Bigger or Cheaper? Scale and Quantization Effects on Uncertainty Signals in Vision-Language Models Under Image Degradation

更大还是更便宜?图像退化下视觉语言模型中尺度和量化对不确定性信号的影响

M M Asif Ferdous

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究在图像退化下视觉语言模型中尺度和量化对不确定性信号的影响,通过对Qwen2-VL系列模型的实验发现,尺度提升内部不确定性信号,4位量化对准确性影响小但对置信信号影响大,建议固定内存预算下选更大量化模型,如7B-4bit。

Comments 12 pages, 4 figures. Code and data: https://github.com/Asif-Ferdous/vlm-scale-quant

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23052 2026-07-28 cs.CV cs.CL cs.LG 新提交 81%

Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models

相似性并非逻辑:双编码器视觉语言模型的因式推理

Sultan Alshehri, Zhantao Yang, Han Zhang, Marios Savvides

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究双编码器视觉语言模型组合约束失效问题,提出因式推理,将证据提取与约束执行分离,引入LCSE方法,在FACTOR-Bench上实验,提升了准确率并保持检索性能。

Comments Accepted at ICML 2026. 18 pages, 8 figures. Project page: https://sultanmo.github.io/factored-vlm Code and benchmark: https://github.com/SultanMo/factored-vlm

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17733 2026-07-21 cs.LG cs.AI 新提交 81%

MXSens: Sensitivity-Aware Mixed-Precision Quantization for Efficient LLM Inference

MXSens:用于高效大语言模型推理的灵敏度感知混合精度量化

Simla Burcu Harma, Danila Mishin, Zhengyuan Su, Ayan Chakraborty, Elizaveta Kostenok, Dongho Ha, Babak Falsafi, Martin Jaggi, Yunho Oh, Amir Yazdanbakhsh

机构 * EPFL(洛桑联邦理工学院) Tsinghua University(清华大学) MangoBoost Inc.(芒果助推公司) Korea University(韩国大学) Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型推理中4位量化因异常值致精度降的问题,提出MXSens方法,基于列和层灵敏度分配混合尾数比特宽度,无需训练,利用MXINT块结构,在多模型任务中优于现有方法,平衡了量化的准确性与资源效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15655 2026-07-20 cs.CL cs.LG 新提交 81%

Adaptive Multi-Step Lookahead Decoding for Diffusion Language Models

扩散语言模型的自适应多步前瞻解码

Yingqian Cui, Wei Deng, Lantao Mei, Hang Li, Charu C. Aggarwal, Hui Liu, Yue Xing

机构 * Michigan State University(密歇根州立大学) Morgan Stanley(摩根士丹利) IBM T.J. Watson Research Center(IBM 托马斯·J·沃森研究中心)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究针对扩散语言模型解码,提出自适应多步前瞻框架AdaLook,基于候选分数方差动态决定是否继续展开及进行分支扩展,避免不必要的深度展开,实验证明其在准确性和解码步骤权衡上优于现有一步前瞻解码方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08960 2026-07-13 cs.LG cs.AI 新提交 81%

Eluna: An Agentic LLM System for Automating Warehouse Operations with Reasoning and Task Execution

Eluna:一个用于通过推理和任务执行实现仓库运营自动化的智能语言模型系统

Ning Liu, Kalle Kujanpää, Zhaoxuan Zhu, P Aditya Sreekar, Kaiwen Liu, Chuanneng Sun, Jorge Marchena Menendez, Matthew Bales, Tianyu Yang, Shahnawaz Alam, Rose Yu, Baoyuan Liu, Kristina Klinkner, Shervin Malmasi

机构 * Amazon.com, Inc. Fulfillment Technologies and Robotics(亚马逊公司履约技术与机器人部门)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对仓库运营中SOP执行问题,提出Eluna智能体系统,它是图形引导多智能体框架,采用非对称情节蒸馏方法,在基准测试和生产应用中,微调模型表现出色,匹配或超教师模型,击败基线,在票务处理应用达94%专家一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07184 2026-07-09 cs.LG cs.AI 新提交 81%

Predicting LLM Safety Before Release by Simulating Deployment

通过模拟部署预测大语言模型发布前的安全性

Marcus Williams, Hannah Sheahan, Cameron Raymond, Tomek Korbak, Deng Pan, Peilin Yang, Leon Maksin, Ningyi Xie, Phillip Guo, Ian Kivlichan, Micah Carroll

机构 * OpenAI(开放人工智能研究公司)

专题命中 效率与部署 :LLM(title);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过模拟部署预测大语言模型发布前安全性的方法,从去识别化对话出发,固定前缀用候选模型生成回复来评估。该方法能估计行为不当率,优于基线,还能克服工具重新采样挑战,为外部研究提供途径,助力预测模型现实行为及评估部署风险。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04013 2026-07-07 cs.LG cs.AI 新提交 81%

When Does Small Data Work? Accuracy and Efficiency Trade-offs Between Tabular Foundation Models and Conventional Methods for Crowd-State Classification at Hajj and Umrah

小数据何时起作用?朝觐和副朝人群状态分类中表格基础模型与传统方法之间的准确性和效率权衡

AlJawharh S. AlOtaibi, Mohamed Eltahir, Jude AlSubaie

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究在朝觐和副朝人群状态分类中,测试表格基础模型在标签稀缺时的作用,将其与传统机器学习方法比较,评估不同模型,揭示标签数量影响模型选择及两种方法在准确性和效率上的权衡。

Comments 6 pages, 3 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02893 2026-07-07 cs.LG cs.CL 新提交 81%

Variable Bit-width Quantization: Learning Per-Group Precision for "Bigger-but-Smaller" Language Models

可变比特宽度量化:为“更大但更小”的语言模型学习每组精度

Hamish Ogilvy

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究提出可变比特宽度量化(VBQ),通过Gumbel-Softmax松弛为每组64个权重学习分辨率,经交替优化联合训练。VBQ能实现强异构分配,有更好存储效率和推理加速,还揭示了深层自修复量化误差机制。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00714 2026-07-02 cs.CL cs.AI 新提交 81%

Self-conditioned Flow Map Language Models via Fixed-point Flows

自条件流映射语言模型通过不动点流

Jaehoon Yoo, Wonjung Kim, Floor Eijkelboom, Chanhyuk Lee, Nicholas M. Boffi, Seunghoon Hong, Jinwoo Kim

机构 * KAIST(韩国科学技术院) University of Amsterdam(阿姆斯特丹大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出不动点流框架,将自条件机制解释为不动点迭代,并设计二维流模型同时压缩迭代与流过程,实现少步生成,在OpenWebText上超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27711 2026-06-29 cs.LG cs.AI stat.CO 新提交 81%

The Simulacrum: Decision-Theoretic Pretraining for Near-Optimal Time-Series Forecasting and Inference

模拟体:面向近乎最优时间序列预测与推断的决策理论预训练

Pablo Montero-Manso, Marcel Scharth

机构 * Google(谷歌)

专题命中 效率与部署 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种通过决策理论预训练学习时间序列估计器的神经网络框架,通过指定生成世界和决策目标,训练网络逼近最优决策规则,在零样本推断中实现近乎最优风险、偏差控制和均匀校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27180 2026-06-26 cs.LG cs.AI cs.RO 新提交 81%

Automating Potential-based Reward Shaping with Vision Language Model Guidance

基于视觉语言模型引导的势能奖励塑形自动化

Henrik Müller, Daniel Kudenko

机构 * L3S Research Center Leibniz University Hannover(莱布尼茨汉诺威大学L3S研究中心)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出VLM-PBRS框架,利用轻量级视觉语言模型的偏好学习势能函数,实现自动化奖励塑形,保证最优策略不变,提升样本效率并避免奖励黑客。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25532 2026-06-25 cs.AI cs.AR cs.LG cs.MA 新提交 81%

Agentic evolution of physically constrained foundation models

物理约束基础模型的智能体演化

Jiangwei Zhang, Wen Sun, Chong Wang, Shiyao Li, Cheng Che, Chunjing Han, Dan Meng, Jian Yang, Yu Wang, Rui Hou

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出基于演化知识图谱的多智能体发现引擎,自动设计硬件兼容计算系统,在基础模型部署中演化出超越人工的压缩方法,实现大规模模型高效部署。

Comments 29 pages, 5 main figures and 4 extended data figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24898 2026-06-25 cs.LG cs.AI 新提交 81%

Dense Supervision Is Not Enough: The Readout Blind Spot in Looped Language Models

密集监督还不够:循环语言模型中的读出盲点

Rituraj Sharma, Tu Vu

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文揭示循环语言模型中密集交叉熵损失仅控制读出变量,忽略隐藏状态尺度,导致尺度失控;提出尺度可见读出、显式范数惩罚或尺度移除循环的修复方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20587 2026-06-23 cs.NI cs.AI cs.LG 新提交 81%

Protocol-Aware Tokenization and Architecture Co-Design for Wireless Packet Foundation Models

协议感知分词与架构协同设计用于无线数据包基础模型

Swadhin Pradhan, Shazal Irshad, Jerome Henry

机构 * Cisco Systems(思科系统)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 通过2x2对比实验发现,协议感知分词是无线数据包基础模型性能的主要杠杆,改变分词器可使准确率波动32个百分点,而改变架构仅影响2个百分点。

Comments 10 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17372 2026-06-18 cs.CL cs.AI 新提交 81%

Implicit vs. Explicit Prompting Strategies for LVLMs in Referential Communication

LVLMs在指称通信中的隐式与显式提示策略

Peter Zeng, Amie J. Paige, Weiling Li, Susan E. Brennan, Owen Rambow, Cameron R. Jones

机构 * Stony Brook University(石溪大学)

专题命中 效率与部署 :prompting(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过控制任务差异,比较显式与隐式提示对LVLM生成高效指称表达的影响,发现显式提示下模型能协调高效表达,而隐式提示则失败,揭示了人机通信的关键差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11766 2026-06-17 eess.AS cs.AI cs.CL cs.SD 新提交 81%

Fast Speech Foundation Model Distillation Using Interleaved Stacking

快速语音基础模型蒸馏使用交错堆叠

Eungbeom Kim, Kyogu Lee

机构 * IPAI AIIS Dept. of Intelligence and Information(智能与信息系)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出交错堆叠方法加速语音基础模型蒸馏训练,通过保持层位置一致性解决性能下降问题,在SUPERB上验证有效性。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09643 2026-06-09 cs.DC cs.AI cs.LG cs.OS 新提交 81%

FMplex: Model Virtualization for Serving Extensible Foundation Models

FMplex: 用于服务可扩展基础模型的模型虚拟化

Hetvi Shastri, Pragya Sharma, Walid A. Hanafy, David Irwin, Mani Srivastava, Prashant Shenoy

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出FMplex系统,通过将基础模型作为虚拟化层实现多任务共享,结合批感知公平队列调度器,在7个基础模型和92个下游任务上降低延迟达80%,提升任务容量6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08565 2026-06-09 cs.LG cs.AI 新提交 81%

EinSort: Sorting is All We Need for Tensorizing LLM

EinSort: 张量化大语言模型,排序即一切

Toshiaki Koike-Akino, Jing Liu, Ye Wang

机构 * Toshiaki Koike-Akino Jing Liu Ye Wang

专题命中 效率与部署 :LLM(title);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出EinSort方法,通过索引排序发现张量中的低秩结构,实现大语言模型权重和KV缓存的张量化压缩,相比基线方法提升了重构质量。

Comments 38 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08497 2026-06-09 cs.AI cs.CL 新提交 81%

Explaining Black-Box Language Models: Learning to Optimize Linguistically-Structured Word Subsets

解释黑盒语言模型:学习优化语言结构化的单词子集

Minyoung Hwang, Seokhyun Lee, Changhee Lee

机构 * Korea University(高丽大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对黑盒语言模型解释的三个关键需求(推理效率、黑盒兼容性、语言结构可解释性),提出一种通过强化学习选择信息性单词子集的方法,实现高效、无梯度且语言连贯的解释。

Comments KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07630 2026-06-09 cs.LG cs.AI stat.ML 新提交 81%

Active Learning with Foundation Model Priors: Efficient Learning under Class Imbalance

基于基础模型先验的主动学习:类别不平衡下的高效学习

Jiancheng Zhang, Meiqing Li, Qi Zhang, Yinglun Zhu

机构 * University of California, Riverside(加州大学河滨分校) Carnegie Mellon University(卡内基梅隆大学) Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对现实数据中的类别不平衡和噪声标注问题,提出一种利用基础模型先验的主动学习框架,通过不平衡感知的协同决策选择信息量最大的样本,在图像和文本数据集上实现超过50%的标注节省。

Comments To appear at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07581 2026-06-09 cs.LG cs.AI cs.ET 新提交 81%

Training-Inference Kernel Contracts: Bounding Divergence in Post-Training and Deployment

训练-推理核契约:约束后训练与部署中的偏差

Bruce Changlong Xu, Lan Wu

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 提出核契约框架,通过数值、统计、运行时和可观测性条款约束训练核与推理核之间的分布偏差,并推导偏差界以保障策略梯度无偏性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11553 2026-06-11 cs.LG 新提交 80%

APEX: A Network-Native Time-Series Foundation Model for Forecasting and Anomaly Detection for Wireless Edge Operations

APEX:面向无线边缘运维的预测与异常检测的网络原生时间序列基础模型

Swadhin Pradhan, Niloo Bahadori, Peiman Amini

机构 * Cisco Systems, USA(思科系统公司)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 提出网络原生解码器Transformer APEX,针对企业AP遥测数据预训练,在DHCP退化基准上MAE比最强基线降低18%,异常检测F1=0.93,边缘版本实现亚秒级隐私保护推理。

Comments 5 pages, 1 figure, 4 tables. Discusses a network-native time-series foundation model for wireless edge operations

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19628 2026-08-21 cs.AR 新提交 80%

A Thread-Register Decoupled GPU Execution Model for Efficient Tensor Computation

用于高效张量计算的线程-寄存器解耦GPU执行模型

Zihan Liu, Jingwen Leng, Yangjie Zhou, Yitong Ding, Guanlin Zhu, Yilu Huang, Chiheng Jin, Chen Zhang, Shixuan Sun, Yu Feng, Anbang Wu, Minyi Guo, Jian Weng, Jiajin Tu, Junsong Wang

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 针对GPU张量计算流水线的固定并行度与粗粒度调度瓶颈,提出扩展SIMT模型的FIBER架构,通过线程-寄存器解耦实现动态并行缩放与细粒度调度,在LLM服务场景下获显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18524 2026-08-20 cs.CL cs.AI cs.LG cs.MA 新提交 80%

DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents

DART-SD:面向多轮工具调用智能体自蒸馏的钻石拓扑感知检索与微调

Hangrui Xu, Jiarui Wang, Yang Yang, Chuanbo Zhu, Fangda Chen, Ziqi Wu, Jingming Cai, Yan Song

机构 * ByteDance(字节跳动) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文针对多轮工具调用智能体训练中的拓扑崩溃问题,提出DART-SD框架,通过建模拓扑、检索恢复参考与渐进自蒸馏提升策略多样性,性能优于传统全轨迹基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18009 2026-08-19 cs.CV 新提交 80%

Memory Tree Guided Key Frame Querying for Efficient 3D Question Answering

基于记忆树引导的关键帧查询的高效三维问答

Hsiang-Wei Huang, Fu-Chen Chen, Li-Wu Tsao, Cheng-Han Lee, Che-Chun Su, Lu Xia, Ronghui Peng, Jenq-Neng Hwang, Min Sun, Cheng-Hao Kuo

机构 * University of Washington(华盛顿大学) Amazon(亚马逊公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究针对具身场景三维问答的效率问题,提出MemTree3D记忆树引导的关键帧选择方法,在OpenEQA数据集上显著提升GPT-4o与LLaVA-OneVision-7B的问答性能,优于现有视觉搜索方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14783 2026-08-18 cs.CV cs.GR 新提交 80%

MegaParts: Scaling Part-Aware 3D Object Generation to 300 Parts via Token-Efficient Autoregressive Modeling

MegaParts:通过令牌高效自回归建模将部件感知三维物体生成扩展至300个部件

Manwen Liao, Xinyu Lian, Jian Mao, Kaixu Chen, Li Luo, Jinghao Yan, Wanshui Gan, Qiao Yu, Weitian Zhang, Chunhua Shen, Guang Chen, Bo Dai, Xudong Xu, Zhaoyang Lyu

机构 * The University of Hong Kong(香港大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Tongji University(同济大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 MegaParts提出结合结构化序列建模与令牌高效矢量量化形状令牌化器的自回归框架,将部件感知3D生成扩展至300个部件,性能优于基线模型,为大规模部件感知3D生成提供新方案。

Comments 12 pages, 6 pages appendix, 13 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏