arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12266 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 12266 篇

2608.13589 2026-08-17 cs.HC cs.AI 新提交 70%

Context Aware AI Assistant and AR Interface for Lunar Extravehicular Activity (EVA) Procedural Guidance

面向月球舱外活动(EVA)程序指导的上下文感知AI助手与AR界面

Rodrigo Gallardo, Qilmeg Doudatcz, Ganit Goldstein, Ilkyaz Sarimehmetoglu, Sergio Mutis, Alexander Htet Kyaw, Anita Lin, Clara Emmerling, Berfin Ataman, Skylar Tibbits

机构 * MIT(麻省理工学院)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对月球EVA中宇航员注意力分散导致的信息适配难题,提出GAIN-AI系统,通过两层架构结合大语言模型与AR界面,在111个合成EVA场景中取得良好表现。

Comments 4 pages, 4 figures, 1 table. Accepted to ACM SIGGRAPH 2026 Conference Posters, July 19-23, 2026, Los Angeles, California, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12674 2026-08-14 cs.AI 新提交 70%

Lines and Ladders: A Context-Aware Multi-Agent Framework for Large-Scale Retail Price Taxonomy

Lines and Ladders:面向大规模零售价格分类的上下文感知多智能体框架

Ravi Teja Chunduri, Srikaran Reddy Boya, Deep Narayan Mishra, Ajay Kumar B, Karthik Kumaran, Pranay Kona

机构 * Walmart Global Tech(沃尔玛全球科技)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对大规模零售商品定价管理难题,提出上下文感知多智能体框架自动化构建Lines and Ladders价格分类,3智能体系统在Lines任务F1达0.83,在多品类数据上表现优异且已投入生产。

Comments 8 pages. Accepted in the Main Conference of IEEE ICMLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12582 2026-08-14 cs.HC cs.AI 新提交 70%

Not All Nudges Land: Behavioral Controllability and Elaboration Quality in AI-Supported Journaling

并非所有助推都能落地:AI辅助日记中的行为可控性与阐述质量

Nadia Mehjabin, Henry Kautz, Subigya Nepal

机构 * University of Virginia(弗吉尼亚大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对AI辅助日记,分析369篇条目后发现,涉及他人的行为改善率仅15%-22%,个人可独立实施的行为改善率达50%-63%,文本特征影响较小,为AI日记助推的适用方向提供了探索性结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12511 2026-08-14 cs.CR cs.CL 新提交 70%

SoK: From Generation to Consumption of Privacy Documents in Software Systems

SoK:软件系统中隐私文档的生成与使用

Shidong Pan, Clark LaChance, Zhen Tao, Sepideh Ghanavati

机构 * Columbia University(哥伦比亚大学) New York University(纽约大学) University of Maine(缅因大学) Technical University of Munich(慕尼黑工业大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本SoK从软件工程视角,系统分析2010-2025年290篇论文,梳理隐私文档全生命周期研究,识别趋势与开放机会,为相关研究提供统一基础。

Comments This SoK paper has been accepted by NDSS 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12361 2026-08-14 cs.CL cs.CY 新提交 70%

New Terms, New Toxicity: Consensus-based Chinese Neologism Toxicity Detection via Search-Augmented LLMs

新术语,新毒性:基于共识的新词毒性检测——通过搜索增强型大语言模型(LLMs)

Shiyao Cui, QingLin Zhang, Di Wang, Yida Lu, Zhexin Zhang, Jinhua Gao, Jinglin Yang, Min He, Han Qiu, Minlie Huang

机构 * Tsinghua University(清华大学) ICT, CAS(中国科学院计算技术研究所) National Computer Network Emergency Response Technical Team Coordination Center of China(国家计算机网络应急技术处理协调中心) IIE, CAS(中国科学院工程热物理研究所) School of Cyber Security, UCAS(中国科学院大学网络空间安全学院) JCSS, Tsinghua University(清华大学软件学院) Science City (Guangzhou) Digital Technology Group Co., Ltd.(广州科学城数字科技集团有限公司)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文针对毒性新词的检测问题,提出捕捉毒性新词起源与共识标准的分类法,构建风险词表,引入搜索增强型框架SeTox,实验显示3B规模的SeTox性能优于近期大规模模型。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00821 2026-08-14 cs.CL 版本更新 70%

Exemplars in Disguise: Pure Exemplar Models Mimic Abstraction-First Learning

伪装的样例:纯样例模型模仿优先抽象学习

Zachary Nicholas Houghton, Vsevolod Kapatsinski

机构 * University of Oregon(俄勒冈大学) Vail Systems, Inc.(韦尔系统公司)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对语言学习中知识学习顺序的核心问题,研究发现纯记忆模型可模仿抽象知识优先学习的表象,且项目特定与抽象知识的区分对分布式表征而言可能定义不明确。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10050 2026-08-12 cs.LG 新提交 70%

Observational Policy Ranking for SMB Financial Guidance from Multi-Action Accounting Logs

基于多动作会计日志的中小企业财务指导观测策略排序

Shrutendra Harsola, Vignesh Subrahmaniam, Vikas Raturi, Kamalika Das, Xiang Gao, Kratika Gupta, Ruocheng Guo, Padmaja Jonnalagedda, Ananya Pramod, Sricharan Kumar

机构 * Foresight-AI(预见人工智能) Intuit(英图易公司)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 该研究针对中小企业财务指导的观测策略排序问题,提出CAR-PL方法,通过85078个公司-月度数据验证,其在毛利润等指标上表现优异,可实现多动作会计日志下的财务指导类别排序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08510 2026-08-11 cs.CL 新提交 70%

From Speech to Interaction: Analyzing Multimodal Systems in Cocktail-Party Scenarios

从语音到交互:鸡尾酒会场景下多模态系统的分析

Thai-Binh Nguyen, Zhaolin Li, Jan Niehues, Alexander Waibel

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究分析了CHiME-9 MCoRec任务中不同多模态系统解决鸡尾酒会场景的策略,发现最优系统实现57%相对错误减少,且高语音重叠并非性能差异的主要原因。

Comments Accepted at ICMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07808 2026-08-11 cs.CR cs.AI 新提交 70%

The Anatomy of a Prompt Injection: A Component Model for Structured Analysis

提示注入的剖析:用于结构化分析的组件模型

Jeremy McHugh

机构 * Preamble, Inc.(普雷安布尔公司)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出七个组件的提示注入结构化分析模型,统一相关分类法,结合实例与CTI模式,助力标记、分析提示注入攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07541 2026-08-11 cs.CV cs.AI cs.MA 新提交 70%

NeuroPilot: An Agent-Driven Smart Pipeline for Processing, Quality Control, and Managing Neuroimages

NeuroPilot:一种用于神经影像处理、质量控制与管理的智能体驱动智能流程

Yiyao Chen, Yucheng Li, Jungong Tong, Shaoqi Wang, Kunhao Zhou, Ziquan Wei, Monica Murea, Marissa DiPiero, Tingting Dan, Guorong Wu

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出NeuroPilot多智能体系统,整合神经影像处理、质控与管理流程,在17个超12.3万受试者的队列中验证,将传统2-3个月的工作压缩至一周,提升了可扩展性与效率。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07283 2026-08-10 cs.CL 新提交 70%

Grammar Engineering Meets LLMs: Development of Cantonese and Irish ParGram Treebanks

语法工程与大语言模型(LLMs)的结合:粤语与爱尔兰语平行语法(ParGram)树库的开发

Chit-Fung Lam, Elaine Uí Dhonnchadha

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究开发了粤语与爱尔兰语ParGram树库,探究多语言LLMs在语法工程中的应用,发现其翻译表现差、跨语言抽象任务效果不佳,但可提供参考,凸显其潜力与专家分析的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09222 2026-08-10 cs.SD cs.AI 版本更新 70%

GRM: Utility-Aware Jailbreak Attacks on Audio LLMs via Gradient-Ratio Masking

GRM:通过梯度比掩码实现音频大语言模型的效用感知越权攻击

Yunqiang Wang, Hengyuan Na, Di Wu, Miao Hu, Guocong Quan

机构 * Sun Yat-Sen University(中山大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出GRM框架,通过频率选择性扰动在音频大语言模型中实现效用感知的越权攻击,实验表明其在攻击成功率与效用平衡方面优于基线方法。

Comments Accpeted by MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19037 2026-08-10 cs.SD cs.CL cs.MM eess.AS 70%

MLLM-based Speech Recognition: When and How is Multimodality Beneficial?

Yiwen Guan, Viet Anh Trinh, Vivek Voleti, Jacob Whitehill

机构 * Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

Journal ref IEEE Transactions on Multimedia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08029 2026-08-10 cs.CL cs.CY 版本更新 70%

Better Together: Quantifying the Benefits of AI-Assisted Recruitment

携手共进:量化AI辅助招聘的益处

Ada Aka, Emil Palikot, Ali Ansari, Nima Yazdani

机构 * Stanford University(斯坦福大学) University of Southern California(南加州大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究通过两项实地实验发现,AI辅助招聘可提升候选人最终面试通过率,在简历信息不足的初级候选人中效果更显著,但存在75%的候选人未完成面试的问题,其将筛选成本从企业转移至申请人。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05732 2026-08-07 cs.LG 新提交 70%

CircuitSteer: Geometrically Aligned Multi-Layer Steering via Sparse Autoencoder Circuits

CircuitSteer:基于稀疏自编码器回路的几何对齐多层引导方法

Mehrshad Saadatinia, Parsa Razmara, Ardalan Aryashad, Ali Abbasi, Seyedarmin Azizi

机构 * University of Southern California(南加利福尼亚大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 CircuitSteer是利用SAEs识别多层语义回路的新型框架,通过几何对齐合成引导向量实现多点干预,在多任务多模型上,其引导效果优于牺牲流畅性或覆盖不足的对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05510 2026-08-07 cs.CL 新提交 70%

Different Perturbations, Different Mechanisms: Understanding Continued Pre-training for Zero-Shot Dialect Robustness

不同扰动,不同机制:理解用于零样本方言鲁棒性的持续预训练

Aarohi Srivastava, David Chiang

机构 * University of Notre Dame(圣母大学)

专题命中 其他LLM :LLM(abstract_cn);language model(abstract);分类 cs.CL

AI总结 本研究针对大型语言模型,系统对比6种训练条件下的6种扰动持续预训练策略,发现字符噪声CPT可提升零样本方言鲁棒性且保留标准性能,不同策略的鲁棒机制存在差异,为相关策略选择提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05233 2026-08-07 cs.AI cs.CV 新提交 70%

Coherence-Oriented Dream Scene Visualisation

面向连贯性的梦境场景可视化

Azra Açıl, Simon Colton

机构 * School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦玛丽女王大学电子工程与计算机科学学院)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出DSV系统,通过大型语言模型拆分梦境描述为四部分,结合文本到图像模型生成连贯的四面板图像序列,经DreamBank数据集50次可视化评估,用CLIP等模型指标验证了其质量、保真度与连贯性。

Comments short paper accepted at ICCC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29152 2026-08-07 cs.AI 版本更新 70%

SimMOF: AI agent for Automated MOF Simulations

SimMOF:用于自动化MOF模拟的AI代理

Jaewoong Lee, Taeun Bae, Jihan Kim

机构 * Department of Chemical and Biomolecular Engineering, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST)化学与生物分子工程系)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SimMOF通过自然语言查询自动化MOF模拟全流程,实现依赖感知计划生成、可运行输入生成、多代理协同执行及结果分析,提供数据驱动的MOF研究可扩展基础。

Comments 42 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05997 2026-08-07 cs.CV cs.AI 版本更新 70%

MM-ISTS: Cooperating Irregularly Sampled Time Series Forecasting with Multimodal Vision-Text LLMs

MM-ISTS: 基于多模态视觉-文本大语言模型的不规则采样时间序列预测

Zhi Lei, Chenxi Liu, Hao Miao, Wanghui Qiu, Bin Yang, Chenjuan Guo

机构 * East China Normal University Shanghai China Centre for Artificial Intelligence Robotics, Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences Hong Kong China Department of Computing, The Hong Kong Polytechnic University Hong Kong China East China Normal University Robotics, Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences Department of Computing, The Hong Kong Polytechnic University

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MM-ISTS利用多模态视觉-文本大语言模型,通过双阶段编码机制提升不规则采样时间序列预测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04554 2026-08-06 cs.CL cs.CV 新提交 70%

Representing Visual Evidence for Item Difficulty Prediction: Visual Textualization and Image-Native Modeling

为题目难度预测表征视觉证据:视觉文本化与原生图像建模

Han Chen, Ming Li, Hong Jiao, Tianyi Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Maryland(马里兰大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文针对题目难度预测的视觉证据表征问题,对比仅用文本、视觉文本化与原生图像建模三种方式,发现原生图像建模是有竞争力的替代方案,其有效性取决于VLMs的适配方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04336 2026-08-06 cs.SE cs.AI 新提交 70%

COMPAS: Difficulty-Aware Joint Search for Optimizing Code Generation

COMPAS:面向优化代码生成的感知难度联合搜索

Jingzhi Gong, Jie M. Zhang, Gunel Jahangirova, Dong Huang, Mohammad Reza Mousavi, Mark Harman

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出感知难度的 COMPAS 方法,通过联合搜索模型、提示词和解码设置优化代码生成,在 LiveCodeBench 和 SWE-bench 上均实现性能提升且成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07558 2026-08-06 cs.HC cs.AI 版本更新 70%

Generative Experiences for Digital Mental Health Interventions: Evidence from a Randomized Study

生成体验用于数字心理健康干预:来自随机研究的证据

Ananya Bhattacharjee, Michael Liut, Matthew Jörke, Diyi Yang, Emma Brunskill

机构 * Stanford University(斯坦福大学) University of Toronto Mississauga(多伦多大学滑铁卢分校)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出生成体验范式,通过动态构建干预体验提升数字心理健康干预效果,实验显示GUIDE在减压和用户体验方面显著优于基线对照。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28587 2026-08-05 cs.SE cs.AI 版本更新 70%

PAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like Benchmarks

PAIChecker:揭示与检查类SWE-Bench基准中的PR-Issue不匹配问题

Manyi Wang, Junjielong Xu, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对类SWE-Bench基准中13.6%的PR-Issue不匹配问题,提出多智能体系统PAIChecker,经实验验证其在两类基准上的二元准确率最高达92.12%

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). Github Repo: https://github.com/manyiResearch/PAIChecker

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02005 2026-08-04 cs.AI 新提交 70%

Evolving in the Agent Jungle via History-Informed Opponent Awareness

在智能体丛林中通过历史感知的对手意识进化

Zhaofeng Zhang, Linhan Xia, Rui Liu, Yihao Wang, Binrui Shen, Shengxin Zhu

机构 * University of Edinburgh(爱丁堡大学) University of Oklahoma(俄克拉荷马大学) Imperial College London(伦敦帝国学院) University of Michigan(密歇根大学) University of Southern California(南加州大学) Tencent(腾讯) Beijing Normal University(北京师范大学) Beijing Normal–Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对多智能体环境中对手策略持续进化导致静态技能修改方法失效的问题,提出OASE方法,通过历史快照锚定的配对比较选择有益技能修改,在两类场景中实现更低均衡距离与更少无效策略变更。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00119 2026-08-04 cs.CV cs.AI 新提交 70%

Counting the Cost of War Under Satellite Embargo: Zero-Shot Estimation of Impacted Infrastructure

卫星禁运下的战争损失统计:受影响基础设施的零样本估计

Saleh Sakib Ahmed, M. Sohel Rahman

机构 * Bangladesh University of Engineering and Technology(孟加拉国工程技术大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对冲突区人道主义救援中受影响建筑估计受卫星数据禁运阻碍的问题,提出基于打击前地图的零样本几何投影方法,引入两项技术创新,在2026年中东冲突数据上验证了深度增强大视觉语言模型的优势,确立了混合零样本危机映射范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05633 2026-08-04 cs.AI 版本更新 70%

Answer Presence Drives RAG Rewriting Gains

答案存在驱动RAG重写收益

Yuejie Li, Yueying Hua, Ke Yang, Li Zhang, Yueping He, Yueping He, Ruiqi Li, Bolin Chen, Tao Wang, Bowen Li, Chengjun Mao

机构 * Ant Group(蚂蚁集团)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 通过受控干预审计,发现检索增强问答中重写器带来的性能提升主要由黄金答案字符串出现在重写上下文中驱动,而非证据质量改善。

Comments The authors have withdrawn this manuscript after identifying errors in the experimental analysis reported in Sections 3 and 4. These errors affect the reported relationship between answer presence and RAG rewriting gains and undermine the paper's main conclusions. Therefore, the results and conclusions in the current version should not be relied upon

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02613 2026-08-04 cs.MA cs.AI cs.CY 版本更新 70%

Exploring Silicon-Based Societies: An Early Study of the Moltbook Agent Community

探索基于硅的社会:对Moltbook代理社区的早期研究

Yu-Zheng Lin, Bono Po-Jen Shih, Hsuan-Ying Alessandra Chien, Shalaka Satam, Jesus Horacio Pacheco, Naima Kaabouch, Sicong Shao, Soheil Salehi, Pratik Satam

机构 * 1 Department of Electrical Computer Engineering, University of Arizona 3 Department of Systems Industrial Engineering, University of Arizona 5 School of Electrical Engineering Computer Science, University of North Dakota 2 The Rock Ethics Institute \& The Leonhard Center for the Enhancement of Engineering Education, The Pennsylvania State University 4 Department of Industrial Engineering, University of Sonora 3 Telecommunication Laboratories, Chunghwa Telecom Co., Ltd. Corresponding Email

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过分析Moltbook平台,研究自主代理的社会结构形成,揭示了代理如何通过数据驱动的方法系统性地组织集体空间。

Comments 11 pages, 3 figures. Improves clarity and exposition and corrects minor errors. Technical content and conclusions remain unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01870 2026-08-04 cs.AI cond-mat.dis-nn math-ph math.MP math.NT 版本更新 70%

Testing Transformer Learnability on the Arithmetic Sequence of Rooted Trees

在根树的算术序列上测试Transformer的可学习性

Alessandro Breccia, Federica Gerace, Marco Lippi, Gabriele Sicuro, Pierluigi Contucci

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究探讨了Transformer模型在根树算术序列上的学习能力,发现模型能部分捕捉序列的内部规律和相关性,表明可学习性可能延伸至算术结构本身。

Comments 33 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19350 2026-08-03 cs.GR cs.LG 版本更新 70%

CompoSE: Compositional Synthesis and Editing of 3D Shapes via Part-Aware Control

CompoSE:通过部分感知控制进行3D形状的组合合成与编辑

Habib Slim, Shariq Farooq Bhat, Mohamed Elhoseiny, Yifan Wang, Mike Roberts

机构 * King Abdullah University of Science and Technology (KAUST)(卡布斯大学) Adobe Research(Adobe研究)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出CompoSE方法,通过部分感知控制实现3D形状的组合合成与编辑,核心方法是使用扩散变压器架构在局部和全局之间交替处理部分,并通过新颖的条件技术确保对用户输入的强遵循,主要贡献是无需部分级文本提示即可直接从用户粗略布局指导中学习部分语义和对称性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27529 2026-07-31 cs.LG 新提交 70%

Latent-Kernel Discrete Flow Maps for Few-Step Generation

用于少步生成的隐核离散流图

Mansoor Ahmed, Yue-Tsz Fan, Hemanth Venkateswara, Murray Patterson

专题命中 其他LLM :language model(abstract,abstract_cn);分类 cs.LG

AI总结 提出隐核离散流图(LKF)模型,通过共享隐变量绑定分解组件实现少步生成,在两个文本基准上较似然基线提升困惑度2.1-3.3倍,M=8时优于现有少步采样器

详情

展开后加载摘要…

URL PDF HTML 收藏