arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12287 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 12287 篇

2511.17388 2026-06-24 cs.CL cs.LG 版本更新 62%

Selective Rotary Position Embedding

选择性旋转位置嵌入

Sajad Movahedi, Timur Carstensen, Arshia Afzal, Frank Hutter, Antonio Orvieto, Volkan Cevher

机构 * ELLIS Institute Tübingen(图宾根埃利斯研究所) LIONS, EPFL(日内瓦理工学院LIONS实验室) University of Freiburg(弗赖堡大学) Max-Planck-Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Prior Labs(Prior实验室)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出选择性RoPE,一种输入依赖的旋转嵌入机制,适用于线性和softmax变压器,通过任意角度旋转提升语言建模和复杂序列任务性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09934 2026-06-24 cs.CL cs.AI 62%

Paying Attention to Deflections: Mining Pragmatic Nuances for Whataboutism Detection in Online Discourse

关注偏移:在线 discourse 中 whataboutism 检测的语用细微差别挖掘

Khiem Phi, Noushin Salek Faramarzi, Chenlu Wang, Ritwik Banerjee

机构 * Department of Computer Science(计算机科学系)

专题命中 其他LLM :prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文通过 Twitter 和 YouTube 新数据集,区分 whataboutism、宣传和 tu quoque 囤谬,提出基于注意力权重的负样本挖掘方法,提升检测精度。

Comments 14 pages, 5 figures

Journal ref Findings of the Association for Computational Linguistics ACL. (2024) 12628-12643. https://aclanthology.org/2024.findings-acl.750

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23679 2026-06-23 cs.CV cs.AI cs.GR cs.LG 新提交 62%

Semantic Browsing: Controllable Diversity for Image Generation

语义浏览:图像生成的可控多样性

Sara Dorfman, Maya Vishnevsky, Omer Dahary, Or Patashnik, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学)

专题命中 其他LLM :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对文本到图像模型生成多样性不足且缺乏语义结构的问题,提出一种在文本层面引入多样性的方法,通过视觉语言模型和代理工作流实现用户可导航的语义变化空间。

Comments ECCV 2026. Project page: https://saradorfman1.github.io/SemanticBrowsing-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22769 2026-06-23 cs.LG cs.AI 新提交 62%

Noise is Signal: Density-Based Outliers as Leading Indicators of Occupational Emergence in Labor Market Text

噪声即信号:基于密度的异常值作为劳动力市场文本中职业涌现的领先指标

Shreyash Rawat

机构 * Independent Researcher(独立研究员)

专题命中 其他LLM :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出涌现-密度反转假设,证明低密度异常值预示新职业涌现,通过时序分析验证并改进涌现职业评分,预测准确率从F1=0.61提升至0.74。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21718 2026-06-23 cs.CL cs.LG 新提交 62%

Leveraging LaBSE with Progressive Curriculum Learning for Multicultural Polarization

利用LaBSE与渐进式课程学习进行多元文化极化检测

Sachin Sundar, Sandeep Kumar, Mothish M

机构 * Indian Institute of Technology, Kharagpur(印度理工学院卡哈拉格普尔分校) Indian Institute of Technology, Madras(印度理工学院马德拉斯分校)

专题命中 其他LLM :prompting(abstract);分类 cs.CL、cs.LG

AI总结 提出基于LaBSE嵌入和渐进式课程学习的架构,解决多语言低资源环境下的在线极化检测,在低资源语言上提升macro F1达0.2。

Comments Accepted at Semeval, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18057 2026-06-23 cs.HC cs.AI cs.CL cs.CY cs.SI 新提交 62%

When AI Says "I have been in similar situations": Synthetic Lived Experience in Peer-Like Caregiver Support

当AI说“我也有过类似经历”:同伴式照护支持中的合成生活经验

Drishti Goel, Agam Goyal, Veda Duddu, Olivia Pal, Violeta J. Rodriguez, Daniel S. Brown, Ravi Karkar, Dong Whi Yoo, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 其他LLM :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 研究AI在同伴支持中生成“合成生活经验”的悖论,通过分析人类与AI在阿尔茨海默病照护社区中的叙事差异,揭示AI虽能模拟情感支持但缺乏真实经历,需建立机制区分支持性语言与虚构经历。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18106 2026-06-23 math.OC cs.AI cs.LG stat.ML 版本更新 62%

Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers

优化器设计的对称性兼容原理:嵌入、LM头、SwiGLU MLP和MoE路由器

Tim Tsz-Kit Lau, Weijie Su

机构 * University of Pennsylvania(宾夕法尼亚大学) Wharton School(沃顿商学院)

专题命中 其他LLM :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对现代神经网络参数空间的对称性与坐标级优化器之间的几何不匹配,提出对称性兼容的优化器设计原则,并针对嵌入矩阵、LM头、SwiGLU MLP投影和MoE路由器等特殊参数块导出相应更新规则,实验证明其改善验证损失、负载平衡和训练稳定性。

Comments Corrected typos and updated the list of references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14240 2026-06-23 cs.LG cs.AI 交叉投稿 62%

Paraphrasing Attack Resilience of Various AI-Generated Text Detection Methods

各种AI生成文本检测方法的改写攻击鲁棒性研究

Andrii Shportko, Inessa Verbitsky

机构 * Northwestern University(西北大学)

专题命中 其他LLM :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文评估了三种AI生成文本检测方法的改写攻击鲁棒性,发现Binoculars集成方法性能最强但攻击损失最严重,揭示了文本检测领域性能与鲁棒性之间的矛盾。

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00509 2026-06-23 cs.LG cs.AI math.OC stat.ML 62%

Functional multi-armed bandit and the best function identification problems

函数多臂老虎机与最佳函数识别问题

Yuriy Dorn, Aleksandr Katrutsa, Ilgam Latypov, Anastasiia Soboleva

机构 * Lomonosov Moscow State University(莫斯科罗蒙诺索夫莫斯科国立大学) Moscow Institute of Physics and Technology(莫斯科物理技术学院) Skoltech(斯克里普切尔技术学院) Avito Moscow, Russia(莫斯科,俄罗斯)

专题命中 其他LLM :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出函数多臂老虎机问题和最佳函数识别问题,通过非线性优化算法构建F-LCB算法,提供 regret 上界并展示实验结果。

Journal ref Proceedings of the 25th International Conference on Autonomous Agents and Multiagent Systems (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02469 2026-06-23 cs.RO cs.AI cs.CL cs.CV 版本更新 62%

SIMSplat: Language-Aligned 4D Gaussian Splatting for Driving Scenario Generation

SIMSplat: 面向驾驶场景生成的语言对齐4D高斯泼溅

Sung-Yeon Park, Adam Lee, Juanwu Lu, Can Cui, Luyang Jiang, Rohit Gupta, Kyungtae Han, Ahmadreza Moradipari, Ziran Wang

机构 * Purdue University(普渡大学) University of California, Berkeley(加州大学伯克利分校) Toyota InfoTech Labs(丰田信息科技实验室)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SIMSplat,一种基于场景图的4D高斯泼溅框架,通过嵌入语言对齐特征实现自由文本查询、对象级编辑和多智能体仿真,在驾驶场景生成中显著提升定位精度和任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00344 2026-06-16 cs.CV cs.AI cs.CL 版本更新 62%

When RAG Hurts: Diagnosing and Mitigating Attention Distraction in Retrieval-Augmented LVLMs

当RAG有害:诊断和缓解检索增强LVLMs中的注意力分散

Beidi Zhao, Wenlong Deng, Xinting Liao, Yushu Li, Nazim Shaikh, Yao Nie, Xiaoxiao Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文发现检索增强生成(RAG)在LVLMs中导致注意力分散(AD)问题,即检索文本抑制视觉注意力并偏离问题相关区域,提出MAD-RAG方法通过双问题公式和注意力混合来解耦视觉定位与上下文整合,在三个基准上提升性能并纠正大部分失败案例。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06035 2026-06-16 cs.AI cs.CL 版本更新 62%

Attention, not scale, drives human-AI alignment in multimodal language prediction

注意力,而非规模,驱动多模态语言预测中的人机对齐

Viktor Kewenig, Andrew Lampinen, Samuel A. Nastase, Christopher Edwards, Quitterie Lacome D'Elascombe, Akilles Rechardt, Jeremy I Skipper, Gabriella Vigliocco

机构 * Psychology and Language Science, Experimental Psychology, University College London, London, UK(心理学与语言科学、实验心理学,伦敦大学学院,伦敦,英国) Google Deepmind, Mountain View, US(谷歌DeepMind,山景城,美国) Princeton Neuroscience Institute, Princeton University, Princeton, NJ, USA(普林斯顿神经科学研究所,普林斯顿大学,普林斯顿,新泽西州,美国) Computer Science Department, Exeter University(计算机科学系,埃克塞特大学)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过比较五种视觉-语言模型与600名人类在视觉世界范式中的表现,发现添加视觉上下文显著提升模型与人类在预测评分上的一致性,且注意力机制而非模型规模是主要驱动因素。

Comments 39 pages, 6 Figures, published in NPJ Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12708 2026-06-12 cs.CL cs.AI 新提交 62%

AfriSUD: A Dependency Treebank Collection for Evaluating Models on African Languages

AfriSUD:用于评估非洲语言模型的依存树库集合

Happy Buzaaba, Cheikh Mouhamadou Bamba Dione, David Ifeoluwa Adelani, Sylvain Kahane, Kim Gerdes, Bruno Guillaume, Kevin Guan, Aremu Anuoluwapo, Naome A. Etori, Shamsuddeen Hassan Muhammad, Utitofon Inyang, Peter Nabende, David Sabiiti Bamutura, Andiswa Bukula, Chinedu Uchechukwu, Rooweither Mabuya, Idris Akinade, Christiane Fellbaum

机构 * Princeton University(普林斯顿大学) Laboratory for Artificial Intelligence, Princeton University(普林斯顿大学人工智能实验室) Gaston Berger University(加斯顿·伯杰大学) Mila, McGill University(麦吉尔大学米拉研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能教席) Paris Nanterre University(巴黎南泰尔大学) Paris-Saclay University(巴黎-萨克雷大学) CNRS(法国国家科学研究中心) Inria(法国国家信息与自动化研究所) LORIA(洛林计算机科学实验室) Université de Lorraine(洛林大学) University of Trento(特伦托大学) University of Minnesota–Twin Cities(明尼苏达大学双城分校) Imperial College London(伦敦帝国学院) Binghamton University(宾汉姆顿大学) Makerere University(马凯雷雷大学) Penn State University(宾夕法尼亚州立大学) Mbarara University of Science and Technology(姆巴拉拉科技大学) Chalmers University of Technology(查尔姆斯理工大学) University of Ibadan(伊巴丹大学) Nnamdi Azikiwe University(纳姆迪·阿齐基韦大学) South African Centre for Digital Language Resources(南非数字语言资源中心)

专题命中 其他LLM :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 为弥补非洲语言在NLP资源上的不足,构建了首个大规模九种非洲语言句法标注树库AfriSUD,评估多种模型发现显著句法差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08365 2026-06-09 cs.LG cs.AI 新提交 62%

Pre-Intervention Prediction of Sparse Autoencoder Steering Side Effects

稀疏自编码器引导副作用的干预前预测

Evan Duan

机构 * University of Michigan(密歇根大学)

专题命中 其他LLM :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种干预前筛选框架,利用特征统计预测SAE引导的副作用(效果不稳定和附带扩散),在多个模型和字典上验证了解码器几何等信号优于基线,但预测效果因模型而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07780 2026-06-09 cs.AI cs.CV cs.LG 新提交 62%

Land cover and flood type govern the detection limits of satellite-based flood mapping across diverse global flood events

土地覆盖与洪水类型控制基于卫星的洪水测绘在不同全球洪水事件中的检测极限

Venkatesh Kolluru, Rajat Shinde, Abdelhak Marouane, Caden Helbling, Deepak Shah, Othneil Drew, Iksha Gurung, Manil Maskey, Rahul Ramachandran

机构 * Earth System Science Center, University of Alabama in Huntsville(阿拉巴马大学亨茨维尔分校地球系统科学中心) Space and Earth Science Data Analysis(空间与地球科学数据分析) NASA Marshall Space Flight Center(NASA马歇尔太空飞行中心)

专题命中 其他LLM :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 研究利用Prithvi-EO-2.0模型在19个全球洪水事件中评估卫星洪水测绘的检测能力,发现检测精度取决于土地覆盖和洪水类型,农田和河流洪水检测效果较好,而树木覆盖和建成区检测近乎为零。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07598 2026-06-09 cs.LG cs.AI 新提交 62%

A Topological Characterization of Graph Neural Networks via Stochastic Block Model Embeddings on the n-Sphere

图神经网络的拓扑特征化:通过n-球面上的随机块模型嵌入

Gopal Anantharaman

机构 * KnotTheory.ai Inc.(KnotTheory.ai 公司) Dept. of Mathematics, Emporia State University(恩波利亚州立大学数学系)

专题命中 其他LLM :LLM(abstract);分类 cs.AI、cs.LG

AI总结 提出将消息传递神经网络诱导的随机块模型映射到单位n-球面的拓扑框架,用于比较训练后的图神经网络,并实现无需重新训练的迁移学习候选检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03244 2026-06-09 cs.LG cs.AI cs.CV 版本更新 62%

VFEM: Visual Feature Empowered Multivariate Time Series Forecasting with Cross-Modal Fusion

VFEM: 视觉特征赋能的多变量时间序列预测与跨模态融合

Yanlong Wang, Hang Yu, Jian Xu, Fei Ma, Hongkang Zhang, Tongtong Feng, Zijian Zhang, Shao-Lun Huang, Danny Dongning Sun, Xiao-Ping Zhang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Pengcheng Laboratory(鹏城实验室) Ant Group(蚂蚁集团) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) University of Pennsylvania(宾夕法尼亚大学)

专题命中 其他LLM :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出VFEM模型,利用预训练大视觉模型通过跨模态注意力融合视觉与时间特征,仅训练7.45%参数即可捕捉跨变量依赖,提升多变量时间序列预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05134 2026-06-04 cs.CL cs.LG 62%

Activation-Based Active Learning for In-Context Learning: Challenges and Insights

基于激活的主动学习用于上下文学习:挑战与见解

Yaseen M. Osman, Geoff V. Merrett, Stuart E. Middleton

机构 * School of Electronics and Computer Science (ECS), University of Southampton(电子与计算机科学学院(ECS),南安普顿大学)

专题命中 其他LLM :LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了基于MLP激活的深度主动学习方法在上下文学习中的应用,发现激活信号与示例质量或任务性能相关性弱,表明此类方法不适用于上下文学习。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03483 2026-06-03 cs.LG cs.AI 62%

Analyzing Stream Collapse in Hyper-Connections: From Diagnosis to Mitigation

分析超连接中的流坍缩:从诊断到缓解

Ekaterina Alimaskina, Gleb Molodtsov, Aleksandr Beznosikov

机构 * MIRAI BRAIn Lab Yandex Research Innopolis University

专题命中 其他LLM :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过细粒度诊断发现超连接中的多流残差连接存在流坍缩现象,即信号集中于主导流,并通过打破初始化对称性缓解该问题以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00050 2026-06-02 cs.AI cs.CL cs.DB cs.IR 62%

Grokers: Bottom-Up Inductive Comprehension and Write-Time Intelligence over Typed Knowledge Graphs

Grokers: 基于类型化知识图谱的自底向上归纳理解与写入时智能

Gregory Magarshak

机构 * Gregory Magarshak

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Grokers架构,通过自底向上的依赖子图归纳遍历构建持久结构化理解,将智能推至写入时,实现零额外LM成本的查询,并证明字节同一性、累积单调性和双遍历顺序三个形式性质。

Comments 6 pages; second in a series with the Magarshak Machine / SPACER paper and the Context paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28832 2026-05-29 cs.CL cs.AI 62%

A comparative study of transformer-based embeddings for topic coherence

基于Transformer的嵌入在主题连贯性中的比较研究

Alex Ding, Tarun Rapaka, Willy Rodriguez, Jason Yang

机构 * Worcester Academy Stanford Online High School(沃斯特学院斯坦福在线高中) Stanford Online High School(斯坦福在线高中) Lexington High School(莱克星顿高中)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究系统比较了七种不同规模的Transformer语言模型(从MiniLM到LLaMA-2)在BERTopic流程中对主题质量的影响,发现模型大小(从2200万到130亿参数)对主题连贯性影响可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22586 2026-05-29 cs.LG cs.CL 62%

A Tutorial on Diffusion Theory: From Differential Equations to Diffusion Models

扩散理论教程:从微分方程到扩散模型

Jiayi Fu, Yuxia Wang

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.LG

AI总结 本教程从微分方程角度统一阐述扩散模型的数学基础,推导ODE和SDE表示,解释分数匹配和去噪目标,并涵盖DDPM、DDIM、流匹配和扩散语言模型。

Comments A detailed tutorial on Diffusion models and SDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04711 2026-05-27 cs.CR cs.AI cs.LG 62%

SWAP: Towards Copyright Auditing of Soft Prompts via Sequential Watermarking

SWAP:通过顺序水印实现软提示的版权审计

Wenyuan Yang, Yichen Sun, Changzheng Chen, Zhixuan Chu, Jiaheng Zhang, Yiming Li, Dacheng Tao

机构 * Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 其他LLM :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对软提示的版权保护问题,提出一种基于顺序水印的审计方法SWAP,通过将水印嵌入到更复杂的输出分布顺序空间中,实现无害且鲁棒的版权验证。

Comments This paper has been accepted by the International Journal of Computer Vision (IJCV), 2026. The first two authors contributed equally to this work. 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19409 2026-05-26 cs.LG cs.AI 62%

Unlocking the Potential of Continual Model Merging: An ODE Perspective

解锁持续模型合并的潜力:ODE视角

Lihong Lin, Haidong Kang

机构 * Northeastern University, Shenyang, China(东北大学,沈阳,中国)

专题命中 其他LLM :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出ODE-M框架,将持续模型合并建模为参数空间中的轨迹,通过整流时变速度场和效用感知时间调度平衡历史知识与新任务,提升长任务流性能。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23061 2026-05-25 cs.LG cs.AI math.OC stat.ML 62%

Anytime Training with Schedule-Free Spectral Optimization

任意时间训练:无调度谱优化

Anuj Apte, Pranav Deshpande, Niraj Kumar, Shouvanik Chakrabarti, Junhyung Lyle Kim

机构 * Global Technology Applied Research(全球技术应用研究)

专题命中 其他LLM :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SF-NorMuon无调度谱优化器,通过单一超参数配置在语言模型上匹配或超越调优的AdamW,实现任意时间高质量检查点获取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22821 2026-05-22 cs.CL cs.LG 62%

Tokenisation via Convex Relaxations

基于凸松弛的分词

Jan Tempus, Philip Whittington, Craig W. Schmidt, Dennis Komm, Tiago Pimentel

机构 * ETH Zurich(苏黎世联邦理工学院) Kensho Technologies(Kensho科技公司)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种基于凸松弛的分词方法ConvexTok,通过将分词构建问题转化为线性规划并利用凸优化工具求解,改进了分词指标和语言模型的bits-per-byte性能,并提升了下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21724 2026-05-22 cs.LG cs.AI 62%

TBP-mHC: full expressivity for manifold-constrained hyper connections through transportation polytopes

TBP-mHC: 通过运输多面体实现 manifold-constrained 超连接的全表达性

Anton Lyubinin

专题命中 其他LLM :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出 TBP-mHC,通过运输多面体参数化实现 manifold-constrained 超连接的全表达性,解决了超连接中无约束混合导致的训练不稳定性问题,并在语言模型预训练中展示了竞争性性能和改进的稳定性与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01406 2026-05-21 cs.LG cs.AI cs.NA math.NA 62%

One Operator to Rule Them All? On Boundary-Indexed Operator Families in Neural PDE Solvers

一个运算符统治一切?关于神经PDE求解器中边界索引运算符家族的探讨

Lennon J. Shikhman

机构 * College of Computing, Georgia Institute of Technology(佐治亚理工学院计算机学院) Department of Mathematics and Systems Engineering, Florida Institute of Technology(佛罗里达理工学院数学与系统工程系)

专题命中 其他LLM :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了神经PDE求解器中边界索引运算符家族的核心问题,指出传统方法在边界条件变化时存在非识别性问题,并通过实验验证了在不同边界条件下求解器的局限性。

Comments Published in the ICLR 2026 Workshop on AI & PDEs. 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16748 2026-05-19 cs.GR cs.AI cs.CV cs.LG cs.MA cs.MM 62%

Genflow Ad Studio: A Compound AI Architecture for Brand-Aligned, Self-Correcting Video Generation

Genflow Ad Studio:一种用于品牌一致、自我纠正视频生成的复合AI架构

Debanshu Das, Lavi Nigam, Sunil Kumar Jang Bahadur, Gopala Dhar

机构 * Google(谷歌)

专题命中 其他LLM :prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Genflow Ad Studio,一种复合AI架构,通过品牌DNA提取模块和对抗性多代理质量控制循环,提高了品牌一致的视频生成效率,将合规率从42%提升到89%。

Comments 6 pages, 2 figures, 2 tables. Accepted to the ACM Conference on AI and Agentic Systems (CAIS '26). Includes demo video and code repository links

Journal ref ACM Conference on AI and Agentic Systems (CAIS '26), May 26-29, 2026, San Jose, CA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12119 2026-05-19 cs.CL cs.AI 62%

Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource

专家混合模型可在严格相等资源下超越密集语言模型

Houyi Li, Ka Man Lo, Shijie Xuyang, Ziqi Wang, Wenzhen Zheng, Haocheng Zhang, Zhao Li, Shuigeng Zhou, Xiangyu Zhang, Daxin Jiang

机构 * Fudan University(复旦大学) StepFun University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究在资源相等条件下MoE模型是否能超越密集模型,提出优化框架并验证了在最优激活率下MoE模型性能更优,且该区域在不同模型规模下一致,通过数据重用解决数据量增加的权衡问题。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏