arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

共收录 2114
2609.03992 2026-09-04 cs.CL eess.AS 新提交

Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis

无对齐文本音频盒(Text-AB):用于语音配音和全双工对话合成

Sanyuan Chen, Min-Jae Hwang, Sho Inoue, Anna Sun, Bokai Yu, David Kant, Dongmin Hyun, Dorian Desblancs, Gregory Antonovsky, Oleg Repin, Peng-Jen Chen, Xutai Ma, Zehai Tu, Juan Pino, Wei-Ning Hsu

机构 * FAIR at Meta(Meta FAIR研究院)

AI总结 该研究提出无对齐文本音频盒(Text-AB),基于流匹配扩散Transformer,在48万小时语音预训练后经微调,实现高质量配音与全双工对话合成,性能大幅优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03109 2026-09-04 cs.CV 新提交

SLIDEFORGE: An LLM Agent for Controllable Editing of Slides as Structured Artifacts

SLIDEFORGE:一款用于将幻灯片作为结构化工件进行可控编辑的大语言模型智能体

Haozhen Zheng, Fulin Wang, Tianhu Xiong, Yingjie Yu, Shengyi Qian, Hanchao Yu, Alex Schwing, Klara Nahrstedt, Mingyuan Wu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta

AI总结 SLIDEFORGE是一款基于Deck State Graph的LLM智能体,可实现保留布局样式等的可控幻灯片编辑,在多维度评估中优于现有基线,提供可控幻灯片编辑的新方案。

Comments EMNLP 2026 Main Conference. Haozhen and Fulin contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01431 2026-09-04 cs.LG cs.AI 版本更新

Efficiently Estimating Optimal Hyperparameter Scaling Laws through Power-Law Entropy Search

通过幂律熵搜索高效估计最优超参数缩放定律

Zhiliang Chen, Sebastian Ament, David Eriksson, Maximilian Balandat, Bryan Kian Hsiang Low, Eytan Bakshy, Jihao Andreas Lin

机构 * Meta National University of Singapore(新加坡国立大学) Atomic Machines(原子机器公司)

AI总结 该研究提出幂律熵搜索(PLES),一种基于多保真度贝叶斯优化的获取函数,可高效估计LLM的最优超参数缩放定律,其计算预算仅为传统网格搜索的十分之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01658 2026-09-04 cs.AI 版本更新

CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery

CORAL:迈向自主多智能体进化以实现开放性发现

Ao Qu, Han Zheng, Zijian Zhou, Yihao Yan, Yihong Tang, Shao Yong Ong, Fenglu Hong, Kaichen Zhou, Chonghe Jiang, Minwei Kong, Jiacheng Zhu, Xuan Jiang, Sirui Li, Cathy Wu, Bryan Kian Hsiang Low, Jinhua Zhao, Paul Pu Liang

机构 * MIT(麻省理工学院) NUS(新加坡国立大学) MiniMax McGill(麦吉尔大学) Stanford(斯坦福大学) SambaNova Meta Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究技术联盟) Amazon(亚马逊) Microsoft(微软)

AI总结 本文提出CORAL框架,通过自主多智能体进化方法,实现了在开放性问题上的发现,展示了智能体自主性和多智能体进化对提升开放性发现的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03313 2026-09-04 cs.LG cs.CL 版本更新

LLM as GNN: Graph Vocabulary Learning for Text-Attributed Graph Foundation Models

大语言模型作为图神经网络:面向文本属性图基础模型的图词汇学习

Xi Zhu, Haochen Xue, Ziwei Zhao, Wujiang Xu, Jingyuan Huang, Minghao Guo, Qifan Wang, Kaixiong Zhou, Imran Razzak, Yongfeng Zhang

机构 * Rutgers University(罗格斯大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) University of Science and Technology of China(中国科学技术大学) Meta AI North Carolina State University(北卡罗来纳州立大学)

AI总结 该研究针对文本属性图基础模型的跨图跨任务迁移难题,提出基于图词汇学习的PromptGFM模型,通过图理解与图推理模块实现LLM与GNN的深度集成,在多图多任务上展现出优越性能与迁移性。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02730 2026-09-03 cs.CL 新提交

CORAL: An LLM-Native Harness for Production Recommender Systems

CORAL:面向生产级推荐系统的原生大语言模型(LLM)工具

Muhammad Rafay Azhar, Yuhang Zhou, Gilbert Jiang, Yuchen Wang, Rahul Sharma, Matthew DeSousa, Jiayi Liu, Xin Guo, Lizhu Zhang, Xiangjun Fan

机构 * Meta AI

AI总结 本研究提出原生大语言模型工具CORAL,将智能体闭环应用于生产级推荐系统,通过A/B实验证实其可在两个大规模社交平台上实现参与度提升或服务成本降低,自动化持续优化工作。

Comments Accepted by RecSys '26 OARS Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02108 2026-09-03 cs.CL cs.AI 新提交

Predict, Don't Iterate: Efficient Adaptive-Length Infilling for Diffusion Language Models

预测而非迭代:用于扩散语言模型的高效自适应长度 infilling

Haobo Xu, Sirui Chen, Yuanchen Bei, Lingjie Chen, Yuchen Yan, Dongqi Fu, Jingrui He, Hanghang Tong

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta

AI总结 该研究针对扩散语言模型 infilling 任务的局限,提出无预设长度的高效 PILL 方法,在多模型多基准上实现代码通过率、文本 BLEU-2 提升且推理速度加快。

Comments Accepted at EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01807 2026-09-03 cs.LG cs.AI cs.IR 新提交

hLLM: Single Pass Decoding for Generative Reranking

hLLM:用于生成式重排序的单遍解码

Emil Laftchiev, Prachi Agrawal, Moe Kayali, Bixing Yan, Qi Xu, Zijie Lei, Chen Qiu, Zhi Hua, Ke Li, Luke Simon

机构 * Meta Platforms, Inc.(元平台公司)

AI总结 该研究提出hLLM,一种O(1)解码的格式专用策略,结合LoRA微调与教师排序蒸馏,使生成式重排序速度提升64倍,保持质量并连接组合优化,开辟实时排序新路径。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24497 2026-09-03 cs.AI cs.LG cs.RO stat.ML 版本更新

What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?

在联合嵌入预测世界模型中成功因素是什么?

Basile Terver, Tsung-Yen Yang, Jean Ponce, Adrien Bardes, Yann LeCun

机构 * Meta FAIR Inria Paris(巴黎理工院) Ecole normale supérieure / PSL(巴黎高等师范学院 / PSL) New York University(纽约大学)

AI总结 本文研究了在物理规划中使用联合嵌入预测世界模型(JEPA-WMs)的成功因素,通过分析模型架构、训练目标和规划算法对规划成功的影响,提出了一种在导航和操作任务中优于现有基线方法的模型。

Comments V2 of the article: - Added AdaLN-zero - Added table comparing JEPA-WMs with baselines with std translating per-seed variability only, no variability across epochs - Reordered figures in main body of the paper V3: added data scaling experiments, theoretical appendix section on autoregressive rollout, acceptance at TMLR V4: Added funding acknowledgements for Jean Ponce

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00759 2026-09-03 cs.CV cs.AI cs.CL 版本更新

Multimodal Language Models as Text-to-Image Model Evaluators

多模态语言模型作为文本到图像模型的评估器

Jiahui Chen, Candace Ross, Reyhane Askari-Hemmat, Koustuv Sinha, Melissa Hall, Amy Zhang, Michal Drozdzal, Adriana Romero-Soriano

机构 * FAIR at Meta - Montreal, New York(Meta 蒙特利尔 FAIR) University of Texas at Austin(德克萨斯大学奥斯汀分校) Mila McGill University(麦吉尔大学) Canada CIFAR AI chair(加拿大 CIFAR 人工智能主席)

AI总结 该研究提出MT2IE框架,以MLLM为评估智能体,生成少量提示即可高效准确评估T2I模型,其排名比现有指标更忠实一致,还可定制基准,助力动态评估框架发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01551 2026-09-02 cs.CV 新提交

What, Where, and How: Probing Spatiotemporal Representations in Video Foundation Models

是什么、在哪里、如何:探究视频基础模型中的时空表征

Sharon S. Musa, Fereshteh Forghani, Harrish Thasarathan, Sonia Joseph, Matthew Kowal, Konstantinos G. Derpanis

机构 * Lassonde School of Engineering(拉桑德工程学院) York University(约克大学) Vector Institute(矢量研究院) FAIR, Meta Superintelligence Labs(Meta超级智能实验室FAIR) Mila(米拉研究院) McGill University(麦吉尔大学) Goodfire AI(Goodfire人工智能公司)

AI总结 本研究通过分层分析V-JEPA 2和VideoMAE-v2,探究其时空表征的编码内容、位置与几何组织,发现相机运动编码特性并应用几何样条引导实现更优的视频插值。

Comments Interactive visualizations are available at https://vid-rep-pca.netlify.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01532 2026-09-02 cs.CL 新提交

Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall

训练中期的知识蒸馏更利于推理而非事实回忆

Jacqueline He, Howard Yen, Shuyue Stella Li, Margaret Li, Hanqing Zeng, Yinglong Xia, Benyu Zhang, Zhuokai Zhao, Qiang Zhang, Pang Wei Koh, Luke Zettlemoyer, Wen-tau Yih

机构 * Meta AI University of Washington(华盛顿大学) Princeton University(普林斯顿大学)

AI总结 该研究发现训练中期的前向KD会减缓事实回忆但提升推理,提出Switch Distillation方法,在保留高推理和知识性能的同时维持大部分事实回忆,优于现有蒸馏目标。

Comments 33 pages, 13 figures, 9 tables. Code is publicly available at https://github.com/facebookresearch/midtraining-distillation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31981 2026-09-02 cs.CV cs.AI 版本更新

LUNA: Learning Universal 3D Human Animation Beyond Skinning

LUNA: 超越蒙皮的学习通用3D人体动画

Peng Li, Rawal Khirodkar, Junxuan Li, Yuan Dong, Chen Cao, Yuan Liu, Wenhan Luo, Yike Guo, Shunsuke Saito

机构 * The Hong Kong University of Science and Technology(香港科技大学) Codec Avatars Lab, Meta(Meta编解码虚拟形象实验室)

AI总结 提出无LBS的通用神经动画模型LUNA,通过Transformer运动回归器将多种2D控制映射为3D高斯变形,结合混合监督实现零样本跨身份泛化。

Comments ECCV 2026, Project page: https://penghtyx.github.io/LUNA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29859 2026-09-02 eess.AS cs.CL 版本更新

MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables

MELD: 基于梅尔频谱的离散潜变量语音语言建模

Sung-Lin Yeh, Wei Zhou, Gil Keren, Duc Le, Zhong Meng, Hao Tang, Jay Mahadeokar, Ozlem Kalinli, Alexandre Mourachko

机构 * University of Edinburgh(爱丁堡大学) Google DeepMind(谷歌DeepMind) Meta Superintelligence Labs(Meta超智能实验室)

AI总结 提出一种在梅尔频谱上联合优化编码器和语音语言模型的离散潜变量模型,在零样本文本转语音和语音转文本任务上优于基于编解码器和其他梅尔频谱基线,并缓解了自回归建模中的长时间静音和单词遗漏问题。

Comments Accepted to EMNLP 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16792 2026-09-02 cs.CV cs.AI 版本更新

V-Co: A Closer Look at Visual Representation Alignment via Co-Denoising

V-Co:通过去噪更深入地审视视觉表示对齐

Han Lin, Xichen Pan, Zun Wang, Yue Zhang, Chu Wang, Jaemin Cho, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) NYU(纽约大学) Meta AI2(人工智能研究院)

AI总结 本文通过统一的JiT框架系统研究视觉去噪,揭示了四个关键要素:双流架构、结构化无条件预测、感知漂移混合损失和特征重缩放,从而在ImageNet-256上实现更高效的生成模型。

Comments Accepted by ECCV 2026. code: https://github.com/HL-hanlin/V-Co

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21638 2026-09-02 cs.LG 版本更新

Iterative GRPO: Batch-Online Policy Iteration for Multi-Turn RL via Single-Turn RLHF

通过迭代PPO对齐大语言模型以实现多轮对话结果

Daniel R. Jiang, Ankur Samanta, Yukai Yang, Jalaj Bhandari, Rémi Munos, Tyler Lu

机构 * Meta FAIR at Meta(Meta的FAIR)

AI总结 本文提出Iterative PPO方法,通过迭代优化多轮对话中的Q函数和策略,实现更稳定的对话生成。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30585 2026-09-01 cs.LG 新提交

The Safety Relay in Roleplay Jailbreaks: A Component-Resolved Causal Analysis of Harm Recognition and Refusal

角色扮演越狱中的安全继电器:对有害内容识别与拒绝的组件解析因果分析

Md Mokarram Chowdhury, Ernie Chang, Yang Li

机构 * Iowa State University(爱荷华州立大学) Meta

AI总结 本研究通过机制可解释性分析角色扮演越狱中模型服从有害请求的机制,发现安全继电器衰减等规律,明确了安全措施需维持有害识别到拒绝的关联。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30559 2026-09-01 cs.SD 新提交

SPHERE: Automatic Music Upmixing via Audio Language Model Post-Training with Spatial Heuristic Rewards

SPHERE:通过结合空间启发式奖励的音频语言模型后训练实现自动音乐上混

Zixun Guo, Calvin Murdock, Sanjeel Parekh, W Owen Brimijoin, Simon Dixon, Joshua Reiss, Ishwarya Ananthabhotla

机构 * Meta Reality Labs(元宇宙实验室) Queen Mary University of London(伦敦玛丽女王大学)

AI总结 该研究提出基于音频语言模型后训练的自动音乐上混方法,设计含6个子奖励的Sphere奖励套件,证明领域知识可蒸馏入语言模型实现该任务。

Journal ref EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28701 2026-09-01 cs.CV 新提交

TopoAgent: A Structure-Aware Perception-to-Reasoning Framework for Diagram-to-Graph Topology Extraction with Large Vision-Language Models

TopoAgent:基于大型视觉语言模型的感知到推理的结构感知框架,用于图到图拓扑提取

Bangwei Guo, Xujiang Zhao, Yanchi Liu, Wei Cheng, Shengyu Chen, Dongyue Li, Masaharu Morimoto, Takayuki Kuroda, Dimitris Metaxas, Haifeng Chen

机构 * Rutgers University(罗格斯大学) Meta NEC Labs America(美国NEC实验室) University of Electro-Communications(电气通信大学) NEC Corporation(日本电气公司)

AI总结 该研究针对图到图拓扑提取任务构建了TopoBench-180基准,并提出TopoAgent框架,结合感知、结构先验与推理,在基准上性能优于现有模型,填补了多模态结构化理解的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06621 2026-09-01 cs.AI 版本更新

NxN E-valuation: Hypothesis Certification via a Conformal CRT Null

NxN E-评估:通过共形CRT空假设进行假设验证

Bin Wang, Yan Zhong

机构 * Meta

AI总结 本文提出NxN E-评估算法,利用大型训练集让样本互为空假设,实现共形CRT以验证LLM的假设,可作为LLM循环验证和保留数据测试的更优替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19313 2026-09-01 cs.LG cs.AI 版本更新

Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information

脱离上下文的广义信赖域策略优化算法:利用特权信息学习解决难题

Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Boris Vidolov, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi

机构 * Meta AI Columbia University(哥伦比亚大学)

AI总结 研究利用特权信息解决强化学习难题,提出脱离上下文的广义信赖域策略优化算法(OC - GRPO),通过引导展开和重要性校正目标避免训练不匹配,在标准数学推理基准上比普通GRPO有显著提升且成本低。

Comments 24 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24232 2026-09-01 cs.CV cs.GR 版本更新

FiCA: Feed-forward instant Gaussian Codec Avatars from a Single Portrait Image

FiCA:基于单张肖像图像的前馈即时高斯编解码器化身

Kim Youwang, Zhengyu Yang, Liuhao Ge, Yu Rong, Timur Bagautdinov, Su Zhaoen, Nir Sopher, Jovan Popović, Teng Deng, Tae-Hyun Oh, Chen Cao

机构 * Codec Avatars Lab, Meta(Meta编解码虚拟化身实验室) Dept. of Electrical Engineering, POSTECH(浦项科技大学电气工程系) School of Computing, KAIST(韩国科学技术院计算机学院)

AI总结 提出FiCA,一种结合人类视觉基础模型和扩散模型的前馈管道,从单张图像生成逼真、可驱动的3D高斯化身,无需测试时优化。

Comments Project page: https://kim-youwang.github.io/FiCA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18987 2026-09-01 cs.CL cs.AI cs.PL

LLMs versus the Halting Problem: Characterizing Program Termination Reasoning

LLMs 与停机问题:程序终止推理的特征化

Oren Sultan, Jordi Armengol-Estape, Pascal Kesseli, Julien Vanegue, Dafna Shahaf, Yossi Adi, Peter O'Hearn

机构 * FAIR Team, Meta AI(Meta AI FAIR 团队) The Hebrew University of Jerusalem, Israel(耶路撒冷希伯来大学) Bloomberg, New York, USA(彭博社,纽约,美国) Imperial College London, UK(伦敦帝国理工学院,英国) University College London, UK(伦敦大学学院,英国)

AI总结 本文评估了前沿LLMs在程序终止推理上的能力,发现GPT-5和Claude Sonnet 4.5在C程序终止判断上达到顶级验证工具水平,但无法生成形式化证明,并引入分歧前置条件形式化描述非终止条件。

Comments long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06181 2026-09-01 cs.CL 版本更新

Investigating Social Bias Changes in Quantized Language Models

不确定性驱动量化大语言模型中的社会偏见变化

Stanley Z. Hua, Sanae Lotfi, Irene Y. Chen

机构 * UC Berkeley(伯克利大学) Centre for Computational Medicine at The Hospital for Sick Children(儿童医院计算医学中心) UCSF(旧金山大学) Meta Superintelligence Labs(Meta超智能实验室)

AI总结 研究发现量化过程导致大语言模型中社会偏见的翻转,且不确定性与量化强度影响偏见变化,需进行后续评估以确保可靠性。

Comments Accepted to COLM 2026 (10 pages, 5 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22707 2026-09-01 cs.IR cs.AI 版本更新

CoFiRec: Coarse-to-Fine Tokenization for Generative Recommendation

CoFiRec: 生成推荐中的粗到细分词

Tianxin Wei, Xuying Ning, Xuxing Chen, Ruizhong Qiu, Yupeng Hou, Yan Xie, Shuang Yang, Zhigang Hua, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta University of California San Diego(加州大学圣地亚哥分校)

AI总结 CoFiRec通过粗到细分词提升生成推荐效果,有效捕捉用户意图演变。

Comments RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01359 2026-09-01 cs.CR cs.AI 版本更新

Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks

破解代码:通过系统性越狱攻击对AI代码代理进行安全评估

Shoumik Saha, Jifan Chen, Sam Mayers, Sanjay Krishna Gouda, Zijian Wang, Varun Kumar

机构 * University of Maryland – College Park(马里兰大学-College Park) AWS AI Labs(AWS人工智能实验室) Meta Superintelligence Labs(Meta超智能实验室)

AI总结 提出JAWS-Bench基准测试,通过三级工作区评估代码LLM代理的越狱风险,发现代理化使攻击成功率提升1.6倍,并揭示可执行攻击代码的高比例。

Comments 22 pages, 18 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00938 2026-08-31 cs.LG 版本更新

Large Reasoning Models Learn Better Alignment from Flawed Thinking

大规模推理模型通过 flawed thinking 学习更好的对齐

ShengYun Peng, Pin-Yu Chen, Eric Smith, Song Jiang, Hongyuan Zhan, Haozhu Wang, Mahesh Pasupuleti, Duen Horng Chau, Jianfeng Chi

机构 * Meta Superintelligence Labs(Meta超级智能实验室) IBM Research(IBM研究院)

AI总结 RECAP通过强化学习提升模型安全对齐能力,减少偏见并增强鲁棒性,同时保持推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08289 2026-08-31 cs.LG cs.AI q-bio.NC 版本更新

Attention as Conditioning: What Classical Learning Theory Predicts About Linear Transformers

作为条件的注意力:经典学习理论对线性Transformer的预测

Mu Qiao

机构 * Meta Platforms, Inc.(Meta公司)

AI总结 该研究将线性Transformer的注意力机制与经典动物学习理论模型对应,推导卡明阻塞闭式解,发现不同注意力的线索竞争差异及容量机制,提出PH-注意力规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26334 2026-08-28 cs.AI 新提交

ProofEvolve: Neuro-Symbolic Evolution for Formal Automated Theorem Proving

ProofEvolve:用于形式化自动定理证明的神经符号进化方法

Wenqian Ye, Ziwei Guan, Eric Xie, Bohan Liu, Shivani Modi, Buyun Zhang, Ellie Dingqiao Wen, Henry Kautz, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学) Meta AI

AI总结 ProofEvolve是一种神经符号框架,结合神经模型与Lean内核进化形式化验证的证明结构,在三个竞赛级Lean基准中实现最高平均定理解决率,解决现有神经证明器的递归结构缺失问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26317 2026-08-28 cs.CV cs.AI cs.MM 新提交

Modality Maturity Index: A benchmark for assessing multimodal capabilities of omni models

模态成熟度指数:评估全模态模型多模态能力的基准

Rohit Patel, Dieuwke Hupkes, Sloan Strader

机构 * Meta Superintelligence Labs(元超级智能实验室)

AI总结 该研究提出评估全模态模型多模态能力的基准MMI,测试五种模态及组合,发现前沿模型MPS得分低,LLM评分者与人工标注者判断一致性达70.8%。

Comments 26 pages, 6 figures. Code and dataset available

详情

展开后加载摘要…

URL PDF HTML 收藏