arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1498 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1498 篇

2606.06921 2026-07-14 cs.SD 版本更新 67%

Towards Event-Robust Acoustic Scene Classification

面向事件鲁棒的声学场景分类

Yiqiang Cai, Bohan Hu, Yu Yang, Pengwei Lu, Shengchen Li, Xi Shao

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) Zhongdian Zhiheng Information Technology Service Co., Ltd(中电智恒信息技术服务有限公司) China Telecom Jiangsu Branch(中国电信江苏分公司) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对现有声学场景分类系统在未知声音事件下性能下降的问题,提出事件移位声学场景数据集ESAS,通过大语言模型注入前景事件模拟真实环境,评估并推动事件鲁棒ASC研究。

Comments Accepted to Interspeech 2026. The ESAS dataset is available at: https://doi.org/10.5281/zenodo.21317541

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03430 2026-07-14 cs.RO 版本更新 67%

ProAct: A Benchmark and Multimodal Framework for Structure-Aware Proactive Response

ProAct:用于结构感知主动响应的基准和多模态框架

Xiaomeng Zhu, Fengming Zhu, Weijie Zhou, Ye Tian, Zhenlin Hu, Yufei Huang, Yuchun Guo, Xinyu Wu, Zhengyou Zhang, Fangzhen Lin, Xuantang Xiong

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST), Hong Kong SAR, China(香港科技大学计算机科学与工程系) Tencent, Shenzhen, China(腾讯(中国深圳)) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究所(SIAT),中国科学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对主动智能体开发受资源缺乏阻碍的问题,引入ProAct-75基准,提出由多模态大语言模型驱动的ProAct-Helper,其利用任务图进行行动选择,实验证明该方法在触发检测等方面优于闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01767 2026-07-14 cs.CL cs.AI cs.LG 版本更新 67%

HiQA: A Hierarchical Contextual Augmentation RAG for Multi-Documents QA

HiQA:一种用于多文档问答的分层上下文增强检索与生成模型

Xinyue Chen, Pengyu Gao, Jiangjiang Song, Xiaoyang Tan

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Southeast University(东南大学) Hello World(Shanghai) Technology Co., Ltd.(Hello World(上海)科技有限公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对检索增强生成在多文档问答中面对大量相似文档时检索准确性有限的问题,提出HiQA框架,它集成级联元数据与多路径检索机制,还发布MasQA基准,在多文档环境中展现了最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01803 2026-07-10 cs.CV 版本更新 67%

Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos

生成式动作叙事:评估合成视频中的人体运动

Xavier Thomas, Youngsun Lim, Ananya Srinivasan, Audrey Zheng, Deepti Ghadiyaram

机构 * Boston University(波士顿大学) Belmont High School(贝利蒙高中) Canyon Crest Academy(坎波尔峡谷学院) Runway

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究视频生成模型中评估复杂人类动作指标难的问题,提出融合骨骼与外观特征的评估指标,经多方面基准验证,该指标相比现有方法有显著改进,与人类感知相关性强,揭示了当前模型局限性并建立新标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21664 2026-07-08 cs.CV 版本更新 67%

HumanOmni-Speaker: Identifying Who said What and When

HumanOmni-Speaker: 识别说话者说了什么以及何时

Detao Bai, Zhiheng Ma, Xihan Wei

机构 * Tongyi Lab Alibaba Group(阿里云实验室) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出HumanOmni-Speaker,通过视觉注册说话人辨识与识别方法,解决多人物对话中说话者身份与时间的识别问题,实现端到端的多模态协同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30583 2026-07-07 cs.CY econ.GN q-fin.EC q-fin.GN 版本更新 67%

AI Premium

AI溢价

Nicola Borri, Yukun Liu, Aleh Tsyvinski

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 基于380万亿token的AI消费数据,构建AI因子并发现高AI贝塔公司获得更高后续收益,AI溢价显著且异质,主要源于密集型、前沿导向的AI消费。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22607 2026-07-07 cs.CV 版本更新 67%

Dress-ED: Instruction-Guided Editing for Virtual Try-On and Try-Off

Dress-ED:基于指令的虚拟试穿和试脱编辑

Davide Lobba, Fulvio Sanguigni, Bin Ren, Marcella Cornia, Rita Cucchiara, Nicu Sebe

机构 * University of Modena(摩德纳大学) University of Trento(特伦托大学) University of Pisa(比萨大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出Dress-ED数据集,首次统一了虚拟试穿、试脱和文本引导的服装编辑,包含146k个样本,涵盖外观和结构修改,提供统一的多模态扩散框架作为指令驱动的VTON和VTOFF基线。

Comments Accepted at ECCV 2026. Project page at https://aimagelab.github.io/Dress-ED/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10730 2026-07-07 cs.CV 版本更新 67%

IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation

IRG-MotionLLM:用于文本到运动生成的交织运动生成、评估和细化

Yuan-Ming Li, Qize Yang, Nan Lei, Shenghao Fu, Ling-An Zeng, Jian-Fang Hu, Xihan Wei, Wei-Shi Zheng

机构 * Sun Yat-sen University(中山大学) Tongyi Lab, Alibaba Group(阿里云实验室) Shenzhen Loop Area Institute(深圳河套学院) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部人工智能与先进计算重点实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究揭示运动评估和细化任务可促进知识流动,提出通过迭代文本-运动对话将运动生成与评估、细化紧密结合的新范式,介绍IRG-MotionLLM及训练方案,构建数据引擎,实验证明其性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20272 2026-07-07 cs.CV 版本更新 67%

VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs

VKnowU:评估多模态语言模型中的视觉知识理解

Tianxiang Jiang, Sheng Xia, Yicheng Xu, Linquan Wu, Xiangyu Zeng, Limin Wang, Yu Qiao, Yi Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究多模态大语言模型视觉知识理解能力,提出VKnowU基准测试。评估28个模型,发现与人类表现有差距。引入新数据集和VideoKnow+基线模型,采用结构化范式和强化学习,提升模型表现。

Comments Accepted by ECCV 2026. https://github.com/OpenGVLab/VKnowU

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08711 2026-07-03 cs.CV 版本更新 67%

TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions

TimeChat-Captioner: 用时间感知和结构化的音视频字幕脚本化多场景视频

Linli Yao, Yuancheng Wei, Yaojie Zhang, Lei Li, Xinlong Chen, Feifan Song, Ziyue Wang, Kun Ouyang, Yuanxin Liu, Lingpeng Kong, Qi Liu, Pengfei Wan, Kun Gai, Yuanxing Zhang, Xu Sun

机构 * South China University of Technology(华南理工大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 评测与基准 :SFT(abstract,abstract_cn)

AI总结 提出Omni密集描述任务,通过六维结构模式生成带时间戳的类脚本描述,构建OmniDCBench基准和SodaM评估指标,训练TimeChat-Captioner-7B模型,在音视频推理和时间定位任务上超越Gemini-2.5-Pro。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09446 2026-07-03 cs.CV 版本更新 67%

Defect-aware Hybrid Prompt Optimization via Progressive Tuning for Zero-Shot Multi-type Anomaly Detection and Segmentation

基于渐进调优的缺陷感知混合提示优化用于零样本多类型异常检测与分割

Nadeem Nazer, Hongkuan Zhou, Lavdim Halilaj, Ylli Sadikaj, Steffen Staab

机构 * Corporate Research, Robert Bosch GmbH(罗伯特·博世集团企业研究部) Otto-von-Guericke-University(奥托·冯·格里克大学) Institute for Artificial Intelligence, University of Stuttgart(斯图加特大学人工智能研究所) Faculty of Computer Science, UniVie Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学系) University of Southampton(南安普顿大学)

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 提出DAPO框架,通过混合提示机制结合可读缺陷描述与可学习嵌入,对齐异常视觉特征与文本语义,在零样本多类型异常检测与分割任务中平均提升AUROC 3.6%和5.2%。

Journal ref European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23365 2026-07-02 cs.CV 版本更新 67%

SpatialMosaic: A Multiview VLM Dataset for Partial Visibility

SpatialMosaic:一个多视角VLM数据集用于部分可见性

Kanghee Lee, Jungi Hong, Sion Lee, Injae Lee, Minseok Kwak, Kwonyoung Ryu, Jaesik Park

机构 * Seoul National University(首尔大学) University College London(伦敦大学学院) Kyung Hee University(庆熙大学) POSTECH(浦项科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出SpatialMosaic数据集,通过多视角图像生成2M问答对,引入SpatialMosaic-Bench基准测试,结合3D重建模型的混合框架提升空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21573 2026-07-02 cs.CV 版本更新 67%

Rethinking Visual Privacy: A Compositional Privacy Risk Framework for Severity Assessment with VLMs

重新思考视觉隐私:一种用于严重性评估的组合隐私风险框架与VLM

Efthymios Tsaprazlis, Tiantian Feng, Anil Ramakrishna, Sai Praneeth Karimireddy, Rahul Gupta, Shrikanth Narayanan

机构 * University of Southern California(南加州大学) Meta Superintelligence Labs(Meta超级智能实验室) Amazon AGI(亚马逊AGI)

专题命中 评测与基准 :SFT(abstract,abstract_cn)

AI总结 提出组合隐私风险分类法(CPRT),将视觉属性按独立可识别性和组合危害潜力分级,并构建6.7K图像数据集,评估VLM在组合隐私风险评估中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12009 2026-07-02 cs.CV 版本更新 67%

Affogato: Open-Vocabulary Affordance Grounding with Automated Data Generation at Scale

Affogato: 基于大规模自动数据生成的开词汇可操作区域定位

Junha Lee, Eunha Park, Chunghyun Park, Dahyun Kang, Minsu Cho

机构 * Pohang University of Science and Engineering (POSTECH)(浦项科技大学) SqueezeBits RLWLRD

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract)

AI总结 提出Affogato框架,通过自动化流程生成750K 3D可操作区域热力图与自然语言查询对,解决数据瓶颈,实现开词汇可操作区域定位,并验证其跨架构迁移能力。

Comments ECCV 2026, Project page: https://junha-l.github.io/affogato/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08758 2026-07-01 eess.IV cs.CV 版本更新 67%

M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding

M3CoTBench:医学图像理解中多模态大语言模型的思维链基准测试

Juntao Jiang, Jiangning Zhang, Yali Bi, Jinsheng Bai, Weixuan Liu, Weiwei Jin, Zhucun Xue, Yong Liu, Xiaobin Hu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) East China Normal University(华东师范大学) Zhejiang Provincial People’s Hospital(浙江省人民医院) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出M3CoTBench基准,通过多层级难度数据集和专用评估指标,系统评测多模态大语言模型在医学图像理解中的思维链推理正确性、效率、影响和一致性。

Comments 39 pages, 8 figures; accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17994 2026-06-29 stat.ME 版本更新 67%

Assessing Monotone Dependence: Area Under the Curve Meets Rank Correlation

评估单调依赖性:曲线下面积与秩相关的结合

Eva-Maria Walz, Andreas Eberl, Tilmann Gneiting

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文统一了连续和二分结果下单调依赖性的度量,引入非对称等级相关(AGC)和单调关联系数(CMA),连接了AUC与Spearman's Rho,并建立了中心极限定理和DeLong型检验。

Comments Substantially expanded and revised

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14609 2026-06-25 cs.CV 版本更新 67%

GroundSet: A Cadastral-Grounded Dataset for Spatial Understanding with Vector Data

GroundSet: 基于地籍数据的空间理解向量数据集

Roger Ferrod, Maël Lecene, Krishna Sapkota, George Leifman, Vered Silverman, Genady Beryozkin, Sylvain Lobry

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对多模态大模型在遥感精细空间理解上的不足,提出基于地籍矢量数据的大规模数据集,含510k高分辨率图像和380万标注对象,通过指令微调基准验证,标准架构可掌握细粒度空间定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05896 2026-06-24 cs.CV 版本更新 67%

Resonant Minds: Closed-Loop Social Avatars with Theory of Mind

共鸣心智:具备心智理论的闭环社交虚拟人

Jianxu Shangguan, Jing Xu, Hang Ye, Xiaoxuan Ma, Yizhou Wang, Jenq-Neng Hwang, Wentao Zhu

机构 * University of Washington(华盛顿大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Eastern Institute of Technology, Ningbo(宁波工程技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出一个闭环双智能体框架,通过整合感知、社会推理(基于心智理论)和多模态生成,实现具备社交智能的虚拟人,并在信息不对称数据集上取得优于全信息脚本模式的对话质量。

Comments Project page: https://resonantminds.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18582 2026-06-24 cs.NI 版本更新 67%

Wireless Copilot: An AI-Powered Partner for Navigating Next-Generation Wireless Complexity

无线副驾驶:一个AI驱动的合作伙伴,用于驾驭下一代无线复杂性

Haoxiang Luo, Ruichen Zhang, Yinqiu Liu, Gang Sun, Hongfang Yu, Dong In Kim

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出“无线副驾驶”框架,通过集成大语言模型与认知架构,将人类意图转化为精确的网络操作,以管理6G的复杂性,并在低空无线网络中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18684 2026-06-24 cs.CR cs.AI cs.CL cs.LG cs.SY eess.SY 版本更新 67%

FALCON: Transforming Cyber Threat Intelligence into Deployable IDS Rules with Self-Reflection

FALCON:通过自我反思将网络威胁情报转化为可部署的入侵检测系统规则

Shaswata Mitra, Subash Neupane, Martin Duclos, Sudip Mittal, Aritran Piplai, Md Rayhanur Rahman, Edward Zieglar, Shahram Rahimi

机构 * Meharry Medical College(梅哈里医学院) The University of Texas at El Paso(德克萨斯理工大学) The University of Alabama(阿拉巴马大学) National Security Agency(国家安全局)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出FALCON框架,通过新颖的CTI-规则语义评分器实现规则检索、生成和验证,解决签名型入侵检测系统中规则创建的手动瓶颈和验证难题,在Snort和YARA平台上达到0.72平均相关性。

Comments 17 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07131 2026-06-23 cs.CR cs.SE 版本更新 67%

MalSkillBench: A Runtime-Verified Benchmark of Malicious Agent Skills

MalSkillBench: 一个运行时验证的恶意智能体技能基准

Wenbo Guo, Wei Zeng, Chengwei Liu, Xiaojun Jia, Yijia Xu, Lei Tang, Yong Fang, Yang Liu

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出MalSkillBench,首个运行时验证的恶意智能体技能基准,包含3944个恶意技能,通过闭环生成-验证-反馈流水线构建,揭示代码注入与提示注入检测的不对称性,并指出联合推理任务意图、代码和指令的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06971 2026-06-19 cs.MA cs.SI 版本更新 67%

Modeling U.S. Attitudes Toward China via an Event-Steered Multi-Agent Simulator

通过事件驱动的多智能体模拟器建模美国对华态度

Chenxu Zhu, Hantao Yao, Wu Liu, Junbo Guo, Yongdong Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出事件驱动多智能体模拟器(ES-MAS),利用CURE数据集和双流数据集成引擎(DSDIE)及新闻驱动动态交互模块(NDDI),模拟美国对华舆论的动态演化,实验表明优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16357 2026-06-19 cs.CY cs.SE 版本更新 67%

Beyond Grading Accuracy: Exploring Alignment of TAs and LLMs

超越评分准确性:探索助教与LLMs的一致性

Matthijs Jansen op de Haar, Nacir Bouali, Faizan Ahmed

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出一个评估管道,通过定量研究92个UML类图,比较助教与六个开源LLMs在单个评分标准上的表现,发现开源LLMs在评分准确性上接近助教,为混合主动评分系统提供了可能。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22959 2026-06-19 cs.CV 版本更新 67%

Can Agents Distinguish Visually Hard-to-Separate Diseases in a Zero-Shot Setting? A Pilot Study

智能体能否在零样本设置中区分视觉上难以分离的疾病?一项初步研究

Zihao Zhao, Frederik Hauke, Juliana De Castilhos, Sven Nebelung, Daniel Truhn

机构 * Department of Diagnostic and Interventional Radiology, University Hospital Aachen, 52074 Aachen, Germany(诊断与介入放射科,亚琛大学医院,德国亚琛,52074)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究探索多模态大语言模型智能体在零样本下区分视觉混淆疾病(如黑色素瘤与不典型痣、肺水肿与肺炎)的能力,提出基于对比裁决的多智能体框架,在皮肤镜数据上准确率提升11个百分点,但总体性能仍不足临床部署。

Comments Code available at https://github.com/TruhnLab/Contrastive-Agent-Reasoning. Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23176 2026-06-17 cs.CV 版本更新 67%

DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving

DRIVESPATIAL:自动驾驶中视觉语言模型时空智能的基准

Hao Vo, Khoa Vo, Phu Loc Nguyen, Sieu Tran, Duc Minh Nguyen, Ngo Xuan Cuong, Gladys Gawugah, Sreevenkata Anjani Tishita Godavarthi, Chase Rainwater, Nghi D. Q. Bui, Anh Nguyen, Duy Minh Ho Nguyen, Ngan Le

机构 * University of Arkansas, USA(美国阿肯色大学) Google Research, Google(谷歌研究院) University of Liverpool, UK(英国利物浦大学) Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究学校)

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 提出DriveSpatial基准,通过多视角、时空推理任务评估视觉语言模型在自动驾驶中的场景构建、关系理解、时序推理和泛化能力,发现人类与模型间存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03788 2026-06-16 cs.CV 版本更新 67%

SLU-2K: A Question-Based Benchmark for Semantic Evaluation of Sign Language Translation

SLU-2K:基于问题的手语翻译语义评估基准

Zeno Testa, Antonino Furnari, Lorenzo Baraldi, Natalia Díaz-Rodríguez

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Catania(卡塔尼亚大学) University of Granada(格拉纳达大学) CITIC & DaSCI Institute(CITIC与DaSCI研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出SLU-2K基准,通过2350个视频问答对评估手语翻译的语义理解,揭示当前系统在语义正确性上的不足。

Comments Accepted at the GenSign Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01900 2026-06-16 cs.CV 版本更新 67%

Auteur: Language-Driven Cinematographic Framing for Human-Centric Video Generation

Auteur: 以语言驱动的电影化取景实现以人为中心的视频生成

Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra, Xuelin Chen, Erkut Erdem, Aykut Erdem, Duygu Ceylan

机构 * Koç University(科克大学) University College London(伦敦大学学院) Adobe(Adobe公司) Hacettepe University(哈切特佩大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出Auteur方法,通过将相机运动参数化为以人为中心的取景(包括镜头尺寸、角度和构图),并利用领域特定语言(DSL)和微调的多模态大语言模型,实现语言驱动的电影化取景,在人类中心视频生成中优于现有方法。

Comments Project Page: https://cyberiada.github.io/Auteur/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16211 2026-06-16 cs.SD 版本更新 67%

NVV-SuperBench: Beyond Words, Beyond Quality-Benchmarking Nonverbal Vocalizations in Speech Generation

NVV-SuperBench:超越语言,超越质量——语音生成中非语言发声的基准测试

Liumeng Xue, Weizhen Bian, Jiahao Pan, Wenxuan Wu, Yilin Ren, Boyi Kang, Jingbin Hu, Ziyang Ma, Shuai Wang, Xinyuan Qian, Hung-yi Lee, Yike Guo

机构 * Nanjing University(南京大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学) Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学) National Taiwan University(国立台湾大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出NVV-SuperBench基准,包含45类非语言发声的统一分类和多轴评估协议,用于测试语音生成系统在非语言发声控制、放置和感知显著性方面的能力,发现当前系统在低信噪比口部线索和长时情感发声方面存在瓶颈。

Comments Accepted as a long paper at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12813 2026-06-16 cs.CV cs.MM 版本更新 67%

DPC-VQA: Decoupling Quality Perception and Residual Calibration for Video Quality Assessment

DPC-VQA: 解耦质量感知与残差校准用于视频质量评估

Xinyue Li, Shubo Xu, Zhichao Zhang, Zhaolin Cai, Yitong Chen, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Baidu Inc.(百度公司) Xinjiang University(新疆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出DPC-VQA框架,通过冻结多模态大模型提供感知先验,轻量校准分支预测残差修正,实现低训练成本下视频质量评估,在UGC和AIGC基准上取得竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16739 2026-06-15 cs.LG cs.AI cs.CL q-bio.NC 版本更新 67%

EmoMind: Decoding Affective Captions from Human Brain fMRI

EmoMind:从人类大脑fMRI信号解码情感描述

Bilal A. Mohammed, Lin Gu, Ruogu Fang

机构 * Department of Biomedical Engineering(生物医学工程系) Vanderbilt University(范德比大学) Research Institute of Electrical Communication(电气通信研究所) Tohoku University(东北大学) University of Florida(佛罗里达大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出EmoMind,首个端到端解码fMRI信号生成情感描述的系统,通过结合语义基础的中性场景描述和连续情感向量,实现了在内容保留与情感表达间的平衡,并在多个验证框架下优于基于标签提示的GPT-4。

详情

展开后加载摘要…

URL PDF HTML 收藏