arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-02 至 2026-03-02 共收录 30 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 30 篇

2505.19764 2026-03-02 cs.LG cs.AI 89%

Multi-View Encoders for Performance Prediction in LLM-Based Agentic Workflows

多视角编码器在基于大语言模型的代理工作流性能预测中的应用

Patara Trirat, Wonyong Jeong, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出Agentic Predictor,通过多视角编码技术与跨领域预训练,实现高效准确的代理工作流性能预测,提升LLM代理系统设计效率。

Comments ICLR 2026, Project Page: https://deepauto-ai.github.io/agentic-predictor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03716 2026-03-02 cs.CL cs.LG hep-th 88%

FeynTune: Large Language Models for High-Energy Theory

FeynTune:用于高能理论的大型语言模型

Paul Richmond, Prarit Agarwal, Borun Chowdhury, Vasilis Niarchos, Constantinos Papageorgakis

机构 * Centre for Theoretical Physics, Department of Physics and Astronomy, Queen Mary University of London(伦敦大学玛丽女王学院理论物理中心,物理与天文学系) ITCP & CCTP, Department of Physics, University of Crete(希腊克里特大学物理系ITCP与CCTP) Meta Amazon(亚马逊公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 FeynTune通过微调Llama-3.1模型,为高能理论物理开发了专门的大型语言模型,并在多个领域数据集上进行了性能比较。

Comments 16 pages; v2: Human evaluation discussion updated, additional training hyperparameters and inference settings included and references added

Journal ref Mach. Learn.: Sci. Technol. 7 025012 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23980 2026-03-02 cs.CV 88%

Venus: Benchmarking and Empowering Multimodal Large Language Models for Aesthetic Guidance and Cropping

Venus: 多模态大语言模型在审美指导与裁剪中的基准测试与赋能

Tianxiang Du, Hulingxiao He, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 Venus通过两阶段框架提升多模态大语言模型的审美指导与裁剪能力,实现可解释的审美优化。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19966 2026-03-02 cs.CL cs.AI 87%

Dhati+: Fine-tuned Large Language Models for Arabic Subjectivity Evaluation

Dhati+: 针对阿拉伯语主观性评估的微调大型语言模型

Slimane Bellaouar, Attia Nehar, Soumia Souffi, Mounia Bouameur

机构 * Dept. of Mathematics and Computer Science(数学与计算机科学系) Lab. des Mathématiques et Sciences Appliquées (LMSA)(应用数学与科学实验室(LMSA)) Exact Sciences and Computer Science Faculty(精确科学与计算机科学系) Lab. d’Informatique et Mathématiques (LIM)(计算机与数学实验室(LIM))

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

AI总结 本文提出了一种针对阿拉伯语主观性评估的微调大型语言模型方法,通过构建AraDhati+数据集并结合集成决策方法,实现了97.79%的高准确率。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23373 2026-03-02 cs.AI cs.CL cs.IR 86%

An Agentic LLM Framework for Adverse Media Screening in AML Compliance

面向反面媒体筛查的代理LLM框架用于反洗钱合规

Pavel Chernakov, Sasan Jafarnejad, Raphaël Frank

机构 * Interdisciplinary Centre for Security, Reliability and Trust(安全、可靠与信任跨学科中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM与RAG的代理框架,用于自动化反面媒体筛查,通过多步骤流程实现高风险个体的准确识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25662 2026-03-02 cs.HC cs.AI 85%

User Misconceptions of LLM-Based Conversational Programming Assistants

基于大语言模型的对话式编程助手中的用户误解

Gabrielle O'Brien, Antonio Pedro Santos Alves, Sebastian Baltes, Grischa Liebel, Mircea Lungu, Marcos Kalinowski

机构 * University of Michigan(密歇根大学) Pontifical Catholic University of Rio de Janeiro(里约热内卢天主教大学) Heidelberg University(海德堡大学) Reykjavik University(雷克雅未克大学) IT University of Copenhagen(哥本哈根IT大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究揭示了用户在使用基于大语言模型的对话式编程助手时可能存在的误解,强调了工具在明确自身能力及通过实证研究澄清编程需求的重要性。

Comments Accepted to the Journal Ahead Workshop at ICSE '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22291 2026-03-02 cs.LG cs.AI cs.CR 84%

Manifold of Failure: Behavioral Attraction Basins in Language Models

失败的流形:语言模型中的行为吸引盆地

Sarthak Munshi, Manish Bhatt, Vineeth Sai Narajala, Idan Habler, Ammar Al-Kahfah, Ken Huang, Blake Gatto

机构 * Amazon Web Services(亚马逊网络服务) Cisco(思科) Shrewd Security(精明安全)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于MAP-Elites的方法,用于系统地映射语言模型的失败流形,揭示不同模型的拓扑结构和漏洞分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23676 2026-03-02 cs.CV 80%

Suppressing Prior-Comparison Hallucinations in Radiology Report Generation via Semantically Decoupled Latent Steering

通过语义解耦潜在引导抑制放射科报告生成中的先验比较幻觉

Ao Li, Rui Liu, Mingjie Li, Sheng Liu, Lei Wang, Xiaodan Liang, Lina Yao, Xiaojun Chang, Lei Xing

机构 * University of New South Wales(新南威尔士大学) Australian Artificial Intelligence Institute, University of Technology Sydney(澳大利亚人工智能研究所,技术悉尼大学) Stanford University(斯坦福大学) School of Computing and Information Technology of University of Wollongong Australia(沃林根澳大利亚大学计算与信息科技学院) Sun Yat-sen University(中山大学) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出语义解耦潜在引导方法,通过正交化技术减少放射科报告生成中的历史幻觉,提升临床准确性与报告忠实度。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04026 2026-03-02 cs.HC 80%

VeriWeb: Verifiable Long-Chain Web Benchmark for Agentic Information-Seeking

VeriWeb: 可验证的长链网络基准测试用于代理信息检索

Shunyu Liu, Minghao Liu, Huichi Zhou, Zhenyu Cui, Yang Zhou, Yuhao Zhou, Jialiang Gao, Heng Zhou, Yunhao Yang, Wendong Fan, puzhen zhang, Ge Zhang, Jiajun Shi, Weihao Xuan, Jiaxing Huang, Shuang Luo, Fang Wu, Heli Qi, Qingcheng Zeng, Junjie Wang, Aosong Feng, Jindi Lv, Sicong Jiang, Ziqi Ren, Wangchunshu Zhou, Zhenfei Yin, Wenlong Zhang, Guohao Li, Wenhao Yu, Lei Ma, Lei Bai, Qunshu Lin, Mingli Song, Dacheng Tao

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 VeriWeb是一个用于评估和开发网络代理的可验证长链网络基准测试,通过长链复杂性和子任务级可验证性设计,揭示了处理长时间网络任务的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23678 2026-03-02 cs.CV cs.LG 79%

Any Model, Any Place, Any Time: Get Remote Sensing Foundation Model Embeddings On Demand

任何模型、任何地点、任何时间:获取遥感基础模型嵌入的按需服务

Dingqi Ye, Daniel Kiv, Wei Hu, Jimeng Shi, Shaowen Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 rs-embed库通过统一接口实现任意模型、地点和时间的遥感嵌入按需获取,提升模型使用效率与公平比较能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20640 2026-03-02 cs.AI cs.LG 79%

CoMind: Towards Community-Driven Agents for Machine Learning Engineering

CoMind:面向机器学习工程的社区驱动代理

Sijie Li, Weiwei Sun, Shanda Li, Ameet Talwalkar, Yiming Yang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CoMind通过多代理系统和迭代并行探索机制,在Kaggle竞赛中实现了优于人类竞争者的性能,展示了社区驱动代理在机器学习工程中的潜力。

Comments ICLR 2026. Code available at https://github.com/comind-ml/CoMind

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18969 2026-03-02 cs.NE 78%

Increasing Computation Resolves Conflicts in Vision Language Models

提升计算能力缓解视觉语言模型中的冲突

Bingyang Wang, Yijiang Li, Yitong Qiao, Maijunxian Wang, Tianwei Zhao, Yucheng Sun, Binyue Deng, Hokin Deng, Nuno Vasconcelos, Dezhi Luo

专题命中 评测与基准 :language model(title,abstract)

AI总结 本研究发现视觉语言模型通过增加计算资源能更有效解决冲突,展示了大规模神经网络中的优化动态如何产生类人认知控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23761 2026-03-02 cs.LG cs.CV 77%

OPTIAGENT: A Physics-Driven Agentic Framework for Automated Optical Design

OPTIAGENT:一种基于物理的代理框架用于自动光学设计

Yuyu Geng, Lei Sun, Yao Gao, Xinxin Hu, Zhonghua Yi, Xiaolong Qian, Weijian Hu, Jian Bai, Kaiwei Wang

机构 * Zhejiang University(浙江大学) INSAIT, Sofia University(INSAIT,索菲亚大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 OPTIAGENT通过结合LLM与物理驱动的优化方法,首次实现了无需专业光学知识即可自动设计光学系统,提升了光学设计的自动化水平和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23730 2026-03-02 cs.AI 77%

Unlocking Cognitive Capabilities and Analyzing the Perception-Logic Trade-off

解锁认知能力并分析感知-逻辑权衡

Longyin Zhang, Shuo Sun, Yingxu He, Won Cheng Yi Lewis, Muhammad Huzaifah Bin Md Shahrin, Hardik Bhupendra Sailor, Heng Meng Jeremy Wong, Tarun Kumar Vangani, Yi Ma, Qiongqiong Wang, Minh Duc Pham, Ridong Jiang, Jingtao Li, Jingyi Liao, Zhuohan Liu, Yanfeng Lu, Manas Gupta, Ai Ti Aw

机构 * Institute for Infocomm Research (I 2 R), A*STAR, Singapore(信息与通信研究 institute(I 2 R),A*STAR,新加坡)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MERaLiON2-Omni(Alpha)通过解耦感知与推理能力,针对东南亚地区提出多语言全方位感知模型,揭示感知与逻辑之间的效率-稳定性权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15909 2026-03-02 eess.AS cs.AI cs.DB cs.HC cs.MA cs.SD 77%

Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis

Resp-Agent:一种基于代理的多模态呼吸声生成与疾病诊断系统

Pengfei Zhang, Tianxin Xie, Minghao Yang, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Resp-Agent是一种基于代理的多模态系统,通过主动对抗课程代理和模态编织器提升呼吸声生成与疾病诊断的鲁棒性。

Comments 24 pages, 3 figures. Published as a conference paper at ICLR 2026

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23407 2026-03-02 cs.CR cs.AI cs.SE 77%

Learning to Generate Secure Code via Token-Level Rewards

通过令牌级奖励学习生成安全代码

Jiazheng Quan, Xiaodong Li, Bin Wang, Guo An, Like Liu, Degen Huang, Lin Liu, Chengbin Hou

机构 * Fuyao University of Science and Technology(福耀科技大学) Xiamen University(厦门大学) Peking University(北京大学) Huawei(华为)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Vul2Safe和SRCode框架,通过令牌级奖励提升代码安全性,有效减少生成代码中的安全漏洞并提高代码质量。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23836 2026-03-02 cs.CV 75%

Stereo-Talker: Audio-driven 3D Human Synthesis with Prior-Guided Mixture-of-Experts

立体说话者:基于优先级的混合专家引导的音频驱动3D人类合成

Xiang Deng, Youxin Pang, Xiaochen Zhao, Chao Xu, Lizhen Wang, Hongjiang Xiao, Shi Yan, Hongwen Zhang, Yebin Liu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Bytedance Inc.(字节跳动公司) State Key Laboratory of Media Convergence and Communication, Communication University of China(媒体融合与传播国家重点实验室,中国传媒大学) School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Stereo-Talker通过优先级引导的混合专家机制实现音频驱动的3D人类合成,生成具有精确唇同步和逼真质量的视频。

Journal ref TPAMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05228 2026-03-02 cs.LG cs.AI 73%

CMT-Benchmark: A Benchmark for Condensed Matter Theory Built by Expert Researchers

CMT-Benchmark:由专家研究人员构建的凝聚态理论基准

Haining Pan, James V. Roggeveen, Erez Berg, Juan Carrasquilla, Debanjan Chowdhury, Surya Ganguli, Federico Ghimenti, Juraj Hasik, Henry Hunt, Hong-Chen Jiang, Mason Kamb, Ying-Jer Kao, Ehsan Khatami, Michael J. Lawler, Di Luo, Titus Neupert, Xiaoliang Qi, Michael P. Brenner, Eun-Ah Kim

机构 * Rutgers University(罗格斯大学) Harvard University(哈佛大学) Weizmann Institute of Science(魏茨曼科学研究所) ETH Zürich(苏黎世联邦理工学院) Cornell University(康奈尔大学) Stanford University(斯坦福大学) University of Zürich(苏黎世大学) Stanford Institute for Materials and Energy Sciences(斯坦福材料与能源科学研究所) SLAC National Accelerator Laboratory(斯坦福直线加速器实验室) University of California, Los Angeles(加州大学洛杉矶分校) National Taiwan University(台湾大学) San José State University(圣何塞州立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CMT-Benchmark通过专家设计的50个凝聚态理论问题评估LLM在物理推理能力上的不足,揭示当前模型在复杂科学问题上的局限性。

Comments CMT-Benchmark dataset is available at https://huggingface.co/datasets/JVRoggeveen/cmt_benchmark. CMT-Benchmark was referenced in the Gemini 3 Deep Think (February 2026) release at https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-deep-think/

Journal ref International Conference on Learning Representations (ICLR) main conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24086 2026-03-02 cs.CY cs.LG 70%

The Subjectivity of Monoculture

单株的主观性

Nathanael Jo, Nikhil Garg, Manish Raghavan

机构 * MIT, Cambridge, USA(麻省理工学院,剑桥,美国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨了机器学习模型间高度一致性的主观性,指出评估单株现象需依赖基线模型和情境选择,通过实验验证不同假设下的推断差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23711 2026-03-02 cs.CV 67%

Can Unified Generation and Understanding Models Maintain Semantic Equivalence Across Different Output Modalities?

统一的生成与理解模型能否在不同输出模态间保持语义等价性?

Hongbo Jiang, Jie Li, Yunhang Shen, Pingyang Dai, Xing Sun, Haoyu Cao, Liujuan Cao

机构 * Tencent Youtu Lab(腾讯云图实验室) Xiamen University(厦门大学) Computing Lab, Department of Artificial Intelligence, School of Informatics(计算实验室,人工智能系,信息学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究探讨统一生成与理解模型在不同输出模态间保持语义等价性的能力,发现其在视觉回答任务中存在性能下降问题,原因在于跨模态语义对齐的失效。

Comments Equal contribution by Jie Li

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23603 2026-03-02 cs.CL cs.AI cs.IR 62%

LFQA-HP-1M: A Large-Scale Human Preference Dataset for Long-Form Question Answering

LFQA-HP-1M:一个大规模的人类偏好数据集用于长形式问答

Rafid Ishrak Jahan, Fahmid Shahriar Iqbal, Sagnik Ray Choudhury

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 LFQA-HP-1M是一个大规模的人类偏好数据集,用于长形式问答的评估,提出了九个评估准则并展示了其在评估性能上的有效性。

Comments LREC 2026 Accepted. https://huggingface.co/datasets/nlpatunt/LFQA-HP-1M

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23387 2026-03-02 cs.SD cs.AI cs.CL eess.AS 62%

Hello-Chat: Towards Realistic Social Audio Interactions

Hello-Chat: 向真实社交音频交互迈进

Yueran Hou, Peilei Jia, Zihan Sun, Qihang Lu, Wenbing Yang, Yingming Gao, Ya Li, Jun Gao

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 Hello-Chat通过大规模真实对话数据和模态交错训练策略,实现了在拟人化生成和情感一致性方面的突破,推动 empathetic AI 的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01959 2026-03-02 cs.CV cs.AI cs.LG 62%

Structure-aware Contrastive Learning for Diagram Understanding of Multimodal Models

结构感知对比学习用于多模态模型的图表理解

Hiroshi Sasaki

机构 * The Japan Research Institute, Limited(日本研究机构)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出结构感知对比学习方法,通过专门的损失函数提升多模态模型对图表图像的理解能力,在图像-文本匹配和视觉问答任务中取得显著改进。

Comments 10 pages, 8 figures

Journal ref ICCVW (2025) 7463-7472

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23649 2026-03-02 cs.SD cs.AI 57%

AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech

AudioCapBench: 音频描述能力的快速评估:涵盖声音、音乐和语音

Jielin Qiu, Jianguo Zhang, Zixiang Chen, Liangwei Yang, Ming Zhu, Juntao Tan, Haolin Chen, Wenting Zhao, Rithesh Murthy, Roshan Ram, Akshara Prabhakar, Shelby Heinecke, Caiming, Xiong, Silvio Savarese, Huan Wang

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 AudioCapBench通过对比不同模型在环境声音、音乐和语音描述任务中的表现,评估了大模型的音频描述能力,揭示Gemini模型在整体质量上优于OpenAI模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06730 2026-03-02 cs.CL 57%

PTEB: Towards Robust Text Embedding Evaluation via Stochastic Paraphrasing at Evaluation Time with LLMs

PTEB: 通过在评估时利用大语言模型进行随机改写实现稳健的文本嵌入评估

Manuel Frank, Haithem Afli

机构 * Department of Computer Science Munster Technological University(计算机科学系穆斯特技术大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 PTEB通过在评估时利用大语言模型进行随机改写,提出了一种动态评估方法,以评估文本嵌入的鲁棒性。

Comments EACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23862 2026-03-02 cs.HC 50%

Human-Centered Multimodal Fusion for Sexism Detection in Memes with Eye-Tracking, Heart Rate, and EEG Signals

以人类为中心的多模态融合用于表情包中性别歧视检测:结合眼动追踪、心率和EEG信号

Iván Arcos, Paolo Rosso, Elena Gomis-Vicent

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出了一种结合眼动追踪、心率和EEG信号的多模态融合模型,用于更准确地检测表情包中的性别歧视。

Comments Accepted to appear in the Proceedings of LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23814 2026-03-02 cs.CV 50%

Action-Geometry Prediction with 3D Geometric Prior for Bimanual Manipulation

基于3D几何先验的双臂操作动作预测

Chongyang Xu, Haipeng Li, Shen Cheng, Jingyu Hu, Haoqiang Fan, Ziliang Feng, Shuaicheng Liu

机构 * College of Computer Science, Sichuan University, China(四川大学计算机学院) University of Electronic Science and Technology of China, China(电子科技大学) Dexmal The Chinese University of Hong Kong, HK SAR, China(香港中文大学(HK SAR))

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出基于3D几何先验的双臂操作预测框架,通过融合几何特征与2D语义信息,实现高效动作预测与空间理解。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22745 2026-03-02 cs.CV 50%

SPATIALALIGN: Aligning Dynamic Spatial Relationships in Video Generation

SPATIALALIGN: 视频生成中动态空间关系的对齐

Fengming Liu, Tat-Jen Cham, Chuanxia Zheng

机构 * College of Computing(计算学院) Data Science, Nanyang Technological University, 50 Nanyang Avenue, Singapore 639798(数据科学,南洋理工大学,50 Nanyang Avenue,新加坡639798)

专题命中 评测与基准 :preference optimization(abstract)

AI总结 SPATIALALIGN通过引入DSR-SCORE和DPO方法,提升文本到视频生成中动态空间关系的对齐能力。

Comments Project page: https://fengming001ntu.github.io/SpatialAlign/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18825 2026-03-02 cs.CV 50%

Q-Save: Towards Scoring and Attribution for Generated Video Evaluation

Q-Save:迈向生成视频评估的评分与归因

Xiele Wu, Zicheng Zhang, Mingtao Chen, Yixian Liu, Yiming Liu, Shushi Wang, Zhichao Hu, Yuhong Liu, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :SFT(abstract)

AI总结 Q-Save提出一个统一的生成视频评估模型和数据集,通过三阶段训练策略实现质量评分与归因生成,提升AIGV质量预测的准确性和可解释性。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00445 2026-03-02 cs.CV 50%

AutoDebias: Automated Framework for Debiasing Text-to-Image Models

AutoDebias:文本到图像模型的自动化去偏框架

Hongyi Cai, Mohammad Mahdinur Rahman, Mingkang Dong, Muxin Pu, Moqyad Alqaily, Jie Li, Xinfeng Li, Jialie Shen, Meikang Qiu, Qingsong Wen

机构 * Universiti Malaya(马来大学) Monash University(莫纳什大学) United Arab Emirates University(阿拉伯联合酋长国大学) University of Science and Technology Beijing(北京科技大学) Nanyang Technological University (NTU)(南洋理工大学) City St George’s, University of London(伦敦大学圣乔治学院) Augusta University(奥古斯塔大学) Squirrel Ai Learning

专题命中 评测与基准 :language model(abstract)

AI总结 AutoDebias提出了一种自动化框架,用于检测和减轻文本到图像模型中的恶意偏见,通过视觉语言模型和CLIP引导的训练过程,有效应对隐秘注入的刻板印象和多重攻击。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏