arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-09 至 2025-12-09 共收录 291 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 56 篇

2512.07141 2025-12-09 cs.CV cs.CL 79%

Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models

思考-反思-修订:一种基于策略的反思框架,用于大型视觉语言模型的安全对齐

Fenghua Weng, Chaochao Lu, Xia Hu, Wenqi Shao, Wenjie Wang

机构 * Shanghaitech University(上海科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 TRR通过策略引导的反思框架提升大型视觉语言模型的安全对齐,显著提高安全响应率至87.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04441 2025-12-09 cs.CV 78%

MindDrive: An All-in-One Framework Bridging World Models and Vision-Language Model for End-to-End Autonomous Driving

MindDrive: 一个整合世界模型和视觉-语言模型的全功能框架,用于端到端自动驾驶

Bin Sun, Yaoguang Cao, Yan Wang, Rui Wang, Jiachen Shang, Xiejie Feng, Jiayi Lu, Jia Shi, Shichun Yang, Xiaoyu Yan, Ziying Song

机构 * School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院) State Key Laboratory of Intelligent Transportation System, Beihang University(北京航空航天大学智能交通系统国家重点实验室) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新院) Contemporary Amperex Technology Co., Limited (CATL)(当代电动车技术有限公司(CATL)) Research Institute of Aero-Engine, Beihang University(北京航空航天大学航空发动机研究院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) China Automotive Engineering Research Institute Co., Ltd.(中国汽车工程研究院股份有限公司)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 MindDrive通过整合世界模型和视觉-语言模型,提出了一种端到端自动驾驶框架,实现高质量轨迹生成与多目标决策推理,提升自动驾驶的安全性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07777 2025-12-09 cs.CL 77%

Mary, the Cheeseburger-Eating Vegetarian: Do LLMs Recognize Incoherence in Narratives?

玛丽,吃汉堡的素食者:LLMs能否识别叙述中的不一致?

Karin de Langis, Püren Öncel, Ryan Peters, Andrew Elfenbein, Laura Kristen Allen, Andreas Schramm, Dongyeop Kang

机构 * Department of Computer Science and Engineering, University of Minnesota(计算机科学与工程系,明尼苏达大学) Department of Educational Psychology, University of Minnesota(教育心理学系,明尼苏达大学) Department of Linguistics, Hamline University(语言学系,哈姆林大学) Department of English, University of Minnesota(英语系,明尼苏达大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现LLMs在识别叙述不一致时存在不足,尤其在处理设定冲突和角色特征冲突时表现不一致,表明其对叙事一致性理解不完整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14683 2025-12-09 cs.SE cs.AI 77%

Unified Software Engineering Agent as AI Software Engineer

统一软件工程代理作为AI软件工程师

Leonhard Applis, Yuntong Zhang, Shanchao Liang, Nan Jiang, Lin Tan, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学) Purdue University(普渡大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出统一软件工程代理USEagent,旨在通过协调多种能力提升软件开发效率,通过USEbench验证其效果,发现其在复杂任务中表现优于现有代理。

Comments Leonhard Applis and Yuntong Zhang contributed equally to this work. To appear in ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00974 2025-12-09 cs.CL 77%

RPRO: Ranked Preference Reinforcement Optimization for Enhancing Medical QA and Diagnostic Reasoning

RPRO:基于优先级的强化优化用于增强医学问答与诊断推理

Chia-Hsuan Hsu, Jun-En Ding, Hsin-Ling Hsu, Chih-Ho Hsu, Li-Hung Yao, Chun-Chieh Liao, Feng Liu, Fang-Ming Hung

机构 * Department of Computer Science and Information Engineering, National Taiwan University of Science and Technology(计算机科学与信息工程系,台湾科技大学) Department of Systems Engineering, Stevens Institute of Technology(系统工程系,史蒂文斯理工学院) Department of Management Information Systems, National Chengchi University(管理信息系,National Chengchi University) AI Research Center, Agaruda System(Agaruda系统人工智能研究中心) Department of Computer Science, Stevens Institute of Technology(计算机科学系,史蒂文斯理工学院) Far Eastern Memorial Hospital(东部纪念医院) Smart Healthcare Interdisciplinary College, National Taipei University of Nursing and Health Sciences(智慧医疗跨领域学院,台北大学护理及健康科学学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

AI总结 RPRO通过结合强化学习与优先级驱动的推理细化,提升医疗问答和诊断推理的可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06258 2025-12-09 cs.CV 75%

Knowing the Answer Isn't Enough: Fixing Reasoning Path Failures in LVLMs

知道答案还不够:修复大型视觉-语言模型中的推理路径失败

Chaoyang Wang, Yangfan He, Yiyang Zhou, Yixuan Wang, Jiaqi Liu, Peng Xia, Zhengzhong Tu, Mohit Bansal, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Texas A&M University(德克萨斯农工大学)

专题命中 推理与问题求解 :language model(abstract);post-training(abstract);preference optimization(abstract)

AI总结 PSO通过优化推理路径选择,提升大型视觉-语言模型的推理准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07302 2025-12-09 cs.CV cs.AI 74%

Towards Accurate UAV Image Perception: Guiding Vision-Language Models with Stronger Task Prompts

迈向准确的无人机图像感知:通过更强的任务提示引导视觉-语言模型

Mingning Guo, Mengwei Wu, Shaoxian Li, Haifeng Li, Chao Tao

机构 * School of Geosciences and InfoPhysics, Central South University(地质科学与信息物理学院,中南大学)

专题命中 推理与问题求解 :language model(title);分类 cs.AI

AI总结 AerialVP通过增强任务提示提升无人机图像感知性能,引入AerialSense基准评估模型在复杂场景下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07038 2025-12-09 cs.CR cs.LG stat.ML 74%

Ideal Attribution and Faithful Watermarks for Language Models

语言模型中的理想归因与忠实水印

Min Jae Song, Kameron Shahabi

机构 * Data Science Institute, University of Chicago(芝加哥大学数据科学研究院) Paul G. Allen School of Computer Science & Engineering, University of Washington(华盛顿大学保罗·G·阿伦计算机科学与工程学院)

专题命中 推理与问题求解 :language model(title);分类 cs.LG

AI总结 本文提出了一种理想归因机制和水印方案框架,通过统一的语言和明确的保证,提升水印方案的理论基础和实际应用价值。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07132 2025-12-09 cs.CL cs.AI cs.CV 73%

DART: Leveraging Multi-Agent Disagreement for Tool Recruitment in Multimodal Reasoning

利用多智能体分歧进行多模态推理中的工具招募

Nithin Sivakumaran, Justin Chih-Yao Chen, David Wan, Yue Zhang, Jaehong Yoon, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Nanyang Technological University(南洋理工大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DART通过多智能体分歧识别有用视觉工具,提升多模态推理中的工具调用效果。

Comments Code: https://github.com/nsivaku/dart

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01485 2025-12-09 cs.AI cs.LG 73%

Multi-Path Collaborative Reasoning via Reinforcement Learning

基于强化学习的多路径协作推理

Jindi Lv, Yuhao Zhou, Zheng Zhu, Xiaofeng Wang, Guan Huang, Jiancheng Lv

机构 * Sichuan University(四川大学) GigaAI Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出M3PO框架,通过多路径协作机制提升大语言模型的推理能力,实现更可靠和高效的多步推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06259 2025-12-09 cs.SD cs.AI cs.LG 73%

Who Will Top the Charts? Multimodal Music Popularity Prediction via Adaptive Fusion of Modality Experts and Temporal Engagement Modeling

谁会登顶排行榜?通过适应性融合模态专家和时间参与建模的多模态音乐流行度预测

Yash Choudhary, Preeti Rao, Pushpak Bhattacharyya

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 GAMENet通过融合多模态数据和时间参与建模,提升了音乐流行度预测的准确性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07059 2025-12-09 cs.CL 70%

Replicating TEMPEST at Scale: Multi-Turn Adversarial Attacks Against Trillion-Parameter Frontier Models

在大规模上复制TEMPEST:针对万亿参数前沿模型的多轮对抗攻击

Richard Young

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过TEMPEST框架评估了十种前沿模型对多轮对抗攻击的鲁棒性,发现模型规模不影响鲁棒性,而思考模式能提升安全性。

Comments 30 pages, 11 figures, 5 tables. Code and data: https://github.com/ricyoung/tempest-replication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05397 2025-12-09 cs.HC cs.AI 70%

Simulating Life Paths with Digital Twins: AI-Generated Future Selves Influence Decision-Making and Expand Human Choice

用数字双胞胎模拟人生路径:AI生成的未来自我影响决策并拓展人类选择

Rachel Poonsiriwong, Chayapatr Archiwaranguprok, Constanze Albrecht, Peggy Yin, Nattavudh Powdthavee, Hal Hershfield, Monchai Lertsutthiwong, Kavin Winson, Pat Pataranutaporn

机构 * MIT Media Lab(MIT媒体实验室) Stanford University(斯坦福大学) Nanyang Technological University(南洋理工大学) University of California, Los Angeles(加州大学洛杉矶分校) KASIKORN Labs(KASIKORN实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究利用AI生成的未来自我虚拟形象,通过模拟人生路径拓展人类选择,发现平衡呈现和新增选项能有效影响决策,提升自主性认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08519 2025-12-09 cs.CL 70%

Bridging Relevance and Reasoning: Rationale Distillation in Retrieval-Augmented Generation

弥合相关性与推理:检索增强生成中的推理蒸馏

Pengyue Jia, Derong Xu, Xiaopeng Li, Zhaocheng Du, Xiangyang Li, Yichao Wang, Yuhao Wang, Qidong Liu, Maolin Wang, Huifeng Guo, Ruiming Tang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RADIO通过推理提取和基于推理的对齐方法,弥合检索增强生成中重排器与生成器之间的相关性差距。

Comments Accepted to ACL 25 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06835 2025-12-09 cs.AI 70%

Decouple to Generalize: Context-First Self-Evolving Learning for Data-Scarce Vision-Language Reasoning

解耦以泛化:面向数据稀缺的视觉语言推理的上下文优先自进化学习

Tingyu Li, Zheng Sun, Jingxuan Wei, Siyuan Li, Conghui He, Lijun Wu, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai JiaoTong University(上海交通大学) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 DoGe通过双解耦框架,引导模型优先从上下文学习以提升数据稀缺下的视觉语言推理能力,提出两阶段RL方法和演进课程学习流水线,有效解决传统方法的奖励黑客问题。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06106 2025-12-09 cs.HC cs.AI 70%

Future You: Designing and Evaluating Multimodal AI-generated Digital Twins for Strengthening Future Self-Continuity

未来你:设计和评估多模态AI生成的数字双胞胎以加强未来自我连续性

Constanze Albrecht, Chayapatr Archiwaranguprok, Rachel Poonsiriwong, Awu Chen, Peggy Yin, Monchai Lertsutthiwong, Kavin Winson, Hal Hershfield, Pattie Maes, Pat Pataranutaporn

机构 * MIT Media Lab(MIT媒体实验室) Harvard University(哈佛大学) Stanford University(斯坦福大学) KASIKORN Labs(KASIKORN实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过多模态AI生成的未来自我探索其对自我连续性、情绪和动机的影响,发现avatar效果最佳,但各模态无显著差异,互动质量是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04478 2025-12-09 cs.AI cs.GT econ.TH 70%

Matching Markets Meet LLMs: Algorithmic Reasoning with Ranked Preferences

匹配市场与大语言模型:基于排名偏好的算法推理

Hadi Hosseini, Samarth Khanna, Ronak Singh

机构 * Penn State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了大语言模型在处理基于排名偏好的匹配市场问题时的局限性,发现其在解决大规模不稳定性方面存在不足,并探讨了参数高效微调对小规模市场的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07733 2025-12-09 cs.CV 67%

SpatialDreamer: Incentivizing Spatial Reasoning via Active Mental Imagery

SpatialDreamer: 通过主动心理意象激励空间推理

Meng Cao, Xingyu Li, Xue Liu, Ian Reid, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学) Sun Yat-sen University(孙中山大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 SpatialDreamer通过主动心理意象和几何策略优化,提升多模态大语言模型在复杂空间推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01821 2025-12-09 cs.CV 67%

Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling

通过想象看见:通过隐式空间世界建模学习场景几何

Meng Cao, Haokun Lin, Haoyuan Li, Haoran Tang, Rongtao Xu, Dong An, Xue Liu, Ian Reid, Xiaodan Liang

机构 * MBZUAI SYSU(南方科技大学) PKU(北京大学) Spatialtemporal AI(时空人工智能)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出MILO和RePE,通过隐式空间世界建模提升多模态大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16828 2025-12-09 cs.LG cs.AI cs.CL 67%

Process Reward Models That Think

能够思考的过程奖励模型

Muhammad Khalifa, Rishabh Agarwal, Lajanugen Logeswaran, Jaekyeom Kim, Hao Peng, Moontae Lee, Honglak Lee, Lu Wang

机构 * University of Michigan(密歇根大学) Mila LG AI Research(LG人工智能研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Equal supervision(共同监督)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ThinkPRM通过生成长CoT验证链实现高效过程奖励模型,以更少的监督标签在多个基准测试中超越现有方法。

Comments Add new ablation and minor writing fixes

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06096 2025-12-09 cs.CV 67%

BeLLA: End-to-End Birds Eye View Large Language Assistant for Autonomous Driving

BeLLA:端到端的鸟瞰图大语言助手用于自动驾驶

Karthik Mohan, Sonam Singh, Amit Arvind Kale

机构 * UC San Diego(加州大学圣地亚哥分校) Robert Bosch Corporate Research India(博世印度公司研究)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 BeLLA通过端到端架构连接统一的360°鸟瞰图表示与大语言模型,提升自动驾驶中的空间推理和问答能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20745 2025-12-09 cs.CV 67%

Math Blind: Failures in Diagram Understanding Undermine Reasoning in MLLMs

数学视觉盲:图示理解的失败削弱了多模态大语言模型的推理能力

Yanpeng Sun, Shan Zhang, Wei Tang, Aotian Chen, Piotr Koniusz, Kai Zou, Yuan Xue, Anton van den Hengel

机构 * Ohio State University(俄亥俄州立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本研究发现多模态大语言模型在图示理解上的缺陷导致推理能力下降,通过改进图示感知可显著提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01912 2025-12-09 cs.MA cs.AI cs.LG 62%

EvoMem: Improving Multi-Agent Planning with Dual-Evolving Memory

EvoMem:通过双进化记忆提升多智能体规划

Wenzhe Fan, Ning Yan, Masood Mortazavi

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Futurewei Technologies(未来科技)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 EvoMem通过双进化记忆机制提升多智能体规划,利用约束记忆和查询反馈记忆模块优化约束跟踪与错误修正,实现旅行、会议和日历任务的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06759 2025-12-09 cs.CV cs.AI 57%

VisChainBench: A Benchmark for Multi-Turn, Multi-Image Visual Reasoning Beyond Language Priors

VisChainBench: 一个多轮多图视觉推理基准,超越语言先验

Wenbo Lyu, Yingjun Du, Jinglin Zhao, Xianton Zhen, Ling Shao

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 VisChainBench是一个多轮多图视觉推理基准,通过多代理生成流水线构建,旨在评估LVLM在连续、相互依赖任务中进行多步骤视觉推理的能力。

Comments 12 pages,13figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06573 2025-12-09 cs.AI cs.MA 57%

The Effect of Belief Boxes and Open-mindedness on Persuasion

信念盒子和开放心态对说服力的影响

Onur Bilgin, Abdullah As Sami, Sriram Sai Vujjini, John Licato

机构 * Advancing Machine and Human Reasoning (AMHR) Lab, University of South Florida(先进机器与人类推理实验室,佛罗里达州立大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究探讨信念盒子和开放心态对智能体说服力的影响,发现开放心态影响信念变化的接受度,而信念陈述影响对对立观点的抵抗能力。

Comments Accepted at the 18th International Conference on Agents and Artificial Intelligence (ICAART 2026), Marbella, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16001 2025-12-09 cs.AI q-bio.NC 57%

Artificial Human Intelligence: The role of Humans in the Development of Next Generation AI

人工人类智能:人类在下一代AI发展中的作用

Suayb S. Arslan

机构 * Department of Computer Engineering, Boğaziçi University(计算机工程系,博兹达奇大学) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology (MIT)(脑与认知科学系,麻省理工学院(MIT))

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 本文探讨了人类在下一代AI发展中的关键作用,分析了人类与人工智能的互动,提出以人类为中心的发展方向,并强调伦理、责任和稳健智能系统的重要性。

Comments 19 pages, 8 figures, 2 tables, accepted to IEEE Transactions on Emerging Topics in Computational Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07203 2025-12-09 cs.CV 50%

MMRPT: MultiModal Reinforcement Pre-Training via Masked Vision-Dependent Reasoning

MMRPT:通过遮蔽视觉依赖推理的多模态强化预训练

Xuhui Zheng, Kang An, Ziliang Wang, Yuhang Wang, Faqiang Qian, Yichao Wu

机构 * SenseTime(秒速科技)

专题命中 推理与问题求解 :language model(abstract)

AI总结 MMRPT通过强化学习提升多模态预训练效果,利用视觉基础推理增强模型对视觉内容的理解能力。

Comments 7 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05524 2025-12-09 cs.CV 50%

VOST-SGG: VLM-Aided One-Stage Spatio-Temporal Scene Graph Generation

VOST-SGG:基于视觉语言模型的一阶段时空场景图生成

Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院) Institute of High-Performance Computing, Agency for Science, Technology and Research, Singapore(科学、技术与研究局高性能计算研究所) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(科学、技术与研究局前沿人工智能研究中心)

专题命中 推理与问题求解 :language model(abstract)

AI总结 VOST-SGG通过整合视觉语言模型的常识推理能力,提出了一种基于多模态特征和双源查询初始化的一阶段时空场景图生成方法,实现了对视频中对象及其关系的高效建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06674 2025-12-09 cs.CV 50%

RunawayEvil: Jailbreaking the Image-to-Video Generative Models

RunawayEvil: 对图像到视频生成模型的劫持

Songping Wang, Rufan Qian, Yueming Lyu, Qinglong Liu, Linzhuang Zou, Jie Qin, Songhua Liu, Caifeng Shan

机构 * PRLab, Nanjing University(南京大学PRLab) Meituan(美团) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :LLM(abstract)

AI总结 RunawayEvil是一种针对图像到视频生成模型的多模态劫持框架,通过自我进化机制实现动态攻击策略,显著提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06663 2025-12-09 cs.CV 50%

CoT4Det: A Chain-of-Thought Framework for Perception-Oriented Vision-Language Tasks

CoT4Det:面向感知导向视觉-语言任务的链式思维框架

Yu Qi, Yumeng Zhang, Chenting Gong, Xiao Tan, Weiming Zhang, Wei Zhang, Jingdong Wang

机构 * Baidu Inc.(百度公司)

专题命中 推理与问题求解 :language model(abstract)

AI总结 CoT4Det通过将感知任务分解为分类、计数和定位三个步骤,提升视觉-语言模型在目标检测等任务中的性能,使mAP从19%提升至33%。

详情

展开后加载摘要…

URL PDF HTML 收藏