arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-31 至 2026-08-31 共收录 83 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 7 篇

2405.20971 2026-08-31 cs.LG cs.CV 版本更新 57%

Amortizing intractable inference in diffusion models for vision, language, and control

在视觉、语言与控制任务的扩散模型中分摊难解推理

Siddarth Venkatraman, Moksh Jain, Luca Scimeca, Minsu Kim, Marcin Sendera, Mohsin Hasan, Luke Rowe, Sarthak Mittal, Pablo Lemos, Emmanuel Bengio, Alexandre Adam, Jarrid Rector-Brooks, Yoshua Bengio, Glen Berseth, Esmeralda S. Whitammer

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文针对扩散模型用作下游任务先验时的难解后验推理问题,提出相对轨迹平衡方法,在视觉、语言、多模态及连续控制等任务上取得良好效果

Comments NeurIPS 2024; code: this https URL (https://github.com/GFNOrg/diffusion-finetuning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27885 2026-08-31 cs.LG 新提交 50%

There and Back Again: Bidirectional Diffusion Bridges for Multimodality Translation

双向扩散桥用于多模态转换:往返之道

Gabe Guo, Elon Litman, Thanawat Sornwanee, Jose Blanchet, Stefano Ermon

机构 * Stanford University(斯坦福大学)

专题命中 多模态生成 :image-text(abstract)

AI总结 针对现有多模态转换方法的不足,提出BIT双向图像-文本扩散桥,实现双向生成且性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19088 2026-08-31 quant-ph math-ph physics.optics 版本更新 50%

Efficient and scalable inter-module switching for distributed quantum computing architectures

分布式量子计算架构的高效可扩展模块间交换

Kamil Bradler

专题命中 多模态生成 :any-to-any(abstract)

AI总结 针对分布式量子计算模块间的高效可扩展交换需求,基于广义马赫-曾德尔干涉仪构建去中心化交换方案,实现主动光深度随逻辑块数对数缩放且不损失连通性。

Comments v3: close to the published version

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 20 篇

2608.27461 2026-08-31 cs.CL cs.AI cs.LG 新提交 86%

SciReC: Diagnostic Evaluation of Multimodal, Multi-Turn Relational Reasoning with Adaptive Interaction

SciReC:基于自适应交互的多模态多轮关系推理诊断评估

Nilay Yilmaz, Naga Sai Abhiram Kusumba, Stella Wenxing Liu, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学) Capital One(第一资本金融公司)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究构建了多模态学术对话基准SciReC,提出缺陷诊断框架DMRA评估多模态大语言模型的关系推理能力,发现不同模型在各类关系及领域上的表现差异,明确错误的主要来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28062 2026-08-31 cs.AI 新提交 85%

WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents

WeAgent-MMSearch:面向多模态搜索智能体的原生文本-视觉交互

Zongkai Liu, Hui Zhang, Liqiang Niu, Zhen Cao, Han Li, Juntao Liu, Wenchao Chen, Chengduo Zhao, Chao Yu, Fandong Meng

机构 * Weixin AI, Tencent(腾讯微信人工智能) Sun Yat-sen University(中山大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对现有多模态搜索智能体忽略图像、长程交互易失败的问题,提出 WeAgent-MMSearch 系统,通过 WeAgent-Harness 实现文本-视觉交互,经 FA-GSPO 后训练后,模型在多模态搜索基准上性能大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27869 2026-08-31 cs.AI 新提交 83%

See, Hypothesize, Validate: Multimodal Agentic Framework for Discovering Governing PDEs

观测、假设、验证:用于发现控制偏微分方程的多模态智能体框架

Sarang Manoj Pekhale, Amartya Roy, Rajat Sarkar, Souvik Chakraborty

机构 * Indian Institute of Technology Delhi(印度德里理工学院) Robert Bosch GmbH(罗伯特·博世有限公司) TCS Research(塔塔咨询服务公司研究院) Yardi School of Artificial Intelligence (ScAI)(亚迪人工智能学院) Department of Applied Mechanics(应用力学系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 提出多模态智能体框架MAGE,通过四个专业化智能体协作迭代发现控制PDE,在经典PDE套件等测试中实现优异恢复与误差表现,支持无库控制定律发现的结构化智能体推理研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28503 2026-08-31 cs.IR 新提交 82%

SG-UMP: Sequence-Guided Universal Multimodal Prioritization Calculation Framework

SG-UMP:序列引导通用多模态优先级计算框架

Xinyi Zhang, Yutong Li, Peijie Sun

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 针对多模态序列推荐中用户偏好异质性与数据集模态偏差问题,提出即插即用的SG-UMP框架,通过模块组合器与模块路由器适配不同场景,在四个数据集上持续提升推荐性能。

Comments Accepted as a Full Paper at MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28341 2026-08-31 cs.CV cs.AI 新提交 81%

Cross-Spectral Dense Correspondence for Multimodal Spectral Medical Imaging

用于多模态光谱医学成像的跨光谱密集对应

Eric L. Wisotzky, Jost Triller, Simon W. Härtl, Oliver T. Bruns, Peter Eisert, Anna Hilsmann

机构 * Fraunhofer Heinrich Hertz Institute HHI(弗劳恩霍夫海因里希·赫兹研究所) Humboldt University Berlin(柏林洪堡大学) National Center for Tumordiseases(德国肿瘤疾病中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态光谱医学成像中跨光谱密集对应数据不足的问题,提出跨光谱调制协议与合成基准,提升模型在光谱不匹配场景下的性能,支撑高光谱成像的空间一致融合。

Comments Accepted at 2nd Data Curation & Augmentation in Medical Imaging Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20409 2026-08-31 cs.CL cs.AI cs.CY 版本更新 81%

Cognitive Chain-of-Thought (CoCoT): Structured Multimodal Reasoning about Social Situations

认知链式推理(CoCoT):关于社会情境的结构化多模态推理

Eunkyu Park, Wesley Hanwen Deng, Gunhee Kim, Motahhare Eslami, Maarten Sap

机构 * Seoul National University(首尔国立大学) Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoCoT框架,通过感知、情境推断和规范应用三个阶段提升多模态社会推理能力,在多个任务中取得显著提升。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18154 2026-08-31 cs.CL cs.AI cs.DB 版本更新 81%

FENCE: A Financial and Multimodal Jailbreak Detection Dataset

FENCE:一个金融和多模态越狱检测数据集

Mirae Kim, Seonghun Jeong, Youngjun Kwak

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对金融领域多模态越狱检测资源匮乏的问题,提出FENCE数据集,包含韩英双语文本和图像,用于训练和评估检测器,实验表明基线检测器准确率达99%。

Comments lrec 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28384 2026-08-31 cs.AI 新提交 79%

MAP: A Benchmark on Multimodal Accessibility Planning for Real World Places

MAP:面向现实场所的多模态可访问性规划基准

Jason Armitage, Ioannis Tsochantaridis, Linda Mazzone, Chuqiao Yan, Srini Narayanan, Sarah Ebling

机构 * University of Zurich(苏黎世大学) Google DeepMind(谷歌DeepMind)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 研究推出首个多模态可访问性规划基准MAP,含声明验证与视觉证据检索两项评估,支持动态信息下的AI系统对比,为服务可访问性需求用户的多模态AI提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27795 2026-08-31 cs.CV 新提交 79%

uScenes: A Multimodal RGB and 3D Sonar Dataset for Underwater Robot Perception

uScenes:用于水下机器人感知的多模态RGB与3D声呐数据集

Trung Tien Dong, Zhenqi Wu, Aditya Penumarti, Zi-Hao Zhang, Micaiah Bartlett, Jane Shin, Xiaomin Lin

机构 * University of South Florida(南佛罗里达大学) University of Florida(佛罗里达大学) Seoul National University(首尔大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对水下机器人感知难题,构建了含同步3D多波束声呐点云与RGB图像的uScenes多模态数据集,为水下传感器融合等任务提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27548 2026-08-31 cs.AI 新提交 79%

Nemotron 3.5 Content Safety Moderator: A Compact Multimodal, Multilingual, and Reasoning Enabled Content Safety Moderator

Nemotron 3.5 内容安全审核器:一款紧凑的多模态、多语言且具备推理能力的内容安全审核器

Varun Singh, Anuj Doshi, Makesh Narsimhan Sreedhar, Shaona Ghosh, Katherine Luna

机构 * NVIDIA(英伟达)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究提出紧凑多模态多语言的Nemotron 3.5 CS安全审核器,兼具低计算成本与推理能力,可覆盖多场景安全审核,还发布配套安全数据集,验证其在多维度评估中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06869 2026-08-31 cs.AI 版本更新 79%

Evidence-Based Intelligent Diagnostic and Therapeutic Visualization System with Large Language Models: Multi-Turn Interaction and Multimodal Treatment Plan Generation

基于证据的智能诊断与治疗可视化系统与大语言模型:多轮交互与多模态治疗方案生成

Yunhan Wang, Yuda Wang, Zhiying Tu, Mingqiang Song, Li Song, Kun Li, Dianhui Chu, Bolin Zhang

机构 * Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院) Shandong Key Laboratory of Digital Service Computing Technology and Systems(山东省数字服务计算技术与系统重点实验室) Weihai Municipal Hospital(威海市人民医院) Shanghai Taizhu Technology Co., Ltd(上海泰山技术有限公司) Tianjin Zhifu Qihuang Medical Technology Co., Ltd(天津中孚启黄医疗技术有限公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 提出知识增强的可视化诊断系统,通过知识图谱约束、信息增益驱动提问和多模态治疗呈现,提升中医辨证透明度和治疗可解释性。

Comments 29 pages, 9 figures, 5 tables, including supporting information

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17304 2026-08-31 cs.CV 版本更新 79%

3D MRI-Based Alzheimer's Disease Classification Using Multi-Modal 3D CNN with Leakage-Aware Subject-Level Evaluation

基于3D MRI的阿尔茨海默病分类:使用多模态3D CNN与泄漏感知的受试者级评估

Md Sifat, Sania Akter, Akif Islam, Md. Ekramul Hamid, Abu Saleh Musa Miah, Najmul Hassan, Md Abdur Rahim, Jungpil Shin

机构 * University of Rajshahi(拉贾斯坦大学) University of Aizu(御所大学) Pabna University of Science(帕布纳科学大学)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出一种多模态3D卷积神经网络,利用原始OASIS 1 MRI体积进行阿尔茨海默病分类,通过受试者级交叉验证实现72.34%的准确率和0.7781的ROC AUC,验证了体积分析在疾病分类中的有效性。

Comments 4 tables, 6 figures, Accepted at 2026 International Conference on Power, Electronics, Communications, Computing, and Intelligent Infrastructure (PECCII)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07576 2026-08-31 cs.HC cs.CV 版本更新 79%

A Multimodal Dataset of Student Oral Presentations with Sensors and Evaluation Data

面向学生口头陈述的多模态数据集,包含传感器和评估数据

Alvaro Becerra, Ruth Cobos, Roberto Daza

机构 * Universidad Autonoma de Madrid, School of Engineering(马德里自治大学工程学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 SOPHIAS是一个包含学生口头陈述的多模态数据集,整合了传感器和评估数据,用于研究多模态行为与表现的关系及自动化反馈工具的开发。

Comments Preprint of an article accepted for publication in Scientific Data. GitHub repository of the dataset at: this https URL (https://github.com/dataGHIA/SOPHIAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14741 2026-08-31 cs.CV cs.AI 版本更新 76%

PolyComp: A Polycube-based Benchmark for Compositional 3D Spatial Reasoning in Multimodal Models

PolyComp:面向多模态模型组合式3D空间推理的基于多立方体(polycube)的基准测试集

Siddharth Patel

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

AI总结 该研究推出PolyComp基准测试集,考察多模态模型的组合式3D空间推理能力,测试了GPT-5.6 Sol等模型的准确率与成本,并发布了120个问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27477 2026-08-31 cs.AI cs.CV 新提交 62%

Benchmarking General Mobile Assistants in Challenging Real-World Scenarios

在具有挑战性的真实场景中对通用移动助手进行基准测试

Yiqi Zhu, Feiyu Gao, Jiaxing Fan, Jiahui Zeng, Minggang Wu, Chenliang Li, Haiyang Xu, Peng Li, Ming Yan, Yang Liu

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出名为GMA的移动助手基准,涵盖七个应用与300个不同难度任务,评估八个前沿模型发现其性能随任务复杂度提升而下降,还证实合适的智能体控制设计可显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21919 2026-08-31 cs.CV cs.AI 版本更新 62%

SDGBiasBench: Benchmarking and Mitigating Vision--Language Models' Biases in Sustainable Development Goals

SDGBiasBench: 评估和减轻可持续发展目标中视觉-语言模型的偏见

Zihang Lin, Huaiyuan Qin, Muli Yang, Hongyuan Zhu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SDGBiasBench,一个用于评估和减轻可持续发展目标中视觉-语言模型偏见的大型基准测试集,通过分析模型在决策和估计层面的偏见,提出CADE方法以减少偏见,提高模型的准确性和可靠性。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06079 2026-08-31 cs.CV cs.AI 版本更新 62%

Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning

通过双自一致性强化学习实现科学图形程序合成

Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu, Xiaoyang Wang, Wenqiao Zhang, Lijun Wu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出双自一致性强化学习框架,结合高质量数据集和多维基准,提升科学图形到可编辑TikZ代码的转换能力,实现视觉与结构的高精度优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17198 2026-08-31 cs.CV cs.AI 版本更新 62%

Riverbank Erosion Analysis in Bangladesh Using Spatiotemporal Segmentation

基于时空分割的孟加拉国河岸侵蚀分析

M. Saifuzzaman Rafat, Akif Islam, Mohd Ruhul Ameen, Momen Khandoker Ope, Abu Saleh Musa Miah, Jungpil Shin

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本研究采用适配通用分割模型SAM的参数高效方法,基于500组卫星图像对构建数据集,实现孟加拉国河岸侵蚀的快速可靠监测,模型在测试集上表现优异且具备区域泛化能力。

Comments 5 figures, 4 Tables, Accepted to 2026 International Conference on Power, Electronics, Communications, Computing, and Intelligent Infrastructure (PECCII)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28339 2026-08-31 cs.CV 新提交 57%

Abstract4D: A Large-Scale Dataset and Framework for Understanding the Visual Language of Abstract Art

Abstract4D:用于理解抽象艺术视觉语言的大规模数据集与框架

Haowei Zhang, Yuanpei Zhao, Ji-Zhe Zhou, Mao Li

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 该研究推出Abstract4D数据集,通过人机混合注释流程构建超12万张抽象绘画数据,开展语义结构分析并建立基准任务,助力评估AI对抽象艺术视觉语言的表征与解读能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23607 2026-08-31 cs.CV cs.RO 版本更新 57%

Reasoning models do not yet follow their reasoning in autonomous driving: The KITScenes LongTail Dataset

长尾驾驶场景与推理轨迹:KITScenes长尾数据集

Royden Wagner, Omer Sahin Tas, Jaime Villa, Felix Hauser, Yinzhe Shen, Marlon Steiner, Dominik Strutz, Carlos Fernandez, Quentin Delfosse, Christoph Weinhuber, Christian Kinzig, Guillermo S. Gutierrez-Cabello, Hendrik Königshof, Fabian Immel, Richard Schwarzkopf, Nils Alexander Rack, Kevin Rösch, Kaiwen Wang, Jan-Hendrik Pauls, Martin Lauer, Igor Gilitschenski, Holger Caesar, Christoph Stiller

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) FZI Research Center for Information Technology(FZI信息技术研究中心) University Charles III of Madrid(马德里卡洛斯三世大学) Technical University of Madrid(马德里理工大学) University of Toronto(多伦多大学) Delft University of Technology(代尔夫特理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出KITScenes长尾数据集,通过多视角视频、轨迹、指令和推理轨迹提升模型在长尾驾驶场景下的泛化能力,评估指令遵循与语义连贯性。

Comments 27 pages; v2: update MMS values (bugfix); v3: more focus on reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 9 篇

2601.19151 2026-08-31 cs.AI cs.MA 版本更新 83%

Multimodal Collaborative Debate for Zero-Shot Time Series Reasoning

TS-Debate:多模态协作辩论用于零样本时间序列推理

Patara Trirat, Jin Myung Kwak, Jay Heo, Heejun Lee, Sung Ju Hwang

机构 * KAIST Seoul(韩国科学技术院)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 TS-Debate通过多模态协作辩论框架,在零样本时间序列推理中实现显著性能提升,通过专门代理和结构化协议提升模态保真度和数值精度。

Comments EMNLP 2026 (Main), Project Page: this https URL (https://deepauto-ai.github.io/ts-debate/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28266 2026-08-31 cs.RO 新提交 80%

CoCoBench: A Cooperative Coordination Benchmark for Embodied Multi-Agent Task Planning

CoCoBench:用于具身多智能体任务规划的协作协调基准

Yang Chen, Ye-Xin Xie, Lirong Che, Danyang Peng, Yuzhe Yang, Peiwen Lin, Xu Cao, Chuang Wang, Lei Yuan, Jian Su, Lan-Zhe Guo

机构 * Nanjing University(南京大学) AgiBot Tsinghua University(清华大学)

专题命中 多模态Agent :MLLM(summary_cn,abstract_cn);multimodal(abstract)

AI总结 研究人员提出CoCoBench这一家庭任务多智能体具身协调基准,评估11种MLLM后发现协调能力具构造特异性,为相关模型设计提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26536 2026-08-31 cs.CL cs.AI cs.CV cs.LG cs.RO 版本更新 80%

OceanGym: A Benchmark Environment for Underwater Embodied Agents

OceanGym: 一个用于水下具身智能体的基准环境

Yida Xue, Mingjun Mao, Xiangyuan Ru, Yuqi Zhu, Baochang Ren, Shuofei Qiao, Mengru Wang, Shumin Deng, Xinyu An, Ningyu Zhang, Ying Chen, Huajun Chen

专题命中 多模态Agent :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 OceanGym通过多模态大语言模型构建首个水下具身智能体基准,揭示水下环境感知与规划的挑战,推动水下自主系统发展。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27994 2026-08-31 cs.CR cs.SE 新提交 78%

Moirae: A Multimodal Agent Collaborative Framework for Dynamic Android Malware Detection

Moirae:用于动态Android恶意软件检测的多模态智能体协作框架

Xueying Zeng, Youquan Xian, Yanze Li, bowen hu, Ziqi Shan, Xu Luo, DanPing Yang, Peng Liu, Lei Cui, Bo Li

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 该研究提出多模态智能体协作框架Moirae,通过融合多维度运行时证据实现动态Android恶意软件检测,在未见过的数据集上零样本准确率达90.06%,优于现有基线且抗概念漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28399 2026-08-31 cs.AI q-fin.TR 新提交 74%

RetailAgent: Structured Adverse Timing in Self-Conditioned Multimodal LLM Trading Agents

RetailAgent:自条件多模态大语言模型交易智能体中的结构化不利时机

Yupeng Zhang, Liuyuan Jiang, Hongyi Huang, Bingheng Li, Lisha Chen

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Michigan State University(密歇根州立大学) University of Rochester(罗切斯特大学)

专题命中 多模态Agent :multimodal(title);分类 cs.AI

AI总结 该研究提出RetailAgent框架,发现LLM交易智能体的决策存在跨维度的持续不利时机,动作与后续收益的一致性是该效应的关键驱动因素,同时自生成记忆会增强策略持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27866 2026-08-31 cs.CV 新提交 70%

Iron: Intent-Aligned and Retrospective Dual Learning Framework for Enhancing Generalist Virtual Agents

Iron:用于增强通用虚拟智能体的意图对齐与回溯双学习框架

Jiahe Ying, Wendong Bu, Kaihang Pan, Bingchen Miao, Siyu Chen, Wen Wang, Xueming Jiang, Juncheng Li, Siliang Tang

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 Iron是用于训练GUI智能体的意图对齐与回溯双学习框架,通过逐步循环一致奖励和事后回放机制提升性能,在跨环境等任务中优于三倍数据训练的模型,未见过的网页任务获25.06%相对提升。

Comments 11 pages, 5 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10891 2026-08-31 cs.LG cs.AI cs.CV cs.RO eess.SY 版本更新 62%

Transformer-Based Autonomous Driving Models and Deployment-Oriented Compression: A Survey

基于Transformer的自动驾驶模型与面向部署的压缩:综述

Juan Zhong, Yuhang Shi, Zukang Xu, Xi Chen

机构 * Renmin University of China(中国人民大学) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) Shanghai Academy of AI for Science(上海人工智能科学研究院) Department of houmo.ai(houmo.ai部门)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了基于Transformer的自动驾驶模型,并从部署角度分析了压缩与加速策略(如量化、剪枝、知识蒸馏等)如何影响模型设计、部署性、鲁棒性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏