arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-01-13 至 2026-01-13 共收录 29
2601.07821 2026-01-13 cs.RO cs.AI cs.LG

Failure-Aware RL: Reliable Offline-to-Online Reinforcement Learning with Self-Recovery for Real-World Manipulation

具有自恢复能力的失败感知强化学习:用于现实世界操控的可靠离线到在线强化学习

Huanyu Li, Kun Lei, Sheng Zang, Kaizhe Hu, Yongyuan Liang, Bo An, Xiaoli Li, Huazhe Xu

机构 * Shanghai Qi Zhi Institute(上海启智研究院) Shanghai Jiao Tong University(上海交通大学) IIIS, Tsinghua University(清华大学人工智能研究院) Nanyang Technological University(南洋理工大学) A*STAR Institute for Infocomm Research(新加坡科技动力研究院) University of Maryland(马里兰大学)

AI总结 本研究提出FARL框架,通过整合安全批评者和恢复策略,有效减少现实世界强化学习中的失败并提升性能。

Comments Project page: https://failure-aware-rl.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07718 2026-01-13 cs.RO cs.AI

Hiking in the Wild: A Scalable Perceptive Parkour Framework for Humanoids

野外徒步:一种可扩展的感知跳跃框架用于人形机器人

Shaoting Zhu, Ziwen Zhuang, Mengjie Zhao, Kun-Ying Lee, Hang Zhao

机构 * IIIS, Tsinghua University(清华大学人工智能研究院) Shanghai Qi Zhi Institute(上海启智研究院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 本文提出了一种可扩展的感知跳跃框架,通过结合地形边缘检测和脚部体积点,实现人形机器人在复杂地形中的稳健徒步。

Comments Project Page: https://project-instinct.github.io/hiking-in-the-wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07660 2026-01-13 cs.CV

StdGEN++: A Comprehensive System for Semantic-Decomposed 3D Character Generation

StdGEN++: 一种用于语义分解3D人物生成的综合性系统

Yuze He, Yanning Zhou, Wang Zhao, Jingwen Ye, Zhongkai Wu, Ran Yi, Yong-Jin Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Tencent AIPD(腾讯AIPD) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

AI总结 StdGEN++是一种基于双分支语义感知模型的综合性系统,通过语义分解和高效生成技术,实现高保真3D人物生成,适用于自动化角色资产生产。

Comments 13 pages, 12 figures. Extended version of CVPR 2025 paper arXiv:2411.05738

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07641 2026-01-13 cs.AI cs.CL cs.MA

Beyond Static Tools: Test-Time Tool Evolution for Scientific Reasoning

超越静态工具:科学推理中的测试时工具进化

Jiaxuan Lu, Ziyu Kong, Yemin Wang, Rong Fu, Haiyuan Wan, Cheng Yang, Wenjie Lou, Haoran Sun, Lilong Wang, Yankai Jiang, Xiaosong Wang, Xiao Sun, Dongzhan Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Xiamen University(厦门大学) University of Macau(澳门大学) Tsinghua University(清华大学) Hangzhou Dianzi University(杭州电子科技大学)

AI总结 本文提出TTE框架,通过在推理过程中动态合成和进化工具,提升科学推理任务的准确性和工具效率,同时支持跨领域适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07462 2026-01-13 cs.CV

From Sketch to Fresco: Efficient Diffusion Transformer with Progressive Resolution

从草图到壁画:高效的扩散变换器与渐进分辨率

Shikang Zheng, Guantao Chen, Lixuan He, Jiacheng Liu, Yuqi Lin, Chang Zou, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学) Tsinghua University(清华大学)

AI总结 Fresco通过渐进式上采样统一重加噪和全局结构,实现高效扩散变换器的加速,适用于多种模型和领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07347 2026-01-13 cs.CL

DiffER: Diffusion Entity-Relation Modeling for Reversal Curse in Diffusion Large Language Models

DiffER: 用于扩散大语言模型中反转诅咒的扩散实体-关系建模

Shaokai He, Kaiwen Wei, Xinyi Zeng, Xiang Chen, Xue Yang, Zhenyang Li, Jiang Zhong, Yu Tian

机构 * Chongqing University(重庆大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Hong Kong University of Science and Technology(香港理工大学)

AI总结 DiffER通过实体感知训练和平衡数据构建,解决扩散大语言模型中的反转诅咒问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07263 2026-01-13 cs.CR cs.AI

When Bots Take the Bait: Exposing and Mitigating the Emerging Social Engineering Attack in Web Automation Agent

当机器人上当:揭露和缓解网络自动化代理中新兴的社会工程攻击

Xinyi Wu, Geng Hong, Yueyue Chen, MingXuan Liu, Feier Jin, Xudong Pan, Jiarun Dai, Baojun Liu

机构 * Fudan University(复旦大学) Zhongguancun Laboratory(中关村实验室) Shanghai Innovation Institute(上海创新研究院) Tsinghua University(清华大学)

AI总结 研究提出AgentBait攻击范式,揭示网络自动化代理的社会工程威胁,并设计SUPERVISOR模块有效缓解此类攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07001 2026-01-13 cs.CV

Spatial Multi-Task Learning for Breast Cancer Molecular Subtype Prediction from Single-Phase DCE-MRI

空间多任务学习用于从单相DCE-MRI预测乳腺癌分子亚型

Sen Zeng, Hong Zhou, Zheng Zhu, Yang Liu

机构 * Tsinghua University(清华大学) Southwest Forestry University(西南林业大学) GigaAI KCL

AI总结 本研究提出空间多任务学习框架,利用单相DCE-MRI实现乳腺癌分子亚型的非侵入性预测,通过多任务学习提升ER、PR、HER2及Ki-67的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06911 2026-01-13 cs.CL cs.AI cs.LG

Distributional Clarity: The Hidden Driver of RL-Friendliness in Large Language Models

分布清晰度:大型语言模型中RL友好性的隐藏驱动因素

Shaoning Sun, Mingzhu Cai, Huang He, Bingjin Chen, Siqi Bao, Yujiu Yang, Hua Wu, Haifeng Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Baidu Inc(百度公司)

AI总结 研究揭示了大型语言模型中RL友好性的隐藏驱动因素——分布清晰度,通过量化Silhouette系数并提出Silhouette-aware Reweighting策略,提升了模型在数学基准测试中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04770 2026-01-13 cs.AI cs.DB

SciIF: Benchmarking Scientific Instruction Following Towards Rigorous Scientific Intelligence

SciIF: 科学指令遵循基准测试以实现严谨的科学智能

Encheng Su, Jianyu Wu, Chen Tang, Lintao Wang, Pengze Li, Aoran Wang, Jinouwen Zhang, Yizhou Wang, Yuan Meng, Xinzhu Ma, Shixiang Tang, Houqiang Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) University of Sydney(悉尼大学) Fudan University(复旦大学) Tsinghua University(清华大学) Beihang University(北航大学)

AI总结 SciIF是一个评估模型在科学问题解决中严格遵守约束条件能力的多学科基准测试,通过显式证据验证科学有效性,提升LLM在科学逻辑框架中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23035 2026-01-13 cs.CV

Toward Stable Semi-Supervised Remote Sensing Segmentation via Co-Guidance and Co-Fusion

迈向稳定的半监督遥感分割:通过共引导与共混淆

Yi Zhou, Xuechao Zou, Shun Zhang, Kai Li, Shiying Wang, Jingming Chen, Congyan Lang, Tengfei Cao, Pin Tao, Yuanchun Shi

机构 * School of Computer Technology and Application, Qinghai University(青海大学计算机技术与应用学院) Intelligent Computing and Application Laboratory of Qinghai Province, Qinghai University(青海省智能计算与应用实验室,青海大学) Key Lab of Big Data & Artificial Intelligence in Transportation (Ministry of Education), School of Computer Science & Technology, Beijing Jiaotong University(交通运输大数据与人工智能重点实验室(教育部),北京交通大学计算机科学与技术学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Key Laboratory of Pervasive Computing, Ministry of Education(教育部普适计算重点实验室)

AI总结 本文提出Co2S框架,通过融合视觉-语言模型和自监督模型的先验知识,解决半监督遥感分割中的伪标签漂移问题,提升分割精度。

Comments 12 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23232 2026-01-13 cs.LG cs.AI cs.CL

SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts

SPEC-RL: 通过推测性回放加速在线策略学习

Bingshuai Liu, Ante Wang, Zijun Min, Liang Yao, Haibo Zhang, Yang Liu, Xu Han, Peng Li, Anxiang Zeng, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) LLM Team, Shopee Pte. Ltd.(Shopee公司语言模型团队) Tsinghua University(清华大学)

AI总结 SPEC-RL通过整合推测解码技术,有效减少强化学习回放阶段的计算开销,提升大模型推理能力。

Comments fixed typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19562 2026-01-13 cs.AI

FairMedQA: Benchmarking Bias in Large Language Models for Medical Question Answering

FairMedQA: 对大型语言模型在医学问答中的偏见进行基准测试

Ying Xiao, Jie Huang, Ruijuan He, Jing Xiao, Mohammad Reza Mousavi, Yepang Liu, Kezhi Li, Zhenpeng Chen, Jie M. Zhang

机构 * King’s College London(伦敦国王学院) University of Electronic Science and Technology of China(电子科技大学) Sun Yat-sen University(中山大学) York University(约克大学) Southern University of Science and Technology(南方科技大学) University College London(伦敦大学学院) Tsinghua University(清华大学)

AI总结 FairMedQA基准测试揭示了大型语言模型在医学问答中存在显著偏见,需进一步开发去偏技术和严格验证方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06425 2026-01-13 cs.CL cs.AI cs.LG

Tensor Product Attention Is All You Need

张量积注意力是所有你所需要的

Yifan Zhang, Yifeng Liu, Huizhuo Yuan, Zhen Qin, Yang Yuan, Quanquan Gu, Andrew Chi-Chih Yao

机构 * IIIS, Tsinghua University(清华大学信息科学技术学院) Shanghai Qi Zhi Institute(上海启智研究院) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 TPA通过张量分解实现高效注意力机制,T6模型在语言建模任务中超越传统基线,提升性能与内存效率。

Comments Published in NeurIPS 2025 (Spotlight); Project Page: https://github.com/tensorgi/TPA

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16108 2026-01-13 cs.CV

LaneSegNet: Map Learning with Lane Segment Perception for Autonomous Driving

LaneSegNet: 用于自动驾驶的基于车道段的地图学习

Tianyu Li, Peijin Jia, Bangjun Wang, Li Chen, Kun Jiang, Junchi Yan, Hongyang Li

机构 * Fudan University(复旦大学) OpenDriveLab(OpenDrive实验室) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 LaneSegNet通过引入车道段表示,实现了端到端的地图学习,提升车道线检测、中心线感知和车道段感知的性能,达到每秒14.7次的实时推理速度。

Comments Accepted in ICLR 2024

Journal ref ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06867 2026-01-13 cs.LG

U-MASK: User-adaptive Spatio-Temporal Masking for Personalized Mobile AI Applications

U-MASK:基于用户适应的时空掩码用于个性化移动AI应用

Shiyuan Zhang, Yilai Liu, Yuwei Du, Ruoxuan Yang, Dong In Kim, Hongyang Du

机构 * Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系)

AI总结 U-MASK通过用户适应的时空掩码方法,解决个性化移动AI中的数据稀疏和非平稳性问题,提升短期预测、长期预测和冷启动推荐性能。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06834 2026-01-13 cs.CV

Enhancing Low-resolution Image Representation Through Normalizing Flows

通过归一化流增强低分辨率图像表示

Chenglong Bao, Tongyao Pang, Zuowei Shen, Dihan Zheng, Yihang Zou

机构 * Yau Mathematical Sciences Center, Tsinghua University, Beijing, China(清华大学数学科学中心,北京,中国) Beijing Institute of Mathematical Sciences and Applications, Beijing, China(北京数学科学研究院,北京,中国) Department of Mathematics, National University of Singapore, Singapore(新加坡国立大学数学系,新加坡) Department of Pharmaceutical Chemistry, University of California, San Francisco, CA, USA(加州大学旧金山分校药学化学系,美国,加利福尼亚州,旧金山) Yau Mathematical Sciences Center and Department of Mathematical Sciences, Tsinghua University, Beijing, China(清华大学数学科学中心及数学系,北京,中国)

AI总结 本文提出LR2Flow框架,通过整合小波紧框架块与归一化流,提升低分辨率图像表示的重建能力与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06818 2026-01-13 cs.CL

AgentHallu: Benchmarking Automated Hallucination Attribution of LLM-based Agents

AgentHallu: 评估基于大语言模型的代理的自动幻觉归因

Xuannan Liu, Xiao Yang, Zekun Li, Peipei Li, Ran He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Department of Computer Science & Technology, Tsinghua University(清华大学计算机科学与技术系) University of California, Santa Barbara(加州大学圣芭芭拉分校) Center for Research on Intelligent Perception and Computing, NLPR, CASIA(智能感知与计算研究中心,国家工程实验室)

AI总结 AgentHallu提出一个评估基于大语言模型的代理自动识别幻觉来源的任务,通过高质量轨迹和多级注释评估13个模型,发现顶级模型在定位幻觉步骤上表现有限,工具使用幻觉最难识别。

Comments Project page: https://liuxuannan.github.io/AgentHallu.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06715 2026-01-13 math.ST cs.LG math.PR stat.ML stat.TH

Diffusion Models with Heavy-Tailed Targets: Score Estimation and Sampling Guarantees

具有厚尾目标的扩散模型:分数估计与采样保证

Yifeng Yu, Lu Yu

机构 * Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)

AI总结 本文研究了厚尾目标下基于分数的扩散模型,推导了分数估计的最小最大速率,并提供了采样保证,揭示了轻尾与多项式尾情况下不同的收敛特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06666 2026-01-13 cs.CL cs.AI

InFi-Check: Interpretable and Fine-Grained Fact-Checking of LLMs

InFi-Check: 可解释且细粒度的大型语言模型事实核查

Yuzhuo Bai, Shuzheng Si, Kangyang Luo, Qingyi Wang, Wenhao Li, Gang Chen, Fanchao Qi, Maosong Sun

机构 * Tsinghua University(清华大学) DeepLang AI Fudan University(复旦大学)

AI总结 InFi-Check通过可控数据合成和细粒度事实核查框架,提升大型语言模型事实性评估的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06586 2026-01-13 cs.CL cs.LG stat.AP stat.ML

Detecting LLM-Generated Text with Performance Guarantees

具有性能保证的LLM生成文本检测

Hongyi Zhou, Jin Zhu, Ying Yang, Chengchun Shi

机构 * Tsinghua University(清华大学) University of Birmingham(伯明翰大学) London School of Economics and Political Science(伦敦政治经济学院)

AI总结 本文提出一种无需辅助信息的LLM生成文本检测方法,通过统计推断实现高准确率和低错误率的文本分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06525 2026-01-13 cs.CV

Toward Generalizable Deblurring: Leveraging Massive Blur Priors with Linear Attention for Real-World Scenarios

迈向可泛化的去模糊化:利用大规模模糊先验与线性注意力以应对现实场景

Yuanting Gao, Shuo Cao, Xiaohui Li, Yuandong Pu, Yihao Liu, Kai Zhang

机构 * Tsinghua University(清华大学) USTC, Shanghai AI Lab(USTC,上海人工智能实验室) SJTU, Shanghai AI Lab(上海交通大学,上海人工智能实验室) Shanghai AI Lab(上海人工智能实验室)

AI总结 本文提出BPP和MoSeG方法,通过大规模模糊先验与线性注意力提升图像去模糊化在现实场景中的泛化能力。

Comments 19 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02228 2026-01-13 cs.CV

FMVP: Masked Flow Matching for Adversarial Video Purification

FMVP: 用于对抗视频净化的掩码流匹配

Duoxun Tang, Xueyi Zhang, Chak Hin Wang, Xi Xiao, Dasen Dai, Xinhang Jiang, Wentao Shi, Rui Li, Qing Li

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of New South Wales(新南威尔士大学) The Chinese University of Hong Kong(香港中文大学) Peng Cheng Laboratory(鹏城实验室)

AI总结 FMVP通过掩码策略和条件流匹配技术,有效净化对抗性视频,提升鲁棒性与检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12216 2026-01-13 cs.SE cs.AI cs.CL

Training Versatile Coding Agents in Synthetic Environments

在合成环境中训练多功能编码代理

Yiqi Zhu, Apurva Gandhi, Graham Neubig

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 SWE-Playground通过从头生成项目和任务,训练多功能编码代理,能够处理更广泛的编码任务并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13021 2026-01-13 cs.AI cs.CL

Empirical Analysis of Decoding Biases in Masked Diffusion Models

掩码扩散模型中解码偏见的实证分析

Pengcheng Huang, Tianming Liu, Zhenghao Liu, Yukun Yan, Shuo Wang, Tong Xiao, Zulong Chen, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系) Alibaba Group, Hangzhou, China(阿里巴巴集团)

AI总结 本文通过实证分析揭示了掩码扩散模型中注意力漂浮现象,揭示其浅层结构感知与深层内容聚焦的注意力机制,证明其在知识密集型任务中性能优于自回归模型。

Comments 22 pages,17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04632 2026-01-13 cs.AI cs.LG

Can Prompt Difficulty be Online Predicted for Accelerating RL Finetuning of Reasoning Models?

能否在线预测提示难度以加速推理模型的强化学习微调?

Yun Qu, Qi Wang, Yixiu Mao, Vincent Tao Hu, Björn Ommer, Xiangyang Ji

机构 * Tsinghua University(清华大学)

AI总结 本研究提出MoPPS框架,通过贝叶斯方法在线预测提示难度,从而加速推理模型的强化学习微调过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20445 2026-01-13 cs.RO

Meta-learning enhanced adaptive robot control strategy for automated PCB assembly

元学习增强的自适应机器人控制策略用于自动化PCB组装

Jieyang Peng, Dongkun Wang, Junkai Zhao, Yunfei Teng, Andreas Kimmig, Xiaoming Tao, Jivka Ovtcharova

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Engineer School(工程师学院) New York University(纽约大学) Department of Electronic Engineering(电子工程系) Tsinghua University(清华大学)

AI总结 本文提出一种基于元学习的自适应机器人控制策略,用于提高自动化PCB组装中对异形组件的定位精度和效率。

Comments Pattern: CN 118960772 A

Journal ref Journal of Manufacturing Systems 78 (2025) 46-57

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06472 2026-01-13 cs.CL cs.AI cs.CE cs.DL

KARMA: Leveraging Multi-Agent LLMs for Automated Knowledge Graph Enrichment

KARMA:利用多智能体大语言模型实现知识图谱的自动化丰富

Yuxing Lu, Wei Wu, Xukai Zhao, Rui Peng, Jinzhuo Wang

机构 * Department of Big Data and Biomedical AI, Peking University(北京大学大数据与生物医学人工智能系) Wallace H. Coulter Department of Biomedical Engineering, Georgia Institute of Technology(佐治亚理工学院生物医学工程系) School of Architecture, Tsinghua University(清华大学建筑学院)

AI总结 KARMA通过多智能体大语言模型自动丰富知识图谱,有效识别新实体并提高正确性与一致性

Comments 24 pages, 3 figures, 2 tables

Journal ref Spotlight paper of NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12195 2026-01-13 cs.CL

Browse and Concentrate: Comprehending Multimodal Content via prior-LLM Context Fusion

浏览与聚焦:通过先验LLM上下文融合理解多模态内容

Ziyue Wang, Chi Chen, Yiqi Zhu, Fuwen Luo, Peng Li, Ming Yan, Ji Zhang, Fei Huang, Maosong Sun, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Jiangsu Collaborative Innovation Center for Language Competence, Jiangsu, China(江苏省语言能力协同创新中心,江苏,中国)

AI总结 本文提出浏览与聚焦两阶段范式,通过融合先验LLM上下文提升多模态内容理解,显著提升多图像场景的性能。

Comments 17 pages, 5 figures

Journal ref ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏