Robust Layout-aware IE for Visually Rich Documents with Pre-trained Language Models
专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.LG
Comments 10 pages, to appear in SIGIR 2020 Industry Track
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.LG
Comments 10 pages, to appear in SIGIR 2020 Industry Track
专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.LG
Comments 11 pages, 11 figures and 6 tables; accepted to the 23rd International Conference on Artificial Intelligence and Statistics (AISTATS) 2020
专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.LG
专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.LG
Comments NeurIPS 2019
专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.LG
专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.LG
Comments To appear in Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics
专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.LG
Comments Pre-trained models and code available at https://github.com/artitw/text2class
专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.LG
Comments ACL 2018, fixed denominator in Equation 3, line 3
摊销联邦自适应:基于超网络的LoRA用于个性化基础模型
机构 * Indian Institute of Technology, Bombay(印度理工学院班加罗尔)
专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI
AI总结 提出HyperLoRA框架,通过超网络驱动的LoRA生成和乘积空间聚合,解决联邦LoRA中的结构聚合偏差和客户端初始化滞后问题,实现高效个性化、无偏聚合和更快收敛。
Comments Accepted at International Workshop on Federated Learning in the Age of Foundation Models In Conjunction with IJCAI 2026 (FL@FM-IJCAI'26)
思考以个性化:统一推理与检索的以用户为中心的个性化密集检索
专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出TTP框架,将用户意图推理与密集检索统一,经两阶段训练后在电商场景实验及在线测试中均取得优于基线的效果,提升了订单量。
Comments Accepted at CIKM 2026. 11 pages, 8 figures, and 9 tables
TransAnyText:通过结构化视觉生成实现电商图像中任意文本的翻译
专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);post-training(abstract)
AI总结 本文提出TransAnyText框架,将电商图像文本翻译转化为生成可渲染HTML补丁,经三阶段后训练优化,在多基准上表现优于对比方法,为跨境电商图像翻译提供有效可控的解决方案。
LOCAL:支持智能体大语言模型在设备上进行连续学习
专题命中 指令微调 :LLM(summary_cn,abstract)
AI总结 LOCAL是首个支持LLM智能体设备端连续学习的单GPU运行时,通过协同组件共享状态实现一致性,在7B级模型、24 GB单GPU上显著降低多项性能指标,保障学习与推理的连续性。
Comments 16 pages, 8 figures
面向病理图像解读的语言空间空间消息传递
机构 * National Taiwan University(台湾大学) ; University of Oxford(牛津大学) ; ZYTCA Limited(ZYTCA有限公司)
专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出SLMP框架,在语言空间对病理图像执行空间推理,无需微调MLLM,提升肿瘤描述准确率,缩小通用与病理专用MLLM的性能差距。
Comments Accepted at MICCAI 2026 Workshop (Oral)
面向多方言自动语音识别的策略内自蒸馏:掌握方言,保留普通话
专题命中 指令微调 :SFT(summary_cn,abstract)
AI总结 本研究针对ASR模型方言识别效果有限且直接适配易降低普通话准确率的问题,提出策略内自蒸馏(OPSD)方法,结合CPT、SFT优化Qwen3-ASR-1.7B,在不降低普通话识别能力的同时提升了多方言识别效果。
两个块粘合构造
专题命中 指令微调 :SFT(summary_cn,abstract)
AI总结 针对二维SFT的块粘合问题,构造了介于指数和对数之间的块粘合函数,并构造了一个熵维数为1的非周期线性块粘合二维SFT,解决了相关开放问题。
Comments 30 pages, 11 figures
LookAgain:基于视觉反思的闭环GUI定位方法
专题命中 指令微调 :SFT(summary_cn,abstract)
AI总结 本文针对现有GUI定位方法在小目标等场景性能骤降的问题,提出LookAgain闭环GUI定位器,通过预测后视觉反思的多轮过程结合SFT与GRPO训练,在相关基准上达到SOTA性能。
MoRSE:面向任务的混合角色-子任务专家多智能体系统
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 MoRSE是一种面向任务的多智能体系统,通过角色-子任务专家混合机制与分层组相对策略优化,在代码生成基准上提升了任务及逐步性能,且专业化增益可跨任务类别与领域泛化。
Comments 25 pages, 8 figures, 9 tables
嵌入信任:语义各向同性预测长文本生成中的非事实性
机构 * New York University(纽约大学) ; University of Toronto(多伦多大学)
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出通过语义各向同性(单位球面上归一化文本嵌入的均匀程度)评估LLMs生成长文本的可信度,其方法无需标注数据等,在多领域仅用少量样本预测非事实性的表现优于现有信号。
Comments Published in Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)
开发者使用本地大语言模型生成和评估的代码导航体验陌生代码库调试的研究
专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 该研究探讨开发者使用本地大语言模型生成评估的代码导航调试陌生代码库的体验,明确代码导航组件属性对开发者的影响,为优化代码导航生成与评估提供方向。
移植、反转和防止错位角色:Qwen2.5中方法条件下的突发错位
机构 * University of Oxford(牛津大学)
专题命中 指令微调 :language model(abstract);pretraining(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究Qwen2.5模型中突发错位,通过移植潜在角色方向诱导错位,消融自身方向可减少诱导,发现招募角色与方法和能力有关,还可筛查和防止其招募。
Comments 34 pages, 18 figures
FiRE:利用细粒度上下文学习增强多模态大语言模型(MLLMs)以实现复杂图像检索
机构 * Shandong University(山东大学) ; City University of Hong Kong(香港城市大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Shandong Jianzhu University(山东建筑大学)
专题命中 指令微调 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)
AI总结 本研究针对MLLMs在复杂图像检索任务中细粒度建模不足的问题,提出自动化细粒度多模态五元组数据集构建流程与两阶段微调策略,在零样本设置下于五个数据集上取得优于现有方法的性能。
Journal ref Proceedings of the ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2025)
超越动作模仿:面向在线广告的决策感知用户模拟器学习
专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)
AI总结 针对现有用户模拟器仅基于单领域交互模仿动作的缺陷,本文提出决策感知用户模拟器DASH,通过上下文工程、蒸馏思考轨迹与定制规则奖励模型,在腾讯广告数据上验证了其多维度优势。
Comments 23 pages, 10 figures, 9 tables
迈向中高频段系统中无别名信道外推:一种空间 - 频率 - 时间张量学习方法
专题命中 指令微调 :SFT(summary_cn,abstract)
AI总结 针对中高频段MIMO系统导频开销大问题,提出张量结构多域信道外推框架,利用有限散射特性恢复CSI。开发基于塔克的SFT域信号模型,揭示ADD域混叠问题,引入支持先验辅助去混叠机制,提出TANN,经训练得统一模型,数值结果验证其有效性和泛化能力。
Comments This work has been submitted to the IEEE for possible publication
正确为我上色:弥合感知颜色空间与文本嵌入以改进扩散生成
机构 * National Yang Ming Chiao Tung University
专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 研究文本到图像生成中颜色对齐问题,提出利用大语言模型消除颜色提示歧义、在文本嵌入空间指导颜色混合操作的无需训练框架,提高了颜色准确性且不影响图像质量,弥合文本语义与视觉生成差距。
Comments Accepted to ACM Multimedia 2025 (MM '25)
PRISP:通过轻量级适配实现隐私安全的少样本个性化
机构 * Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) ; ASRI/INMC/IPAI/AIIS, Seoul National University(ASRI/INMC/IPAI/AIIS,首尔国立大学)
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对大语言模型个性化中数据、资源和隐私问题,提出PRISP框架,利用文本到LoRA超网络生成参数,结合少样本用户数据优化,减少计算开销并消除隐私风险,相比先前方法性能更强。
Comments 18 pages, 9 figures
MADA-RL:用于紧凑模型中参数高效推理的多智能体辩论感知强化学习
专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对紧凑模型训练成本高问题,提出MADA-RL框架,将其分为生成器和评论家角色,用辩论感知信号训练,通过LoRA微调少量参数。核心是反事实评论家优势,提高了模型准确率,在数学推理基准测试中有显著效果。
Comments 20 pages, 3 figures, 9 tables, 2 algorithms, under review at TMLR
ConsiSpace:学习几何一致性对视频空间推理很重要
机构 * School of Intelligent Science and Technology, Nanjing University(南京大学智能科学与技术学院) ; School of Computer Science, Peking University(北京大学计算机科学学院) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 针对视频空间推理中现有模型难以聚合一致空间证据的问题,提出ConsiSpace框架,通过构建几何一致内存及采用统一一致性自监督强化学习,在三个空间推理基准测试上取得成绩提升,平均得分比最强基线高12.6分。
Comments ECCV 2026
MindDrive: 一种通过在线强化学习实现自动驾驶的视觉-语言-动作模型
机构 * Huazhong University of Science and Technology(华中科技大学) ; Xiaomi EV(小米电动车)
专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 MindDrive通过在线强化学习实现自动驾驶中的视觉-语言-动作模型,结合决策专家和动作专家,提升复杂场景下的驾驶决策与探索效率。
Comments Accepted by ECCV 2026; Project Page: https://xiaomi-mlab.github.io/MindDrive/
BiliVLA: 基于强化学习的场景感知视觉-语言-动作模型用于自主胆道内镜导航
机构 * The Chinese University of Hong Kong(香港中文大学) ; The Third Affiliated Hospital of Sun Yat-sen University(中山大学附属第三医院) ; University of Cambridge(剑桥大学) ; University of California, Davis(加州大学戴维斯分校)
专题命中 指令微调 :SFT(summary_cn,abstract)
AI总结 提出BiliVLA框架,将胆道内镜导航建模为指令条件化的视觉运动学习问题,结合场景感知监督和两阶段训练(SFT+GRPO),在ERCP子任务中实现91.96%的动作精度和84.85%的成功率。
超越描述:为具身智能体进行细粒度动作的认知基准测试
机构 * Zhejiang University(浙江大学) ; Wolf 1069 b(沃尔夫1069b) ; Sany Group(三一集团) ; The Hong Kong Polytechnic University(香港理工大学) ; Imperial College London(帝国理工学院)
专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出CFG-Bench基准测试,旨在评估具身智能体在物理交互中的细粒度动作能力,揭示现有MLLMs在高层次推理中的不足,并通过监督微调提升其性能。
Comments Accepted to ECCV2026