Towards Universal Tabular Embeddings: A Benchmark Across Data Tasks
面向通用表格嵌入:跨数据任务的基准测试
机构 * Technical University of Darmstadt(达姆施塔特工业大学) ; IBM Research(IBM研究院)
AI总结 该研究推出统一基准TEmBed,在四个表示层级评估多种表格模型,明确模型选择取决于任务和层级,为表格嵌入应用及通用模型开发提供指导。
Company Research
按论文发表机构汇总科技公司的最新研究成果。直属研究团队按母公司归类,机构信息由 AI 分析生成,仅供参考。
面向通用表格嵌入:跨数据任务的基准测试
机构 * Technical University of Darmstadt(达姆施塔特工业大学) ; IBM Research(IBM研究院)
AI总结 该研究推出统一基准TEmBed,在四个表示层级评估多种表格模型,明确模型选择取决于任务和层级,为表格嵌入应用及通用模型开发提供指导。
Scal3R:学习高效的多相对位姿查询以实现可扩展的在线三维重建
机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) ; NVIDIA(英伟达公司)
AI总结 Scal3R将在线三维重建转化为多参考相对位姿查询,通过轻量可学习标记和位姿图优化抑制漂移,在多数据集上实现性能提升
Comments ECCV 2026. Project page: https://linjohnss.github.io/scal3r/
自主研究群体中涌现的作弊与举报行为案例研究
机构 * Google DeepMind(谷歌DeepMind)
AI总结 该研究以100个自主LLM智能体组成的研究集体为对象,发现其自发涌现作弊与举报行为,提出用制度机制支持自主群体去中心化自治的方案。
Terminal-Universe:将智能体轨迹转化为可扩展的终端环境
机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) ; Tsinghua University(清华大学)
AI总结 Terminal-Universe 是将智能体轨迹转化为可重用终端环境的框架,可扩展任务的广度与深度,经其生成的语料库微调 Qwen3.5-27B,显著提升了代码智能体的单轮与多轮任务性能。
AI智能体的自然语言交互协议与标准
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Marist University(玛里斯大学) ; IBM(国际商业机器公司) ; Aitomatic, Inc.(艾托马蒂克公司) ; Fordham University(福特汉姆大学)
AI总结 本文介绍了由多方开发并经Ecma International标准化的NLIP协议,解决异构AI智能体的互操作问题,阐述其设计、实现及与其他协议的关系。
Comments Accepted by ACM AI Summit 2026
终端智能体的环境演化
机构 * Hunyuan Team, Tencent(腾讯混元团队)
AI总结 针对现有协同演化方法的不足,提出环境演化方法,通过off-policy逐代提升环境难度,在Terminal-Bench 2.1上显著提升Qwen系列模型性能。
BooM-VVT:借助图像级伪数据提升无掩码视频虚拟试穿性能
机构 * Nanjing University of Science and Technology(南京理工大学) ; University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学) ; Meituan(美团)
AI总结 针对现有无掩码视频虚拟试穿依赖掩码、成本高及服装一致性差的问题,提出BooM-VVT框架,采用图像级伪数据、服装敏感关键帧采样等技术,构建OmniView数据集,实现更优的时间一致性与服装保真度。
Comments 23 pages, 18 figures, 8 tables. Accepted to ACM Multimedia 2026 (MM '26)
Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), 2026
通过潜在空间蒸馏压缩流式神经音频编码器
机构 * Apple(苹果公司)
AI总结 本研究提出通过潜在空间蒸馏压缩流式神经音频分词器,以预量化潜在为监督目标,在2.8倍压缩下保持低WER偏差,性能优于同等规模独立训练的分词器。
Comments 15 pages
基于可组合基础先验与通用抓取合成的自适应视觉-语言抓取
机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) ; KEENON Robotics Co., Ltd.(科语机器人有限公司) ; Suzhou Silicon Era Intelligent Technology Co., Ltd.(苏州硅时代智能科技有限公司) ; College of Materials, Xiamen University(厦门大学材料学院) ; School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) ; ByteDance(字节跳动) ; State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院通用人工智能国家重点实验室) ; Hubei Automation Institute(湖北省自动化研究所)
AI总结 本文提出AdaRoboVLG框架,通过解耦物理抓取合成与任务依赖理解,结合可组合基础先验实现自适应通用抓取,在仿真与真实实验中展现出高效学习、跨机械臂泛化及应对复杂环境的能力。
DRACO:面向长视界智能体训练的基于动态规则的细粒度信用分配
机构 * Carnegie Mellon University(卡内基梅隆大学) ; IBM Research(IBM研究院)
AI总结 针对长视界智能体训练中缺乏可验证奖励的问题,提出DRACO方法,通过动态生成规则并重新分配判断结果,在AppWorld和Tau-Bench上均取得显著性能提升。
CORE:通过重排器蒸馏提升多模态大语言模型(MLLM)嵌入中的组合推理能力
机构 * Alibaba Group(阿里巴巴集团) ; University of Chinese Academy of Sciences(中国科学院大学) ; Yale University(耶鲁大学) ; CASIA(中国科学院自动化研究所)
AI总结 该研究提出CORE方法,通过将MLLM重排器的组合判断蒸馏到嵌入模型,在COLA等三个组合推理基准及MCMR基准上实现了最优性能,提升了嵌入模型的组合检索能力。
离散思维到连续动作:面向端到端自动驾驶的隐式对齐规划
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Central Media Technology Institute, Huawei(华为中央媒体技术研究院)
AI总结 该研究提出具备隐式对齐规划的VLA框架LaPla,通过残差VQ-VAE消除量化误差,在nuScenes基准和AlpaSim模拟器上分别实现长时程L2误差降低、驾驶成功率提升的效果。
Comments 8 pages, 5 figures
GRPO中隐藏的虚假优势
机构 * Rochester Institute of Technology(罗切斯特理工学院) ; Adobe Research(奥多比研究院)
AI总结 该研究发现GRPO存在虚假优势会误导策略走向猜测行为,提出SIGNBALANCE算法,在有界答案数学任务和搜索智能体上性能优于GRPO,开放答案数学任务表现相当。
整体三维结构的稳定且可扩展的光束平差法
机构 * ETH Zurich(苏黎世联邦理工学院) ; Microsoft Spatial AI Lab(微软空间人工智能实验室) ; Australian National University(澳大利亚国立大学) ; Lund University(隆德大学)
AI总结 本文提出统一框架扩展光束平差法,将高阶几何关系建模为类相机实体,保留稀疏性并提升稳定性,在相当运行时下生成更丰富三维结构与更高几何精度。
Comments To appear at ECCV 2026. Code available as part of the LIMAP toolbox at https://github.com/cvg/limap/
针对重尾分布的极值分位数处理效应的位置不变估计量
机构 * Huazhong University of Science and Technology(华中科技大学) ; Tencent(腾讯)
AI总结 针对重尾分布极值QTE估计量的位置偏移不不变问题,通过适配位置不变EVI估计量并替换外推方案,提出位置不变的极值QTE估计量,经模拟验证其性质良好。
无对齐文本音频盒(Text-AB):用于语音配音和全双工对话合成
机构 * FAIR at Meta(Meta FAIR研究院)
AI总结 该研究提出无对齐文本音频盒(Text-AB),基于流匹配扩散Transformer,在48万小时语音预训练后经微调,实现高质量配音与全双工对话合成,性能大幅优于现有系统。
WorldReward:面向相机条件世界模型的奖励建模
机构 * Fudan University(复旦大学) ; Tencent Hunyuan(腾讯混元) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
AI总结 该研究提出WorldReward,一种基于VLM的成对偏好奖励模型,解决相机条件世界模型现有奖励函数的缺陷,在WorldReward-Bench上超GPT-5.5,还提升了HY-WorldPlay 1.5的动作与视觉质量。
Comments Website: https://codegoat24.github.io/WorldReward
OctWorld:基于八叉树三维映射的长程世界一致视频生成
机构 * University of Science and Technology of China(中国科学技术大学) ; Microsoft Research Asia(微软亚洲研究院) ; Tsinghua University(清华大学)
AI总结 研究提出带持久三维记忆的视频扩散框架OctWorld,通过引入空间自适应三维记忆OctMap解决长程生成的空间一致性难题,生成的视频在基准及长程设置下优于现有方法。
Comments Accepted to ECCV 2026 Project page: https://maxtirerror.github.io/octworldpage/
重新审视连续环境中基于宏观动作的视觉语言导航闭环强化学习的拓扑图
机构 * Zhejiang University(浙江大学) ; Huawei Technologies Co., Ltd(华为技术有限公司) ; Zhejiang Humanoid Robot Innovation Center(浙江人形机器人创新中心)
AI总结 该研究针对连续环境视觉语言导航的模仿学习缺陷,提出分层马尔可夫决策过程结合拓扑图与动作感知价值头的方法,在R2R-CE等基准取得最优性能。
CROCODIL:基于大语言模型的跨模型代码编辑
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Cisco Research(思科研究院)
AI总结 本研究针对多LLM协作时的外来代码过度编辑问题,提出CROCODIL后训练框架,通过相似度奖励与执行奖励的乘积优化,在保证功能正确的同时减少了不必要的代码编辑。
Comments EMNLP 2026 Findings
GraFT:一种基于3D场景图的多模态大语言模型空间推理无训练框架
机构 * Riemann Lab, Huawei Technologies(华为技术有限公司黎曼实验室)
AI总结 GraFT是一种无训练框架,通过3D场景图为多模态大语言模型提供三类空间推理能力,在ScanQA、VSI-Bench数据集上显著提升了模型空间推理性能。
Xiaomi-TabLDM:表格基础模型技术报告
机构 * Xiaomi(小米)
AI总结 本研究提出Xiaomi-TabLDM表格基础模型,仅在SCM生成的合成数据预训练,通过三阶段训练策略等技术,在多基准回归任务表现优异且效率高,还可通过测试时计算扩展提升性能。
STAIR(结构感知信息检索器):用于文档结构增强的新型数据集与基于大语言模型的检索器
机构 * IBM(国际商业机器公司) ; Amazon Books Science(亚马逊图书科学部门)
AI总结 本研究提出新型检索系统STA IR及基准SearchTome,利用语料库目录增强检索,在SearchTome上的Recall@1达82.6%,显著优于DSI、BM25等基线,可构建低幻觉IR系统。
免费暂停令牌
机构 * Microsoft(微软) ; Cornell University(康奈尔大学)
AI总结 该研究提出免费暂停令牌,通过权重共享主干的并行预测流承载额外计算,在不增加推理开销的前提下,以1.14倍训练计算成本实现Transformer下一个令牌预测性能提升2-3centinats。
视频生成器是否会跨片段追踪世界?视频延续中世界状态推理的基准与方法
机构 * Alibaba Group(阿里巴巴集团)
AI总结 该研究针对视频生成器无法可靠追踪视频世界状态的问题,构建了基准Statebench并提出方法Stateagent,将可控视频延续的全案例状态分数从45.2提升至69.3,还有益于一分钟规模的故事生成。
重新思考3D噪声:通过无优化形态扰动学习3D感知视频先验
机构 * Technical University of Munich(慕尼黑工业大学) ; Huawei Heisenberg Research Center(华为海森堡研究中心) ; Tavus(塔沃斯公司)
AI总结 该研究针对3D场景表示在稀疏视图下的伪影问题,提出无优化的3D形态扰动正则化方法,结合3DGS实现更强几何先验,提升视频模型的3D感知能力及下游机器人操纵任务的成功率。
WeatherNext 3:利用原始观测数据提升全球气象模型的分辨率与性能
机构 * Google Research(谷歌研究院) ; Google DeepMind(谷歌DeepMind) ; Google(谷歌公司)
AI总结 WeatherNext 3通过摄入低延迟地球静止卫星数据,实现每小时预报、与物理模型相当的分辨率及多源观测利用,解决了AI气象模型的分辨率与观测利用缺陷,提升了中期预报性能。
CulturalMenuBench:探究多模态烹饪推理中的知识应用差距
机构 * Alibaba Group(阿里巴巴集团) ; Xiamen University(厦门大学) ; University of Hamburg(汉堡大学)
AI总结 该研究推出多模态烹饪推理基准CulturalMenuBench,发现模型在食物识别任务中存在知识应用差距,无法通过视觉输入激活文化知识,推动了关联感知、过程与文化背景的训练。
Comments Accepted to EMNLP 2026 Findings. Code and data: https://github.com/BobTsang-NLP/CulturalMenuBench
激进解码时KV驱逐的关键因素:时间聚合与排名保留
机构 * Ant Group(蚂蚁集团) ; Alibaba Group(阿里巴巴集团) ; Universität Hamburg(汉堡大学)
AI总结 该研究聚焦激进解码时KV驱逐的关键因素,提出基于EMA的InertiaKV及其变体,揭示时间聚合与排名保留的重要性,相关方法可提升解码吞吐量且不显著降低质量。
Comments Accepted to EMNLP 2026 Main Conference
让每一次工具调用都发挥作用:面向智能体视觉语言模型的必要工具-证据路径奖励
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; Department of Machine Learning, Carnegie Mellon University(卡内基梅隆大学机器学习系) ; MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)
AI总结 针对智能体视觉语言模型工具调用监督不足的问题,提出NTEP标注方案与NTEP-R监督机制,在7个基准上验证了NTEP-8B可提升搜索准确率与工具使用效率。