Roomer: Reflective Object-Grounded Model Editing and Repair for 3D Indoor Layout Synthesis
Roomer:用于3D室内布局合成的基于对象的反射式模型编辑与修复
专题命中 评测与基准 :language model(abstract)
AI总结 针对现有室内布局生成器的局部违规问题,提出Roomer框架,通过视觉语言模型规划器与确定性求解器实现基于对象的局部修复,提升布局物理有效性与可用性且可跨生成器迁移。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
Roomer:用于3D室内布局合成的基于对象的反射式模型编辑与修复
专题命中 评测与基准 :language model(abstract)
AI总结 针对现有室内布局生成器的局部违规问题,提出Roomer框架,通过视觉语言模型规划器与确定性求解器实现基于对象的局部修复,提升布局物理有效性与可用性且可跨生成器迁移。
Event ActivityNet:用于未修剪动作理解的大规模模拟事件基准
专题命中 评测与基准 :pretraining(abstract)
AI总结 本文提出大规模模拟事件基准Event ActivityNet,解决长时序事件动作理解数据集不足的问题,建立基线并验证其预训练对原生事件微调的性能提升效果。
Comments 22 pages, 10 figures
结合先进深度学习技术的优势,从无人机影像中评估灾后建筑物损毁情况
机构 * KDDI Research, Inc.(KDDI研究所)
专题命中 评测与基准 :language model(abstract)
AI总结 本文提出将CV模型与LVLM结合的混合框架,在RescueNet、FloodNet基准上评估,可准确统计灾后建筑物损毁情况,性能优于单独基准模型且仅需少量标注数据,相关资源公开。
Comments Accepted at ECMLPKDD 2026, 31 pages (including appendix), 18 figures
BoilerSketch:面向CS1/早期CS2的TA监督、以图表为核心的生成式AI结构化图表实践
专题命中 评测与基准 :prompting(abstract)
AI总结 BoilerSketch是面向CS1/早期CS2的TA监督式生成式AI实践,通过双面板交互模型生成结构化Mermaid图表,经21名教学人员评估,三分之二认为其对概念理解和支持任务有中等以上帮助,为入门计算课程提供了实用AI支持方案。
Comments 9 pages, 3 tables, 3 figures
ORCESTRA:基于视觉语言模型的混合现实视觉机器人编程系统
机构 * Skolkovo Institute of Science and Technology(斯科尔科沃科技学院) ; R&D Center, MWS(MWS研发中心)
专题命中 评测与基准 :language model(abstract)
AI总结 ORCESTRA是一款混合现实系统,通过无代码路径点示教和语言引导控制实现机器人数字孪生编程,支持多种异构机器人,其混合现实验证可作为语言引导机器人物理部署前的安全层。
Comments 4 page, 3 figures, 1 table, ISMAR 2026
MDTD-ArtIR:针对纹理叠加退化的艺术图像修复的图像编辑与修复模型基准测试
机构 * Durham University(杜伦大学)
专题命中 评测与基准 :language model(abstract)
AI总结 本研究构建MDTD-Art基准及MDTD-Art数据集,对比各类模型,发现图像编辑模型在艺术图像修复中优于专用修复架构,结构化提示可放大其性能优势。
Comments 15 pages, 6 figures, 6 tables. Preprint submitted to Elsevier Journal of Visual Communication and Image Representation
助手放置基准Aria:面向以自我为中心的放置辅助任务的基准
机构 * Reality Labs, Meta inc.(Meta公司现实实验室) ; Technion, institute of technology(以色列理工学院) ; Sensei
专题命中 评测与基准 :foundation model(abstract)
AI总结 本文提出首个虚拟放置基准Assistant Placement Aria,涵盖三类以人为中心的放置任务,在基准上评估了多个基础模型,推动虚拟放置领域研究。
病理基础模型图谱中的信号由什么承载?乳腺癌的患者级对照基准测试
机构 * University of Missouri(密苏里大学)
专题命中 评测与基准 :foundation model(abstract)
AI总结 本研究以乳腺癌患者为单位开展对照基准测试,发现病理基础模型的信号由嵌入而非几何机制承载,嵌入在多数基因程序预测中优于组织组成,驱动基因计数指标无显著预测性。
Comments 40 pages, 7 figures, 10 tables. Supplementary Information (16 pages) included as an ancillary file. Segmentation outputs obtained under the Aignostics Research Access Programme; OpenTME data at https://huggingface.co/datasets/Aignostics/OpenTME
通过分层轨迹抽象复用编码智能体的过往修复工作
专题命中 评测与基准 :LLM(abstract)
AI总结 本研究提出STAIR框架,通过分层轨迹抽象复用编码智能体过往修复经验,在SWE-bench Verified上显著提升修复智能体的Pass@1指标,且计划可跨智能体泛化。
Comments 10 pages
MoRoute:面向上下文多模态视频生成的动态路由
机构 * Sun Yat-sen University(中山大学) ; HUJING Digital Media & Entertainment Group(沪景数字媒体娱乐集团) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 评测与基准 :language model(abstract)
AI总结 MoRoute是采用动态层路由连接VLM与视频DiT的多模态视频生成框架,在三个基准数据集上均优于现有最优方法,提升了视频生成与编辑的性能。
Comments Project page: https://orange-3dv-team.github.io/MoRoute/
MarkushGlyph与OCSRGlyph:改进的化学结构识别
专题命中 评测与基准 :language model(abstract)
AI总结 本研究将化学结构识别视为图像到文本转换任务,提出OCSRGlyph与MarkushGlyph模型,前者优化OCSR性能,后者针对Markush结构采用整体视觉语言建模,还提出新指标解决Markush结构翻译的准确性判定问题。
面向离线卫星安全计划分解的受控候选集基准
专题命中 评测与基准 :prompting(abstract)
AI总结 本文提出低秩分解适配器,构建含24个卫星安全案例的防泄露数据集,在Qwen2.5基线对比中验证其性能,为离线卫星安全计划分解提供基准与概念验证。
Comments 8 pages, 1 figure, 2 tables
ARCHER:用于可执行法规的智能规则与合规框架
专题命中 评测与基准 :prompting(abstract)
AI总结 研究针对建筑合规验证难题,提出ARCHER这一测试驱动、确定性编排的多智能体程序合成框架,能从法规代码生成验证代码,经评估其在多骨干模型上准确率高,成本-准确率分析显示可降低成本实现数据主权合规检查。
迈向可靠的染色转移:基于多模态专家指导评估的迭代数据-模型协同优化框架
机构 * East China Normal University(华东师范大学) ; Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) ; Hangzhou Hyperspectral Imaging Technology Co., Ltd.(杭州高光谱成像技术有限公司) ; Fudan University Shanghai Cancer Center(复旦大学附属肿瘤医院)
专题命中 评测与基准 :language model(abstract)
AI总结 研究针对染色转移建模难题,提出DMCoStain框架,通过迭代优化数据与模型能力提升准确性和可解释性。基于IPE视觉语言模型构建MEGFS策略并创建ImmunoInstruction数据集,实验证明该框架达最优精度,其范式有实用价值,MEGFS可作评估工具。
Comments 10 pages, accepted by ACMMM2026 Main Track
MEDit-Bench:一个用于评估消息驱动叙事视频编辑的数据集
机构 * The University of Osaka(大阪大学) ; CyberAgent, Inc.(株式会社CyberAgent)
专题命中 评测与基准 :LLM(abstract)
AI总结 研究消息驱动的视频编辑问题,提出MEDit-Bench数据集及基准,通过多消息与编辑配对展示消息对编辑的影响,定义评估协议,标注消息属性,实验表明模型虽在宽松阈值下接近人类,但严格标准下仍落后,人类编辑更优。
真实性:用于3D城市模型的多源溯源感知知识图谱及基准测试
专题命中 评测与基准 :LLM(abstract)
AI总结 研究针对城市数字孪生多源数据整合难题,提出多源溯源感知的3D城市知识图谱AuthentiCity,整合多城市多类型数据。引入两个基准测试系列,通过自然语言到查询翻译及图表示学习评估,展示其在多任务中的优势,为相关研究提供数据及测试支持。
IMPRINT:用于长尾目标导航的图像条件查询增强
机构 * University of Padova(帕多瓦大学) ; Fondazione Bruno Kessler (FBK)(布鲁诺·凯斯勒基金会)
专题命中 评测与基准 :language model(abstract)
AI总结 研究针对具身人工智能中ObjectNav依赖纯文本查询可靠性低的问题,提出IMPRINT框架,用网络图像丰富文本查询改善定位,无需训练导航策略。通过新基准HSSD-rare评估,显示图像条件查询可提升导航增益,还指出下游检测质量是关键瓶颈。
Comments Accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). Project page: https://github.com/JelinR/IMPRINT
Qwen-Audio-3.0-TTS:基于多阶段训练范式的可自由控制且高度鲁棒的语音合成
专题命中 评测与基准 :language model(abstract)
AI总结 介绍Qwen-Audio-3.0-TTS语音合成系统,结合低帧率分词器与五阶段训练范式,通过自然语言指令等实现生产级控制,支持多语言多方言,在多种评估中性能优异,为生产级语音合成奠定基础。
Comments 19 pages
UMI3D:通过同步聚焦交叉注意力路由在无约束多图像输入上进行稳健的3D生成
专题命中 评测与基准 :foundation model(abstract)
AI总结 研究针对3D基础模型在无约束多图像输入上表现不佳的问题,提出UMI3D框架,通过同步聚焦交叉注意力路由,利用体素参考分数,无需训练即可提升单图像3D生成框架在多图像输入时的性能。
Comments Project Page: https://umi3d-project.github.io/
RoadVGGT:基于道路结构感知的前馈式路面重建
专题命中 评测与基准 :foundation model(abstract)
AI总结 针对现有道路重建方法需逐场景训练及场景依赖覆盖设计的局限,提出RoadVGGT框架,利用几何基础模型结合多视图图像等,经高斯头预测、坐标对齐及融合等重建紧凑高斯路面,提升多方面性能,证明几何基础模型在路面重建中的潜力。
一种尺度自适应视觉模型将秀丽隐杆线虫神经元形态与行为联系起来用于神经毒性评估
机构 * Zhejiang University School of Medicine(浙江大学医学院) ; Second Affiliated Hospital of Zhejiang University School of Medicine(浙江大学医学院附属第二医院) ; Zhejiang University(浙江大学) ; Guizhou University(贵州大学) ; Fourth Affiliated Hospital of Zhejiang University School of Medicine(浙江大学医学院附属第四医院) ; Liangzhu Laboratory(良渚实验室)
专题命中 评测与基准 :foundation model(abstract)
AI总结 研究针对神经毒性评估难题,引入专用自监督视觉模型及多粒度共聚焦基准,提出尺度自适应掩码图像建模策略,在多任务中超越基础模型,融合特征可预测行为缺陷,筛选化学品发现新神经毒性决定因素,为评估和药物发现提供新方法。
Nova3D:可编程3D资产的代码原生生成
机构 * Raresense Inc(锐感公司) ; University of Edinburgh(爱丁堡大学)
专题命中 评测与基准 :LLM(abstract)
AI总结 研究针对交互式3D世界需求,提出Nova3D系统,以代码原生方式生成可编程3D资产。通过在基准测试中的表现,展示其能生成有效工件,满足多种约束,实现局部编辑和关节运动,在几何方面有竞争力,转变了3D对象的表示形式。
室内环境下无校准的3D多摄像机人体跟踪
专题命中 评测与基准 :foundation model(abstract)
AI总结 针对室内环境下多摄像机人体跟踪依赖校准的问题,提出统一无校准3D MCPT框架,集成多种技术,采用姿态引导3D提升策略和全局身份关联方法,在挑战赛中取得53.13%的HOTA分数,为纯视觉3D跟踪建立基线。
Journal ref The 15th Conference on Information Technology and its Applications (CITA2026), Jul 2026, Ha Long, Vietnam
面向儿童的AIGC视频风险审查:一个基准和知识支持的迭代推理框架
机构 * Shandong University(山东大学) ; Fudan University(复旦大学) ; Beijing Jiaotong University(北京交通大学)
专题命中 评测与基准 :language model(abstract)
AI总结 研究面向儿童的AIGC视频审查问题,构建CAVSR基准和分层风险分类法,提出结合多智能体协作与知识经验的QVRS-E框架,实验证明该方法能增强儿童相关风险审查,产生更可靠报告。
用于分类任务的基于三量子比特的神经量子核
专题命中 评测与基准 :pretraining(abstract)
AI总结 研究聚焦三量子比特,将神经量子核扩展到量子位设置,系统研究关键设计选择。在四个基准数据集任务中,三量子比特NQKs大多优于QNN基线,能从增加特征和系统规模受益,酉表示影响性能,凸显基于量子位量子模型潜力。
对齐异构DFT数据集:一种用于交叉泛函形成能的图神经网络方法
专题命中 评测与基准 :foundation model(abstract)
AI总结 研究针对异构DFT计算中形成能误差导致多源数据整合困难的问题,采用基于图的迁移学习,利用MatPES数据库训练结构感知图神经网络,将PBE能量转换为r2SCAN级精度,有效升级数据集,推动高性能材料基础模型发展。
ReCowGnition:用于奶牛面部识别的真实生物识别基准
机构 * Fraunhofer Institute for Computer Graphics Research IGD(弗劳恩霍夫计算机图形研究所IGD) ; Technische Universität Darmstadt(达姆施塔特工业大学)
专题命中 评测与基准 :foundation model(abstract)
AI总结 针对奶牛面部识别,构建了含6838张图像的公开基准数据集,定义了评估协议,给出六个基准模型的评估结果,为奶牛面部识别研究提供数据支持与评估标准,推动该领域可比研究。
Comments Accepted at ICPR 2026 Workshops
当模型发布遇到模型重用:Hugging Face 中的生产者 - 消费者错位
专题命中 评测与基准 :language model(abstract)
AI总结 研究预训练语言模型供应链中生产者与消费者的错位问题,通过对50位Hugging Face生产者和95位GitHub消费者的双视角调查,发现双方在模型发现、文档实践、谱系追踪和模型治理采用上存在差异,为改进供应链相关方面提供了机会。
AXIS:用于可扩展机器人操作的可增长社区驱动数据引擎
机构 * Axis Robotics(轴机器人公司) ; University of California, Berkeley(加州大学伯克利分校) ; Georgia Institute of Technology(佐治亚理工学院) ; Texas A&M University(德州农工大学) ; Johns Hopkins University(约翰·霍普金斯大学) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Michigan(密歇根大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学)
专题命中 评测与基准 :pretraining(abstract)
AI总结 研究针对机器人操作策略学习中数据管道难扩展的问题,提出AXIS这一可增长社区驱动数据引擎,它能收集、处理数据并组织成任务快照,通过实验表明其能提升模型性能且随数据量增加有一致扩展性。
Comments Project Website: https://axisaiorg.github.io/AXIS-V1/
你点击的位置很重要:开放集射频指纹识别的探测与建模基准
专题命中 评测与基准 :LLM(abstract)
AI总结 研究射频指纹识别中样本收集位置对性能的影响,通过在五个探测点收集数据评估开放集、重建误差RFFI,发现其强烈依赖探测点,定时恢复等效果好,还通过基准测试验证,表明探测点选择比自动编码器复杂性更主导性能。
Comments 10 pages, 8 figures