OmniPresent: Generating Coherent Presentation Suites from Scientific Papers
OmniPresent:从科学论文生成连贯的演示文稿套件
专题命中 推理评测 :planning(abstract)
AI总结 研究如何将静态论文转化为动态媒体,提出OmniPresent框架,采用可渲染HTML表示和自校正循环解决模态冲突,还发布数据集与评估协议,生成的演示文稿套件质量高。
Comments In progress
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
OmniPresent:从科学论文生成连贯的演示文稿套件
专题命中 推理评测 :planning(abstract)
AI总结 研究如何将静态论文转化为动态媒体,提出OmniPresent框架,采用可渲染HTML表示和自校正循环解决模态冲突,还发布数据集与评估协议,生成的演示文稿套件质量高。
Comments In progress
用于电信网络故障排除的单 GPU 上的边缘可部署大语言模型微调
专题命中 推理评测 :reasoning(abstract)
AI总结 研究电信边缘站点大语言模型微调,用Unsloth框架进行GPU分析,系统分析多因素对训练稳定性和资源效率的影响,给出推理与非推理模型不同行为,为电信边缘环境LLM微调提供配置指南。
Comments 6 pages, 2 figures, 5 tables
LASER: 通过视觉注意力保持与沉没抑制为LVLMs提供矫正透镜
机构 * The University of Queensland(昆士兰大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对大型视觉语言模型在长序列解码中视觉遗忘的问题,提出LASER后训练框架,通过视觉接地奖励和沉没抑制奖励调节注意力轨迹与分布,在8个基准上超越强基线。
Comments The 19th European Conference on Computer Vision (ECCV 2026)
STRUCTSURVEY: 结构化智能检索用于自动生成综述论文
专题命中 推理评测 :reasoning(abstract)
AI总结 提出STRUCTSURVEY分层多智能体框架,通过动态构建实体、关系和主题分类的图表示,将结构推理从生成阶段转移到检索阶段,在ACL综述基准上相比嵌入检索基线平均提升ROUGE-1召回率2.9、ROUGE-2召回率1.0,且不降低精确度。
Comments 8 pages, 1 figure, appendices, SurgeLLM, RAG4Reports, ACL
所有关系通向罗马:自动化知识图谱构建与问题生成
专题命中 推理评测 :reasoning(abstract)
AI总结 提出ARLtR框架,联合构建知识图谱、嵌入和基于事实的问答对,实现符号图与稠密检索的统一表示,并以罗马帝国历史数据集验证。
Comments 10 pages, 5 figures, version one
如其所是:将LLM搜索评估与历史用户偏好对齐
专题命中 推理评测 :reasoning(abstract)
AI总结 提出行为锚定的LLM评判器,通过查询-相关性-印象卡引入历史用户交互证据,在音乐搜索评估中提升与用户偏好的斯皮尔曼秩相关约5%,并在多语言数据集上提高15%的相关性。
ClarifyCodeBench: 评估大语言模型在代码生成中澄清模糊需求的能力
专题命中 推理评测 :reasoning(abstract)
AI总结 提出ClarifyCodeBench基准,通过人工标注的模糊需求、澄清问题和指标,评估LLMs主动澄清需求的能力,发现代码生成能力与需求澄清能力脱钩,且多模糊场景下性能下降。
Imprint: 面向长程自我中心问答的在线记忆压缩
机构 * IIT, Kharagpur(印度理工学院卡哈拉格普尔分校)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出交互中心记忆框架Imprint,将长程自我中心记忆建模为在线压缩问题,利用人类记忆巩固信号选择性保留和压缩交互,在7天基准上提升QA准确率并大幅降低存储和检索开销。
检索图像作为视觉思维:面向开放与封闭差距的无训练多模态上下文学习
专题命中 推理评测 :reasoning(abstract)
AI总结 提出无训练框架ReVisIT,通过检索图像-标签对作为视觉思维单元,结合结构化类定义、多模态检索和交替注入示例,在多个基准上显著提升性能,弥合开放与封闭任务差距。
Comments 12 pages, 6 figures. Includes appendix. Introduces the MAAC-Bench benchmark
Labimus: 化学实验室中类人灵巧操作的仿真与基准
机构 * University of Science and Technology of China(中国科学技术大学) ; Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出Labimus,首个针对有机化学实验室中类人灵巧操作的基准,通过真实到仿真建模重建30多个功能资产,定义原子操作和称重流程,揭示任务完成与实验精度之间的差距。
Comments Project page: https://labimus.github.io/
ScratchWorld: 评估世界模型是否计算可执行后果
专题命中 推理评测 :reasoning(abstract)
AI总结 提出ScratchWorld基准,通过Scratch项目验证世界模型在稀疏变化环境中的状态预测、因果归因等能力,发现模型常忽略可执行规则,最高仅达13.8%的F1值。
CooperScene: 具有C-V2X通信特性的多模态协作自主基准
机构 * University of California, Riverside(加州大学河滨分校)
专题命中 推理评测 :planning(abstract)
AI总结 提出CooperScene数据集,通过真实C-V2X通信特性、多模态传感器和3GPP标准,建立多车协作感知基准,包含59K帧、344K标注对象。
Comments Accepted to ECCV 2026. 15 pages, 15 figures
学习拒绝:多模态大语言模型中的动作否定
机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出UCF101-AD基准测试,评估多模态大语言模型在强上下文线索下识别动作缺失的能力,发现模型倾向于肯定动作而非验证其真实性,并通过因果图CausalAct减少误报。
Comments Accepted to ECCV 2026 main conference
超越单字符:评估多模态大语言模型在句子级甲骨文理解中的表现
机构 * Shanghai Jiao Tong University(上海交通大学) ; Nanjing University of Science and Technology(南京理工大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出S-OBI基准,通过字形替换与组合合成清晰标准的句子级甲骨文实例,设计语义匹配、语义槽提取和上下文推理任务,评估多模态大语言模型在句子级甲骨文理解中的表现,发现当前模型仍依赖字符级识别。
Comments 13 pages, 4 figures
TaxoMIL:用于层次化全切片图像分析的分层约束学习
机构 * School of Electrical Engineering, Korea University(韩国大学电气工程学院) ; Department of Hospital Pathology, The Catholic University of Korea College of Medicine(韩国天主教大学医学院医院病理学系)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出TaxoMIL框架,将WSI诊断重构为多粒度文本生成任务,通过双头Transformer解码器和分类学引导目标,实现层次感知的准确预测。
Comments Accepted at ECCV 2026
SurgAtlas:一个包含2,391小时开放和微创手术的大规模手术视频-语言数据集
机构 * University of Michigan(密歇根大学) ; University of Edinburgh(爱丁堡大学) ; Vanderbilt University Medical Center(范德比尔特大学医学中心) ; University of Colorado(科罗拉多大学) ; University of Rochester(罗切斯特大学) ; Michigan Medicine(密歇根医学)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出SurgAtlas,最大手术视频-语言数据集(15,291视频,2,391小时,18专科,5,000+术式),首次大规模纳入开放手术并建立基准,通过多层级自动标注管道生成丰富注释,微调Qwen3-VL-8B在多个基准上达到领先。
基于LLM从利益相关者对话中发现潜在需求:来自工业界的初步结果
专题命中 推理评测 :reasoning(abstract)
AI总结 提出LENS方法,利用LLM分析利益相关者访谈记录,提取显式需求并推断潜在需求,以用户故事表示并链接原文,工业评估显示显式需求F1为84.4%,75%潜在需求被认为有用。
Comments This paper has been accepted at the 13th International Workshop on Artificial Intelligence and Requirements Engineering (AIRE 2026), co-located with RE 2026
SafeGen: 面向功能安全的LLM驱动断言生成与故障关键性评估
专题命中 推理评测 :reasoning(abstract)
AI总结 提出SafeGen框架,利用大语言模型和超知识图谱从设计文档提取规范并生成功能安全断言,结合门级到RTL故障映射与形式验证实现故障关键性语义分级,在FOC系统中验证了优于传统方法。
Comments Accepted by DAC 2026
我们到了吗?探索多模态大语言模型在辅助人工智能应用中的能力
机构 * IIT BHU India(印度理工学院瓦拉纳西校区) ; CVIT, IIIT Hyderabad India(印度海得拉巴国际信息技术学院计算机视觉与信息技术中心)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文通过真实世界任务评估多模态大语言模型在辅助AI中的表现,开发NetraLink系统收集基准数据,揭示其优势与局限。
用于植物显微图像理解的视觉语言模型基准测试
机构 * The University of Queensland(昆士兰大学) ; Adelaide University(阿德莱德大学) ; University of Southern Queensland(南昆士兰大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出PlantMicro基准,包含5000+图像和9000+VQA对,评估视觉语言模型在植物显微图像理解上的能力,发现现有模型在细粒度识别和生物学推理上表现不佳。
机器人操作的世界价值模型
机构 * Peking University(北京大学) ; Tsinghua University(清华大学)
专题命中 推理评测 :planning(abstract)
AI总结 提出世界价值模型(WVM),融合世界模型与价值估计,通过时序建模评估数据质量,在标准基准和次优轨迹基准上达到SOTA,提升策略学习性能。
Comments preprint
EgoSAT: 一个全面的自我中心流式交互理解基准
机构 * College of AI, Tsinghua University(清华大学人工智能学院) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出EgoSAT基准,统一自我中心视频的回顾、在线和前瞻推理任务,评估视觉语言模型在流式设置中的表现,发现现有模型存在前瞻/回顾困难及置信度校准问题。
Comments Accepted to ECCV 2026. Project page: https://leiyj23.github.io/EgoSAT/
MapReason-OSM:视觉语言模型能否从街道地图中做出可图验证的移动决策?
机构 * NVIDIA(英伟达) ; University of Central Florida(中佛罗里达大学) ; University of South Florida(南佛罗里达大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出MapReason-OSM基准,通过自渲染OpenStreetMap面板和隐藏街道图,评估VLM在路由、设施定位等任务中做出可图验证的移动决策的能力,发现模型在图形成本推理和跨缩放一致性上表现不佳。
Comments 9 pages, 7 figures. Submitted to ACM SIGSPATIAL 2026 (Industrial Track). Code and data: https://github.com/Vi-Sri/mapreason-osm
MSU-Bench:面向对话多说话人场景中以说话人为中心的理解
专题命中 推理评测 :reasoning(abstract)
AI总结 提出MSU-Bench基准,包含16个说话人中心任务和2300个问答实例,用于评估多说话人对话中的说话人定位与推理能力,揭示现有模型在复杂场景下的不足。
Comments 4 pages, accepted by interspeech 2026
PROMPT:临床AI提示组件级评估的预注册随机协议
专题命中 推理评测 :reasoning(abstract)
AI总结 提出PROMPT协议,通过预注册、随机化、匹配对照和拆解设计,在合成和医学图像任务中识别提示组件的有益、有害和无效效应,揭示整体提示评估遗漏的安全漏洞。
Comments 4 figures, 1 table
表格另有说法:用反事实关系数据测试大语言模型
专题命中 推理评测 :reasoning(abstract)
AI总结 提出ContraTable基准,通过配对原始与反事实数据库测试LLM是否基于表格回答,发现模型在复杂推理时易依赖先验知识,强调评估应关注对提供数据的忠实度。
LLM-as-a-Judge:用于Top-K推荐中可靠且可解释的离线评估
专题命中 推理评测 :reasoning(abstract)
AI总结 针对离线评估中反馈偏差和缺乏解释的问题,提出基于LLM的语义代理和推理评分框架,提升评估可靠性与可解释性。
Comments Accepted by KDD 2026
零样本视觉语言模型用于课堂投入度识别:提示敏感性与跨数据集泛化的基准研究
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; Magna International(麦格纳国际)
专题命中 推理评测 :chain-of-thought(abstract)
AI总结 本研究系统评估五种视觉语言模型在零样本条件下识别课堂投入度的表现,发现三个主要失败模式:个体学生识别近乎随机、类别崩溃和极端提示敏感性,但场景级分类效果较好。
Comments 11 pages, 6 figures, including supplementary material. Presented as a non-archival paper at the CV4Edu Workshop, CVPR 2026
评估语言模型在显著类识别中的表现
专题命中 推理评测 :chain-of-thought(abstract)
AI总结 研究语言模型能否直接从代码提交中识别显著类,无需特征工程或图构建,发现小模型在少样本提示下性能接近大模型,可降低成本和隐私障碍。
Comments 22 pages, 1 images, 8 tables, Manuscript submitted to a Journal (2026)
WeGenBench:面向文本到图像模型优化的多维诊断基准
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Dalian University of Technology(大连理工大学) ; Weixin, Tencent(腾讯微信)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出WeGenBench基准,包含4000个中英双语提示,通过场景分类和多维标签实现跨维度评估,并设计基于视觉语言模型的新颖指标,精准定位模型在特定生成类别中的缺陷。