iTIMO: An LLM-empowered Synthesis Dataset for Travel Itinerary Modification
iTIMO:一个基于大语言模型的旅行行程修改合成数据集
专题命中 推理评测 :planning(abstract)
AI总结 iTIMO通过基于大语言模型的意图驱动扰动任务,构建了一个用于旅行行程修改的合成数据集,用于评估和改进旅行推荐系统。
Comments Accepted by SIGIR2026
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
iTIMO:一个基于大语言模型的旅行行程修改合成数据集
专题命中 推理评测 :planning(abstract)
AI总结 iTIMO通过基于大语言模型的意图驱动扰动任务,构建了一个用于旅行行程修改的合成数据集,用于评估和改进旅行推荐系统。
Comments Accepted by SIGIR2026
基于代理的软件工件评估
专题命中 推理评测 :planning(abstract)
AI总结 研究针对软件工件评估中人工评估难及现有政策缺乏验证标准的问题,构建ArtifactGuide评分标准,设计ArtifactCopilot代理,通过实验评估,该框架提升了评估性能,提高了评审信心,还为设计高质量工件提供了实践指导。
ManiScope:基于大语言模型的加密货币操纵风险可视化分析
专题命中 推理评测 :reasoning(abstract)
AI总结 针对加密货币市场操纵风险评估问题,提出ManiScope系统,利用大语言模型辅助可视化分析,提供多方面协同视图及人机协作框架,经案例和用户研究验证,该系统能有效评估风险、减少人工并围绕假设组织发现。
DynEval:对自然环境下的文本到图像生成模型进行全面评估
机构 * Indian Institute of Science(印度科学研究所) ; Hugging Face(拥抱脸)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究针对文本到图像生成模型评估难题,提出DynEval动态评估框架,通过构建两个数据集,利用课程学习策略微调评估器,在多基准测试中与人类判断相关性更高,可对多个T2I模型进行细粒度分析。
Comments Accepted at ECCV 2026. Project page: https://vcl-iisc.github.io/dyneval/
使用具有错误减少技术的大语言模型来判定静态分析警报
专题命中 推理评测 :reasoning(abstract)
AI总结 研究用大语言模型判定静态分析警报,采用一致性检查和LLM推理评估两种方法,在三个测试套件上评估多个LLMs,中级推理LLMs经错误缓解后召回率和特异性高,还探讨了相关问题及合成程序作为证据的结果。
Comments 22 pages
SkillGuard:一种面向智能体技能的权限框架
专题命中 推理评测 :reasoning(abstract)
AI总结 提出SkillGuard权限框架,通过双平面治理模型联合管控上下文影响和动作副作用,以缩小技能声明意图与运行时行为之间的安全差距。
OpenEarthAgent:一个用于工具增强地理空间代理的统一框架
机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) ; IBM Research(IBM研究院) ; Linköping University(林霍姆斯大学) ; Technical University Munich(慕尼黑技术大学) ; Australian National University(澳大利亚国立大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出OpenEarthAgent框架,通过整合卫星影像、自然语言查询和结构化推理轨迹,实现多模态地理空间推理,提升遥感任务的执行能力与空间逻辑一致性。
Comments Accepted at the European Conference on Computer Vision (ECCV 2026)
基于大语言模型的分布式多智能体系统中长期记忆的成本与准确性
专题命中 推理评测 :reasoning(abstract)
AI总结 针对分布式多智能体系统中长期记忆的成本与准确性评估空白,构建独立可复现测试平台,比较多种架构并发现检索不完整是准确率差距主因,RAG基线以更低总拥有成本达到高准确率。
Comments Copyright IEEE 2026. Manuscript accepted at IEEE COMPSAC 2026. Not for redistribution. Published version: https://doi.org/10.1109/XXXXXX
TIIF-Bench:你的文本到图像模型如何遵循指令?
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Tsinghua University(清华大学) ; OPPO Research Institute(OPPO研究院)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究旨在评估T2I模型遵循指令能力,提出TIIF-Bench基准,含多维度、多难度提示及新评估指标,利用大语言模型知识开发可重现评估器,通过对主流模型测试分析其优缺点及现有基准局限性。
Comments 35 pages, 14 figures, 9 tables
以自我为中心的视频-语言模型是否捕捉了以手和物体为中心的线索?
机构 * The University of Tokyo(东京大学) ; University of Twente(特温特大学) ; University of Bristol(布里斯托大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究手部-物体交互识别中现有视频-语言模型的局限,提出结合手部-物体掩码训练与HOI-动态感知解码器的新范式,构建DEHOI测试平台评估,证明该方法更有效利用相关信息,在多方面优于现有模型,提升HOI理解。
视频扩散模型在手部运动重建中的惊人有效性
机构 * Nanyang Technological University(南洋理工大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出ViDiHand,利用预训练视频扩散模型重建4D双手姿态,无需检测器或优化,在多个基准上显著超越现有方法。
AI系统如何解决AP物理问题?对大型语言模型在代数基础自由回答问题上的比较评估
专题命中 推理评测 :reasoning(abstract)
AI总结 本文评估了AI系统在解答AP物理自由回答问题上的表现,发现其在代数问题解决上表现良好,但在空间推理和视觉解释方面存在局限。
Comments 10 pages, 3 figures
Journal ref Phys. Educ. 61 045008 (2026)
诊断视觉语言模型中由损坏引起的可靠性故障
机构 * City University of Macau(澳门城市大学) ; Nanyang Technological University(南洋理工大学) ; Jiangxi University of Finance and Economics(江西财经大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究视觉损坏对视觉语言模型行为的影响,引入Bench-C测试平台及稳健对齐分数(RAS),通过对13个VLM实验发现轻度损坏会提高top-1准确率却降低预测结构,支持超越最终答案的稳健性评估。
Comments 14 pages
从我的视角到你的视角:利用特权自我中心监督从外中心视频中学习自我中心线索
机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) ; Elorian AI
专题命中 推理评测 :reasoning(abstract)
AI总结 研究针对视觉语言模型难以从外中心视频推断自我中心属性的问题,提出Ego2ExoVLM框架,利用时间同步视频对及特权监督,通过两个组件实现此能力,在多任务评估中取得领先性能。
Comments ECCV 2026
PERSONAJUDGE:使用特定评估者的示范数据模拟个体人类偏好判断
专题命中 推理评测 :reasoning(abstract)
AI总结 研究针对大语言模型作评判时忽略个体评估者差异的问题,提出结合分类判断与特定评估者辅助数据的模拟方法,经实证研究发现该方法有改进,推理痕迹作用大,还明确了模拟难度及相关属性,为个性化评估提供见解。
基于LoRA的跨上下文视觉语言适配用于临床伤口监测中的个性化严重不良事件检测
机构 * San Diego State University(圣地亚哥州立大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; University of California, Davis(加利福尼亚大学戴维斯分校)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究针对临床伤口监测中严重不良事件检测问题,提出基于双流LoRA框架及跨上下文融合机制的多模态框架,结合多种方法识别个性化严重不良事件并捕捉愈合动态,在相关实验中展现良好性能。
用于法医合成媒体检测的概率人工智能模型的溯因确证
机构 * NCSC, part of GCHQ(英国国家网络安全中心(NCSC))
专题命中 推理评测 :reasoning(abstract)
AI总结 研究针对法医合成媒体检测问题,利用溯因推理确证多种方法输出以识别最可能结论,应用该方法可降低误报风险,还对OpenAI的SynthID进行实证评估及评估不同检测方法互补性。
基于混合评估的软件需求到架构生成基准测试
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出R2ABench基准,包含真实软件项目及PRD和PlantUML图,通过多维混合评估框架评估生成架构,发现LLM在关系推理上存在不足,代码专用模型和代理框架各有优劣。
SteelBench:真实工业环境下的视觉语言模型评估基准
机构 * Indian Institute of Technology Bhilai(印度理工学院比莱分校) ; Steel Authority of India Limited(印度钢铁管理局有限公司) ; VIT Vellore(维洛尔理工学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对现有基准无法适配真实工业监控场景的问题,构建含1345条标注片段的SteelBench基准,评估视觉语言模型的工业活动识别、安全规则推理等能力,发现现有模型性能远低于人类水平。
用于自动驾驶的智能体驱动长尾模拟
机构 * IIIS, Tsinghua University(清华大学交叉信息研究院) ; Bosch Research(博世研究院)
专题命中 推理评测 :planning(abstract)
AI总结 针对现有自动驾驶模拟器局限性,提出智能体驱动模拟框架,通过结构化动作接口由大语言模型控制道路参与者,还引入SemanticPlan基准测试,结果表明长尾场景仍具挑战性。
迈向高效低空传感:一种用于无人机任务分配的双异构图学习方法
专题命中 推理评测 :planning(abstract)
AI总结 针对传统无人机任务分配方法难捕捉任务依赖与通信关系的问题,提出基于双异构图学习的方法,构建任务图与通信图,将分配问题转为结构匹配问题,用图注意力网络和交叉注意力机制优化匹配,提升任务完成率与效率。
知识与关怀之间:从患者和医生角度对用于2型糖尿病自我管理的生成式人工智能的混合方法评估
专题命中 推理评测 :reasoning(abstract)
AI总结 该混合方法研究从患者和医生角度评估用于2型糖尿病自我管理的生成式人工智能。通过分析患者查询、医生评分及访谈,发现模型优缺点,得出两个分析概念,为四个设计方向提供依据。
Comments arXiv admin note: text overlap with arXiv:2510.10048
一种评估大语言模型道德敏感性的可扩展方法
专题命中 推理评测 :reasoning(abstract)
AI总结 研究如何评估大语言模型道德敏感性,提出新方法解决AI对齐研究中行为评估的问题,引入MORPH-1K基准测试并应用于八个模型,证明相关特征语义内容稳定。
Comments 9 pages, 3 figures, preprint
GRCD:用于多发现胸部X光对的地面区域变化检测
机构 * Department of Computer Science(计算机科学系)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对现有胸部X光多发现报告自动生成方法不足,提出GRCD框架。通过修正标注错误构建数据集,引入模块编码区域变化并注入语言模型,在多发现测试集上性能优于基线,消融实验验证设计有效性。
编码代理能否实现错过的编译器优化?在LLVM窥孔优化上评估大语言模型代理
专题命中 推理评测 :reasoning(abstract)
AI总结 研究编码代理能否开发编译器优化,引入PeepholeBench框架,其任务来自LLVM的实际窥孔优化问题,通过对比衡量编码代理与人工修复,发现正确性和收益性间存在矛盾及主要失败模式,为编码代理提供了现实且具挑战性的基准。
大语言模型驱动的渗透测试综述:分类法、共同演化及开放挑战
专题命中 推理评测 :reasoning(abstract)
AI总结 通过系统分析2023至2026年间81篇论文,梳理大语言模型驱动的渗透测试文献分类,追溯架构四阶段演化,指出关键发现,识别出评估可靠性等三个开放挑战。
OmniPresent:从科学论文生成连贯的演示文稿套件
专题命中 推理评测 :planning(abstract)
AI总结 研究如何将静态论文转化为动态媒体,提出OmniPresent框架,采用可渲染HTML表示和自校正循环解决模态冲突,还发布数据集与评估协议,生成的演示文稿套件质量高。
Comments In progress
用于电信网络故障排除的单 GPU 上的边缘可部署大语言模型微调
专题命中 推理评测 :reasoning(abstract)
AI总结 研究电信边缘站点大语言模型微调,用Unsloth框架进行GPU分析,系统分析多因素对训练稳定性和资源效率的影响,给出推理与非推理模型不同行为,为电信边缘环境LLM微调提供配置指南。
Comments 6 pages, 2 figures, 5 tables
SWE-Manager:编码前选择并合成黄金方案
专题命中 推理评测 :reasoning(abstract)
AI总结 研究软件工程中提案选择问题,引入SWE-Manager方法,通过强化学习训练8B模型进行提案比较、选择及合成黄金方案,在基准测试中表现优异,并设计框架评估其在实际问题解决中的有效性。
IRG-MotionLLM:用于文本到运动生成的交织运动生成、评估和细化
机构 * Sun Yat-sen University(中山大学) ; Tongyi Lab, Alibaba Group(阿里云实验室) ; Shenzhen Loop Area Institute(深圳河套学院) ; Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部人工智能与先进计算重点实验室)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究揭示运动评估和细化任务可促进知识流动,提出通过迭代文本-运动对话将运动生成与评估、细化紧密结合的新范式,介绍IRG-MotionLLM及训练方案,构建数据引擎,实验证明其性能。
Comments Accepted by ECCV 2026