arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12101 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2940 篇

2608.23563 2026-08-25 cs.CV cs.AI 新提交 57%

EG-ARSA: An Expert-Grounded Open Model for Visual Road Safety Auditing in Low-Resource Settings

EG-ARSA:适用于低资源场景的基于专家知识的开放视觉道路安全审计模型

Md Thamed Bin Zaman Chowdhury, Moazzem Hossain

机构 * Bangladesh University of Engineering and Technology (BUET)(孟加拉工程技术大学(BUET))

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对中低收入国家道路安全审计的资源限制,提出EGD框架,构建BD-ARSA数据集和EG-ARSA模型,实验显示其性能优于310亿参数教师模型及Gemini-2.5-Flash,为低资源场景道路安全审计提供有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23476 2026-08-25 cs.CL 新提交 57%

On the Threat Model of Weird Generalization and Emergent Misalignment

怪异泛化与涌现失配的威胁模型研究

Miriam Wanner, Mark Dredze, William Walden

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL

AI总结 本文研究怪异泛化(WG)的威胁模型,发现WG程度依赖数据集组成、语言及评估问题集,预训练熟悉数据的WG程度更高,认为WG是需谨慎数据工程的对抗性威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23448 2026-08-25 cs.CL 新提交 57%

How Useful are LLMs for Grammar Engineering? Cantonese ParGram Resources and Controlled Experimental Evaluation with English Baselines

大型语言模型(LLMs)对语法工程有多有用?粤语ParGram资源及与英文基线的对照实验评估

Chit-Fung Lam

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 本研究通过对照实验评估LLMs在语法工程中的作用,发现GPT-5.4优于gpt-oss-120b,LLMs可支持语法开发中间阶段但需人类专业知识,还贡献了新粤语符号语法资源。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22930 2026-08-25 cs.AI cs.SE 新提交 57%

Concepts for Securing Agentic AI Coding and the Terok Environment

智能体AI编码的安全概念与Terok环境

Jiří Vyskočil, Franz Pöschel, Andreas Knüpfer

机构 * Center for Advanced Systems Understanding (CASUS)(高级系统理解中心(CASUS)) Helmholtz-Zentrum Dresden-Rossendorf (HZDR)(德累斯顿-罗森多夫亥姆霍兹中心(HZDR))

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 本文针对智能体AI编码的IT安全风险,提出风险评估、无损失缓解概念及实现概述,助力社区安全评估该技术的应用潜力。

Comments to be published in the proceedings of the AGENSYS workshop (Workshop on Knowledge Discovery, Maintenance and Distributed Intelligence in Multi-Agent Systems) at ECML PKDD 2026 conference in Sept. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22859 2026-08-25 cs.IR cs.CL 新提交 57%

WARP: Wasserstein-Aligned RAG for Population Opinions

WARP:用于群体意见的Wasserstein对齐检索增强生成(RAG)

Aman Singh Thakur, Aditya Agrawal, Alwarappan Nakkiran, Alex Karlsson

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 WARP是一种用于群体意见的检索后算法,通过Wasserstein-1距离校准检索证据,在多领域实验中显著降低分布误差,提升RAG系统生成答案的偏好度。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22842 2026-08-25 cs.AI 新提交 57%

FinixDoc: Rethinking Financial Document Parsing Beyond Saturated Benchmarks

FinixDoc:重新思考超出饱和基准的金融文档解析

Hang Wang, Jin Zhang, Guoliang Xu, Pengyue Lu, Yao Li, Zijiao Zhang, Tianyu Huang, Weiqi Xiong, Yulong Wang, Chuqiao Lu, Wenkang Huang, Kai Yang, Yadong Li, Hui Li, Xingzhong Xu, Xiao Xu

机构 * Ant Group(蚂蚁集团)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本研究针对金融文档解析基准与实际需求的差距,提出端到端智能体解析系统FinixDoc,核心为4B规模视觉语言模型FinixDoc-VL,在自建评估套件FinixDocBench上实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22301 2026-08-25 cs.RO cs.AI 新提交 57%

The Imitator Game: Benchmarking Robot Imitative Ability Beyond Action Prediction

模仿者游戏:超越动作预测的机器人模仿能力基准测试

Xunzhe Zhou, Yiyang Cai, Fengyi Wang, Ran Ju, Hanxiang Ren, Ruizhe Liu, Yu Zhang, Qian Luo, Feng Chen, Pei Zhou, Yi Ma, Yanchao Yang

机构 * The University of Hong Kong(香港大学) TranscEngram Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

AI总结 该研究推出四级基准《模仿者游戏》及配套数据集、评估平台,发现功能替代是机器人意图层面模仿的关键障碍,微调IG-10K预训练模型可显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22279 2026-08-25 cs.CV cs.AI 新提交 57%

OVIBench: Benchmarking Online Video Question Answering under Interruption

OVIBench:面向中断场景的在线视频问答基准测试

Naiming Liu, Zhiheng Wu, Shuning Wang, Tie Zhang, Bowen Liu, Tong Wang

机构 * HIT(哈尔滨工业大学) CASIA(中国科学院自动化研究所) ZJU(浙江大学) UESTC(电子科技大学) HKUST(香港科技大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究针对现有视频问答基准未考虑用户中断的问题,提出首个面向中断场景的在线视频问答基准OVIBench,开发模拟协议与指标集,构建训练集OVI-Train,验证了其有效性。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22229 2026-08-25 cs.CL 新提交 57%

Grounded Normative Rule Generation with Structured Search

基于结构化搜索的接地规范规则生成

Fanqi Kong, Huaxiao Yin, Ruijie Zhang, Xiaoyuan Zhang, Yizhe Huang, Jian Gao, Shuo Chen, Song-Chun Zhu

机构 * Peking University(北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室、北京智源人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本研究提出GNRS-Search框架,将规范规则生成为接地规范规则合成问题,通过MCMC采样优化AOG,在两个基准上提升规则质量,为受监管环境的合规智能体提供基础范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21417 2026-08-25 cs.AI cs.RO 新提交 57%

Retrieval-grounded robot program generation and simulation-based correction via Model Context Protocol

基于检索的机器人程序生成与基于仿真的修正:通过模型上下文协议

Zhichao Zhou, Siyuan Chen, Omkar Salunkhe, Ebru Turanoglu Bekar, Johan Stahre, Anders Skoogh

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究针对柔性制造中机器人快速重编程需求,提出结合RAG与MCP的工作流,可生成并修正ABB RAPID机器人程序,借助仿真暴露代码执行故障,减少专家监督需求。

Comments Accepted by CIE53; to appear in the CIE53 Proceedings, Khalifa University, Abu Dhabi, UAE, October 20-23, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21357 2026-08-24 cs.AI 新提交 57%

VIALS: A Benchmark for Visual Interpretation of Artifacts in the Life Sciences

VIALS:生命科学领域人工产物视觉解释基准

Elaine Lau, Thanuka Udumulla, Lee Izhaki-Tavor, Francisco Guzmán, Nicholas Magazine, Jonas Mueller

机构 * Handshake AI

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究针对生命科学人工产物视觉解释的需求,构建含161项任务的VIALS基准,发现前沿视觉语言模型在该任务上存在领域知识与推理局限,凸显AI需具备此类能力以服务生命科学工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20868 2026-08-24 cs.CV cs.CL 新提交 57%

Identify, Locate, Link: End-to-End Key-Value Extraction from Document Images

识别、定位、关联:从文档图像中进行端到端键值提取

A. Said Gurbuz, Ahmed Nassar, Christoph Auer, Maksym Lysak, Lucas Morin, Matteo Omenetti, Tim Strohmeyer, Panagiotis Vagenas, Nikolaos Livathinos, Michele Dolfi, Peter Staar

机构 * IBM Research Zurich(IBM苏黎世研究院) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究针对传统文档处理的误差传播问题,微调SmolDocling模型实现端到端键值提取,在多个数据集上性能优于更大基线模型,且体积小、推理快。

Comments Accepted at ICDAR 2026. 17 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18736 2026-08-20 cs.LG cs.CR cs.DC 新提交 57%

FedLNS: Leverage LayerNorm Signature Modeling to Mitigate Adversarial Manipulation in Federated LLMs

FedLNS:利用层归一化签名建模缓解联邦大语言模型中的对抗性操纵

Kai Li, Jong-Ik Park, Carlee Joe-Wong, Wei Ni, Falko Dressler

机构 * Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(卢森堡大学安全、可靠性与跨学科研究中心(SnT)) Carnegie Mellon University(卡内基梅隆大学) Edith Cowan University(埃迪斯科文大学) TU Berlin(柏林工业大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 FedLNS是一种服务器端联邦学习框架,通过层归一化签名筛选恶意更新,在200个客户端、40%目标操纵下,对三类模型均实现优于基线的测试困惑度。

Comments 13 pages (main body), 36 pages (appendix), 3 figures, 98 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18336 2026-08-20 cs.AI cs.CY 新提交 57%

Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam's 2025 Convex Marking Scheme

测量部分学分差距:越南2025年凸评分制的严格基准

Nguyen Quoc Hung, Nguyen Dang Minh, Le Nhu Quynh, Tran Khanh Linh, Nguyen Kieu Linh

机构 * Posts and Telecommunications Institute of Technology(越南邮电技术学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究针对越南2025年凸评分制,构建THPT-Ladder基准,发现标准准确率指标会夸大模型在该评分制下的表现,不同错误分布会导致模型得分差异显著,影响模型能力评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17561 2026-08-19 cs.CV cs.LG 新提交 57%

Leveraging existing sparse point annotations for benthic imagery dense segmentation

利用现有稀疏点标注进行底栖图像的密集分割

Cesar Borja, Breck A. McCollum, Jarret E. Byrnes, Kenneth Sebens, Ana C. Murillo

机构 * Universidad de Zaragoza(萨拉戈萨大学) Berklee College of Music(伯克利音乐学院) University of Washington(华盛顿大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本研究结合SAM2基础模型与底栖图像的稀疏专家点标注,提出自动筛选可靠点的机制以生成高质量伪真值掩码,训练细粒度分割模型,还引入新基准推进生态分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17519 2026-08-19 cs.CV cs.LG 新提交 57%

Looking Beyond the Scale: Do Surgical Skill Models Learn Transferable Representations Across Assessment Rubrics?

超越规模:手术技能模型是否能学习到跨评估准则的可迁移表征?

Hanna Hoffmann, Felix von Bechtolsheim, Stefanie Speidel, Rebecca Hisey

机构 * National Center for Tumor Diseases (NCT)(国家肿瘤疾病中心) DKFZ(德国癌症研究中心) Faculty of Medicine and University Hospital Carl Gustav Carus(卡尔·古斯塔夫·卡鲁斯医学院及大学医院) TUD Dresden University of Technology(德累斯顿工业大学) Helmholtz-Zentrum Dresden-Rossendorf (HZDR)(德累斯顿-罗森多夫亥姆霍兹中心) BMFTR Research Hub 6G-Life(BMFTR 6G生活研究中心) Deutsches Krebsforschungszentrum (DKFZ)(德国癌症研究中心) The Centre for Tactile Internet with Human-in-the-Loop (CeTI)(人在回路触觉互联网中心)

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 本文研究手术技能模型的跨评估准则可迁移性,发现JIGSAWS预训练骨干在LASANA上迁移可行但反向迁移失败,任务特定头部主导技能预测,视觉成分非唯一预测因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17426 2026-08-19 cs.CV cs.AI 新提交 57%

SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation

SemComp-Bench:视频生成中的语义任务完成基准

Keyu Tu, Zhuowei Chen, Mengqi Huang, Yuxin Wang, Jiahao Zhu, Zhendong Mao, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Sun Yat-sen University(中山大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究提出面向结果的视频生成任务语义任务完成,构建SemComp-Data数据集与SemComp-Bench基准,发现代表性视频生成模型在兼顾结果实现与参考图像语义基础上仍具挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17044 2026-08-19 cs.CV cs.AI 新提交 57%

The 10th AI City Challenge

第10届AI City挑战赛

Zheng Tang, Shuo Wang, David C. Anastasiu, Ming-Ching Chang, Anuj Sharma, Quan Kong, Munkhjargal Gochoo, Jun-Wei Hsieh, Tomasz Kornuta, Zhedong Zheng, Renran Tian, Judah Goldfeder, Fulgencio Navarro, Yuxing Wang, Yizhou Wang, Sameer Satish Pusegaonkar, Anqi Li, Nalin Dadhich, Ridham Kachhadiya, Dhanishtha Patil, Haoquan Liang, Jiajun Li, Han Zhang, Yilin Zhao, Zaid Pervaiz Bhat, Shuyu Yang, Ashutosh Kumar, Rong Wang, Rafael Martin Nieto, Peter Christiansen, Ahmed Abduljawad, Mohanrasu Shanmugam, Nadeem Shaik, Sujit Biswas, Xunlei Wu, Vidya Murali, Rama Chellappa

机构 * Santa Clara University(圣克拉拉大学) University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Iowa State University(爱荷华州立大学) Woven by Toyota(丰田编织公司) United Arab Emirates University(阿拉伯联合酋长国大学) National Yang Ming Chiao Tung University(国立阳明交通大学) University of Macau(澳门大学) North Carolina State University(北卡罗来纳州立大学) Columbia University(哥伦比亚大学) Milestone Systems(里程碑系统公司) Xi’an Jiaotong University(西安交通大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文总结了与ECCV 2026同期举办的第10届AI City挑战赛的设置、数据集、评估结果等,该赛事规模扩大,设多类赛道,成功系统结合基础模型与多种技术。

Comments Summary of the 10th AI City Challenge Workshop in conjunction with ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16852 2026-08-18 cs.AI 新提交 57%

What Do Compliance Detectors Read? An Audit of Activation Probes and Guard Models

合规检测器读取什么?激活探针与防护模型的审计

Saisab Sadhu, Aadit Sengupta, Vinay Kumar Sankarapu, Pratinav Seth

机构 * Lexsi Labs(雷克西实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究通过审计合规检测器发现其存在规则盲视问题,引入无需训练的ICS检测器,发布相关基准以推动规则盲视的进一步研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16661 2026-08-18 cs.CV cs.LG 新提交 57%

Turning spectra into images improves plant trait retrieval with 2D-CNNs

将光谱转换为图像可通过2D-CNN改进植物性状检索

Javier Lopatin, Teja Kattenborn, Eya Cherif, Sebastián Moreno

机构 * Adolfo Ibáñez University(阿道夫·伊瓦涅斯大学) University of Chile(智利大学) University of Freiburg(弗莱堡大学) Leipzig University(莱比锡大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 本研究将一维光谱转为二维图像,用EfficientNet-B0在GreenHyperSpectra数据集上实验,发现直接重塑为二维网格的方法提升了植物多性状预测精度,且2D光谱图像的表征优势是性能提升的关键。

Comments 38 pages, 14 figures, 11 tables. Supplementary material appended after the references. v2: adds a per-image vs global scaling ablation, expands the methods, and corrects several figures and captions

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16556 2026-08-18 cs.AI 新提交 57%

DeepInsight II: One Trace from Benchmark to Robot

DeepInsight II:从基准测试到机器人的单条轨迹

Siyi Li, Yuchen Kang, Wuliang Wang, Zhengjie Zhang, Jiangpin Liu, Jianhao Yao, Jie Chen

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 DeepInsight II量化具身层,复现基准结果、通过MotionBench实现仿真到真实机器人的原生迁移,并扩展轨迹定位至带修复动作的交接标签,提供从基准到机器人的经验连续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16203 2026-08-18 cs.SD cs.CL eess.AS 新提交 57%

INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval

INSPIRE:指令感知语音检索基准

Chen-An Li, Hung-yi Lee

机构 * National Taiwan University(台湾大学) NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)(台湾大学人工智能卓越研究中心)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究针对现有语音检索系统无法适配多样用户意图的问题,构建首个指令感知语音检索基准INSPIRE,评估四类检索范式,发现当前无方法能稳健处理所有检索意图,凸显统一架构的必要性。

Comments Interspeech 2026 long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15407 2026-08-18 cs.CR cs.AI cs.NE 新提交 57%

Chameleon: An Adaptive AI-Driven Honeypot Architecture Using Threat-Calibrated Particle Swarm Optimization and Semantic Deception Rapidly-Exploring Random Trees

变色龙:一种采用威胁校准粒子群优化算法与语义欺骗快速探索随机树的自适应AI驱动蜜罐架构

Rohit Swami, Tushar Singh, Akash Warde, Sri Muthu

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 Chameleon是一种开源自适应AI蜜罐平台,通过BiLSTM分类器、Qwen3.5-0.8B模型及TC-PSO、S-RRT引擎,解决传统蜜罐与商业产品的缺陷,性能显著提升且成本大幅降低。

Comments 10 pages, 7 figures, 2 tables. Under consideration for journal publication. MIT-licensed code and datasets: https://github.com/RohitSwami33/Chameleon-cybersecurity-ml

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14669 2026-08-18 cs.AI 新提交 57%

Beyond Correctness: Toward Automated Novelty Verification with Lean 4

超越正确性:基于 Lean 4 的自动化新颖性验证研究

Ayrton Porto

机构 * Universidad Nacional del Centro de la Provincia de Buenos Aires (UNICEN)(布宜诺斯艾利斯省国立中部大学(UNICEN))

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出 AViD Journal 流程,基于 Lean 4 从三维度验证数学定理新颖性,评估时发现编译不保证语义保真度等三个通用障碍。

Comments 20 pages. Preliminary version; a large-scale quantitative evaluation (N theorems x M models) is left to future work. Comments welcome. Code: https://github.com/ayrtonporto/avid-journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14663 2026-08-18 cs.LG stat.AP 新提交 57%

In-Context Learning to Assess Built Environment Impacts on Perceived Neighborhood Walkability Among Mobility-impaired Older Adults

基于上下文学习评估建成环境对行动受限老年人感知社区步行便利性的影响

Houhao Liang, Kresimir Friganovic, Joanne Kua, Noor Hafizah Ismail, Su Su, Bryan Yijia Tan, Navrag B. Singh, Panos Mavros

机构 * Future Health Technologies, Singapore-ETH Centre(未来健康技术中心,新加坡-ETH中心) Institute of Geriatrics and Active Ageing, Tan Tock Seng Hospital(陈笃生医院老年病学与 active 老龄化研究所) Geriatric Medicine, Khoo Teck Puat Hospital(邱德拔医院老年医学科) Department of Orthopedic Surgery, Woodlands Health Campus(伍德兰兹健康园区骨科)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本研究采用TabPFN的上下文学习方法,在小规模数据集上较传统模型更优,通过SHAP-IQ揭示高阶特征交互对行动受限老年人感知社区步行便利性的影响。

Comments 8 pages, 2 tables, 1 figure

Journal ref COSIT 2026 Poster Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15373 2026-08-18 cs.LG cs.NA math.NA 新提交 57%

Beyond Field Accuracy: Two-Axis Diagnosis of Inverse-PINN Parameter Error

超越场精度:逆物理信息神经网络参数误差的双轴诊断

Yifan Zhang, Qian Tao

机构 * School of Software Engineering, South China University of Technology(华南理工大学软件学院)

专题命中 评测与基准 :post-training(abstract);分类 cs.LG

AI总结 针对逆PINNs的参数误差问题,提出双轴后训练诊断方法,经三类合成PDE及耦合双参数达西检验验证,可有效分离有限样本分辨率与参数偏好,助力后续研究方向确定。

Comments Preprint with supplementary appendix. 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14228 2026-08-17 cs.LG 新提交 57%

AutoSchema: Live Schema Grounding for Agentic Text-to-Sparql over Heterogeneous Knowledge Graphs

AutoSchema:面向异构知识图谱的智能体文本转SPARQL的实时模式接地

Yiming Zhang, Koji Tsuda

机构 * The University of Tokyo(东京大学) National Institute for Materials Science(国立材料科学研究所) RIKEN Center for Advanced Intelligence Project(理化学研究所高级智能项目中心)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 提出无需训练的AutoSchema框架,用于异构知识图谱的智能体文本转SPARQL的实时模式接地,在多项生物医学KGQA等任务中优于TogoMCP,可支持未记录RDF图谱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14130 2026-08-17 cs.MM cs.AI cs.CV cs.HC 新提交 57%

AlignFace: Human-Aligned Face Similarity Metric with Interpretable Concept Relations

AlignFace:具有可解释概念关系的人类对齐人脸相似度度量

Ying Huang, Wencan Zhang, Brian Y. Lim

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本研究针对人脸生成模型评估中现有度量未实现认知对齐的问题,提出AlignFace度量,结合VLM、CA、CBM、GAM等技术,利用FACETS数据集,提升了与人类亚群感知的对齐度。

Comments 10 pages, 10 figures, 2 tables, ACM MM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14054 2026-08-17 cs.LG 新提交 57%

Model-agnostic Retrieval-Augmented Extended Forecasting for time series

模型无关的检索增强扩展预测用于时间序列

Juan Pablo Villa Serna, Rohan Asthana, Vasileios Belagiannis

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 该研究提出模型无关的RAEF方法,通过改进检索与聚合机制提升时间序列预测性能,其效果优于RAF,兼具高效性与竞争力,可替代微调用于时间序列预测的领域适配。

Comments 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13940 2026-08-17 cs.AI 新提交 57%

AI Research Preference Models

AI研究偏好模型

Thomas Simon Foster, Bassel Al Omari, Tingchen Fu, Thomas Mann, Carl Domond, Lucia Cipolina-Kun, Bhavul Gauri, Muna Aghamelu, Alexander D. Goldie, Eryk Helenowski, Jean-Christophe Gagnon-Audet, Alberto Pepe, Saba Nazir, Daniel Izcovich, Noam Levi, Rishi Hazra, Karen Hambardzumyan, Nicolas Baldwin, Xian Li, Martin Josifoski, Paris Giampouras, Masoud Jalili Sabet, Anya Sims, Hela Momand, Tatiana Shavrina, Despoina Magka, Jason Weston, Yulin Wang, Anirudh Goyal, João Henriques, Yoram Bachrach, Emily McMilin, Jakob Nicolaus Foerster

机构 * FAIR at Meta University of Oxford(牛津大学) University College London(伦敦大学学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究针对AI研究智能体的候选方案评估成本过高问题,提出AI研究偏好模型,将其集成到AIRA-dojo智能体后提升了基准任务性能,且达到目标性能的时间更短、预算更少。

Comments 34 pages, 17 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏