Automated QoR improvement in OpenROAD with coding agents
在OpenROAD中通过编码代理实现自动化QoR提升
机构 * UC San Diego(UC圣地亚哥大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 AuDoPEDA通过自主编码代理在OpenROAD中实现EDA技术的自动化改进,显著提升QoR指标。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
在OpenROAD中通过编码代理实现自动化QoR提升
机构 * UC San Diego(UC圣地亚哥大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 AuDoPEDA通过自主编码代理在OpenROAD中实现EDA技术的自动化改进,显著提升QoR指标。
PersonaX: 多模态数据集与LLM推断行为特征
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of California San Diego(加州大学圣地亚哥分校) ; Australian National University(澳大利亚国立大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 PersonaX通过多模态数据集结合LLM推断行为特征,推动多模态特征分析与因果推理发展。
Comments ICLR 2026
MAPS: 一种多语言评估基准,用于代理性能和安全
机构 * Fujitsu Research of Europe(富士通欧洲研究部) ; Fujitsu Limited(富士通有限公司) ; Cohere
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 MAPS是一个多语言评估基准,用于评估代理AI在不同语言和任务中的性能与安全性。
Comments Accepted to EACL 2026 findings
大型语言模型在人道主义危机响应中的地理信息提取
机构 * Universidad de San Andrés Victoria(圣安德烈斯大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文提出基于LLM的两步框架,通过结合命名实体识别和上下文地理编码模块,提升人道主义文档中地理信息提取的精度与公平性。
PERSPECTRA: 一种可扩展且可配置的多元视角论证基准
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 PERSPECTRA提出了一种结合结构清晰与语义多样性的多元视角论证基准,用于评估模型在处理多个视角时的表示、区分与推理能力。
Comments 15 pages, 1 figure
UrbanGraphEmbeddings: 学习和评估空间导向的多模态嵌入用于城市科学
机构 * National University of Singapore Department of Architecture Singapore ; The Chinese University of Hong Kong Dept of Systems Eng. \& Eng. Mgmt. China ; Singapore Management University School of Computing \& Info. Systems Singapore ; National University of Singapore ; Department of Architecture ; The Chinese University of Hong Kong ; Singapore Management University
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出UGE框架,通过空间导向的多模态嵌入提升城市理解任务性能,实验显示在图像检索和地理位置排名上取得显著提升。
视觉语言模型中的道德趋炎奉承
机构 * University of Dhaka(达卡大学) ; Daffodil International University(达福迪国际大学) ; Islamic University of Technology(伊斯兰技术大学) ; University of Central Florida(佛罗里达中央大学) ; King Fahad University of Petroleum and Minerals(国王法赫德石油与矿物大学) ; SDAIA - KFUPM Joint research Center for Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文研究了视觉语言模型在道德决策中的趋炎奉承现象,发现模型在用户偏见下易产生道德错误回应,揭示了模型在伦理一致性与稳健性上的权衡问题。
Comments 13 pages, 6 figures, 8 tables, Submitted for review in ACL
JUSTICE: 通过中间结论模拟实现司法统一合成以生成自动判决文件
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 JUSTICE通过模拟预判过程提升判决书生成的法律准确性和连贯性
超越数量:代码代理的轨迹多样性扩展
机构 * SIAT, CAS(中国科学院软件研究所) ; Alibaba Group(阿里巴巴集团) ; UNSW Sydney(新南威尔士大学悉尼分校) ; SUAT(上海大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 TDScaling通过提升轨迹多样性而非单纯增加数据量,优化代码代理训练的性能-成本平衡,提升工具使用泛化和编码能力。
KoTaP:韩国企业税务避税、绩效与治理的面板数据集
专题命中 推理评测 :planning(abstract);分类 cs.LG
AI总结 KoTaP是一个涵盖韩国非金融企业的长期面板数据集,用于研究税务避税、绩效和治理,提供标准化变量和国际可比性,支持经济计量、AI分析和政策研究。
Comments 18 pages, 3 figures, 8 tables. Submitted to Scientific Data; currently under review. Data and codebook available at Zenodo (DOI: 10.5281/zenodo.17149808)
通过Bootstrap聚合实现高效且适应性强的恶意LLM提示检测
机构 * KAUST(卡塔尔人工智能研究所在线中心)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 BAGEL通过Bootstrap聚合和专家混合方法,实现高效且适应性强的恶意LLM提示检测,以高F1得分超越现有大参数模型。
从不承认的裁判:基于大语言模型的评估中的隐藏捷径
机构 * Sharif University of Technology(沙菲大学技术学院) ; Qatar Computing Research Institute(卡塔尔计算研究所)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 研究揭示了基于大语言模型的评估中隐藏的捷径问题,指出裁判模型在面对注入提示时缺乏透明度,导致裁决偏移率高但提示识别率低,揭示了评估流程中的可靠性缺口。
无人类触感:基于LLM的摘要评估中的重叠偏差
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本研究发现LLM在摘要评估中对重叠度敏感,随着重叠减少,LLM更倾向于选择其他LLM生成的摘要,表明需采用更复杂的评判技术。
ONTrust:信任的参考本体
机构 * Semantics, Cybersecurity \& Services, University of Twente, The Netherlands ; Business Information Systems, University of Twente, The Netherlands ; DAFIST, University of Genoa, Italy
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 ONTrust通过构建信任参考本体,提供信任概念的本体学基础,支持信息建模、自动推理和语义互操作性,应用于信任管理、AI设计等领域。
Comments 46 pages
ViHERMES: 一个基于图的多跳问答基准和系统用于越南卫生法规
机构 * URA Research Group, Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), VNU-HCM, Vietnam(URA研究组,计算机科学与工程学院,胡志明市技术大学(HCMUT),VNU-HCM,越南)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 ViHERMES是一个针对越南医疗法规多跳问答的基准和系统,通过图感知方法提升法规问答性能。
Comments Accepted at ACIIDS 2026
通过战略资源分配实现激励感知的AI安全:从Stackelberg安全游戏视角出发
机构 * Harvard University(哈佛大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出基于Stackelberg安全游戏的AI安全框架,通过战略资源分配设计激励机制,提升AI监管的主动性与鲁棒性。
大规模生成逼真合成家庭数据
机构 * Siddharth Singh(1 西雅图)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出了一种大规模生成逼真合成家庭数据的方法,通过松耦合生成人机交互与环境数据,实现双向影响建模,提升家庭智能设备的开发与测试能力。
Comments Accepted at Agentic AI Benchmarks and Applications for Enterprise Tasks workshop at AAAI 2026
ShoppingComp: LLMs 是否真的准备好为您的购物车服务?
机构 * ByteDance(字节跳动)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 ShoppingComp通过现实世界基准揭示LLM在购物代理任务中的局限性,强调其在信息定位、多约束验证和风险决策方面的不足。
CyberRAG: 一种基于代理的RAG网络攻击分类与报告工具
机构 * University of Calabria(卡利博里大学) ; IMT School for Advanced Studies(IMT高级研究学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 CyberRAG是一种基于代理的RAG框架,通过模块化设计实现网络攻击的实时分类、解释和结构化报告,提高检测准确性和可解释性。
Journal ref Future Generation Computer Systems, 176, 2026, 108186
AutoMixer:检查点 artifacts 作为自动数据混合器
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 AutoMixer通过利用检查点模型的新兴能力,自动优化数据混合,提升预训练性能达1.93%。
Comments Accepted at ACL 2025
方差的价值:通过不确定性驱动的策略优化缓解多智能体系统中的辩论崩溃
机构 * Department of Computer Science, Binghamton University, Binghamton, NY, USA(宾夕法尼亚州立大学计算机科学系) ; University of Iowa, Iowa City, IA, USA(爱荷华大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 本文提出了一种基于不确定性驱动的策略优化方法,通过量化多智能体系统中的不确定性来缓解辩论崩溃问题,提升决策准确性和系统一致性。
WorldEdit: 向开放世界图像编辑迈进的基于知识的基准
机构 * Zhejiang University(浙江大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Nanyang Technological University(南洋理工大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 WorldEdit通过引入基于知识的基准,提升模型在开放世界图像编辑中对隐式指令的理解和处理能力。
OMNI-Dent:迈向一个可及且可解释的AI框架,用于自动化牙科诊断
机构 * University of Minnesota(明尼苏达大学) ; Khon Kaen University(科恩卡恩大学) ; Minnesota State University(明尼苏达州立大学) ; The University of Western Australia(西澳大学) ; Kaohsiung Medical University(高雄医学院) ; Auckland University of Technology(奥克兰理工大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 OMNI-Dent通过结合临床推理原则和视觉语言模型,提供一个数据高效且可解释的牙科诊断框架,帮助用户识别异常并判断是否需要专业评估。
Vectra: 一种新的度量标准、数据集和模型用于电子商务图像中的图像翻译视觉质量评估
机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 Vectra提出了一种无参考、基于大语言模型的视觉质量评估框架,通过多维度量系统、数据集和模型提升电子商务图像翻译的视觉质量评估效果。
TrajAD:用于可信大语言模型代理的轨迹异常检测
机构 * School of Software, Shandong University(山东大学软件学院) ; Sonli Holding Group Co., Ltd.(山东利集团有限公司) ; Shandong Huazhi Talent Technology Co., Ltd.(山东华智人才科技有限公司) ; Information Technology Service Center of People’s Court(人民法院信息技术服务中心)
专题命中 推理评测 :verifier(abstract);分类 cs.AI
AI总结 TrajAD通过细粒度过程监督训练的专用验证器,解决大语言模型代理轨迹异常检测问题,提升过程可靠性。
Comments 9 pages, 5 figures, 1 table
面向成本的模型选择用于文本分类:在生产环境中细调编码器与LLM提示之间的多目标权衡
机构 * Pontifical Catholic University of Chile(天主教智利大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文提出在生产环境中细调编码器与LLM提示之间的多目标权衡,发现微调编码器在成本和性能上优于LLM提示。
Comments 26 pages, 12 figures. Empirical benchmark comparing fine-tuned encoders and LLM prompting for text classification under cost and latency constraints
面向知识图谱问答的人机协同、大语言模型中心架构
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文提出一种人机协同的大语言模型中心架构,用于知识图谱问答,通过生成Cypher查询并让用户逐步优化,提升复杂数据集的可访问性并保持事实准确性。
THOR:基于超关系知识图谱的归纳链接预测
机构 * University of Macau(澳门大学) ; Khalifa University(哈利法大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 THOR提出了一种针对超关系知识图谱的归纳链接预测方法,通过基础图建模和Transformer解码器提升预测性能,优于多种基线方法。
Spider-Sense: 基于内在风险感知的高效代理防御方法与分层自适应筛查
机构 * SUFE(上海财经大学) ; NUS(新加坡国立大学) ; QuantaAlpha(量子阿尔法) ; CMU(卡内基梅隆大学) ; SYSU(南方科技大学) ; USTC(中国科学技术大学) ; XJTU(西安交通大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 Spider-Sense通过内在风险感知实现高效代理防御,结合分层自适应筛查机制,有效降低攻击成功率和误报率,仅引入微小延迟。
MDAgent2:用于分子动力学中代码生成和知识问答的大型语言模型
机构 * Peking University(北京大学) ; National Key Laboratory of Data Space Technology and System(国家数据空间技术与系统重点实验室) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Liaoning Technical University(辽宁技术大学) ; Wenjing Future Lab (Beijing) Technology Co., Ltd(文景未来实验室(北京)科技有限公司)
专题命中 推理评测 :self-correction(abstract);分类 cs.LG
AI总结 MDAgent2是首个能同时进行分子动力学知识问答和代码生成的端到端框架,通过领域特定数据集和强化学习方法提升性能。
Comments 24 pages,4 figures