arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9400 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9400 篇

2606.20557 2026-06-19 cs.LG math.ST stat.ML stat.TH 新提交 57%

Optimal Deterministic Multicalibration and Omniprediction

最优确定性多校准与全预测

Georgy Noarov, Aaron Roth

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出一种确定性算法,实现多校准的极小化最优样本复杂度,并推广到结果不可区分性,解决确定性预测器是否必要的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05435 2026-06-19 cs.AI 版本更新 57%

CareTransition-Audit: A Benchmark to Audit Discharge Summaries for Efficient Care Transitions

CareTransition-Audit:用于高效护理过渡的出院总结审计基准

Akshat Dasula, Prasanna Desikan, Jaideep Srivastava, Shivali Dalmia, Abhishek Mukherji

机构 * Department of Computer Science \& Engineering, University of Minnesota-Twin Cities, Minneapolis, USA Centific AI Research, Redmond, USA

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出基于大语言模型的自动化框架,通过46项检查清单审计出院总结完整性,在MIMIC-IV数据集上基准测试11个模型,最佳模型与临床医生标签的Cohen's kappa约0.5,所有模型难以识别模糊文档。

Comments Accepted as a poster at IEEE-ICHI 2026; Accepted at SD4H@ICML

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16606 2026-06-19 cs.CL 版本更新 57%

Omnilingual SONAR: Cross-Lingual and Cross-Modal Sentence Embeddings Bridging Massively Multilingual Text and Speech

Omnilingual SONAR:跨语言与跨模态句子嵌入,连接大规模多语言文本与语音

Omnilingual SONAR Team, João Maria Janeiro, Pere-Lluís Huguet Cabot, Ioannis Tsiamas, Yen Meng, Vivek Iyer, Guillem Ramírez, Loic Barrault, Belen Alastruey, Xiang "Tony" Cao, Yu-An Chung, Marta R. Costa-Jussa, David Dale, Kevin Heffernan, Jaehyeong Jo, Artyom Kozhevnikov, Alexandre Mourachko, Christophe Ropers, Holger Schwenk, Paul-Ambroise Duquenne

机构 * FAIR at Meta(Meta的FAIR)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出OmniSONAR模型,通过渐进式训练和教师-学生蒸馏,在数千种语言上实现文本、语音、代码和数学表达式的统一语义嵌入,在跨语言检索和翻译任务上显著降低错误率,并支持零样本语音翻译。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00875 2026-06-19 cs.CL cs.HC cs.MA 版本更新 57%

TransLaw: A Large-Scale Dataset and Multi-Agent Benchmark Simulating Professional Translation of Hong Kong Case Law

TransLaw:模拟香港判例法专业翻译的大规模数据集与多智能体基准

Xi Xuan, Chunyu Kit

机构 * City University of Hong Kong, Hong Kong SAR, China(香港城市大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 针对香港判例法英译中资源匮乏、法律术语和格式要求严格的问题,构建了首个大规模句对齐平行语料库HKCFA Judgment 97-22,并提出多智能体框架TransLaw,通过分解翻译任务、集成法律词汇库和检索增强生成,显著提升翻译质量,但仍未达到人类专家的风格自然度。

Comments Accepted at ICML 2026 - AI for Law

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19057 2026-06-18 stat.ML cs.LG stat.CO stat.ME 新提交 57%

Quantifying and Auditing LLM Evaluation via Positive--Unlabeled Learning

通过正-无标签学习量化与审计大语言模型评估

Zilong Zhang, Yi-Ting Hung, Lei Ding, Chi-Kuang Yeh

机构 * Department of Mathematics and Statistics(数学与统计学系) Georgia State University(佐治亚州立大学) Department of Statistics(统计学系) University of Manitoba(曼尼托巴大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 针对大语言模型作为评估者存在的系统性偏差(如冗长偏好),提出基于部分最优传输的几何审计框架,利用少量人工验证正样本校正偏差,无需重训练即可提升与人类偏好的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19218 2026-06-18 cs.CL 新提交 57%

RECOM: A Validity Discrimination Tradeoff in Automatic Metrics for Open Ended Reddit Question Answering

RECOM:开放式 Reddit 问答中自动评估指标的有效性与区分性权衡

Pushwitha Krishnappa, Amit Das, Vinija Jain, Aman Chadha, Tathagata Mukherjee

机构 * University of Alabama Huntsville(阿拉巴马大学亨茨维尔分校) University of North Alabama(北阿拉巴马大学) Stanford University(斯坦福大学) Meta AI Amazon GenAI(亚马逊生成人工智能)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出 RECOM 数据集,发现自动评估指标在开放式问答中无法同时兼顾有效性和区分性,余弦相似度有效性高但区分性差,BERTScore 区分性受长度影响且有效性弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18780 2026-06-18 cs.CV cs.CL cs.MM 新提交 57%

SAMA: Semantic Anchor-aligned Augmentation for Unified Low-Resource Multimodal Information Extraction

SAMA:面向统一低资源多模态信息抽取的语义锚定对齐增强

Quanjiang Guo, Chong Mu, Jiazhou Pan, Ming Jia, Ling Tian, Hui Gao, Zhao Kang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出语义锚定对齐增强框架SAMA,通过构建结构化语义锚引导多专家多模态大模型生成高保真文本,并利用锚保留扩散机制合成图像,结合双约束过滤模块,在低资源多模态信息抽取任务中显著提升性能。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18356 2026-06-18 cs.CR cs.AI 新提交 57%

SafeClawBench: Separating Semantic, Audit-Evidence, and Sandbox Harm in Tool-Using LLM Agents

SafeClawBench: 区分工具使用LLM代理中的语义、审计证据和沙箱危害

Yuchuan Tian, Mengyu Zheng, Haocheng Mei, Ye Yuan, Chao Xu, Xinghao Chen, Hanting Chen, Yu Wang

机构 * Peking University(北京大学) Beijing Jiaotong University(北京交通大学) SUIBE(上海外国语大学) Huawei(华为) Tsinghua University(清华大学)

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI

AI总结 提出SafeClawBench基准,通过三个独立端点(语义攻击接受、审计可见危害证据、沙箱观察危害)评估工具使用LLM代理的安全性,揭示不同失败模式并支持可复现比较。

Comments 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18129 2026-06-17 cs.HC cs.AI 新提交 57%

Towards Understanding and Measuring COGNITIVE ATROPHY in LLM Behaviour

理解和测量LLM行为中的认知萎缩

Abeer Badawi, Moyosoreoluwa Olatosi, Negin Baghbanzadeh, Laleh Seyyed-Kalantari, Frank Rudzicz, R. Shayna Rosenbaum, Sara Pishdadian, Elham Dolatabadi

机构 * York University(约克大学) Vector Institute(向量研究所) Rotman Research Institute(罗特曼研究学院) Dalhousie University(达尔豪斯大学) Centre for Addiction & Mental Health(成瘾与心理健康中心) KITE Research Institute(KITE研究机构)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 针对LLM在心理健康支持中缺乏过程行为评估的问题,提出认知萎缩概念及基准,通过临床标注和专家评估揭示模型普遍存在中度至高度萎缩行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17798 2026-06-17 cs.CV cs.AI 新提交 57%

LiveStarPro: Proactive Streaming Video Understanding with Hierarchical Memory for Long-Horizon Streams

LiveStarPro: 具有分层记忆的主动式流视频理解用于长时域流

Zhenyu Yang, Kairui Zhang, Bing Wang, Shengsheng Qian, Changsheng Xu

机构 * IEEE

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出LiveStarPro,通过流验证解码、流因果注意力掩码和树结构分层记忆三个组件,实现长时域流媒体视频的主动理解,在语义正确性和时序误差上分别提升28.9%和降低18.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17657 2026-06-17 cs.AI 新提交 57%

Using Cognitive Models to Improve Language Model Simulation of Human Persuasion Games

使用认知模型改进语言模型对人类说服博弈的模拟

Zirui Cheng, Zeyu Shen, Thomas L. Griffiths, Peter Henderson

机构 * Princeton University(普林斯顿大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出方程到行为提示和强化学习方法,使语言模型匹配认知模型(如贝叶斯更新、动机推理),在说服博弈中提升模拟人类决策多样性的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17577 2026-06-17 cs.AI 新提交 57%

Surrogate Assisted Pedestrian Protection Design via a Foundation Model Orchestrated Workflow

基于基础模型编排工作流的代理辅助行人保护设计

Osamu Ito, Akihiko Katagiri, Yoshikazu Nakagawa, Shin Saeki, Jun Shiraishi, Masato Sasaki

机构 * Honda Motor Co., Ltd.(本田汽车有限公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出首个基础模型编排的碰撞安全设计工作流,集成代理模型、多目标进化搜索、几何生成器和自然语言接口,将行人保护评估时间从数小时降至秒级。

Journal ref ICLR 2026 Workshop The 2nd Workshop on Foundation Models for Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17507 2026-06-17 cs.AI cs.SE 新提交 57%

LLM-as-Judge in Education: A Curriculum-Grounded Marking Pipeline

教育中的LLM作为评判者:基于课程标准的评分流水线

Xiwei Xu, Chen Wang, Jacky Jiang, Phil Yang, Qian Fu, Mohan Dhall, Wenjie Zhang, Liming Zhu

机构 * NSW Department of Education(新南威尔士州教育部) South Australian Department for Education(南澳大利亚州教育部) OC Selective exam preparation platform(OC精英考试备考平台) Studitory: HSC preparation platform(Studitory: HSC备考平台)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出一种基于课程标准的可配置LLM评判流水线,用于高利害考试评分,通过整合授权课程工件和评分指南,提高评分一致性、透明度和与官方实践的契合度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17368 2026-06-17 cs.AI cs.NI 新提交 57%

Distributed General-Purpose Agent Networks: Architecture, Key Mechanisms, and Prototypes

分布式通用智能体网络:架构、关键机制与原型

Shengli Zhang, Deen Ma, Zibin Lin, Taotao Wang

机构 * College of Electronics and Information Engineering, Shenzhen University(深圳大学电子与信息工程学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出分布式通用智能体网络架构,通过协议适配层连接上层任务语义与底层网络操作,解决语义公告传播、可信身份与多主题声誉、语义梯度机制设计三大核心问题,实现开放可信的智能体协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17367 2026-06-17 cs.CY 新提交 57%

Towards Auditing AI Systems in the Wild

野外AI系统审计的探讨

Aditya T. Vadlamani, Anutam Srinivasan, Srinivasan Parthasarathy

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 本文提出将AI系统审计视为在不确定性下监控约束违规的统计问题,强调开发全生命周期审计框架,以持续评估公平性、安全性等风险控制约束。

Comments Accepted to KDD 2026 (Blue Sky Ideas Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17220 2026-06-17 cs.AI 新提交 57%

When Rules Learn: A Self-Evolving Agent for Legal Case Retrieval

当规则学习时:一种用于法律案例检索的自演化智能体

Mingxu Tao, Jiawei Hu, Xian Zhou, Wenpeng Hu, Jiajun Cheng, Yunbo Cao, Zhunchen Luo, Guotong Geng

机构 * Center of Information Research, AMS(AMS信息研究中心) Discipline and Technology Research Center for Large Model Intelligence Applications(大模型智能应用学科与技术研究中心) Hebei University of Engineering(河北工程大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出一种自演化框架,通过LLM智能体自动生成并优化查询重写规则,无需参数训练即可增强BM25在法律案例检索中的性能。

Comments To appear in ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17197 2026-06-17 cs.SE cs.AI 新提交 57%

Cluster-Aware Dual-Level Test Specification Generation for Large-Scale Automotive Software Requirements

面向大规模汽车软件需求的集群感知双层测试规格生成

Hazem Ayman, Menna Sedik, Kareem Mostafa, Mahmoud Soliman, Samer Saber, Ibrahim Habib

机构 * CairoMotive Cairo, Egypt(开罗动力埃及)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出一种“先聚类后总结”流水线,通过嵌入、降维、聚类、多级摘要和双层测试生成,解决大规模需求下LLM处理依赖缺失和上下文窗口限制问题,提升集成测试覆盖率并高效扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15121 2026-06-17 cs.CL 新提交 57%

When Cognitive Graphs Meet LLMs: BDEI Cognitive Pathways for Panic Emotional Arousal Prediction

当认知图遇见大语言模型:恐慌情绪唤醒预测的BDEI认知路径

Mengzhu Liu, Long Qin, Chuan Ai, Zhengqiu Zhu, Hongru Liang, Chen Gao, Yong Li, Xin Lu, Quanjun Yin

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 提出PanicCognitivePath框架,通过心理安全距离模型融合多域信号,引入显式情绪节点构建BDEI认知路径,将LLM限制于单步参数估计,实现恐慌情绪唤醒时间预测,准确率提升10.68%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31286 2026-06-17 cs.RO cs.AI 版本更新 57%

DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation

DeMaVLA:面向可泛化可变形物体操作的视觉-语言-动作基础模型

Taiyi Su, Jian Zhu, Tianjian Wang, Youzhang He, Zitai Huang, Jianjun Zhang, Chong Ma, Hanyang Wang, Tianjiao Zhang, Munan Yin, Weihao Ding, Yi Xu

机构 * Tongji University(同济大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出DeMaVLA模型,采用VLM骨干与动作专家结合流匹配生成连续动作,通过剪枝Transformer层提升效率,并利用大规模真实世界数据和人类反馈数据聚合训练,实现可变形物体折叠操作的多类别泛化。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09998 2026-06-17 cs.CR cs.AI 版本更新 57%

Like a Hammer, It Can Build, It Can Break: Large Language Model Uses, Perceptions, and Adoption in Cybersecurity Operations on Reddit

像锤子一样,它能建造,也能破坏:Reddit上网络安全运营中大语言模型的使用、认知与采纳

Souradip Nath, Chih-Yi Huang, Aditi Ganapathi, Kashyap Thimmaraju, Jaron Mink, Gail-Joon Ahn

机构 * Arizona State University(亚利桑那州立大学) Technische Universität Berlin(柏林技术大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 通过对Reddit网络安全论坛892篇帖子进行混合方法分析,研究安全从业者使用LLM工具的模式、认知和采纳情况,发现LLM主要用于低风险、生产力导向任务,企业级安全平台受关注,但可靠性、验证开销和安全问题限制了其自主性。

Comments This paper appears in the Proceedings of the Twenty-Second Symposium on Usable Privacy and Security (SOUPS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28251 2026-06-17 cs.CV cs.AI 版本更新 57%

DiffAttn: Diffusion-Based Drivers' Visual Attention Prediction with LLM-Enhanced Semantic Reasoning

DiffAttn: 基于扩散的驾驶员视觉注意力预测与LLM增强语义推理

Weimin Liu, Qingkun Li, Jiyuan Qiu, Wenjun Wang, Joshua H. Meng

机构 * School of vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) Beijing Key Laboratory of Human-Computer Interaction, Institute of Software, Chinese Academy of Sciences(北京人机交互重点实验室,中国科学院软件研究所) Remote Sensing and Earth Observation Laboratory, University of Copenhagen(远程感知与地球观测实验室,哥本哈根大学) California PATH, University of California, Berkeley(加州PATH,加州大学伯克利分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出DiffAttn框架,将驾驶员视觉注意力预测建模为条件扩散去噪过程,结合Swin Transformer、特征融合金字塔和LLM增强语义推理,在四个数据集上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22184 2026-06-17 cs.GT cs.LG cs.MA 版本更新 57%

Tacit Coordination of Large Language Models

大型语言模型的隐性协调

Ido Aharon, Emanuele La Malfa, Michael Wooldridge, Sarit Kraus

机构 * Department of Computer Science, Bar-Ilan University(巴伊兰大学计算机科学系) Department of Computer Science, University of Oxford(牛津大学计算机科学系) Institute for Decentralized AI (IDAI)(去中心化人工智能研究所)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 研究大型语言模型在多智能体无通信协调中的焦点涌现能力,通过博弈和搜救任务评估,发现模型在多数场景匹配或超越人类,但在数值常识和文化显著性任务中失败,并提出无学习策略改善协调。

Comments Code: https://github.com/EmanueleLM/focal-points

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19099 2026-06-17 cs.CV cs.AI 版本更新 57%

m2sv: A Scalable Benchmark for Map-to-Street-View Spatial Reasoning

m2sv: 地图到街景空间推理的可扩展基准

Yosub Shin, Michael Buriek, Igor Molybog

机构 * University of Hawai'i at M\=anoa, Honolulu, HI, USA

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出m2sv基准,通过匹配朝北俯视图与街景图像推断相机方向,评估VLM空间推理能力;最佳模型准确率65.2%,低于人类72.0%,揭示几何对齐与推理一致性的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16822 2026-06-16 physics.ed-ph cs.CY 新提交 57%

AI as a Partner in Learning about, Doing, and Engaging with Science: Vigilance as the Key to Productive Augmentation

AI作为学习、实践和参与科学的伙伴:警惕性是高效增强的关键

Marcus Kubsch

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

AI总结 本文探讨AI作为科学学习、实践和参与伙伴的三种形式,提出人类对AI输出的认知警惕性是决定增强效果的关键约束,并详细阐述了警惕性的组成、机制及测量方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16684 2026-06-16 cs.CL 新提交 57%

Progressive Knowledge-Guided Large Language Model Framework for Bearing Fault Diagnosis

渐进式知识引导的大型语言模型框架用于轴承故障诊断

Jinghan Wang, Gaoliang Peng, Yanjun Chen, Wei Zhang, Wentao Wu, Tianchen Liu

机构 * Harbin Institute of Technology, China(哈尔滨工业大学,中国) Eastern Institute of Technology, China(东方技术研究所,中国)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 提出渐进式物理引导多尺度振动信号处理框架,通过81维测量描述符、故障自适应分割和隐式知识编码,在四个数据集上实现98.49%诊断精度并降低12.6倍计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16322 2026-06-16 cs.CL 新提交 57%

PaperJury: Due-Process Review for Bounded LaTeX Revision

PaperJury: 有界LaTeX修订的正当程序审查

Yiran Wang, Ruixuan An, Biao Wu, Wenhao Wang

机构 * Vast Intelligence Lab(vast 智能实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 提出PaperJury系统,通过确定性编排与语义代理分离,实现LaTeX论文的对抗性审查、裁决和修订,确保有界安全编辑和终止结果。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16075 2026-06-16 cs.LG cs.CV 新提交 57%

AME: A Multi-Type Contributor Attribution Framework in Generative AI Markets

AME:生成式AI市场中的多类型贡献者归属框架

Yang Shi, Songwen Pei, Yang Gao, Bingxue Zhang

机构 * University of Shanghai for Science and Technology(上海理工大学) Fudan University(复旦大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 针对生成式AI中多阶段协作的价值分配问题,提出AME框架,整合异构数据贡献评估、数据权利映射和可信执行,实现与人类判断一致的低成本价值分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16003 2026-06-16 cs.AI 新提交 57%

SciText2Eq: Assessing LLMs for Explainable Equation Generation for Scientific Creativity

SciText2Eq: 评估大语言模型在科学创造力中的可解释方程生成

Yifan Mo, Xiao Fu, Yue Su, Qingyu Meng, Koen Hindriks, Qingzhi Liu, Jiahuan Pei

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Wageningen University & Research(瓦赫宁根大学及研究中心)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究大语言模型从科学文本生成数学方程的能力,构建AI论文数据集,提出可解释方程生成流程,并设计结合自动指标、LLM评估和人工判断的评估协议,发现LLM在语义准确性上表现不足。

Comments Accepted by findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15890 2026-06-16 cs.AI 新提交 57%

UrbanWell: Benchmarking Multimodal Large Language Models for Spatio-Temporal Urban Wellbeing Analytics

UrbanWell: 面向时空城市福祉分析的多模态大语言模型基准测试

Yanxin Xi, Xiang Su, Jie Feng, Yu Liu, Sasu Tarkoma, Pan Hui

机构 * University of Helsinki(赫尔辛基大学) Zhongguancun Academy(中关村学院) University of Oxford(牛津大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出UrbanWell基准,通过卫星和街景图像联合建模,系统评估多模态大语言模型在环境、空间可达性、城市形态、活力和主观感知等5类城市福祉指标上的时空推理能力,并定义时序预测和趋势分类任务。

Comments accepted by KDD Datasets and Benchmarks Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15508 2026-06-16 cs.AI 新提交 57%

ToolMenuBench: Benchmarking Tool-Menu Filtering Strategies for Reliable and Efficient LLM Agents

ToolMenuBench: 用于可靠高效LLM智能体的工具菜单过滤策略基准测试

Rahul Suresh Babu, Laxmipriya Ganesh Iyer

机构 * Independent Researcher(独立研究者) United States of America(美国)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出ToolMenuBench基准,评估多步LLM智能体中工具菜单构建策略,发现因果最小工具过滤在任务成功率、令牌使用和风险暴露间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏