arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10472 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10472 篇

2511.23119 2026-08-19 cs.CL 版本更新 57%

Dripper: Token-Efficient Main HTML Extraction with a Lightweight LM

Dripper:一种轻量级的HTML主内容提取框架

Mengjie Liu, Jiahui Peng, Wenchang Ning, Pei Chu, Jiantao Qiu, Ren Ma, He Zhu, Rui Min, Lindong Lu, Linfeng Hou, Kaiwen Liu, Yuan Qu, Zhenxiang Li, Chao Xu, Zhongying Tu, Wentao Zhang, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Dripper通过轻量级框架实现高效HTML主内容提取,兼顾效率与准确性,开源模型促进高质量数据集构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02876 2026-08-19 cs.CL 版本更新 57%

Eval4Sim: An Evaluation Framework for Persona Simulation

Eval4Sim: 一种用于人设模拟的评估框架

Eliseo Bao, Anxo Perez, Javier Parapar, Xi Wang

机构 * University of Sheffield(谢菲尔德大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Eval4Sim提出了一种评估框架,用于衡量模拟对话与人类对话模式的契合度,通过三个互补维度评估人设的忠实性、一致性和自然性。

Comments Accepted at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16852 2026-08-18 cs.AI 新提交 57%

What Do Compliance Detectors Read? An Audit of Activation Probes and Guard Models

合规检测器读取什么?激活探针与防护模型的审计

Saisab Sadhu, Aadit Sengupta, Vinay Kumar Sankarapu, Pratinav Seth

机构 * Lexsi Labs(雷克西实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究通过审计合规检测器发现其存在规则盲视问题,引入无需训练的ICS检测器,发布相关基准以推动规则盲视的进一步研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15930 2026-08-18 cs.AI cs.CV 新提交 57%

UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations

UI-Mate:利用上下文内演示推进开放权重基础图形用户界面智能体

Zihan Ding, Longxu Dou, Qi Gao, Xiangwu Guo, Shengchao Hu, Zilong Huang, Zihang Jiang, Lei Ke, Mengcheng Lan, Weixian Lei, Hanxuan Li, Honglin Li, Xiyun Li, Zaitang Li, Leowei Liang, Xin Luo, Haozhe Ma, Jiayi Mao, Zhoujie Pan, Can Qin, Tianyuan Qu, Weiqi Wang, Wenkai Wang, Yonglin Wang, Yuxin Wang, Chenxu Wu, Yingchen Yu, Chenyu Zhang, Yuhao Zheng

机构 * Tencent Hy Frontier Team(腾讯 Hy 前沿团队)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 UI-Mate是集成环境基训练栈与上下文内演示学习的GUI智能体,在多计算机使用基准上创开放权重SOTA,提升了长周期办公任务的执行可靠性

Comments UI-Mate Technical Report. Project page: https://ui-mate.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15592 2026-08-18 cs.AI 新提交 57%

When Entropy Is Not Enough: Reclaiming Lost Semantics in LLM Output Length Prediction

当熵不够用时:在大语言模型输出长度预测中恢复丢失的语义

Feiyang Ren, Shengtao Wen, Lingbing Guo, Yu Tian, Yuanning Cui, Xiang Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对 LLM 服务中序列填充导致的算力浪费问题,提出 ESTP 框架结合熵与语义重要性预测输出长度,在 ForeLen 基准及端到端测试中均表现更优,可提升吞吐量并降低填充率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15090 2026-08-18 cs.CV cs.LG 新提交 57%

Distribution-free false-alarm calibration and chance-corrected spatial evaluation for industrial anomaly detection

面向工业异常检测的无分布虚警校准与经机会校正的空间评估

Jie Deng

机构 * Tongji University(同济大学)

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 该研究针对工业异常检测现有指标的缺陷,提出结合无分布上限容差阈值与配对减交叉空间检验的方法,在多数据集上验证了其有效性,支持同时报告工作点性能与经机会校正的空间证据。

Comments 15 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14863 2026-08-18 cs.SE cs.AI cs.DC 新提交 57%

Evaluating Agentic Code Repair Capabilities in Distributed Systems

评估分布式系统中智能体的代码修复能力

Yibo Yan, Huijuan Wang, Junzhou He, Yizhuo Liang, Shaoyu Wang, Huanchen Sun, Seo Jin Park

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究推出分布式系统代码修复基准DDBench,评估10个LLM的代码修复能力,发现调试上下文可提升准确率且对强弱模型影响不同,分布式调试能凸显单进程基准未体现的推理能力。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11891 2026-08-18 cs.CY cs.AI cs.HC 版本更新 57%

Benchmark-Based Comparative Assessment of Publicly Benchmarked Indian Foundation Models: A Capability and Evaluation-Maturity Framework

基于基准的公开基准印度基础模型对比评估:能力与评估成熟度框架

Avinash Agarwal, Vridhi Jain

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出能力与评估成熟度框架,对公开基准的印度基础模型与全球同类模型对比评估,发现其在传统基准表现尚可但参与新评估不足,还提出基准成熟度指数,指出能力差距或源于评估生态问题。

Comments 19 pages, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21037 2026-08-18 cs.CR cs.CL 版本更新 57%

Honeyquest for LLMs: Rethinking Cyber Deception for AI Attackers

Honeyquest for LLMs: 重新思考针对AI攻击者的网络欺骗

Kerri Prinos, Lilianne Brush, Cameron Denton

机构 * Horizon3.ai

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出自动评估框架,测试21个LLM(从8B到1T参数)对网络欺骗陷阱的反应,发现LLM比人类更容易上当,缺乏注意力转移效应,且存在认知-行动差距(73.4%识别陷阱但仍被利用),表明以人为中心的欺骗假设不适用于AI攻击者。

Comments 20 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08974 2026-08-18 cs.CV cs.AI 版本更新 57%

Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models

追踪真相:面向视频大语言模型的物体感知时空监控

Tri Cao, Khoi Le, Thong Nguyen, Cong-Duy Nguyen, Quynh Vo, Anh Tuan Luu, Chunyan Miao, See-Kiong Ng, Shuicheng Yan, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) VinUniversity(文大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出STEMO-Bench基准测试,通过分解查询验证时空监控能力,改进视频大语言模型的时空推理一致性。

Comments The authors are withdrawing this manuscript due to errors identified in the experimental evaluation and result aggregation, which affect several reported quantitative results and some conclusions. These issues require substantial re-evaluation of the experiments and analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06850 2026-08-18 cs.CR cs.AI 57%

The Dark Side of LLMs: Agent-based Attack Vectors for System-level Compromise

大语言模型的阴暗面:基于代理的攻击向量用于系统级入侵

Matteo Lupinacci, Francesco Aurelio Pironti, Francesco Blefari, Francesco Romeo, Luigi Arena, Angelo Furfaro

机构 * DIMES , University of Calabria , P. Bucci , 87036 , Rende (CS) , Italy(DIMES,卡利博里大学,P. Bucci,87036,Rende(CS),意大利) IMT School for Advanced Studies , Piazza San Francesco , 55100 , Lucca , Italy(IMT高级研究学院,圣弗朗西斯科广场,55100,卢卡,意大利)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了大语言模型作为推理引擎在自主代理中的安全漏洞,揭示其被用作攻击向量实现计算机入侵的机制,指出94.4%的模型易受直接提示注入攻击,83.3%易受RAG后门攻击,且多代理系统中100%的模型可通过代理信任利用攻击被入侵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11374 2026-08-18 cs.CL cs.CY 57%

Mining Legal Arguments to Study Judicial Formalism

从法律论证中研究司法形式主义

Tomáš Koref, Lena Held, Mahammad Namazov, Harun Kumru, Yassine Thlija, Ivan Habernal

机构 * Center for Critical Computational Studies(批判性计算研究所以) Goethe University Frankfurt(法兰克福歌德大学) Department for Legal Theory and Legal Doctrines, Faculty of Law(法学院法律理论与法律学说系) Charles University(查尔斯大学) Technical University of Darmstadt(达姆施塔特技术大学) Research Center Trustworthy Data Science and Security of the University Alliance Ruhr & Ruhr University Bochum(鲁尔大学博德姆大学可信数据科学与安全研究所以)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过自动化方法分析捷克最高法院判决中的法律论证,建立MADON数据集,验证了东欧司法形式主义的主张,提升了司法决策分类的准确性和可解释性。

Comments pre-print under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17216 2026-08-18 cs.AI 版本更新 57%

ML-AutoResearch: Training Machine Learning Research Agents with Automatically Generated Environments

通过合成任务扩展实现AI科学家

Ziyang Cai, Amir Saeidi, Harkirat Behl

机构 * Princeton University(普林斯顿大学) Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种合成环境生成管道,用于训练能从实践中学习的机器学习代理。通过真实数据集验证和自调试循环,生成高质量合成任务,提升Qwen3-4B和Qwen3-8B在MLGym上的性能,AUP指标分别提升9%和12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14270 2026-08-17 cs.AI 新提交 57%

TimeSage-EV: A Live Benchmark for Agentic Time Series Analysis in Evolving Environments

TimeSage-EV:面向动态环境下智能体时间序列分析的实时基准测试集

Qingren Yao, Yaxuan Kong, Yuqi Nie, Yichen Li, Stefan Zohren, Anna Vettoruzzo, Qingsong Wen, Ming Jin, Joaquin Vanschoren

机构 * Eindhoven University of Technology(埃因霍温理工大学) University of Oxford(牛津大学) VulpiVox Intelligence(VulpiVox智能公司) Squirrel Ai Learning(Squirrel AI学习公司) Griffith University(格里菲斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对现有时间序列基准未评估时间有效性等问题,推出动态环境智能体时间序列分析基准TimeSage-EV,含多领域真实场景,实验揭示模型性能差距及失败模式,提供研究资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14179 2026-08-17 cs.AI 新提交 57%

Can Language Models Understand mmWave Data? Benchmarking Large Language Models for mmWave Radar-Based Human Understanding

语言模型能否理解毫米波数据?基于毫米波雷达的人类理解任务对大语言模型进行基准测试

Jeongwan Shin, Jaehyeon Kim, Donguk Ko, Jaeho Choi

机构 * DGIST(大邱庆北科学技术院) KAIST(韩国科学技术院) InnoCORE LLM

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对毫米波数据与大语言模型融合的研究空白,构建首个毫米波人类感知基准mmWave-QA,评估LLMs在该任务上的零样本推理潜力与视觉退化下的鲁棒性,为相关研究奠定基础。

Comments Accepted to CVPR 2026 Findings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14130 2026-08-17 cs.MM cs.AI cs.CV cs.HC 新提交 57%

AlignFace: Human-Aligned Face Similarity Metric with Interpretable Concept Relations

AlignFace:具有可解释概念关系的人类对齐人脸相似度度量

Ying Huang, Wencan Zhang, Brian Y. Lim

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对人脸生成模型评估中现有度量未实现认知对齐的问题,提出AlignFace度量,结合VLM、CA、CBM、GAM等技术,利用FACETS数据集,提升了与人类亚群感知的对齐度。

Comments 10 pages, 10 figures, 2 tables, ACM MM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14094 2026-08-17 cs.CR cs.AI 新提交 57%

P2Skill: Privacy Preserving Skill Distillation for Cloud-Local LLM Inference Systems

P2Skill:面向云-本地大语言模型推理系统的隐私保护技能蒸馏

Myunghoon Ryu, Geunpyo Park, Sungjoon Lee, XinYu Piao, Jong-Kook Kim

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对云-本地LLM推理系统的P2Skill,通过技能提示实现本地SLM自主处理PII相关操作,无需隐私微调,在四领域基准上的隐私保护推理质量较基线提升1.69倍、3.66倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14075 2026-08-17 cs.AI cs.CV cs.DL 新提交 57%

A Pathway to General-Purpose Scientific AI: Multimodal Comprehension of Scientific Images

通用科学人工智能的实现路径:科学图像的多模态理解

Jennifer D'Souza, Fahad Ahmed, Cecilia Andrea Bustamante Andrade, Lina Frolova, Poorani Gnanasambandan, Dilshad Hussain, Muhammad Uzair Khan, Nkembeng Kevin Nkengfoa, Paul Praveen J., Fabio Priante, Sjoerd Franciscus van der Werf, Thomas Frederik Jan van Roeden

机构 * TIB Leibniz Information Centre for Science and Technology(莱布尼茨科学与技术信息中心(TIB)) Eindhoven University of Technology(埃因霍温理工大学) Freie Universität Berlin(柏林自由大学) International Center for Chemical and Biological Sciences, University of Karachi(卡拉奇大学国际化学与生物科学中心) National University of Sciences and Technology(国家科技大学) University of Warwick(华威大学) PSG College of Technology(PSG理工学院) Aalto University(阿尔托大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出以科学图像多模态理解构建通用科学AI的路径,依托ALD/E-ImageMiner基准与2026年ICDAR竞赛,明确相关任务能力检验维度及长期研究方向,推动可机器执行的科学视觉知识与可验证多模态科学AI发展。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13883 2026-08-17 cs.AI 新提交 57%

MemoryLake on MemoryArena: A Matched Study of Agent Memory Backends

基于MemoryArena的MemoryLake研究:智能体记忆后端的匹配对比

Chaoqun Zhan, Qiang Zhou, Guannan Li, Zhenqiang Huang, Qianjin Wang

机构 * MemoryLake Team(MemoryLake团队)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 该研究在MemoryArena的五个任务领域中,对比MemoryLake等三种智能体记忆后端,发现MemoryLake在数学等三个领域成功率最高,整体平均成功率领先,且性能与工作负载相关。

Comments 16 pages, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12343 2026-08-17 cs.CL 版本更新 57%

Lost in Historical Time? A Polish History Matura Benchmark for Large Language Models

大语言模型通过了历史考试却遗漏了《历史》:波兰高中毕业考试Matura基准测试

Adrian Trzoss, Kacper Dudzic, Wiktor Werner, Marcin Moskalewicz

机构 * Adam Mickiewicz University(亚当·密茨凯维奇大学) IDEAS Research Institute(IDEAS研究院) AMU Center for Artificial Intelligence(亚当·密茨凯维奇大学人工智能中心) Poznań University of Medical Sciences(波兹南医科大学) Maria Curie-Skłodowska University(玛丽·居里-斯克洛多夫斯卡大学) WSB Merito University(WSB梅里托大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对波兰Matura历史考试评估8款LLM,发现其总分远超人类考生,但存在波兰历史得分惩罚、源内容混淆等缺陷,推出了首个基于波兰国家课程的LLM历史基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14616 2026-08-17 cs.AI cs.CV 版本更新 57%

SportD: How do VLMs physically strategize?

SportD:视觉语言模型能进行物理策略制定吗?

Jasin Cekinmez, Addison J. Wu, Haotian Xia, Kyumin Andrew Shim, Anay Putty, Jinglin Xiao, Zhuohan Liu, Leo Liu, Weining Shen

机构 * Princeton University(普林斯顿大学) Rice University(莱斯大学) UC Irvine(加州大学欧文分校) POSTECH(浦项科技大学) NYU Shanghai(纽约大学上海分校) UC Santa Barbara(加州大学圣塔芭芭拉分校) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究视觉语言模型在足球场景中能否进行物理策略制定,引入SportD基准,通过控球价值模型评估模型决策,发现模型表现低于职业球员,有偏好低方差低回报动作等问题,为衡量模型物理策略推理提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01793 2026-08-17 cs.CL 版本更新 57%

Research-Oriented Human-Centric Evaluation for Foundation Models

面向研究的基础模型以人为中心的评估

Yijin Guo, Kaiyuan Ji, Xiaorong Zhu, Junying Wang, Farong Wen, Chunyi Li, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) East China Normal University(华东师范大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对现有基础模型评估忽视用户主观体验的问题,提出Human-Centric Evaluation框架,通过604次人类评估会话及LLM-as-a-judge实验,证实人类主观评估不可替代,为基础模型研究提供新评估方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13210 2026-08-14 cs.CV cs.AI cs.MM 新提交 57%

NARU: A Benchmark for NARrative Evolution and Cultural Nuance Understanding in Japanese Extreme Long Video

NARU:用于理解日语超长视频中叙事演变与文化细微差别的基准

Yuheng Huang, Jianlang Chen, Jiayang Song, Hua Qi, Aza Kai, Vincent Markert, Edison Marrese-Taylor, Jianjun Zhao, Lei Ma

机构 * The University of Tokyo(东京大学) Kyushu University(九州大学) Macau University of Science and Technology(澳门科技大学) Infinimind Japan Inc.(Infinimind日本公司) University of Alberta(阿尔伯塔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究推出NARU基准,涵盖155个146.8小时日语视频的1481个问题,评估模型在长程叙事整合与文化推理上的局限,为MLLM开发提供测试平台。

Comments Yuheng Huang and Jianlang Chen contributed equally to this work. More details available on the project's website https://ma-labo.github.io/naru/ and https://infinimind.io/en/company/news/2026/narubench-release

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13113 2026-08-14 cs.CV cs.AI 新提交 57%

EgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal Memory

EgoMonth:面向长期时空记忆的月级自我中心视频基准

Weitao Chen, Hu Jiaxin, Xie Tianyidan, Yang Li, Yuyi Qian, Banghao Xu, Ziheng Tang, Shenyi Wang, Mingyue Yu, Duo Li, Jiacheng Shi, Gao Wang, Zhan Xu, Zhicheng Qiu, Xuanfu Li, Jian Yang, Lanjun Wang, Zili Yi

机构 * Nanjing University(南京大学) Huawei Technologies Co., Ltd.(华为技术有限公司) Tianjin University(天津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究人员推出首个月级自我中心视频基准EgoMonth,评估发现当前主流MLLMs的长期时空记忆能力远逊于人类,仅为有损总结器而非忠实记忆器。

Comments 21 pages, 4 figures, 6 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12875 2026-08-14 cs.CL 新提交 57%

The Embedder's Dilemma: LLMs Are Better, but at What Cost?

嵌入器的困境:大型语言模型(LLM)性能更优,但代价是什么?

Adnan El Assadi, Niklas Muennighoff, Jinhyuk Lee

机构 * Harvard University(哈佛大学) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究对比LLM与嵌入模型在37项任务的性能与成本,发现二者性能接近但LLM成本高、速度慢,建议嵌入模型用于通用任务,LLM用于推理密集型检索。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09164 2026-08-14 cs.AI 版本更新 57%

CIDER: A Dataset of Contextual Disclosure Boundaries for Privacy Preference Alignment

CIDER:用于隐私偏好对齐的上下文披露边界数据集

Bingcan Guo, Eryue Xu, Jijie Zhou, Zhiping Zhang, Tianshi Li

机构 * University of Washington(华盛顿大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Northeastern University(东北大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文推出包含169名用户标注的CIDER数据集,用于评估LLM隐私偏好对齐,发现上下文个性化可提升预测准确率,GPT-5.4和Claude Sonnet 4.6表现更优。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19799 2026-08-14 cs.AI hep-lat 版本更新 57%

PhysMaster: Building an Autonomous AI Physicist for Theoretical and Computational Physics Research

PhysMaster:构建一个自主的AI物理学家用于理论和计算物理学研究

Tingjia Miao, Wenkai Jin, Jinxin Tan, Muhua Zhang, Xianghe Pang, Zexi Liu, Yuwen Du, Tian Jin, Tu Guo, Zhengliang Zhang, Jingkun Liu, Yuelin Hu, Jiejun Zhang, Yunjie Huang, Yuhan Wang, Wenbo Li, Yinuo Gao, Shuo Chen, Rui Ye, Yuzhi Zhang, Linfeng Zhang, Kun Chen, Wei Wang, Weinan E, Siheng Chen

机构 * School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) School of Physics and Astronomy(物理天文学院) State Key Laboratory of Dark Matter Physics(暗物质物理国家重点实验室) Tsung-Dao Lee Institute(李政道研究所) Zhiyuan College(智源学院) Institute of Theoretical Physics(理论物理研究所) Chinese Academy of Sciences(中国科学院) DP Technology(DP技术)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 PhysMaster通过结合抽象推理与数值计算,利用LANDAU数据宇宙提升决策可靠性,实现理论与计算物理学研究的自动化与自主发现。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00048 2026-08-14 cs.CY cs.AI 版本更新 57%

MOSAIC: Unveiling the Moral, Social and Individual Dimensions of Large Language Models

MOSAIC:揭示大型语言模型的道德、社会和个体维度

Erica Coppolillo, Emilio Ferrara

机构 * University of Southern California(南加州大学) University of Calabria and ICAR-CNR(卡利亚里大学和ICAR-CNR) Thomas Lord Department of Computer Science(托马斯·劳德计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MOSAIC首次提出评估大型语言模型道德、社会和个体维度的综合基准测试,通过九个问卷和四个游戏全面考察伦理推理能力,揭示MFT的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11729 2026-08-14 cs.CV cs.LG 版本更新 57%

SpaRRTa: A Synthetic Benchmark for Evaluating Spatial Intelligence in Visual Foundation Models

SpaRRTa:用于评估视觉基础模型空间智能的合成基准

Turhan Can Kargin, Wojciech Jasiński, Adam Pardyl, Bartosz Zieliński, Marcin Przewięźlikowski

机构 * AGH University of Krakow(克拉科夫AGH大学) IDEAS NCBR

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 SpaRRTa通过评估视觉基础模型的空间推理能力,揭示其在不同空间任务中的表现差异,旨在推动更高效的空间意识视觉模型发展。

Comments Project page is available at https://sparrta.gmum.net/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17449 2026-08-14 cs.CL 版本更新 57%

SLAyiNG: A Diverse and Community-validated Dataset of Queer Slang

SLAyiNG:一个经社群验证的多元酷儿俚语数据集

Leonor Veloso, Lea Hirlimann, Lucija Mihić Zidar, Philipp Wicke, Valentin Hofmann, Hinrich Schütze

机构 * Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对酷儿语言处理偏差问题,本文提出首个经社群验证的英语酷儿俚语数据集Slaying,揭示语言模型对酷儿社群无表征偏差但存在语言偏差等发现,可提升酷儿用户NLP体验。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏