arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2512.14312 2025-12-17 cs.CV cs.AI 57%

From YOLO to VLMs: Advancing Zero-Shot and Few-Shot Detection of Wastewater Treatment Plants Using Satellite Imagery in MENA Region

从YOLO到VLMs:利用卫星图像在中东和北非地区推进零样本和少样本废水处理厂检测

Akila Premarathna, Kanishka Hewageegana, Garcia Andarcia Mariangel

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究利用VLMs替代YOLOv8,通过零样本和少样本方法高效识别中东和北非地区废水处理厂,提升遥感应用的可扩展性。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14233 2025-12-17 cs.SE cs.AI cs.CR 57%

PentestEval: Benchmarking LLM-based Penetration Testing with Modular and Stage-Level Design

PentestEval: 一种基于模块化和阶段级设计的LLM渗透测试基准测试

Ruozhao Yang, Mingfei Cheng, Gelei Deng, Tianwei Zhang, Junjie Wang, Xiaofei Xie

机构 * School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡国立管理大学) School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学) School of Cyber Security, Tianjin University(网络安全学院,天津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 PentestEval通过模块化和阶段级设计,评估LLM在渗透测试各阶段的性能,揭示其在自动化测试中的局限性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14141 2025-12-17 cs.CV cs.AI 57%

TorchTraceAP: A New Benchmark Dataset for Detecting Performance Anti-Patterns in Computer Vision Models

TorchTraceAP: 一种新的基准数据集,用于检测计算机视觉模型中的性能反模式

Hanning Chen, Keyu Man, Kevin Zhu, Chenguang Zhu, Haonan Li, Tongbo Luo, Xizhou Feng, Wei Sun, Sreen Tallam, Mohsen Imani, Partha Kanuparthy

机构 * University of California, Irvine(加州大学尔湾分校) Meta University of California, Riverside(加州大学河滨分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 TorchTraceAP提出了一种新的基准数据集和迭代方法,用于提升ML模型检测计算机视觉模型轨迹中反模式的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14014 2025-12-17 cs.AI 57%

MobileWorldBench: Towards Semantic World Modeling For Mobile Agents

MobileWorldBench: 向移动智能体的语义世界建模迈进

Shufan Li, Konstantinos Kallidromitis, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Aditya Grover

机构 * UCLA(加州大学洛杉矶分校) Panasonic AI Research(松下人工智能研究) Salesforce AI Research(Salesforce人工智能研究)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 MobileWorldBench通过语义世界模型提升移动智能体任务成功率

Comments 21 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07961 2025-12-17 quant-ph cs.DS cs.LG stat.ML 57%

QCircuitBench: A Large-Scale Dataset for Benchmarking Quantum Algorithm Design

QCircuitBench:用于量子算法设计的大型数据集

Rui Yang, Ziruo Wang, Yuntian Gu, Tianyi Chen, Yitao Liang, Tongyang Li

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Center on Frontiers of Computing Studies, Peking University(北京大学计算前沿研究中心) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Anderson School of Management, University of California, Los Angeles(美国加州大学洛杉矶分校安德森管理学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 QCircuitBench是一个用于评估AI在量子算法设计中能力的大型数据集,包含多种任务和算法,揭示了大语言模型在此领域的局限性。

Comments 45 pages, 17 figures, 15 tables, GitHub repository: https://github.com/EstelYang/QCircuitBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12424 2025-12-16 cs.CV cs.LG 57%

ViInfographicVQA: A Benchmark for Single and Multi-image Visual Question Answering on Vietnamese Infographics

ViInfographicVQA:单图和多图越南信息图视觉问答基准测试

Tue-Thu Van-Dinh, Hoang-Duy Tran, Truong-Binh Duong, Mai-Hanh Pham, Binh-Nam Le-Nguyen, Quoc-Thai Nguyen

机构 * Neu.edu.vn

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 ViInfographicVQA是首个针对越南信息图VQA的基准测试,通过单图和多图任务评估模型在复杂信息图中的视觉问答能力。

Comments 10 pages, 4 figures, Accepted to AI4Research @ AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12405 2025-12-16 cs.LG 57%

Can Graphs Improve Tabular Foundation Models?

图能否提升表格基础模型?

Franck Le, Keith Grueneberg, Erich Nahum, Vadim Sheinin

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 BOLERO通过引入轻量图先验提升预训练表格Transformer的性能,在分类和回归任务中均取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08808 2025-12-16 cs.LG 57%

TinyGraphEstimator: Adapting Lightweight Language Models for Graph Structure Inference

TinyGraphEstimator: 为图结构推断适应轻量级语言模型

Michal Podstawski

机构 * NASK National Research Institute(波兰国家研究 institute)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出TinyGraphEstimator数据集,评估轻量级语言模型在图结构推断中的能力,通过LoRA技术实现参数调优,证明小型模型在图推理任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04457 2025-12-16 cs.CL 57%

Do MLLMs Really Understand the Charts?

多模态大语言模型真的能理解图表吗?

Xiao Zhang, Dongyuan Li, Liuyu Xiang, Yao Zhang, Cheng Zhong, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) AAITC, CTO Organization, Lenovo(AAITC、CTO组织、联想) Lenovo(联想)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出 ChartVR-3B/7B 模型,通过 VR-RFT 策略提升图表视觉推理能力,并在 ChartVRBench 上取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12461 2025-12-16 cs.CL 57%

Is GPT-OSS Good? A Comprehensive Evaluation of OpenAI's Latest Open Source Models

GPT-OSS好吗?对OpenAI最新开源模型的综合评估

Ziqian Bi, Keyu Chen, Chiung-Yi Tseng, Danyang Zhang, Tianyang Wang, Hongying Luo, Lu Chen, Junming Huang, Jibin Guan, Junfeng Hao, Xinyuan Song, Junhao Song

机构 * AI Agent Lab, Vokram Group(AI代理实验室,Vokram集团) Purdue University(普渡大学) Georgia Institute of Technology(佐治亚理工学院) University of Minnesota(明尼苏达大学) Emory University(埃默里大学) Imperial College London(伦敦帝国学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 GPT-OSS在代码生成方面表现优异,但在多语言任务上存在不足,研究发现稀疏架构扩展未必能带来性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17234 2025-12-16 cs.CL 57%

CLARIFID: Improving Radiology Report Generation by Reinforcing Clinically Accurate Impressions and Enforcing Detailed Findings

CLARIFID:通过强化临床准确印象和强制详细发现来改进放射报告生成

Kyeongkyu Lee, Seonghwan Yoon, Hongki Lim

机构 * Department of Electrical and Computer Engineering(电子与计算机工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 CLARIFID通过强化临床准确印象和强制详细发现,提升放射报告生成的临床效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13405 2025-12-16 cs.CL 57%

RealHiTBench: A Comprehensive Realistic Hierarchical Table Benchmark for Evaluating LLM-Based Table Analysis

RealHiTBench: 一个全面的现实感分层表格基准,用于评估基于LLM的表格分析

Pengzuo Wu, Yuhang Yang, Guangcheng Zhu, Chao Ye, Hong Gu, Xu Lu, Ruixuan Xiao, Bowen Bao, Yijing He, Liangyu Zha, Wentao Ye, Junbo Zhao, Haobo Wang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) Institute of Computing Innovation, Zhejiang University(浙江大学计算机创新研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 RealHiTBench是一个用于评估基于LLM的表格分析能力的综合现实感分层表格基准,通过多种输入格式和复杂结构的表格测试,验证了改进LLMs对表格层次结构感知的重要性。

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12117 2025-12-16 cs.SE cs.LG 57%

Citation-Grounded Code Comprehension: Preventing LLM Hallucination Through Hybrid Retrieval and Graph-Augmented Context

基于引用的代码理解:通过混合检索和图增强上下文防止LLM幻觉

Jahidul Arafat

机构 * Department of Computer Science and Software Engineering, Auburn University, Alabama, USA(计算机科学与软件工程系,阿伯丁大学,阿拉巴马州,美国)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出混合检索与图增强上下文方法,通过系统评估实现92%引用准确率,有效防止LLM幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12059 2025-12-16 cs.AI 57%

The Forecast Critic: Leveraging Large Language Models for Poor Forecast Identification

预测批评者:利用大语言模型进行差预测识别

Luke Bhan, Hanyu Zhang, Andrew Gordon Wilson, Michael W. Mahoney, Chuck Arvin

机构 * Amazon(亚马逊)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 利用大语言模型进行预测监控,通过识别不合理预测提升预测质量。

Comments Presented at AAAI 2026 AI4TS workshop and AABA4ET workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11997 2025-12-16 cs.AI 57%

Log Anomaly Detection with Large Language Models via Knowledge-Enriched Fusion

通过知识增强融合进行大规模语言模型的日志异常检测

Anfeng Peng, Ajesh Koyatan Chathoth, Stephen Lee

机构 * University of Pittsburgh(匹兹堡大学) Eaton Corporation(埃顿公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 EnrichLog通过知识增强融合技术,提升日志异常检测的准确性和可解释性,适用于实际系统部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11871 2025-12-16 cs.CV cs.AI 57%

Automated Plant Disease and Pest Detection System Using Hybrid Lightweight CNN-MobileViT Models for Diagnosis of Indigenous Crops

基于混合轻量CNN-MobileViT模型的自动化植物病害和害虫检测系统用于本地作物诊断

Tekleab G. Gebremedhin, Hailom S. Asegede, Bruh W. Tesheme, Tadesse B. Gebremichael, Kalayu G. Redae

机构 * Department of Computer Science \& Engineering Department of Information Technology Mekelle University - Mekelle Institute of Technology, Ethiopia Email

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出基于混合轻量CNN-MobileViT模型的自动化植物病害检测系统,通过本地作物数据集验证了模型在边缘环境中的高效诊断能力。

Comments A preliminary version of this work was presented at the International Conference on Postwar Technology for Recovery and Sustainable Development (Feb. 2025). This manuscript substantially extends that work with expanded experiments and on-device deployment analysis. Code and dataset are publicly available at: https://github.com/Tekleab15/Automated_plant_disease_and_pest_detection_system

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11323 2025-12-15 cs.AI 57%

CAPTURE: A Benchmark and Evaluation for LVLMs in CAPTCHA Resolving

CAPTURE:一个用于LVLM在CAPTCHA解决中的基准和评估

Jianyi Zhang, Ziyin Zhou, Xu Ji, Shizhao Liu, Zhangchi Zhao

机构 * Beijing Electric Science and Technology Institute(北京电子科技研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CAPTURE是一个专为LVLM设计的CAPTCHA基准,涵盖4种主要类型和25种子类型,旨在全面评估LVLM在解决CAPTCHA任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11315 2025-12-15 cs.LG 57%

Benchmarking the Generality of Vision-Language-Action Models

对视觉-语言-动作模型通用性的基准测试

Pranav Guruprasad, Sudipta Chowdhury, Harsh Sikka, Mridul Sharma, Helen Lu, Sean Rivera, Aryan Khurana, Hangliang Ren, Yangyue Wang

机构 * Manifold Research Metarch AI Georgia Tech(佐治亚理工学院) Tufts University(塔夫茨大学) Northeastern University(东北大学) Birla Institute of Technology and Science, Pilani(比拉理工学院,帕利尼) Institute for Research and Innovation in Intelligent Systems (IRIIS)(智能系统研究与创新研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出MultiNet v1.0基准,评估视觉-语言-动作模型在六个基础能力领域的跨领域泛化能力,发现现有模型在未见领域和模态转移时表现显著退化。

Comments 23 pages, 7 figures, and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10206 2025-12-15 cs.AI 57%

CP-Env: Evaluating Large Language Models on Clinical Pathways in a Controllable Hospital Environment

CP-Env:在可控医院环境中评估大型语言模型在临床路径中的表现

Yakun Zhu, Zhongzhen Huang, Qianhan Feng, Linjie Mu, Yannian Gu, Shaoting Zhang, Qi Dou, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学) SenseTime Research(商汤科技研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CP-Env通过可控医院环境评估大型语言模型在复杂临床路径中的表现,揭示其在决策和伦理方面的挑战,并推动医疗AI的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13115 2025-12-15 eess.IV cs.AI cs.CV 57%

Multimodal Learning for Scalable Representation of High-Dimensional Medical Data

多模态学习用于高维医学数据的可扩展表示

Areej Alsaafin, Abubakr Shafique, Saghir Alfasly, Krishna R. Kalari, H. R. Tizhoosh

机构 * Kimia Lab, Dept. of Artificial Intelligence & Informatics, Mayo Clinic, Rochester, MN, USA(Kimia实验室,人工智能与信息学系,梅奥诊所,罗切斯特,MN,美国) Division of Computational Biology, Dept. of Quantitative Health Sciences, Mayo Clinic, Rochester, MN, USA(计算生物学部门,定量健康科学系,梅奥诊所,罗切斯特,MN,美国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MarbliX通过多模态学习实现高维医学数据的可扩展表示,提升癌症诊断的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10624 2025-12-12 cs.CL 57%

AgriGPT-Omni: A Unified Speech-Vision-Text Framework for Multilingual Agricultural Intelligence

AgriGPT-Omni: 一种统一的语音-视觉-文本框架用于多语言农业智能

Bo Yang, Lanfei Feng, Yunkui Chen, Yu Zhang, Jianyu Zhang, Xiao Xu, Nueraili Aierken, Shijian Li

机构 * Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 AgriGPT-Omni提出了一种统一的语音-视觉-文本框架,通过数据合成、多阶段训练和三模态基准,提升多语言农业智能的性能和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10384 2025-12-12 cs.CV cs.AI 57%

Towards Fine-Grained Recognition with Large Visual Language Models: Benchmark and Optimization Strategies

基于大视觉语言模型的细粒度识别:基准测试与优化策略

Cong Pang, Hongtao Yu, Zixuan Chen, Lewei Lu, Xin Lou

机构 * ShanghaiTech University(上海科技大学) Southeast University(东南大学) SenseTime Research(商汤科技研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出FROW基准测试和优化策略,通过马赛克数据和开放世界数据提升大视觉语言模型的细粒度识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08868 2025-12-12 cs.AI 57%

EcomBench: Towards Holistic Evaluation of Foundation Agents in E-commerce

EcomBench: 向电子商务基础智能体的全面评估迈进

Rui Min, Zile Qiao, Ze Xu, Jiawen Zhai, Wenyu Gao, Xuanzhong Chen, Haozhen Sun, Zhen Zhang, Xinyu Wang, Hong Zhou, Wenbiao Yin, Bo Zhang, Xuan Zhou, Ming Yan, Yong Jiang, Haicheng Liu, Liang Ding, Ling Zou, Yi R. Fung, Yalong Li, Pengjun Xie

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 EcomBench通过真实电子商务场景评估智能体的核心能力,提供动态测试环境以衡量其在实际决策中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05647 2025-12-12 cs.CL 57%

A Greek Government Decisions Dataset for Public-Sector Analysis and Insight

一个用于公共部门分析与洞察的希腊政府决策数据集

Giorgos Antoniou, Giorgos Filandrianos, Aggelos Vlachos, Giorgos Stamou, Lampros Kollimenos, Konstantinos Skianis, Michalis Vazirgiannis

机构 * National Technical University of Athens, Greece(希腊国家技术大学) University of Thessaly, Greece(希腊塞萨洛尼基大学) University of Ioannina, Greece(希腊伊奥安尼纳大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究提出了一种大规模公共部门语料库,用于分析和生成公共决策信息,支持高级信息检索和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22888 2025-12-12 cs.CL 57%

When Models Reason in Your Language: Controlling Thinking Language Comes at the Cost of Accuracy

当模型用你的语言思考:控制思考语言会以准确性为代价

Jirui Qi, Shan Chen, Zidi Xiong, Raquel Fernández, Danielle S. Bitterman, Arianna Bisazza

机构 * University of Groningen(格罗宁根大学) Harvard University(哈佛大学) Mass General Brigham(麻省总医院) Boston Children’s Hospital(波士顿儿童医院) University of Amsterdam(阿姆斯特丹大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究发现,强制模型用用户语言推理虽提高可读性但降低准确性,通过微调可缓解此矛盾,揭示当前大型推理模型在多语言推理上的局限性。

Comments Accepted at EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09841 2025-12-11 cs.CL cs.CV cs.MM 57%

ChronusOmni: Improving Time Awareness of Omni Large Language Models

ChronusOmni: 提升 Omni 大语言模型的时间感知能力

Yijing Chen, Yihan Wu, Kaisi Guan, Yuchen Ren, Yuyue Wang, Ruihua Song, Liyun Ru

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光荣人工智能学院) Baichuan Inc.(百川科技公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ChronusOmni 通过增强时间感知能力,提升音频视觉时间定位任务的性能,实现跨模态统一建模和细粒度推理。

Comments Code available at https://github.com/YJCX330/Chronus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08352 2025-12-11 cs.CV cs.AI 57%

Evaluating Small Vision-Language Models on Distance-Dependent Traffic Perception

评估小型视觉-语言模型在距离依赖性交通感知中的表现

Nikos Theodoridis, Tim Brophy, Reenu Mohandas, Ganesh Sistu, Fiachra Collins, Anthony Scanlan, Ciaran Eising

机构 * University of Limerick(利默里克大学) Data Driven Computer Engineering Research Centre(数据驱动计算机工程研究中心) Lero, The Irish Software Research Centre(Lero爱尔兰软件研究中心) Valeo Vision Systems(瓦莱欧视觉系统)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文评估了小型视觉-语言模型在距离依赖性交通感知任务中的表现,发现其在感知能力上显著弱于人类。

Comments Published in IEEE Open Journal of Vehicular Technology. Final version available at: https://ieeexplore.ieee.org/document/11230063

Journal ref IEEE Open Journal of Vehicular Technology, vol. 7, pp. 54-72, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24403 2025-12-11 cs.CL cs.DB 57%

Agentar-Scale-SQL: Advancing Text-to-SQL through Orchestrated Test-Time Scaling

Agentar-Scale-SQL: 通过协调的测试时扩展推进文本到SQL

Pengfei Wang, Baolin Sun, Xuemei Dong, Yaxun Dai, Hongwei Yuan, Mengdie Chu, Yingqi Gao, Xiang Qi, Peng Zhang, Ying Yan

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) Soochow University(苏州大学) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Agentar-Scale-SQL通过协调的测试时扩展策略,结合内部扩展、顺序扩展和并行扩展,提升文本到SQL的性能,在BIRD基准上达到81.67%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08814 2025-12-10 cs.CL 57%

Ask, Answer, and Detect: Role-Playing LLMs for Personality Detection with Question-Conditioned Mixture-of-Experts

提问、回答与检测:基于角色扮演的LLM用于带有问题条件的专家混合模型的人格检测

Yifan Lyu, Liang Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of International Business and Economics(国际经济贸易大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ROME通过角色扮演LLM模拟用户回答心理测量问卷,生成可解释的证据链接语言线索与人格标签,提升人格检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07898 2025-12-10 cs.MA cs.AI 57%

MARINE: Theoretical Optimization and Design for Multi-Agent Recursive IN-context Enhancement

MARINE:多智能体递归上下文增强的理论优化与设计

Hongwei Zhang, Ji Lu, Yongsheng Du, Yanqin Gao, Lingjun Huang, Baoli Wang, Fang Tan, Peng Zou

机构 * Hongwei Zhang(张宏伟) Ji Lu(卢纪) Yongsheng Du(杜永生) Yanqin Gao(高燕琴) Lingjun Huang(黄令军) Baoli Wang(王宝利) Fang Tan(谭芳) Peng Zou(邹鹏)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MARINE通过理论优化和设计实现多智能体递归上下文增强,显著提升推理性能并减少参数需求。

详情

展开后加载摘要…

URL PDF HTML 收藏