arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Xi'an Jiaotong University(西安交通大学)

2026-01-16 至 2026-01-16 共收录 3
2601.10406 2026-01-16 cs.AI

ErrEval: Error-Aware Evaluation for Question Generation through Explicit Diagnostics

ErrEval: 通过显式诊断实现的问题生成的误差感知评估

Weiping Fu, Bifan Wei, Jingyi Hao, Yushun Zhang, Jian Zhang, Jiaxin Wang, Bo Li, Yu He, Lingling Zhang, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学) School of Continuing Education, Xi’an Jiaotong University(继续教育学院,西安交通大学) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering, Xi’an(陕西省大数据知识工程重点实验室,西安) Test center, National University of Defense Technology(测试中心,国防科技大学)

AI总结 ErrEval通过显式诊断机制改进问题生成评估,有效识别并纠正事实性幻觉和答案不匹配等缺陷,提升评估与人类判断的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10312 2026-01-16 cs.LG

We Need a More Robust Classifier: Dual Causal Learning Empowers Domain-Incremental Time Series Classification

我们需要一个更稳健的分类器:双因果学习赋能领域增量时间序列分类

Zhipeng Liu, Peibo Duan, Xuan Tang, Haodong Jing, Mingyang Geng, Yongsheng Huang, Jialu Xu, Bin Zhang, Binwu Wang

机构 * School of Software, Northeastern University(东北大学软件学院) Institute of Artificial Intelligence and Robotics, Xi'an Jiaotong University(西安交通大学人工智能与机器人研究所) College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) School of Software, University of Science and Technology of China(中国科学技术大学软件学院)

AI总结 本文提出双因果学习框架DualCD,通过解耦因果特征与虚假特征,提升领域增量时间序列分类的鲁棒性。

Comments This paper has been accepted for publication at ACM WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02064 2026-01-16 cs.CV

RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video

RTV-Bench: 通过实时视频对多模态大语言模型的连续感知、理解和推理进行基准测试

Shuhang Xun, Sicheng Tao, Jungang Li, Yibo Shi, Zhixin Lin, Zhanhui Zhu, Yibo Yan, Hanqian Li, Linghao Zhang, Shikang Wang, Yixin Liu, Hanbo Zhang, Ying Ma, Xuming Hu

机构 * HIT(哈尔滨工业大学) HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) XJTU(西安交通大学) SDU(山东大学) CityU(城市大学) HUST(华中科技大学)

AI总结 RTV-Bench通过实时视频对多模态大语言模型的连续感知、理解和推理能力进行细粒度基准测试,揭示了实时模型在长时段视频处理中的性能优势与局限。

Comments Accepted by NeurIPS 2025 Datasets and Benchmarks Track;

详情

展开后加载摘要…

URL PDF HTML 收藏