多模态学习 · 计算机视觉 · 医学影像

连接多种模态,构建更可靠的医学影像 AI。

我目前专注于医学影像 AI 中的多模态学习:研究模型如何融合不同影像模态与互补信息,形成可靠的表征与预测。我的既有工作还涉及计算机视觉、人群计数、视觉–语言学习与以人为中心的感知。这里会从问题与直觉出发,讲清每项工作的证据与局限。

“操千曲而后晓声,观千剑而后识器。”

— 刘勰,《文心雕龙·知音

01 / 代表性研究

讲清想法、证据与边界。

3 篇精选工作,完整档案收录 6 篇论文。

查看全部出版物
ZIP 人群计数方法概览
Preprint

ZIP: Scalable Crowd Counting via Zero-Inflated Poisson Modeling

当人群密度图中超过 95% 的局部分块都是空的,平方误差回归还是合适的统计模型吗?

核心想法

ZIP 为每个分块预测两个量:结构零概率用于背景、身体部位和其他非头部中心区域,泊松率用于可能包含头部中心的区域。整数计数分箱用于稳定泊松率预测,联合似然则直接从点标注中学习区分结构零与抽样零。

任务 · 人群计数方法 · 概率模型目标 · 可扩展性

02 / 我的随笔

让研究变得可读。

第一篇真实长文现已发布,中英文内容一一对应。

查看全部随笔

03 / 关于

“凡人之患,蔽于一曲,而暗于大理。”

— 荀子,《解蔽

研究不只是一张成果清单。这个网站用来串联我选择的问题、构建的模型、信任的证据,以及从局限中获得的认识。我目前专注于医学影像 AI 中的多模态学习,并延续此前在人群计数、视觉–语言模型、多模态驾驶员监控和以人为中心的视觉方面的研究积累。