英伟达开发者博客上线了一个新模型,叫NV-Reason-CT。它是一个专门用来读三维CT的视觉语言模型,能做的是生成结构化报告,并且在报告里写出推理过程,模仿放射科医生逐区域看片、列出发现、权衡鉴别诊断、最后给出结论的思路。这个项目建在此前的NV-Reason-CXR之上,那套推理方法在一项多读者临床研究里做过验证,研究被今年的北美放射学会年会接收。
三维CT一直是个难点。一次腹部CT可能有300到600张轴位切片,解剖信息分布在三个空间方向上,用处理二维图像的模型去读,等于把一卷胶片拆成一张张照片分别看,切片之间的空间关系就丢了,而肿块、积液、浸润这类结构的意义恰恰要靠三维才成立。英伟达的做法是把CT体数据重采样成192×192×192的体素,用不重叠的8×8×8小块切成视觉标记,得到13824个视觉token,并且把这些标记的三维坐标一并送进语言模型。
架构上是三维视觉编码器加语言模型的组合。视觉部分是一个三维ViT编码器,语言部分用的是Qwen3.5-4B,两侧权重在大规模CT数据上端到端重新训练过。为了让模型理解标记之间的空间关系,视觉标记没有被合并或降采样,而是连同三维网格坐标全部送入语言模型,由后者用三维旋转位置编码来建模。这种让模型先说出中间步骤再给结论的做法通常被叫作链式推理,也是它和普通分类模型拉开距离的地方。
训练走的是两阶段。第一阶段用放射科医生写下的推理口述、结构化报告和视觉问答数据做监督微调,课程量大约是55万条结构化问答,覆盖胸部与腹部,包括分区解剖问答、定位与侧别问答、严重程度问答和有无异常的判断。第二阶段用分组相对策略优化做强化学习,奖励函数按解剖区域分别计算异常识别和诊断的准确性,而不是给一个全局分数。英伟达称模型在CT理解的主要公开基准上取得了当前最好的结果,异常覆盖面是胸部30类、腹部29类。
最需要说清的是它的定位。英伟达把NV-Reason-CT定义为开放的研发基础模型,明确说不是自主诊断系统,也没有取得临床产品资质,用途是给研究人员和开发者做底子,再针对具体场景做后训练。官方博客里提到,这个模型是作为教师型工具来设计的,会解释问题、走完证据、给出结论,而不是直接抛一个分类标签。对做医学影像AI的团队来说,这层限定比成绩更重要,一段可被审核的推理过程,才有机会进入临床流程。
申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!
