科学数据的长相千差万别:蛋白质是一条氨基酸序列,气象场是带经纬度和气压层的三维网格,遥感影像是多通道的卫星图像,医疗数据里又混着文本报告和数值指标。传统做法是为每一类数据单独训一个专用模型,结果就是模型越堆越多,跨学科研究反而越来越难。上海人工智能实验室发布的神珍多模态科学大模型,尝试用110亿参数的单个模型统一覆盖六类科学数据模态,包括蛋白质、医学影像、气象场、遥感、时序信号和自然语言文本,并在开源社区放出了权重和推理代码,给科研人员和开发者提供了一个可以直接上手的多模态科学基座。

一、为什么单一模型能读懂六类科学数据
神珍的核心思路是把异构科学数据统一映射到同一个隐空间。不同模态的数据虽然物理形态不同,但都可以被拆解成token序列:蛋白质的氨基酸天然就是离散符号,可以直接当作词元处理;气象场这样的三维连续数据则通过空间分块和线性投影转成视觉token序列;时序信号用滑动窗口切片后编码。这样一来,无论输入是蛋白质序列还是气象格点场,进入模型内部后都变成了统一表示的token流,由同一个Transformer主干进行处理。
这种统一token化的好处是显而易见的。首先是参数共享带来的效率提升,六类任务共用一个主干网络,相比六个独立模型总参数量大幅下降,110亿参数就能覆盖原本需要几十亿到上百亿参数堆起来的任务矩阵。其次是跨模态知识迁移,比如蛋白质结构理解中学习到的长程依赖建模能力,可以自然迁移到气象场的大尺度时空关系建模上,这是专用模型完全不具备的能力。
第三点是工程上的简化。科研人员只需要部署一套推理服务,就能同时支撑蛋白质性质预测、气象要素预报、遥感地物分类等多个任务,运维成本和显存占用都显著降低。对于算力有限的高校实验室来说,这种一体化设计的吸引力相当大。
二、架构设计与多模态统一训练策略
在架构层面,神珍采用了多模态联合建模的路线。模型整体由模态特定的编码器、统一投影层和共享的Transformer主干组成。各模态编码器负责把原始数据转换成语义token,投影层把它们对齐到统一维度,主干网络则通过自回归或填空式预训练目标学习跨模态的通用科学表征。以气象数据为例,具体的处理流程可以参考下面的伪代码:
import torch # 气象格点数据: [batch, levels, lat, lon] weather_field = torch.randn(2, 5, 720, 1440) # 空间分块: 把经纬度网格切成patch patches = weather_field.unfold(2, 16, 16).unfold(3, 16, 16) # 展平成token序列: [batch, num_tokens, dim] tokens = patches.permute(0, 2, 3, 1, 4, 5).reshape(2, -1, 5 * 16 * 16) # 线性投影到模型隐维度, 与文本token维度对齐 proj = torch.nn.Linear(5 * 16 * 16, 4096) unified_tokens = proj(tokens) # 进入共享Transformer主干</code>
训练策略上,神珍采用了分阶段的课程式方案。第一阶段在大量单一模态数据上分别预训练各模态编码器,保证每个模态都有扎实的基础表征能力;第二阶段进行多模态混合训练,按一定比例采样六类数据,让主干网络学会在模态之间建立关联;第三阶段针对下游科学任务做指令微调,使模型能够理解自然语言提出的科研问题,比如输入一段蛋白质序列后用自然语言回答它的功能注释。
这种渐进式训练避免了多模态训练中常见的模态坍塌问题。如果从一开始就把六类数据混在一起训练,数据量大的模态(通常是文本)会主导梯度方向,小数据模态学不到有效表征。分阶段课程让每个模态先站稳脚跟,再进行融合,是多模态领域被反复验证有效的做法。
三、实际表现与开源使用方式
在公开的科学基准测试中,神珍在多个任务上展现出与专用模型相当甚至更好的表现。蛋白质相关的二级结构预测和功能注释任务上,它能逼近专门的蛋白质语言模型;气象短临预报任务上,其对温度、湿度、风速等要素的预报技巧接近业务化的气象数值模式后处理模型;遥感场景分类和医学影像识别任务同样保持了较高的准确率。更重要的是,当任务涉及跨模态推理,比如根据文本描述检索符合条件的蛋白质序列时,统一模型的优势就体现出来了,这是任何单一模态模型都无法完成的。
模型权重和代码已经开源,推理部署并不复杂。以Transformers风格的加载方式为例:
from transformers import AutoModel, AutoTokenizer
model_name = "ShenZhen-Science-11B"
tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
model = AutoModel.from_pretrained(
model_name,
trust_remote_code=True,
torch_dtype="bfloat16", # 使用bf16降低显存占用
device_map="auto"
)
# 多模态输入: 蛋白质序列 + 自然语言问题
inputs = tokenizer(
"protein:MKTLLLTLVVVTIVCLDLGYT\nquestion:这段序列是否为分泌蛋白?",
return_tensors="pt"
).to(model.device)
output = model.generate(**inputs, max_new_tokens=256)
print(tokenizer.decode(output[0], skip_special_tokens=True))110亿参数的模型用bfloat16精度加载大约需要22GB显存,单张高端消费级显卡或者一张专业推理卡就能跑起来。如果是做批量科学数据处理,建议搭配vLLM等推理框架提升吞吐量。科研人员也可以基于开源权重在自己的领域数据上继续做增量预训练,把模型适配到更细分的研究方向,比如特定地区的气象要素或者特定蛋白家族的功能预测。
四、对科研生态的意义与局限
神珍这类统一科学大模型的出现,正在改变科研AI工具的使用范式。过去生物、气象、遥感各领域各有自己的模型生态,工具链互不兼容,跨学科合作时数据格式和模型接口的对接成本很高。统一基座让不同背景的研究者用同一套接口、同一种自然语言交互方式来调用AI能力,显著降低了科学AI的使用门槛,也为构建跨领域的科学智能体打下了基础。
当然也要看到局限。110亿参数的规模决定了它的单模态深度上限不如超大规模专用模型,在极端专业化的任务上,比如超高分辨率的中期气象预报或者超长蛋白质复合物结构预测,专用大模型仍然占优。另外,多模态统一训练对数据质量极其敏感,六类数据的标注质量参差不齐时,模型表现会出现明显波动。开源社区后续通过微调_recipe和领域适配数据的积累,有望逐步弥补这些短板。
总体来看,神珍证明了科学多模态统一建模这条技术路线的可行性,也把高质量的科学基座模型的获取成本降到了一个高校实验室可以承受的水平。对于想在科学AI方向做探索的开发者和研究者来说,现在正是一个不错的入场时机。