Ai2 发布 OlmoEarth 平台:面向行星尺度的地理空间推理基础设施
Allen AI 研究所推出 OlmoEarth 平台,可在一天内完成洲级卫星影像推理,支持森林监测与野火风险等应用。
Allen AI 研究所(Ai2)近日在 Hugging Face Blog 上正式介绍了其 OlmoEarth 平台:一套用于将地球观测基础模型从微调、评估,推进到大规模推理的工程基础设施。OlmoEarth 系列模型此前已在约 10 TB 的多模态卫星数据上完成预训练,被政府部门、NGO 等机构用于森林砍伐监测、粮食安全与野火风险等场景。
Ai2 表示,虽然开源模型对具备工程能力的团队已足够,但大多数环保领域的应用方并不具备完整的数据标注、微调与大规模推理能力。OlmoEarth 平台正是为了填补这一缺口:它面向生产环境设计,需要像 Ai2 此前运营的 Skylight 和 EarthRanger 一样「每天都能用」。
为何卫星推理如此困难
地球观测推理与典型 ML 任务有数量级的差异:一次基础模型微调任务可能要搬运数 TB 数据,运行数小时;输入可能跨越多个光谱波段、传感器类型和时间步长,来自不同投影与分辨率的供应商,并存在云遮挡或缺失观测;输出本身是一张地图,每个预测必须与周围区域的投影与坐标网格精确对齐。在很多任务中,下载与准备影像的时间甚至超过模型推理本身。
三阶段流水线匹配不同硬件
由于数据获取与预处理往往主导推理任务的总耗时,平台将作业拆分为三个阶段,分别匹配 CPU 与 GPU 的不同特性:
- 数据获取与预处理(CPU、高 I/O):拉取、重投影、对齐与归一化影像,并以便于推理快速加载的格式落盘;
- 推理(GPU):运行模型前向计算,把最小化处理后的输出直接写入存储;
- 后处理(CPU):把窗口级输出拼接、掩膜、重缩放,并导出为 Zarr、GeoTIFF、GeoJSON 等用户友好格式。
多进程数据加载器持续喂给每块 GPU,完成的输出流式写入对象存储,以保证 GPU 始终饱和。
海量扇出与容错
平台执行层 OlmoEarth Run 把每次作业覆盖的地理区域切分为匹配单个计算实例(worker)的分区,再细分为模型处理的更小窗口;每个窗口可独立前向计算,跨分区无需等待。实际运行中,一个州级区域可拆为约一百个分区,洲级作业则可达数千个,相邻分区略有重叠,在装配输出时消除接缝。
以一次覆盖整个北美大陆的野火风险制图为例,峰值并行使用约 19,600 个 CPU 与 994 块 GPU,网络吞吐超过 168 GB/s。原本估计需要 4,737 小时的串行计算被压缩到约 30.5 小时墙钟时间,达到 155 倍加速。同时,平台针对云配额等限制把并行度设计为可调旋钮,以适配不同作业规模。
成本与下一步
OlmoEarth 平台目前可在约一天时间内完成洲级区域推理,处理数十 TB 影像,每平方公里成本仅为「几分之一美分」。这种成本结构让政府、NGO 等机构可以更频繁地对大面积区域进行地球观测分析。
Ai2 表示,平台将持续扩展在容错、数据接入与输出可消费性方面的能力,让开源地球观测模型在真实环境与气候决策场景中真正落地。读者可访问 allenai.org/olmoearth 了解更多信息。
