GPU Cloud

需要多少算力,
就用多少

RTX 4090 · A6000 · 5090 · 昇腾 910B。弹性 GPU、Serverless 推理、模型 API,按卡·时计费。

83-122 tok/s 单卡吞吐 · Qwen2.5-7B int4 · Decode 实测
One platform. Three products.

三类算力,按需组合

从实验到生产,一条链路打通。100GbE RoCE v2 互联。

弹性 GPU

GPU Instances

物理 GPU 独占或共享,k3s 调度,100GbE RoCE v2 低延迟互联。按卡·时计费。

GPU:RTX 4090 / A6000 显存:24GB / 48GB 计费:按卡·时
Serverless 推理

VM Instances

8 卡超售 12 VM,单 VM 独占 vGPU 配额。预装 vLLM / PyTorch / Jupyter,弹性扩缩容,按分钟计费。

调度:k3s + GPU Plugin 超售比:1.5×(8卡→12VM) 计费:按分钟
模型 API

Model API

自建推理网关,标准 OpenAI 兼容接口,一行代码切换。预付费/后付费灵活选择。

模型:Qwen2.5 7B/14B/72B 量化:int4 (AWQ) 引擎:vLLM
83-122 tok/s7B int4 单卡
40-55 tok/s14B int4 单卡
6-12 tok/s72B int4 单卡
600-1,000 tok/s7B 8卡并发

以上为 RTX 4090 · vLLM · AWQ int4 · Decode 阶段实测

Why SPL

光伏 + 算力,成本从源头不同

分布式光伏站点提供边际零成本电力。全开源技术栈,每层可替换,零锁定。

⚡

绿电降本

分布式光伏站点边际零成本电力
每kWh产出70-100万token

🔓

全开源

k3s + vLLM + Lago + Kong
零锁定,每一层可替换

🏭

分布式

节点下沉到光伏站点、充电站
灵活选址,就近部署

⚙️

即开即用

预装推理栈,分钟级交付
不用从裸机搭起

Architecture

从 GPU 到 API,一条链路

全开源组件,兼容 NVIDIA + 昇腾。业界验证的标准方案。

算力
4090 / A6000 / 昇腾
→
调度
k3s + GPU Plugin
→
推理
vLLM / TensorRT-LLM
→
网关
Kong + Lago
→
交付
OpenAI 兼容 API

Start building on SPL Token Factory

一台 4 卡 4090 节点起步,分钟级上线。弹性 GPU、Serverless 推理、模型 API,按需取用。

开始使用