在WAIC 2026展会上,芯展速(GenStorAIGE)带来了一套名为AI90的软硬件一体化AI推理加速方案。简单来说,这套方案的核心思路是把高性能SSD直接纳入GPU显存体系,让KV Cache可以卸载到更大容量的固态硬盘上,从而构建起HBM + DRAM + SSD三级存储架构。

效果相当惊人:首Token延迟从秒级直接降到了亚秒级,提速整整50倍;吞吐量提升了5.1倍;显存节省了39%。更关键的是,结合智能P2P多卡互联技术,AI90可以让8块NVIDIA GeForce RTX 5090组成的集群实现最高5.8倍的推理加速,并且支持128K以上的上下文窗口。这意味着,过去需要昂贵大显存设备才能跑起来的大模型推理任务,现在用消费级显卡集群也能高效完成。

当然,KV Cache卸载到SSD上会带来极高的写入负载,普通SSD根本扛不住。为此,芯展速同步推出了PT200Z AI SSD。它基于pSLC闪存介质,采用PCIe Gen5接口,DWPD(每天全盘写入次数)最高可达100。顺序读取速度14.8GB/s,随机读取3100K IOPS,读取延迟54微秒,写入延迟10微秒。这样的性能参数,足以应对AI推理场景下频繁的缓存读写需求。