韩国 FuriosaAI 发布第三代推理加速器:算力与内存带宽双双提升 32 倍
近日,韩国 AI 芯片初创公司 FuriosaAI 正式发布了其第三代推理加速器 **RNGD**(代号 “Renegade”),在业界引发广泛关注。该芯片基于台积电 5nm 制程工艺,采用创新的数据流架构,其算力与内存带宽相较上一代产品 **Warboy** 均实现了 **32 倍**的飞跃式提升。具体而言,RNGD 在 INT8 精度下的峰值算力达到 **1024 TOPS**,内存带宽则飙升至 **1.3 TB/s**,两项核心指标均进入全球第一梯队。
# 架构与性能突破:面向大模型的“内存墙”破局
RNGD 的核心竞争力在于其针对大语言模型推理场景的深度优化。传统 GPU 在处理 Transformer 类模型时,常因计算单元与内存之间的数据搬运瓶颈而效率低下。FuriosaAI 通过自研的 **数据流(Dataflow)架构**,将片上 SRAM 与计算单元紧密耦合,使权重和激活值能够在芯片内部高效复用,极大减少了对片外高带宽内存的依赖。配合 **HBM3** 的采用,1.3 TB/s 的带宽足以支持 70B 参数模型在单卡上进行实时推理,且延迟控制在毫秒级。这一设计直接回应了当前 AI 推理中“内存墙”的核心痛点——算力增长远快于带宽增长,而 RNGD 试图通过架构创新拉平这一差距。
# 市场定位与竞争格局:从边缘到数据中心
从产品定位看,RNGD 瞄准的是 **数据中心级推理** 市场,直接与 NVIDIA 的 L40S、Intel 的 Gaudi 3 以及 AMD 的 MI300X 等产品竞争。与通用 GPU 不同,RNGD 的专用架构在特定推理任务(如 LLM 生成、视觉大模型)上能效比更高。据 FuriosaAI 官方数据,其每瓦 TOPS 达到 **20+**,显著优于同等算力的 GPU。此外,该芯片支持 **开放标准(如 PCIe 5.0 和 CXL)**,并适配 PyTorch 等主流框架,降低了用户迁移成本。对于韩国本土的 AI 云服务商和大型企业而言,RNGD 的推出不仅是技术选择上的补充,更是在地缘政治背景下实现供应链多元化的关键一步。
# 展望:韩国 AI 芯片生态的里程碑
FuriosaAI 本轮的突破,标志着韩国在 AI 半导体领域从“追赶”转向“并跑”。RNGD 不仅有望在明年量产并进入全球市场,还将通过其开放生态吸引更多开发者。然而,面对 NVIDIA CUDA 生态的绝对统治力和持续的架构迭代,FuriosaAI 仍需在软件栈成熟度、模型兼容性和大规模部署稳定性上继续攻坚。若能在 2025 年顺利交付 RNGD 并取得标杆客户验证,这家韩国初创公司或将成为 AI 推理芯片赛道中的重要变量。