基于瑞芯微官方RKNPU3 SDK V0.5.0,所有性能数据均为实测值
| 项目 | 规格参数 |
|---|---|
| 主控芯片 | 瑞芯微 RK182X AI加速处理器 |
| 产品形态 | M.2 2280 Key M 标准接口 |
| 产品尺寸 | 裸板:80×22×6mm | 带散热器:81×25×21.75mm |
| 主接口 | PCIe 2.1 x1 |
| 供电方式 | M.2 3.3V + 4Pin 1.25mm 12V 输入 |
| 风扇接口 | 4Pin 1mm 间距,支持PWM调速和转速检测 |
| 扩展接口 | RST复位、CLKREQ时钟请求、USB2.0、GPIO |
| 推理精度 | 支持w4a16量化 |
| 典型功耗 | 15W |
| 支持模型 | Qwen2.5、Qwen3、InternVL3、FastVLM等主流开源大模型 |
| 开发支持 | 完整RKNPU3 SDK,提供C/C++、Python API |
所有测试均使用w4a16量化模型,输入输出长度均为128
包含大语言模型(LLM)和多模态模型(VLM)的完整性能测试数据,所有模型使用w4a16量化,输入输出长度均为128
数据基于RKNPU3 SDK V0.5.0
完整的硬件设计资料,帮助开发者快速集成
M.2 Key M接口硬件连接原理图,包含PCIe信号、供电电路、风扇接口等完整设计参考
完整的M.2 Key M接口77针引脚定义表,包含电源、信号、接地等详细说明
本产品需要双供电设计,M.2接口提供3.3V逻辑供电,额外4Pin接口提供12V核心供电,确保稳定运行。
专为边缘大模型推理优化,即插即用,无需复杂配置
基于RKNPU3架构专门优化大语言模型和多模态模型推理,支持w4a16量化,在低功耗下实现超高吞吐量。
Qwen2.5-0.5B可达210+ TPS,首字时延仅22ms,完全满足边缘端实时对话和多模态交互需求。
采用M.2 2280 Key M标准接口,兼容绝大多数工控机、迷你主机、台式机和服务器,即插即用。
内置硬件PWM风扇控制器,支持实时转速检测和自动调速,在保证散热效果的同时兼顾运行静音。
典型功耗仅15W,远低于传统GPU加速卡,边缘部署无需额外供电改造,适合嵌入式和无人值守场景。
提供完整RKNPU3 SDK,原生支持TensorFlow、PyTorch、ONNX及所有主流开源大模型,开发门槛低。