2026/06/12GPU 架构学习第九课:GPU 如何执行神经网络卷积这一课把矩阵乘法继续推进到卷积,重点解释卷积的数据组织、常见映射方式,以及为什么不同卷积在 GPU 上效率差异很大。21 min readGPUCUDAArchitectureCNNConvolutionImplicit GEMM
2026/05/20人工智能芯片从算法模型到可综合 RTL 的完整流程记录神经网络算子从 Python 模型、定点化、接口定义到可综合 RTL 的工程拆解方法。11 min readCNNQuantizationRTLDataflowVerification
2026/04/15FPGA 与硬件加速FPGA 神经网络加速器的数据流设计梳理 FPGA 上神经网络加速器的数据复用、流水线、片上缓存和 AXI 传输组织方式。9 min readFPGAAXIHLSCNNDataflow