开源项目、科研代码与实验室折腾记录。
对GEMM通用矩阵乘法进行逐步优化,学习并行编程,内存读取相关内容,包括传统的FMA优化和新架构如基于BLackwell架构的MMA优化,尝试使用Tensor core加速GEMM计算
基于 YOLOv13 目标检测模型,实现从 ONNX 导出 → TensorRT Engine 构建 → FP32/FP16/INT8 多精度推理对比 的全链路模型部署与优化