KingOfEgg
首页项目归档照片墙音乐灵境说说杂谈友链关于

Projects Matrix

开源项目、科研代码与实验室折腾记录。

GEMM-Cuda算子优化

对GEMM通用矩阵乘法进行逐步优化,学习并行编程,内存读取相关内容,包括传统的FMA优化和新架构如基于BLackwell架构的MMA优化,尝试使用Tensor core加速GEMM计算

CUDA,C++

yolov13模型部署与推理优化对比

基于 YOLOv13 目标检测模型,实现从 ONNX 导出 → TensorRT Engine 构建 → FP32/FP16/INT8 多精度推理对比 的全链路模型部署与优化

Pytorch,ONNX,TensorRT