开源项目、科研代码与实验室折腾记录。
学习对常用的cuda算子进行优化
基于 YOLOv13 目标检测模型,实现从 ONNX 导出 → TensorRT Engine 构建 → FP32/FP16/INT8 多精度推理对比 的全链路模型部署与优化