KingOfEgg
首页项目归档照片墙音乐灵境说说杂谈友链关于

归档与探索

总计 13 篇研究记录

Mini-vllm 学习记录
2026-09-12 16:36:09

Mini-vllm 学习记录

#mini-vllm#GPU优化#学习总结#性能优化

GEMM优化(三)大矩阵适配和极致优化
2026-09-03 12:00:00

GEMM优化(三)大矩阵适配和极致优化

#CUDA#Tensor Core#HGEMM#性能优化

把 wmma 的黑盒拆开自己写,最后 6% 是怎么抠出来的;矩阵一大撞上内存墙,再用 L2 二维分块把流量降 7 倍。

NV系显卡架构与Tensor Core :从 MMA 到 tcgen05
2026-08-25 20:00:00

NV系显卡架构与Tensor Core :从 MMA 到 tcgen05

#CUDA#Tensor Core#学习总结

从 Volta 到 Blackwell,五代 Tensor Core 到底改了什么:一条"把数据通路从寄存器里搬出去"的主线

Flash Attention (四)v2.1 前向算子代码实现与官方源码对比
2026-08-24 11:00:00

Flash Attention (四)v2.1 前向算子代码实现与官方源码对比

#CUDA#FlashAttention#Tensor Core#mma#ldmatrix#学习总结

Flash Attention (三)前置:裸写 mma.sync 与 ldmatrix 的布局验证实验
2026-08-24 02:00:00

Flash Attention (三)前置:裸写 mma.sync 与 ldmatrix 的布局验证实验

#CUDA#FlashAttention#Tensor Core#mma#ldmatrix#学习总结

Flash Attention (二)v2版本朴素实现 cuda core
2026-08-23 10:00:00

Flash Attention (二)v2版本朴素实现 cuda core

#CUDA#FlashAttention#Online Softmax#GPU优化#学习总结

Flash Attention (一)v1版本前向传播cuda kernel的具体实现 cuda core版
2026-08-20 02:51:01

Flash Attention (一)v1版本前向传播cuda kernel的具体实现 cuda core版

#CUDA#FlashAttention#Online Softmax#GPU优化#学习总结

Softmax优化(二) Online Softmax从V0到Grid Stride
2026-08-19 12:00:00

Softmax优化(二) Online Softmax从V0到Grid Stride

#CUDA#Softmax#Online Softmax#FlashAttention#GPU优化

Online Softmax从V0单线程到V4 Grid Stride的完整实现,涵盖online递推、warp shuffle合并规约、float4向量化与寄存器缓存,并结合笔记一分析为何省读不省DRAM。

Softmax优化(一) 从Naive到两遍融合
2026-08-17 12:00:00

Softmax优化(一) 从Naive到两遍融合

#CUDA#Softmax#GPU优化#性能调优

从naive到两遍融合的Softmax优化过程,涵盖safe softmax、shared memory归约、warp shuffle、float4向量化与online softmax,并用ncu数据验证memory-bound瓶颈。

GEMM优化(二) Tensor Core : wmma Api调用
2026-08-14 16:16:18

GEMM优化(二) Tensor Core : wmma Api调用

#CUDA#GPU优化#性能调优

调用wmma api使用Tensor core进行矩阵运算

CUBLAS GEMM 函数用法
2026-08-12 12:00:00

CUBLAS GEMM 函数用法

#CUDA#SGEMM#cublas

学习了如何使用 CUBLAS GEMM 函数,包括参数签名、正确调用方法、核心难点等。

GEMM  优化(一) Cuda Core计算
2026-08-11 12:00:00

GEMM 优化(一) Cuda Core计算

#CUDA#SGEMM#GPU优化#性能调优#学习总结

从 Naive 到 Double Buffering,七步优化,10.6× 加速比。涵盖算术强度推导、bank conflict 消除、寄存器预取、双缓冲流水线等核心技术,含自测十问。

YOLOv13 部署项目 — 技术栈全解
2026-08-09 12:00:00

YOLOv13 部署项目 — 技术栈全解

#YOLO#深度学习#模型部署#CUDA#TensorRT#ONNX#PyTorch

从底层硬件到上层应用,逐层梳理 YOLOv13 部署项目的完整技术栈:CUDA、TensorRT、ONNX、PyTorch、OpenCV 等各组件的角色与关联。