Tag
2 articles
This article explains tile-based GPU programming concepts, focusing on NVIDIA's cuTile and Triton frameworks, and how they enable efficient Flash Attention in large language models.
Flash-KMeans, an open-source IO-aware k-means implementation, achieves over 200× speedup on GPUs compared to FAISS by optimizing distance matrix operations and reducing atomic contention.