121.
122.
Compiling LLMs into a MegaKernel: A path to low-latency inference
(news.ycombinator.com)
123.
Compiling LLMs into a MegaKernel: A Path to Low-Latency Inference
(news.ycombinator.com)
124.
EDAN: Towards Understanding Memory Parallelism and Latency Sensitivity in HPC [pdf]
(news.ycombinator.com)