Transformer
2 yazı bu etiketle etiketlendi.
KV Cache (Key-Value Cache) nedir? Transformer dikkat mekanizmasında K ve V tensörlerini önbelleğe alarak LLM inference gecikmesini O(n²)'den O(n)'e nasıl düşürdüğünü ve API maliyet tasarrufunu keşfedin.
Transformer mimarisi ve dikkat (attention) mekanizması nasıl çalışır? Self-attention formülü, Q-K-V matrisleri, multi-head attention ve model ölçekleme (scaling laws) detaylı rehberi.