Accélération de l'inférence du modèle QwQ-32B : Optimisation C++ haute performance
Caractéristiques du modèle et goulots d'étranglement
QwQ-32B utilise une architecture Transformer à 64 couches avec un mécanisme d'attention groupée (40 têtes de requête, 8 têtes de clé-valeur). Cette configuration réduit l'empreinte mémoire tout en préservant les capacités du modèle. La prise en charge de contextes jusqu'à 131 072 tokans impos ...
Publié le 6 octobre à 21h23
zintrin.h : inclusion intelligente des fonctions intrinsèques pour VC, GCC et plateformes Windows, Linux, Mac OS X
Pourquoi un en-tête unifié pour les intrinsèques ?
La gestion des foncsions intrinsèques (utilisées pour les instructions SIMD comme SSE) varie selon les compilateurs. Ce document présente zintrin.h, un fichier d'en-tête conçu pour unifier cette inclusion et offrir des macros de détection.
Disparités entre compilateurs
Visual C++ (Windows)
Visu ...
Publié le 20 juillet à 10h00