Accélération de l'inférence du modèle QwQ-32B : Optimisation C++ haute performance

Caractéristiques du modèle et goulots d'étranglement QwQ-32B utilise une architecture Transformer à 64 couches avec un mécanisme d'attention groupée (40 têtes de requête, 8 têtes de clé-valeur). Cette configuration réduit l'empreinte mémoire tout en préservant les capacités du modèle. La prise en charge de contextes jusqu'à 131 072 tokans impos ...

Publié le 6 octobre à 21h23