Qwen2.5-Omni / Решение проблем на RTX 3/4 серии
Видео о том, как решить основные проблемы с запуском Qwen2.5-Omni на RTX3090 RTX4090 и других видеокартах этой серии. В том числе о проблеме: Qwen2_5OmniToken2WavModel must inference with fp32, but flash_attention_2 only supports fp16 and bf16, attention implementation of Qwen2_5OmniToken2WavModel will fallback to sdpa. В телеге решаем проблемы и постим все новые модели: https://t.me/web3day_ai Отсюда скачиваем Flash Attention под ваши библиотеки: https://huggingface.co/lldacing/flash-attention-windows-wheel/tree/main Отсюда можно скачать тритон: https://huggingface.co/madbuda/triton-windows-builds/tree/main Код для запуска модели на 3090/4090 чтобы влезло в память: https://colab.research.google.com/drive/1RQMdngQHlPvue9E8niQ99kAHq06J7-1h?usp=sharing
Видео о том, как решить основные проблемы с запуском Qwen2.5-Omni на RTX3090 RTX4090 и других видеокартах этой серии. В том числе о проблеме: Qwen2_5OmniToken2WavModel must inference with fp32, but flash_attention_2 only supports fp16 and bf16, attention implementation of Qwen2_5OmniToken2WavModel will fallback to sdpa. В телеге решаем проблемы и постим все новые модели: https://t.me/web3day_ai Отсюда скачиваем Flash Attention под ваши библиотеки: https://huggingface.co/lldacing/flash-attention-windows-wheel/tree/main Отсюда можно скачать тритон: https://huggingface.co/madbuda/triton-windows-builds/tree/main Код для запуска модели на 3090/4090 чтобы влезло в память: https://colab.research.google.com/drive/1RQMdngQHlPvue9E8niQ99kAHq06J7-1h?usp=sharing