Модель Qwen3.5-9B-Uncensored-HauhauCS-Aggressive — это одна из самых обсуждаемых open-source нейросетей 2026 года. Она построена на архитектуре Qwen3.5 (9B параметров) и поддерживает до 262K токенов контекста.
Главная особенность версии от HauhauCS — полное отсутствие цензуры. Модель не отказывает в генерации любого контента и подходит для задач, где стандартные ИИ блокируют запросы: сложные сценарии и запросы, агрессивный SEO-контент, обсуждение механизмов обхода алгоритмов, абсолютно любые темы.
Разбираем, как запустить ее локально и какие варианты есть.
Формат модели и требования к системе
Модель распространяется в формате GGUF, поэтому ее можно запускать даже на обычном ПК без топового GPU.
Доступные варианты квантования
- Q4_K_M (~5.3 GB). Минимальный порог входа. Для работы достаточно около 8 ГБ RAM или VRAM. Это оптимальный вариант по соотношению скорости и качества.
- Q6_K / Q8_0 (6.9–8.9 GB). Требуют уже 12–16 ГБ памяти. Обеспечивают более высокое качество генерации по сравнению с базовой квантовкой.
- BF16 (~17 GB). Самый тяжелый вариант. Для стабильной работы потребуется от 24 ГБ памяти, то есть уровень видеокарт вроде RTX 3090 или RTX 4090.
Для работы с изображениями нужен отдельный файл mmproj размером около 880 МБ.
Способ 1: LM Studio (самый простой)
Если не хотите возиться с консолью — это базовый вариант.
Как установить:
- Скачайте LM Studio
- В поиске введите HauhauCS/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive
- Выберите нужную версию (лучше Q4_K_M)
- Скачайте mmproj, если нужны картинки
- Откройте чат и загрузите модель
- Включи GPU Offload в настройках
Готово — можно работать.
Способ 2: KoboldCPP (под API и связки)
Этот вариант подходит, если вы работаете с Telegram-ботами, автогенерацией контента или делаете интеграции под арбитраж.
Сначала необходимо скачать KoboldCPP с GitHub, затем загрузить модель в формате .gguf и файл mmproj, который используется для обработки изображений.
После этого запустите KoboldCPP и укажите путь к модели в поле Model, а путь к энкодеру в поле Mmproj. Далее настройте параметр GPU Layers, например установите значение 32, чтобы часть нагрузки была перенесена на видеокарту. Когда все готово, нажмите Launch.
После запуска откроется чат в браузере, а API станет доступен по адресу http://localhost:5001/v1 — его можно использовать для интеграций и автоматизации.
Способ 3: Ollama (через консоль)
Этот вариант подойдет, если вы уже работаете с локальными LLM и привыкли к запуску через консоль.
Сначала необходимо установить Ollama и скачать модель в формате .gguf. После этого создайте файл с именем Modelfile и укажите в нем путь к модели в формате строки FROM, например: FROM ./Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf.
Далее выполните команду ollama create qwen-uncensored -f Modelfile, чтобы собрать модель, и затем запустите ее через ollama run qwen-uncensored.
После запуска модель будет доступна для локального использования через консоль и API Ollama.
Способ 4: llama.cpp (для продвинутых)
Этот вариант актуален, если вы работаете напрямую с движком и хотите максимальный контроль над запуском модели. Важно учитывать, что поддержка Qwen3.5 появилась только в свежих сборках llama.cpp в 2026 году.
Пример запуска может выглядеть так: ./main -m Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf \
—mmproj mmproj-Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-BF16.gguf \
-n -1 -c 8192 -ngl 33 -i
Рекомендуемые настройки генерации
Модель работает стабильнее и дает более адекватные тексты при корректно заданных параметрах генерации. Для режима с размышлением оптимальны значения Temperature около 0.6, Top_p 0.95 и Top_k 20. Также важен большой контекст, желательно от 128K токенов — это напрямую улучшает качество ответов.
Для задач, где важна скорость и объем, Temperature можно повысить до 0.7, а Top_p снизить до 0.8, оставив Top_k на уровне 20. В этом режиме генерация идет быстрее, но точность немного снижается.
Важный нюанс
Иногда модель может добавлять в конце ответа фразы вроде «это не профессиональный совет». Это не фильтрация и не ограничение контента — основной ответ при этом остается полным.
Более подробно о запуске написано по ссылке.
Вывод
Qwen3.5-9B Uncensored — это уже полноценный рабочий инструмент. Она запускается даже на среднем железе, подходит для SEO-задач, арбитража и генерации контента, а также легко встраивается в пайплайны через API.
При этом модель не режет ответы и сохраняет гибкость в использовании, что делает ее одним из наиболее практичных вариантов среди локальных решений на текущий момент.







Среднее железо под llm сейчас – это чт по сегодняшним меркам? К примеру, наличием 32Гб ОЗУ на борту сейчас мало кого удивишь…