branding images
branding images

Любой контент без ограничений. Как установить нейросеть Qwen3.5-9B Uncensored: полный гайд по запуску локально

Любой контент без ограничений. Как установить нейросеть Qwen3.5-9B Uncensored: полный гайд по запуску локально
5.00/0.00
1
4736

Модель Qwen3.5-9B-Uncensored-HauhauCS-Aggressive — это одна из самых обсуждаемых open-source нейросетей 2026 года. Она построена на архитектуре Qwen3.5 (9B параметров) и поддерживает до 262K токенов контекста.

Главная особенность версии от HauhauCS — полное отсутствие цензуры. Модель не отказывает в генерации любого контента и подходит для задач, где стандартные ИИ блокируют запросы: сложные сценарии и запросы, агрессивный SEO-контент, обсуждение механизмов обхода алгоритмов, абсолютно любые темы.

Разбираем, как запустить ее локально и какие варианты есть.

Формат модели и требования к системе

Модель распространяется в формате GGUF, поэтому ее можно запускать даже на обычном ПК без топового GPU.

Доступные варианты квантования

  • Q4_K_M (~5.3 GB). Минимальный порог входа. Для работы достаточно около 8 ГБ RAM или VRAM. Это оптимальный вариант по соотношению скорости и качества.
  • Q6_K / Q8_0 (6.9–8.9 GB). Требуют уже 12–16 ГБ памяти. Обеспечивают более высокое качество генерации по сравнению с базовой квантовкой.
  • BF16 (~17 GB). Самый тяжелый вариант. Для стабильной работы потребуется от 24 ГБ памяти, то есть уровень видеокарт вроде RTX 3090 или RTX 4090.

Для работы с изображениями нужен отдельный файл mmproj размером около 880 МБ.

Способ 1: LM Studio (самый простой)

Если не хотите возиться с консолью — это базовый вариант.

Как установить:

  1. Скачайте LM Studio
  2. В поиске введите HauhauCS/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive
  3. Выберите нужную версию (лучше Q4_K_M)
  4. Скачайте mmproj, если нужны картинки
  5. Откройте чат и загрузите модель
  6. Включи GPU Offload в настройках

Готово — можно работать.

Способ 2: KoboldCPP (под API и связки)

Этот вариант подходит, если вы работаете с Telegram-ботами, автогенерацией контента или делаете интеграции под арбитраж.

Сначала необходимо скачать KoboldCPP с GitHub, затем загрузить модель в формате .gguf и файл mmproj, который используется для обработки изображений.

После этого запустите KoboldCPP и укажите путь к модели в поле Model, а путь к энкодеру в поле Mmproj. Далее настройте параметр GPU Layers, например установите значение 32, чтобы часть нагрузки была перенесена на видеокарту. Когда все готово, нажмите Launch.

После запуска откроется чат в браузере, а API станет доступен по адресу http://localhost:5001/v1 — его можно использовать для интеграций и автоматизации.

Способ 3: Ollama (через консоль)

Этот вариант подойдет, если вы уже работаете с локальными LLM и привыкли к запуску через консоль.

Сначала необходимо установить Ollama и скачать модель в формате .gguf. После этого создайте файл с именем Modelfile и укажите в нем путь к модели в формате строки FROM, например: FROM ./Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf.

Далее выполните команду ollama create qwen-uncensored -f Modelfile, чтобы собрать модель, и затем запустите ее через ollama run qwen-uncensored.

После запуска модель будет доступна для локального использования через консоль и API Ollama.

Способ 4: llama.cpp (для продвинутых)

Этот вариант актуален, если вы работаете напрямую с движком и хотите максимальный контроль над запуском модели. Важно учитывать, что поддержка Qwen3.5 появилась только в свежих сборках llama.cpp в 2026 году.

Пример запуска может выглядеть так: ./main -m Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf \
—mmproj mmproj-Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-BF16.gguf \
-n -1 -c 8192 -ngl 33 -i

Рекомендуемые настройки генерации

Модель работает стабильнее и дает более адекватные тексты при корректно заданных параметрах генерации. Для режима с размышлением оптимальны значения Temperature около 0.6, Top_p 0.95 и Top_k 20. Также важен большой контекст, желательно от 128K токенов — это напрямую улучшает качество ответов.

Для задач, где важна скорость и объем, Temperature можно повысить до 0.7, а Top_p снизить до 0.8, оставив Top_k на уровне 20. В этом режиме генерация идет быстрее, но точность немного снижается.

Важный нюанс

Иногда модель может добавлять в конце ответа фразы вроде «это не профессиональный совет». Это не фильтрация и не ограничение контента — основной ответ при этом остается полным.

Более подробно о запуске написано по ссылке.

Вывод

Qwen3.5-9B Uncensored — это уже полноценный рабочий инструмент. Она запускается даже на среднем железе, подходит для SEO-задач, арбитража и генерации контента, а также легко встраивается в пайплайны через API.

При этом модель не режет ответы и сохраняет гибкость в использовании, что делает ее одним из наиболее практичных вариантов среди локальных решений на текущий момент.

Владислав Долгов
Владислав Долгов
Автор
(1 голосов, среднее значение: 5,00 из 5)

Комментарии: (1)

    Среднее железо под llm сейчас – это чт по сегодняшним меркам? К примеру, наличием 32Гб ОЗУ на борту сейчас мало кого удивишь…

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

X