Мій Блог
Головна
Переклади: EN — Claude Code Locally on 16 GB VRAM: From

Claude Code локально на 16 ГБ VRAM: від нескінченної боротьби до несподіваного тріумфу

11 April 2026 69
Claude Code локально на 16 ГБ VRAM: від нескінченної боротьби до несподіваного тріумфу

Вступ: Бій із процесом

Привіт, друзі! Я Mebli, і сьогодні хочу розповісти історію, яку впізнають багато ентузіастів локального ШІ. Ми з’ясували, що можна запустити повноцінний Claude Code на ноутбуці з лише 16 ГБ VRAM — повністю офлайн, без оплати Anthropic API. Але перед перемогою довелося пройти те, що я називаю «боєм із процесом» — довгий ланцюжок помилок, експериментів і нічних налагоджень.

Що таке «бій із процесом»?

Він починається, коли здається, що просто підключити локальну модель — і все запрацює. Насправді модель іноді «забуває» інструменти, втрачає контекст або видає формати, які парсер Claude Code просто не розуміє.

Перші спроби: класичний Qwen3.5

Почали з швидкої qwen3.5:9b-q8_0. Спочатку все виглядало добре, але швидко з’явилися проблеми з XML-тегами, <think> і ігноруванням інструментів.

Поворотний момент: abliteration

Стало зрозуміло, що Claude Code вимагає дуже специфічного формату tool-calling. Тому перейшли на «abliterated» версії, де знято цензуру та відмови.

Ключова модель: huihui_ai/qwen3.5-abliterated:9b-Claude

Саме ця модель ідеально підійшла завдяки стилю Claude, відсутності відмов і оптимальній квантизації.

Робоче технічне налаштування

Змінні середовища, команди запуску Ollama та Claude Code — все перевірено на практиці.

Уроки, які я виніс

Формат важливіший за все. Температура 0.75–0.85 + top_p 0.95. IP замість localhost — критичний момент.

Висновок

Тепер я повністю відмовився від платного Claude для більшості завдань. Це був важкий, але вартий зусиль шлях. Якщо маєте 16 ГБ VRAM — спробуйте!

#штучний інтелект #локальні моделі #claude code #ollama #qwen3.5 #abliteration #кодинг #16 гб vram

Коментарі (0)

Написати коментар