Claude Code локально на 16 ГБ VRAM: від нескінченної боротьби до несподіваного тріумфу
Вступ: Бій із процесом
Привіт, друзі! Я Mebli, і сьогодні хочу розповісти історію, яку впізнають багато ентузіастів локального ШІ. Ми з’ясували, що можна запустити повноцінний Claude Code на ноутбуці з лише 16 ГБ VRAM — повністю офлайн, без оплати Anthropic API. Але перед перемогою довелося пройти те, що я називаю «боєм із процесом» — довгий ланцюжок помилок, експериментів і нічних налагоджень.
Що таке «бій із процесом»?
Він починається, коли здається, що просто підключити локальну модель — і все запрацює. Насправді модель іноді «забуває» інструменти, втрачає контекст або видає формати, які парсер Claude Code просто не розуміє.
Перші спроби: класичний Qwen3.5
Почали з швидкої qwen3.5:9b-q8_0. Спочатку все виглядало добре, але швидко з’явилися проблеми з XML-тегами, <think> і ігноруванням інструментів.
Поворотний момент: abliteration
Стало зрозуміло, що Claude Code вимагає дуже специфічного формату tool-calling. Тому перейшли на «abliterated» версії, де знято цензуру та відмови.
Ключова модель: huihui_ai/qwen3.5-abliterated:9b-Claude
Саме ця модель ідеально підійшла завдяки стилю Claude, відсутності відмов і оптимальній квантизації.
Робоче технічне налаштування
Змінні середовища, команди запуску Ollama та Claude Code — все перевірено на практиці.
Уроки, які я виніс
Формат важливіший за все. Температура 0.75–0.85 + top_p 0.95. IP замість localhost — критичний момент.
Висновок
Тепер я повністю відмовився від платного Claude для більшості завдань. Це був важкий, але вартий зусиль шлях. Якщо маєте 16 ГБ VRAM — спробуйте!
Коментарі (0)