Расскажу как оно у меня работает, только у меня 32 VRAM.
У меня стоит и Ollama и LMStudio. LMStudio работает лучше, тк в олламе обновления для запуска новых моделей выходят гораздо позже, плюс с huggingface.co работают далеко не все модели.
Я поставил себе claude code cli (он работает и с локальными моделями) в .bashrc прописал такие переменные для подключения к lmstudio (для олламы только порт поменять)
export ANTHROPIC_BASE_URL=localhost:1234
export ANTHROPIC_AUTH_TOKEN=lmstudio
и просто запускаю через терминал например claude --model gpt-oss:20b
Для поиграть и понять как оно работает этого будет достаточно.
По моделям для агентного программирования:
- gpt-oss:20b - занимает всего 15-20 гигабайт памяти, что-то пишет как агент.
- На 64гб возможно получится запустить 4 битную https://huggingface.co/unsloth/Qwen3-Coder-Next-GGUF На 32гб запускается 2 битная, но работает просто ужасно, а так ей нужно гигабайт 80-90 для нормальной работы. Она уже дает хоть какие адекватные результаты.
- Другие локальные модели как агенты программирования (чтобы написали тебе целый сайт например) не дадут результата, либо дадут полную фигню, они работают хорошо как чат. Могут еще и комп сильно перегреть, если не заточены под работу агента.
В основном локально сейчас я использую только как чат модель Qwen3-Coder-30b (занимает 28 гигов vram) Дает нормальные ответы, рефакторит куски кода. Так же использую просто "Режим ИИ" в гугле, бесплатно, ответы хорошие.
Поигравшись я понял что локально запускать агента это никуда не годится. Купил акк для claude code на месяц и сразу понял насколько велика разница по сравнению с локальными моделями. Я ему составил ТЗ для сайта, приложил примеры апи (через тот же Qwen3-Coder-30b) и уже через пол часа получил готовый проект на nuxt.js из 5 страниц с полным рестапи.
Потом я решил купить акк google gemini на год, но тут нужен хороший квн, не в Нидерланде, чтобы он по стране не заблокировал тебя, у меня USA регион прошел нормально. Поставил так же gemini-cli и antigravity (форк vscode) В целом работает похуже чем claude, но работает нормально, рефакторит мне код потихоньку.
Еще создал себе аккаунт на openroute, закинул туда 15 баксов. Чтобы пробовать запускать новые модельки, которые не влезают в память, но это чисто поиграть и потестить.