Пн - Пт: 09:00 - 18:00
ИИ, который отвечает только по вашей базе знаний: проверили на домашнем ПК — 59 верных из 60

ИИ, который отвечает только по вашей базе знаний: проверили на домашнем ПК — 59 верных из 60

17 сентября 2026|Евгений Буземский
Коротко

Если читать некогда

Задача
Клиент хотел разгрузить службу поддержки: на типовые вопросы отвечает ИИ, люди занимаются сложными случаями. Условие — ни вопросы клиентов, ни внутренние инструкции не должны уходить в облако.
Проверка
Развернули ИИ на домашнем ПК с игровой видеокартой RTX 4060, без интернета, и задали 70 вопросов по базе знаний:
  1. две базы — восемь наших внутренних инструкций и 150 статей справки Битрикс24;
  2. три открытые модели на своём железе и облачный Claude Sonnet 5 для сравнения;
  3. из 70 вопросов 10 — без ответа в базе: проверяли, начнёт ли модель сочинять;
  4. все 280 ответов прочитал человек.
Результат
Лучшая модель на своём железе — 59 верных ответов из 60, облачный Claude — 60. Выдумок ноль у всех. Единственная ошибка была не в модели, а в поиске: нашёлся не тот абзац.
Вывод
ИИ отвечает строго по базе знаний и на своём сервере. Своя модель — это не экономия, а цена конфиденциальности: по деньгам облако выигрывает, пока вопросов не десятки тысяч в месяц.

Что предлагаем: такой же замер на вашей базе знаний до покупки сервера — отчёт с цифрами, где модель ошибается и какой сервер нужен.

Нейросеть может отвечать клиентам и сотрудникам по вашей базе знаний: брать ответ только из ваших инструкций и регламентов, говорить «в базе этого нет» вместо выдумки и работать на вашем сервере, не отправляя ни строчки в облако.

Мы проверили, насколько это надёжно, на самом скромном железе — домашнем компьютере с игровой видеокартой, без интернета. Задали 70 вопросов по базе знаний, из них 10 — таких, ответа на которые в базе нет. На остальные 60 — 59 верных ответов, на 10 «пустых» — ни одной выдумки. Облачный Claude на тех же вопросах ответил верно на все 60.

59 из 60

верных ответов по базе знаний — на домашнем ПК, без интернета

0 из 10

выдумок там, где ответа в базе нет

60 из 60

у облачного Claude Sonnet 5 для сравнения

Домашний ПК здесь — не тема, а нижняя планка: если ИИ держит качество на нём, на сервере компании удержит тем более. Ниже — с чем пришёл клиент, как устроен такой ИИ, как мы проверяли и где подвох.

В конце статьи можно скачать полный отчёт по замеру в PDF: методика, все цифры и ответы моделей на одни и те же вопросы.

С чем пришёл клиент

Компания с собственной службой поддержки хотела разгрузить сотрудников. Есть база знаний: инструкции, ответы на частые вопросы, регламенты. Задача — чтобы на типовые вопросы отвечал ИИ, а люди занимались сложными случаями. С одним условием: ничего не должно уходить в облако — ни вопросы клиентов, ни инструкции компании.

Обычный путь — подключить облачную модель: Claude, GigaChat, YandexGPT. Это дёшево и работает хорошо. Но у этого клиента служба безопасности против: в вопросах клиентов бывают персональные данные, а внутренние инструкции не должны покидать компанию.

Значит, модель должна работать на сервере компании. И сразу появляются вопросы:

  • какой сервер для этого нужен и сколько он стоит;
  • насколько хуже будут ответы по сравнению с облаком;
  • не начнёт ли модель уверенно сочинять.

До этого проекта мы отвечали на такие вопросы по ощущениям. Теперь отвечаем цифрами: собрали стенд, прогнали 70 вопросов через четыре модели и прочитали все 280 ответов.

Как нейросеть отвечает по базе знаний

Частое заблуждение: «чтобы бот знал базу, её нужно целиком отправлять модели с каждым вопросом». Это не так — и в облачном варианте тоже.

Работает связка из двух частей: поиск и модель.

Поиск находит в базе 3–6 абзацев, подходящих к вопросу. Модель получает только их и вопрос — и пересказывает найденное человеческим языком.

По шагам:

1
Один раз при загрузке базы

Статьи режутся на фрагменты по абзацу-два. Для каждого считается «отпечаток смысла» — набор чисел. Всё это хранится на сервере компании.

2
На каждый вопрос

Считается отпечаток вопроса, из базы достаются ближайшие по смыслу фрагменты. Это примерно полторы страницы текста, а не вся база.

3
Модель отвечает

Ответ строится только по найденным фрагментам, со ссылкой на статью, из которой он взят.

4
Если поиск ничего не нашёл

Бот не отвечает сам, а передаёт вопрос сотруднику.

Где оказываются данные

Модель на своём сервереОблачная модель
Нужен ли интернетНет: только один раз, чтобы скачать модельДа, на каждый вопрос
Вопрос клиентаОстаётся в компанииУходит поставщику ИИ
База знанийОстаётся в компанииЦеликом — нет, но найденные абзацы уходят с каждым вопросом
Что нужноСервер с видеокартойОбычный сервер — для бота и поиска — плюс оплата поставщику за вопросы
Если поставщик изменит правилаНичего не меняетсяМожет вырасти цена, пропасть модель или доступ из страны

Как мы проверяли

Железо — домашний компьютер. Обычный ПК с игровой видеокартой RTX 4060 на 8 ГБ, не сервер. Выбрали его намеренно: нам нужна была нижняя планка. Если ИИ справляется на домашнем железе, на сервере он справится точно.

Интернет ему не нужен. Модель скачивается один раз, дальше работает целиком на самом компьютере: вопрос, поиск по базе и ответ не выходят за его пределы. Отключите интернет — ИИ продолжит отвечать всем, кто работает с ним внутри вашей сети.

Модели. Три открытые, которые помещаются на эту видеокарту, и одна облачная для сравнения:

МодельРазработчикРазмерОсобенность
Qwen 3.5, 9 млрд параметровAlibaba6,6 ГБЦеликом на видеокарте, самая быстрая
Gemma 4, 12 млрдGoogle7,2 ГБСжата с учётом будущего сжатия, теряет меньше качества
Gemma 4, 26 млрдGoogle18 ГБ«Смесь экспертов»: на каждом шаге работает малая часть модели, поэтому помещается частично на видеокарту, частично в память
Claude Sonnet 5AnthropicоблакоТочка отсчёта

Две базы знаний:

  • наша внутренняя — 8 инструкций для сотрудников: доступ к рабочим сервисам, регламент работы с кодом портала, описания наших сервисов;
  • 150 публичных статей справки Битрикс24 — телефония, открытые линии, CRM, коробочная версия. Большая и разнородная база, ближе к реальному хэлпдеску.

Вопросы. По 35 на каждую базу, сформулированные так, как спросил бы живой человек. 30 — с ответом в статьях. 5 — таких, ответа на которые в базе нет. Эти пять важнее остальных: они показывают, начнёт ли модель сочинять.

Проверка. Все модели получали одни и те же найденные фрагменты и одну инструкцию. Каждый из 280 ответов прочитан человеком — автоматическая проверка по ключевым словам ошибается в обе стороны.

Что получилось

МодельВерно из 60Выдумок из 10Время ответа
Qwen 3.5, 9 млрд5501,5 с
Gemma 4, 12 млрд5704,3 с
Gemma 4, 26 млрд5905 с
Claude Sonnet 56002 с
Разрыв между своим железом и облаком — один вопрос из шестидесяти.

И тот случился не из-за модели: поиск нашёл нужную статью, но не тот абзац.

Три вещи, которых мы не ожидали

Формулировка инструкции важнее размера модели. Сначала мы написали строгое «отвечай только по фрагментам, ничего не додумывай». Модели стали перестраховываться: на вопросы вида «можно ли…» до четырёх из тридцати раз отвечали «не знаю», хотя ответ был перед глазами. Одна правка — «если ответ следует из текста, скажи да или нет и поясни» — убрала почти все такие отказы и не добавила ни одной выдумки.

Все оставшиеся ошибки — от поиска, а не от модели. На вопрос «нужно ли платить за SIP-коннектор, если нужны только входящие звонки» ошиблись все три локальные модели. Правильный ответ в статье есть, но нужный абзац не попал в подборку. Локальные модели отказались отвечать или ответили не о том. Облачная честно написала, что прямого ответа в найденном тексте нет, и вывела его из того, что было. Вывод для практики: улучшать нужно прежде всего поиск.

Самая маленькая модель неустойчива на точных строках. В перечне адресов, с которых приходит письмо для восстановления пароля, она в одном прогоне подменила домен, в другом — написала верно. Такая ошибка опаснее отказа: она выглядит уверенно. Для поддержки мы бы её не брали.

Как звучат ответы

Цифры не показывают разницу в тоне. Вот один вопрос и ответы трёх моделей (сокращённо):

Вопрос: «Клиент пишет то во ВКонтакте, то в Telegram, и в CRM появляются две карточки. Как собрать всё в одну?»

  • Gemma 4, 12 млрд: можно с помощью чат-трекера — он определяет клиента по контактам и собирает переписку в одну карточку.
  • Gemma 4, 26 млрд: то же, плюс точный путь по меню: где включить чат-трекер и какие две галочки поставить.
  • Claude Sonnet 5: то же, плюс что делать с уже созданными дублями.

Все три ответа верны. Но для первой линии поддержки последний довесок экономит клиенту второе обращение. Именно в таких «продолжениях» облачная модель пока сильнее.

Сколько стоит корпоративная нейросеть на своём сервере

Сервер для самого бота, базы и поиска нужен в обоих вариантах. Это обычный сервер без видеокарты — аренда от нескольких тысяч рублей в месяц.

Дальше варианты расходятся:

Своя модельОблачная модель
ДоплатаСервер с видеокартой: аренда 30–50 тыс. ₽ в месяц или покупка 450–700 тыс. ₽Оплата за вопросы: порядка 0,3–0,4 ₽ за вопрос
Тысяча вопросов в месяцТе же 30–50 тыс. ₽Несколько сотен рублей
ОбслуживаниеВаше или наше: обновления, сбоиПоставщика
Своя модель — это не экономия, а цена конфиденциальности и независимости.

По деньгам облако выигрывает, пока вопросов не десятки тысяч в месяц.

Чего этот тест не показывает

Честно о границах:

  • Крупные открытые модели мы не проверяли. На видеокарту 24–32 ГБ помещаются модели на 27–31 млрд параметров, заметно сильнее наших. Вполне возможно, что на нормальном сервере разрыв с облаком исчезнет. Это следующий замер.
  • Базы были аккуратными. В реальном хэлпдеске бывают устаревшие статьи и два разных ответа на один вопрос. Там результат будет ниже у всех моделей, включая облачные.
  • Вопросы составляли мы. Живые клиенты пишут путанее, с опечатками и сразу о двух вещах.
  • Одна задача. Мы проверяли ответы по базе знаний. На свободном диалоге, переговорах, сложных рассуждениях разрыв между небольшой локальной моделью и облачной будет заметнее.

Когда бизнесу нужна нейросеть без интернета

Главное, что показал замер: ИИ умеет отвечать строго по базе знаний и не сочинять — и в облаке, и на своём железе. Разница между вариантами не в качестве ответов, а в том, где находятся ваши данные и кто обслуживает сервер.

Модель на своём сервере стоит рассматривать, если:

  • данные клиентов или внутренние документы нельзя передавать внешним сервисам — по требованию службы безопасности, закона или договора;
  • нужна независимость от поставщика ИИ, его цен и доступности из страны;
  • вопросов много — десятки тысяч в месяц;
  • есть кому обслуживать сервер — или вы готовы отдать это подрядчику.

Если ни одно из этого не про вас — начните с облачной модели. Принцип тот же: ответы только по вашей базе, без выдумок. Это быстрее и дешевле, а перейти на свою модель потом можно без переделки бота: меняется только адрес, куда он отправляет запросы.

Если у вас похожая задача

Мы проведём такой же замер на вашей базе знаний, до покупки сервера:

1
Ваша база и вопросы

Берём вашу базу — или её часть — и 30–50 реальных вопросов ваших клиентов;

2
Прогон через модели

Прогоняем их через 2–3 подходящие модели и облачную для сравнения;

3
Отчёт с цифрами

Отдаём отчёт: сколько ответов верных, где модель ошибается, какой сервер нужен и сколько он будет стоить.

По итогам вы увидите на своих же вопросах, как ИИ отвечает по вашей базе и где ошибается, — и решите, нужна ли своя модель, на фактах, а не на обещаниях.

Полный отчёт по этому замеру

Методика, все цифры и ответы моделей на одни и те же вопросы — 12 страниц.

Скачать полный отчёт в PDF

Проверим, справится ли своя модель с вашей базой

Расскажите, какая у вас база знаний и какие вопросы приходят в поддержку. Предложим, как провести такой же замер на ваших данных.

Обсудить замер

Теги:
ИИ, который отвечает только по вашей базе знаний: проверили на домашнем ПК — 59 верных из 60
17 сентября 2026|Евгений Буземский
Нейросеть, которая отвечает только по базе знаний компании и не отправляет данные в облако. Проверили на домашнем компьютере: 59 верных ответов из 60 и ни одной выдумки.
Как мы перевели управленческий учёт из Excel в свой сервис
1 сентября 2026|Евгений Буземский
Свод таблицы — полдня, зарплата — час трижды в месяц, а картина всё равно вчерашняя. Как мы перевели собственный управленческий учёт из Excel в свой сервис.
Что подготовить до интеграции Битрикс24
28 августа 2026|Евгений Буземский
Открытые линии, платные тарифы, чужие сервисы и человек с телефоном под рукой. Разбираем по каналам, что подготовить заранее, чтобы подключение уложилось в час.
Почему бесплатная поддержка по Битрикс24 больше не работает
26 февраля 2026|Евгений Буземский
15 октября 2025 года 1С-Битрикс назвал бесплатные услуги в обмен на покупку лицензий неэтичной практикой, а следом вдвое сократил вознаграждение партнёрам. Рассказываем, что теперь можно, чего нельзя и что вы можете сделать сами.
Переход с amoCRM на Битрикс24: чего ждать на самом деле
12 сентября 2024|Евгений Буземский
Перенести всё из amoCRM действительно можно, но не нажатием кнопки. Разбираем три способа переноса, реальные сроки, ограничения готового приложения и наши собственные ошибки.