Передача корпоративных данных — проводок 1С, клиентских баз, технической документации и исходных кодов — в публичные облачные API (OpenAI ChatGPT, Google Gemini или Anthropic Claude) вызывает обоснованную тревогу у службы информационной безопасности (CISO) и юристов (риски утечки коммерческой тайны и нарушения 152-ФЗ). С выходом открытых моделей мирового уровня (DeepSeek-V3/R1, LLaMA 3.1/3.3, Qwen 2.5) бизнес получил возможность развернуть полноценный искусственный интеллект на собственном железе внутри изолированного периметра компании. Разбираем требования к серверному оборудованию, математику квантования и пошаговый запуск через Ollama и промышленный движок vLLM.

Читать далее

 В характеристиках современных нейросетей разработчики гордятся огромными цифрами: «Контекстное окно 128 000 токенов!», «1 миллион токенов в Gemini!», «2 миллиона токенов в Claude 3.5 Sonnet!». Пользователю кажется, что теперь в модель можно загрузить целиком документацию по ERP, 500-страничный регламент компании или исходный код всего монолита — и нейросеть будет помнить каждую строчку. Однако на практике длинные диалоги начинают сыпаться: модель «забывает» вводные условия, игнорирует критические пункты ТЗ в середине текста и начинает уверенно галлюцинировать. Разбираем, что представляет собой контекстное окно с точки зрения архитектуры Transformer, почему возникает феномен «Lost in the Middle» и почему архитектура RAG по-прежнему незаменима.

Читать далее

 Когда компания начинает внедрять искусственный интеллект — подключать ChatGPT к корпоративному Service Desk, настраивать интеллектуального помощника в 1С или анализировать техническую документацию через API — в счетах от провайдеров (OpenAI, Anthropic, OpenRouter) появляется загадочная единица тарификации: токены (Tokens). Для многих руководителей и разработчиков становится неприятным сюрпризом, что абсолютно одинаковый по смыслу запрос на русском языке стоит в 2–3 раза дороже, чем на английском, а диалог из пяти реплик «сжигает» в десять раз больше лимитов, чем первое сообщение. Разбираем фундаментальную физику токенизации, математику расхода и способы сократить расходы на API в 2–3 раза.

Читать далее