Технологические гиганты столкнулись с неконтролируемым ростом расходов на использование искусственного интеллекта. Чтобы сократить бюджеты, инженеры таких компаний, как Nvidia и GitHub, начали применять радикальный метод оптимизации — принудительное упрощение ответов языковых моделей до уровня лаконичности «пещерного человека».
Для этих целей используется открытый плагин caveman, разработанный программистом Юлиусом Брюсси. Утилита позволяет инструментам вроде Codex и Claude Code исключать из ответов вежливые обороты и лишние пояснения, сохраняя при этом критически важные данные: программный код, числовые значения, команды и гиперссылки. Согласно результатам тестов, такая стратегия позволяет сократить объем потребляемых токенов на 65–75 %. В ряде случаев экономия в одном сеансе работы с Claude Code достигала 5800 токенов. Проектом уже заинтересовались эксперты мирового уровня, включая директора по инженерии OpenAI Шейна Суини, который способствовал интеграции плагина в Codex.
Необходимость в подобных мерах продиктована финансовым давлением. Например, Uber потратил годовой лимит на использование ИИ всего за четыре месяца, а GitHub перешел на оплату за каждый отдельный токен. Из-за этого крупные корпорации, включая Walmart, вводят жесткие ограничения на доступ к нейросетям. Французская компания Legrand уже официально рекомендовала своим сотрудникам использовать caveman для соблюдения бюджетной дисциплины.
На данный момент разработчики нейросетей из Google, OpenAI и Anthropic не представили ответной реакции на намеренное ограничение объема трафика пользователями. Существует вероятность того, что в будущем владельцы моделей изменят тарифные планы или внедрят штатный режим кратких ответов, чтобы нивелировать потери прибыли от использования подобных утилит.



