Skip to content

🔄 Auto-sync: from Discussion #1502 every hour.

Обратная связь от разработчика: почему текущий модельный ряд Gonka пока не проходит production bar

Автор: @bitcompool · Категория: 💡 Proposals · Создано: 2026-07-26 17:26 UTC · Обновлено: 2026-07-26 17:26 UTC


📝 Описание

Обратная связь от разработчика: почему текущий модельный ряд Gonka пока не проходит production bar

Всем привет! Я разработчик AI-продукта Prompt Perfect. Сейчас я выбираю API-провайдера для двух production-функций: улучшения пользовательских промптов и анализа их качества.

Мне действительно хочется поддержать Gonka, использовать децентрализованную инфраструктуру и направлять в сеть реальный API-трафик. Поэтому я провёл полноценное сравнительное исследование GPT-5.4 Mini, DeepSeek V4 Flash/Pro, Mistral Small и Gonka24 с Kimi K2.6.

Тестирование включало фиксированные наборы из 32 кейсов для Prompt и 32 кейсов для Advisor, автоматические проверки контракта, отдельный holdout и слепую ручную оценку качества.

Результаты для Prompt

Модель | Автоматическая проверка | Слепая оценка | Стоимость 32 запросов | Медианная задержка -- | -- | -- | -- | -- GPT-5.4 Mini | 32/32 | 12/12 | $0.026675 | 1.20 с DeepSeek V4 Flash | 30/32 | 8/12 | $0.000890 | 1.10 с Mistral Small | 29/32 | 6/12, ещё 2 не оценены | $0.003115 | 0.76 с Gonka24 / Kimi K2.6 | 29/32 | 7/12 | $0.015254 | 30.77 с

Полные результаты показывают, что GPT остаётся единственным вариантом, который одновременно даёт высокую формальную надёжность и хорошее реальное качество.

Особенно показателен результат Gonka Advisor. Формально Kimi получила 30/32, то есть сравнялась с GPT. Но в слепой оценке прошли только 2/12 ответов против 11/12 у GPT. Модель регулярно запрашивала необязательные детали, допускала ошибки с защищёнными значениями и нарушала границы контракта. Иными словами, JSON выглядел правильно, но пользовательское качество оставалось слабым.

Кроме того, Gonka оказалась приблизительно в 26 раз медленнее GPT для Prompt и в 16 раз медленнее для Advisor. При этом она лишь примерно в 1.7–2.4 раза дешевле GPT. На фоне DeepSeek Flash, который стоил примерно в 30 раз дешевле GPT на Prompt при практически такой же скорости, текущее предложение Gonka выглядит неконкурентоспособным.

У меня также вызывает вопрос выбор моделей для сети с такими высокими требованиями к оборудованию. В официальной документации для Kimi K2.6 указывается референсная конфигурация от двух ML Nodes, каждый примерно с 8×H200 или 8×B200 и 640 ГБ VRAM. Для MiniMax M2.7 указаны конфигурации уровня 4×A100/H100 или 2×H200/B200 и около 320 ГБ VRAM на ML Node. (Gonka)

При таком уровне оборудования логично ожидать, что сеть будет предоставлять действительно передовые и конкурентоспособные модели. Поэтому я не понимаю, почему основной каталог сейчас фактически строится вокруг Kimi K2.6 и MiniMax M2.7. MiniMax M2.7 я в этом конкретном исследовании не тестировал, поэтому не буду делать выводы о её качестве, но сам выбор и ширина модельного ряда вызывают вопросы. Gonka24 сейчас публично предлагает именно Kimi K2.6 и MiniMax M2.7. (gonka24.com)

Моя просьба к комьюнити и governance Gonka: рассмотрите возможность запуска более современных, быстрых и конкурентоспособных моделей. Например, даже DeepSeek V4 Flash, который тоже не прошёл мой строгий production bar, оказался намного дешевле, быстрее и немного сильнее Kimi в Prompt-задачах.

Пожалуйста, воспринимайте это сообщение не как нападение или критику ради критики. Это реальный опыт разработчика, который действительно хочет использовать Gonka API, поддерживать экосистему и направлять в неё production-трафик.

Но для этого модельный каталог должен соответствовать уровню оборудования, которое предоставляет сеть. Сейчас главное ограничение Gonka для моего продукта не API и не цена, а качество моделей и огромная задержка. Я искренне надеюсь, что проект начнёт запускать более современные и конкурентоспособные модели. Тогда у разработчиков появится реальная причина выбирать Gonka не только из идеологических соображений, но и по качеству продукта.

Обратная связь от разработчика: почему текущий модельный ряд Gonka пока не проходит production bar

Всем привет! Я разработчик AI-продукта Prompt Perfect. Сейчас я выбираю API-провайдера для двух production-функций: улучшения пользовательских промптов и анализа их качества.

Мне действительно хочется поддержать Gonka, использовать децентрализованную инфраструктуру и направлять в сеть реальный API-трафик. Поэтому я провёл полноценное сравнительное исследование GPT-5.4 Mini, DeepSeek V4 Flash/Pro, Mistral Small и Gonka24 с Kimi K2.6.

Тестирование включало фиксированные наборы из 32 кейсов для Prompt и 32 кейсов для Advisor, автоматические проверки контракта, отдельный holdout и слепую ручную оценку качества.

Результаты для Prompt

Модель Автоматическая проверка Слепая оценка Стоимость 32 запросов Медианная задержка
GPT-5.4 Mini 32/32 12/12 $0.026675 1.20 с
DeepSeek V4 Flash 30/32 8/12 $0.000890 1.10 с
Mistral Small 29/32 6/12, ещё 2 не оценены $0.003115 0.76 с
Gonka24 / Kimi K2.6 29/32 7/12 $0.015254 30.77 с

Результаты для Advisor

Модель Автоматическая проверка Слепая оценка Стоимость 32 запросов Медианная задержка
GPT-5.4 Mini 30/32 11/12 $0.045785 2.45 с
Mistral Small 28/32 6/12, ещё 2 не оценены $0.008469 1.34 с
DeepSeek V4 Flash 26/32 2/12 $0.002786 2.27 с
Gonka24 / Kimi K2.6 30/32 2/12 $0.019198 38.85 с

Полные результаты показывают, что GPT остаётся единственным вариантом, который одновременно даёт высокую формальную надёжность и хорошее реальное качество.

Особенно показателен результат Gonka Advisor. Формально Kimi получила 30/32, то есть сравнялась с GPT. Но в слепой оценке прошли только 2/12 ответов против 11/12 у GPT. Модель регулярно запрашивала необязательные детали, допускала ошибки с защищёнными значениями и нарушала границы контракта. Иными словами, JSON выглядел правильно, но пользовательское качество оставалось слабым.

Кроме того, Gonka оказалась приблизительно в 26 раз медленнее GPT для Prompt и в 16 раз медленнее для Advisor. При этом она лишь примерно в 1.7–2.4 раза дешевле GPT. На фоне DeepSeek Flash, который стоил примерно в 30 раз дешевле GPT на Prompt при практически такой же скорости, текущее предложение Gonka выглядит неконкурентоспособным.

У меня также вызывает вопрос выбор моделей для сети с такими высокими требованиями к оборудованию. В официальной документации для Kimi K2.6 указывается референсная конфигурация от двух ML Nodes, каждый примерно с 8×H200 или 8×B200 и 640 ГБ VRAM. Для MiniMax M2.7 указаны конфигурации уровня 4×A100/H100 или 2×H200/B200 и около 320 ГБ VRAM на ML Node. (Gonka)

При таком уровне оборудования логично ожидать, что сеть будет предоставлять действительно передовые и конкурентоспособные модели. Поэтому я не понимаю, почему основной каталог сейчас фактически строится вокруг Kimi K2.6 и MiniMax M2.7. MiniMax M2.7 я в этом конкретном исследовании не тестировал, поэтому не буду делать выводы о её качестве, но сам выбор и ширина модельного ряда вызывают вопросы. Gonka24 сейчас публично предлагает именно Kimi K2.6 и MiniMax M2.7. (gonka24.com)

Моя просьба к комьюнити и governance Gonka: рассмотрите возможность запуска более современных, быстрых и конкурентоспособных моделей. Например, даже DeepSeek V4 Flash, который тоже не прошёл мой строгий production bar, оказался намного дешевле, быстрее и немного сильнее Kimi в Prompt-задачах.

Пожалуйста, воспринимайте это сообщение не как нападение или критику ради критики. Это реальный опыт разработчика, который действительно хочет использовать Gonka API, поддерживать экосистему и направлять в неё production-трафик.

Но для этого модельный каталог должен соответствовать уровню оборудования, которое предоставляет сеть. Сейчас главное ограничение Gonka для моего продукта не API и не цена, а качество моделей и огромная задержка. Я искренне надеюсь, что проект начнёт запускать более современные и конкурентоспособные модели. Тогда у разработчиков появится реальная причина выбирать Gonka не только из идеологических соображений, но и по качеству продукта.