🔄 Auto-sync: from Discussion #1502 every hour.
Обратная связь от разработчика: почему текущий модельный ряд Gonka пока не проходит production bar
Автор: @bitcompool · Категория: Proposals · Создано: 2026-07-26 17:26 UTC · Обновлено: 2026-07-26 17:26 UTC
📝 Описание
Обратная связь от разработчика: почему текущий модельный ряд Gonka пока не проходит production bar
Всем привет! Я разработчик AI-продукта Prompt Perfect. Сейчас я выбираю API-провайдера для двух production-функций: улучшения пользовательских промптов и анализа их качества.
Мне действительно хочется поддержать Gonka, использовать децентрализованную инфраструктуру и направлять в сеть реальный API-трафик. Поэтому я провёл полноценное сравнительное исследование GPT-5.4 Mini, DeepSeek V4 Flash/Pro, Mistral Small и Gonka24 с Kimi K2.6.
Тестирование включало фиксированные наборы из 32 кейсов для Prompt и 32 кейсов для Advisor, автоматические проверки контракта, отдельный holdout и слепую ручную оценку качества.
Результаты для Prompt
Модель | Автоматическая проверка | Слепая оценка | Стоимость 32 запросов | Медианная задержка -- | -- | -- | -- | -- GPT-5.4 Mini | 32/32 | 12/12 | $0.026675 | 1.20 с DeepSeek V4 Flash | 30/32 | 8/12 | $0.000890 | 1.10 с Mistral Small | 29/32 | 6/12, ещё 2 не оценены | $0.003115 | 0.76 с Gonka24 / Kimi K2.6 | 29/32 | 7/12 | $0.015254 | 30.77 сПолные результаты показывают, что GPT остаётся единственным вариантом, который одновременно даёт высокую формальную надёжность и хорошее реальное качество.
Особенно показателен результат Gonka Advisor. Формально Kimi получила 30/32, то есть сравнялась с GPT. Но в слепой оценке прошли только 2/12 ответов против 11/12 у GPT. Модель регулярно запрашивала необязательные детали, допускала ошибки с защищёнными значениями и нарушала границы контракта. Иными словами, JSON выглядел правильно, но пользовательское качество оставалось слабым.
Кроме того, Gonka оказалась приблизительно в 26 раз медленнее GPT для Prompt и в 16 раз медленнее для Advisor. При этом она лишь примерно в 1.7–2.4 раза дешевле GPT. На фоне DeepSeek Flash, который стоил примерно в 30 раз дешевле GPT на Prompt при практически такой же скорости, текущее предложение Gonka выглядит неконкурентоспособным.
У меня также вызывает вопрос выбор моделей для сети с такими высокими требованиями к оборудованию. В официальной документации для Kimi K2.6 указывается референсная конфигурация от двух ML Nodes, каждый примерно с 8×H200 или 8×B200 и 640 ГБ VRAM. Для MiniMax M2.7 указаны конфигурации уровня 4×A100/H100 или 2×H200/B200 и около 320 ГБ VRAM на ML Node. (Gonka)
При таком уровне оборудования логично ожидать, что сеть будет предоставлять действительно передовые и конкурентоспособные модели. Поэтому я не понимаю, почему основной каталог сейчас фактически строится вокруг Kimi K2.6 и MiniMax M2.7. MiniMax M2.7 я в этом конкретном исследовании не тестировал, поэтому не буду делать выводы о её качестве, но сам выбор и ширина модельного ряда вызывают вопросы. Gonka24 сейчас публично предлагает именно Kimi K2.6 и MiniMax M2.7. (gonka24.com)
Моя просьба к комьюнити и governance Gonka: рассмотрите возможность запуска более современных, быстрых и конкурентоспособных моделей. Например, даже DeepSeek V4 Flash, который тоже не прошёл мой строгий production bar, оказался намного дешевле, быстрее и немного сильнее Kimi в Prompt-задачах.
Пожалуйста, воспринимайте это сообщение не как нападение или критику ради критики. Это реальный опыт разработчика, который действительно хочет использовать Gonka API, поддерживать экосистему и направлять в неё production-трафик.
Но для этого модельный каталог должен соответствовать уровню оборудования, которое предоставляет сеть. Сейчас главное ограничение Gonka для моего продукта не API и не цена, а качество моделей и огромная задержка. Я искренне надеюсь, что проект начнёт запускать более современные и конкурентоспособные модели. Тогда у разработчиков появится реальная причина выбирать Gonka не только из идеологических соображений, но и по качеству продукта.
Обратная связь от разработчика: почему текущий модельный ряд Gonka пока не проходит production bar
Всем привет! Я разработчик AI-продукта Prompt Perfect. Сейчас я выбираю API-провайдера для двух production-функций: улучшения пользовательских промптов и анализа их качества.
Мне действительно хочется поддержать Gonka, использовать децентрализованную инфраструктуру и направлять в сеть реальный API-трафик. Поэтому я провёл полноценное сравнительное исследование GPT-5.4 Mini, DeepSeek V4 Flash/Pro, Mistral Small и Gonka24 с Kimi K2.6.
Тестирование включало фиксированные наборы из 32 кейсов для Prompt и 32 кейсов для Advisor, автоматические проверки контракта, отдельный holdout и слепую ручную оценку качества.
Результаты для Prompt
| Модель | Автоматическая проверка | Слепая оценка | Стоимость 32 запросов | Медианная задержка |
|---|---|---|---|---|
| GPT-5.4 Mini | 32/32 | 12/12 | $0.026675 | 1.20 с |
| DeepSeek V4 Flash | 30/32 | 8/12 | $0.000890 | 1.10 с |
| Mistral Small | 29/32 | 6/12, ещё 2 не оценены | $0.003115 | 0.76 с |
| Gonka24 / Kimi K2.6 | 29/32 | 7/12 | $0.015254 | 30.77 с |
Результаты для Advisor
| Модель | Автоматическая проверка | Слепая оценка | Стоимость 32 запросов | Медианная задержка |
|---|---|---|---|---|
| GPT-5.4 Mini | 30/32 | 11/12 | $0.045785 | 2.45 с |
| Mistral Small | 28/32 | 6/12, ещё 2 не оценены | $0.008469 | 1.34 с |
| DeepSeek V4 Flash | 26/32 | 2/12 | $0.002786 | 2.27 с |
| Gonka24 / Kimi K2.6 | 30/32 | 2/12 | $0.019198 | 38.85 с |
Полные результаты показывают, что GPT остаётся единственным вариантом, который одновременно даёт высокую формальную надёжность и хорошее реальное качество.
Особенно показателен результат Gonka Advisor. Формально Kimi получила 30/32, то есть сравнялась с GPT. Но в слепой оценке прошли только 2/12 ответов против 11/12 у GPT. Модель регулярно запрашивала необязательные детали, допускала ошибки с защищёнными значениями и нарушала границы контракта. Иными словами, JSON выглядел правильно, но пользовательское качество оставалось слабым.
Кроме того, Gonka оказалась приблизительно в 26 раз медленнее GPT для Prompt и в 16 раз медленнее для Advisor. При этом она лишь примерно в 1.7–2.4 раза дешевле GPT. На фоне DeepSeek Flash, который стоил примерно в 30 раз дешевле GPT на Prompt при практически такой же скорости, текущее предложение Gonka выглядит неконкурентоспособным.
У меня также вызывает вопрос выбор моделей для сети с такими высокими требованиями к оборудованию. В официальной документации для Kimi K2.6 указывается референсная конфигурация от двух ML Nodes, каждый примерно с 8×H200 или 8×B200 и 640 ГБ VRAM. Для MiniMax M2.7 указаны конфигурации уровня 4×A100/H100 или 2×H200/B200 и около 320 ГБ VRAM на ML Node. (Gonka)
При таком уровне оборудования логично ожидать, что сеть будет предоставлять действительно передовые и конкурентоспособные модели. Поэтому я не понимаю, почему основной каталог сейчас фактически строится вокруг Kimi K2.6 и MiniMax M2.7. MiniMax M2.7 я в этом конкретном исследовании не тестировал, поэтому не буду делать выводы о её качестве, но сам выбор и ширина модельного ряда вызывают вопросы. Gonka24 сейчас публично предлагает именно Kimi K2.6 и MiniMax M2.7. (gonka24.com)
Моя просьба к комьюнити и governance Gonka: рассмотрите возможность запуска более современных, быстрых и конкурентоспособных моделей. Например, даже DeepSeek V4 Flash, который тоже не прошёл мой строгий production bar, оказался намного дешевле, быстрее и немного сильнее Kimi в Prompt-задачах.
Пожалуйста, воспринимайте это сообщение не как нападение или критику ради критики. Это реальный опыт разработчика, который действительно хочет использовать Gonka API, поддерживать экосистему и направлять в неё production-трафик.
Но для этого модельный каталог должен соответствовать уровню оборудования, которое предоставляет сеть. Сейчас главное ограничение Gonka для моего продукта не API и не цена, а качество моделей и огромная задержка. Я искренне надеюсь, что проект начнёт запускать более современные и конкурентоспособные модели. Тогда у разработчиков появится реальная причина выбирать Gonka не только из идеологических соображений, но и по качеству продукта.