- GPT0%
- OPUS0%
- GLM0%
Dynamic Beating AI News Flash: Terminal-Bench выпустил версию 4.0, в которой была произведена перекалибровка времени, CPU и памяти при выполнении задач агентом, а также исправлено 19 задач. Было удалено 8 задач из-за насыщения, отказов, открытого раскрытия решений или проблем с качеством. Максимальное время выполнения для всех задач было стандартизировано до 8 часов, главным образом для снижения влияния тайм-аутов и проблем с окружением на производительность.
В последнем рейтинге Opus 5 + Claude Code занимает первое место с 51,8%, за ним следует Fable 5 с 44,5%. GLM-5.3 + Claude Code набрал 41,8%, заняв третье место и обойдя GPT-5.6 Sol + Codex с 37,3%. Среди первой тройки GLM-5.3 — единственная модель не от Anthropic.
В Terminal-Bench 3.0 модель GLM-5.3 занимала четвертое место с 32,4%, уступая GPT-5.6 Sol с 34,6%; к версии 4.0 GLM-5.3 поднялась на третье место, опередив Sol на 4,5 процентных пункта.
Отказ от ответственности: текущее содержание основано на мнениях третьих лиц или напрямую переведено искусственным интеллектом из сторонних источников. Мы не гарантируем его подлинность, точность или оригинальность, а также эта информация не содержит инвестиционных рекомендаций со стороны CoinEx. Криптоактивы подвержены сильной волатильности, поэтому всегда учитывайте потенциальные риски.
- МонетыЦенаИзм. за 24 ч.