- OPUS0%
- HIGHER0%
- GPT0%
Insightful Beating AI News: Perplexity провела бенчмаркинг GPT-6 Astra с помощью своего собственного агента WANDR, получив результат 0,682 — это самый высокий показатель среди всех протестированных на данный момент моделей. Средняя стоимость выполнения одной задачи составляет $11,98. По сравнению с Claude Fable 5.1 модель набрала на 13,5% больше баллов при стоимости на 6,1% ниже; по сравнению с Opus 5 ее результат оказался на 27% выше при увеличении стоимости всего на 3,3%.
WANDR специализируется на тестировании задач «широкого и глубокого» исследования. Он включает в себя 500 реальных исследовательских задач, в которых агенту требуется не просто найти несколько ответов, а выявить все объекты, соответствующие критериям, затем исследовать каждый из них, подтвердить их подлинность и предоставить проверяемый источник для каждого результата. Типичные задачи включают анализ конкурентов, комплексную проверку (due diligence), поиск литературы, анализ рынка и поиск талантов.
Ранее первое место занимала Fable 5.1 с результатом 0,601 и стоимостью $12,76 за задачу, в то время как Opus 5 набрала 0,537 при стоимости $11,60. На этот раз Astra значительно повысила планку, и это было достигнуто не просто за счет увеличения затрат.
Отказ от ответственности: текущее содержание основано на мнениях третьих лиц или напрямую переведено искусственным интеллектом из сторонних источников. Мы не гарантируем его подлинность, точность или оригинальность, а также эта информация не содержит инвестиционных рекомендаций со стороны CoinEx. Криптоактивы подвержены сильной волатильности, поэтому всегда учитывайте потенциальные риски.
- МонетыЦенаИзм. за 24 ч.