Artificial Analysis, самая внимательно отслеживаемая независимая платформа оценки в секторе искусственного интеллекта, обновила свою систему баллов «Индекс интеллекта» (Intelligence Index) трижды менее чем за неделю. В версии v4.3, представленной 7 сентября, модель OpenAI «GPT-6 Astra» и модель Anthropic «Claude Fable 5.1» набрали по 53 балла, продемонстрировав равенство.
elchi сообщает, что представители Artificial Analysis заявили, что версии v4.1.1, v4.2 и v4.3 были выпущены в рамках ускоренного процесса, ведущего к более масштабному обновлению «v5». Они отметили, что из-за быстрых темпов прогресса в отрасли откладывать обновление было невозможно.
Что изменили три обновления за неделю?
В начале процесса обновления — когда «GPT-6 Astra» была представлена впервые — Astra набрала 61 балл в версии v4.1.1, а модель «Fable 5.1» имела 66 баллов.
Через четыре дня, в выпущенной версии v4.2, платформа добавила новые критерии оценки и одновременно исключила тест «GPQA Diamond», который уже достиг точки насыщения. На этом этапе разрыв сократился: «Fable 5.1» набрала 57 баллов, а Astra — 55 баллов.
Три дня спустя, в результате выпуска версии v4.3 и интеграции в систему тестов «Terminal-Bench» и «AutomationBench-AA», обе модели сравнялись с 53 баллами.
Şayəstə