SoluBench — бенчмарк для проверки способности больших языковых моделей решать практические задачи, связанные с растворимостью органических соединений
Ученые Института общей и неорганической химии им. Н.С. Курнакова РАН разработали SoluBench — бенчмарк для проверки способности больших языковых моделей решать практические задачи, связанные с растворимостью органических соединений. SoluBench включает 9806 вопросов четырех типов, составленных на основе экспериментальных данных BigSolDB 2.0 и MixtureSolDB. Моделям предлагалось определить, в каком из двух растворителей вещество растворяется лучше; выбрать лучший растворитель из нескольких; предсказать, как добавление второго растворителя повлияет на растворимость; а также сравнить растворимость двух разных соединений в одном растворителе. При этом вопросы были составлены так, чтобы снизить вероятность простого воспроизведения запомненных данных. С помощью SoluBench были протестированы более 20 открытых и проприетарных языковых моделей.
Результаты работы опубликованы в «Journal of Chemical Information and Modeling» и позволяют сравнивать новые поколения языковых моделей, а также отслеживать, насколько улучшается их способность работать с химическими задачами.
Пресс-релиз опубликован на сайтах Поиск, Индикатор, Mendeleev.info, Химическое информационное агентство, , Микроблог Минобрнауки России, а также в разделе «Пресс-релизы» сайта ИОНХ РАН.
Источник: Пресс –служба ИОНХ РАН
