何が発表された?
Amazon Bedrock経由で利用できるOpenAIモデルについて、AWS Machine Learning Blogはトークン単価ベースの評価の限界を指摘しています。実際の本番ワークロードではアウトプットの品質や正確性も含めたコスト効率が重要であり、その測定を支援するオープンソースのベンチマークツールが紹介されています。
メモ
- トークン単価だけでなく、得られた正答当たりのコスト(cost per correct answer)でモデル性能を評価できるベンチマーク方法論が提案されています。
- 本番運用ではモデルの精度や出力品質がコスト全体に大きく影響するため、単純な価格比較では最適な選択ができない可能性が指摘されています。
- 提供されるベンチマークツールの詳細な使用方法と、各モデルの具体的な性能差については公式ブログ記事で確認することをお勧めします。
公式情報
公式タイトル: Beyond the price per token: Choosing the right OpenAI model on Amazon Bedrock for your workload
公式ソース: AWS Machine Learning Blog