注: 以下の翻訳の正確性は検証されていません。AIPを利用して英語版の原文から機械的に翻訳されたものです。
複数のパラメーター値のさまざまな組み合わせを体系的にテストすることは、LLM を使用する関数を評価し、最適化するうえで重要です。コストを最小限に抑えながら最も優れた性能を発揮するモデルや、最良の結果を生成するプロンプトを特定したい場合があります。
実験を使うと、テスト対象の関数の性能とコストを最適化できます。AIP Evals でテストするパラメーター値を定義すると、グリッドサーチを使い、それぞれ個別の評価スイートの実行ですべての組み合わせをテストできます。その後、実験結果を分析して、最も優れた性能を発揮したパラメーター値を特定できます。

この例では、記事を要約する Logic 関数を使い、どのモデルとプロンプトの組み合わせが最も優れた性能を発揮するかを特定します。実験の対象は Logic 関数に限定されません。
まず、モデルとプロンプトの両方をパラメーター化する必要があります。これは、両方を入力として追加し、Logic 関数内で使用することを意味します。この例では、プロンプトの言い回しを少しずつ変えて実験し、どれが最良の要約を生成するかを確認します。extraPromptContext を使って、元のプロンプトに追加のコンテキストを加えます。

モデルについては、変数を必須から任意に変更することを推奨します。また、各 LLM を使用ブロックでモデル変数を使用するように設定する必要があります。これを行うには、UseLLM ブロックのモデルセレクターを選択し、登録済みタブでモデル変数に移動します。

Logic 関数をパラメーター化したら、実行設定ダイアログのトグルをオンにして実験を有効にします。

実験に名前を付けると、後から結果を簡単に見つけられます。次に、実験パラメーターを追加します。これらは、異なる値でテストするパラメーターです。各パラメーターには、実験で探索する値の選択肢を複数指定できます。これにより、評価スイートのテストごとに設定されていた既存の値が上書きされます。

このセクションの下部では、評価が何回実行されるかを確認できます。また、プレビューを開いて、実験でグリッドサーチを使ってテストするパラメーターのすべての組み合わせを表示できます。

実験を実行するには、ダイアログを閉じて実験を実行を選択します。
実験が完了したら、サイドパネルの下部にある結果を選択します。AIP Evals アプリケーションに移動し、結果を分析できます。
AIP Logic の直近の実行カードには、一連の評価のうち最後の実行結果のみが表示されます(この例では、6回中6回目の実行)。結果の全体を表示するには、AIP Evals からアクセスすることを推奨します。
AIP Evals では、単独の評価実行と実験の実行を結果 > 実行タブで表示できます。AIP Logic の結果(上図)から移動した場合、実行テーブルは、直前に実行した実験に自動的に絞り込まれます。

グループ化するでは、テーブルの列を選択してその列で実行をグループ化し、グループごとに集計されたメトリクスを表示できます。たとえば、モデルでグループ化すると、すべてのメトリクスについてモデルごとの性能を簡単に比較できます。

テーブルヘッダーの右端にある列アイコンを使って、テーブルに表示する列を制御します。
実行テーブルから比較する実行を最大4件選択し、テストケースを表示またはテストケースサブタブを選択して、結果をさらに詳しく確認できます。

テストケースの比較は、実行間でテストケースの出力やメトリクスがどのように異なるか、また、異なるパラメーター間で性能とコストにどのようなトレードオフが生じる可能性があるかを調べるデバッグに役立ちます。選択した実行にホバーすると、使用された具体的なパラメーター値を確認できます。テーブル内でも確認できます。

関連するテストケースや反復、またはその両方をまとめてグループ化することで、行の表示方法を変更できます。
列セレクターを使うと、目的に合わせて列の表示と非表示を切り替えられます。たとえば、メトリクスを高密度に表示したい場合は、入力と関数の出力を含む列を非表示にできます。

行にホバーすると、開くが表示されます。これを使ってさらに詳しく確認し、テストケースの実行を理解してデバッグできます。

これによりドロワーが開き、関数の実行とスイート内の評価ツールの両方について、入力、出力、ログが表示されます。
比較表示は、テーブルのグループ化方法によって異なります。比較対象の実行が別々の行に表示されている場合、デバッガーには選択した行の実行のみが表示されます。
