エントリーの編集
エントリーの編集は全ユーザーに共通の機能です。
必ずガイドラインを一読の上ご利用ください。
AI機能の品質評価を自動化する:機械採点と LLM-as-a-Judge の役割分担 - kickflow Tech Blog
記事へのコメント0件
- 注目コメント
- 新着コメント
このエントリーにコメントしてみましょう。
注目コメント算出アルゴリズムの一部にLINEヤフー株式会社の「建設的コメント順位付けモデルAPI」を使用しています
- バナー広告なし
- ミュート機能あり
- ダークモード搭載
関連記事
AI機能の品質評価を自動化する:機械採点と LLM-as-a-Judge の役割分担 - kickflow Tech Blog
シャチは群れで役割を分け、波を起こす係と仕留める係が連携して狩りをする こんにちは、kickflow QAチ... シャチは群れで役割を分け、波を起こす係と仕留める係が連携して狩りをする こんにちは、kickflow QAチームの川村です。 kickflowにはチケット要約や計算式生成、入力補助といったAI機能が増えてきました。 これらの品質をどう担保するかは、従来のテストとは別の難しさがあります。AI機能は同じ入力を与えても出力が毎回同じとは限らないため、同じ入力には同じ結果が返ることを前提に「期待値と一致するか」を1回だけ検証する従来の自動テストでは、揺れを含んだ品質を測れないのです。 そこでkickflowでは、AI機能を本番と同じ経路で実際に何度も呼び出し、その出力を採点して評価指標として記録する評価(eval)フレームワークを構築しました。 この記事では、その仕組みと、実際にAIを呼んで初めて見えてきたこと(テスト基盤の統合バグと、プロダクト本体の品質課題)、そして機械採点とLLM-as-a-

