複数のLLM を同じ基準で評価して比べるアプリ
タスクごとのルーブリックを使って、複数の LLM の出力を別の LLM に評価させ、結果を並べて比較できるデスクトップアプリです。 バックエンドは Python / FastAPI、フロントエンドは React です。複数のプロバイダを差し替えられる構成にして、評価結果の保存とコスト推定を含めています。GitHub Actions で Linux 用 AppImage と Windows 用バンドルをビルドして配布しています。
Business social network with 4M professionals
東洋大学 / 経営学部 第二部経営学科
第二部(夜間部)所属のため、平日の昼がまるごと空いています。 平日は 9:00 ~ 17:00で週3~4日、土曜日に9:00~19:00で稼働可能です。
自分の作ったものが、実際に誰かの毎日のひと手間を減らしている状態を見たいと思っています。 そのためにも、個人で触れることのできる範囲を超えて、チームだからこそできることを経験したいと考えています。
タスクごとのルーブリックを使って、複数の LLM の出力を別の LLM に評価させ、結果を並べて比較できるデスクトップアプリです。 バックエンドは Python / FastAPI、フロントエンドは React です。複数のプロバイダを差し替えられる構成にして、評価結果の保存とコスト推定を含めています。GitHub Actions で Linux 用 AppImage と Windows 用バンドルをビルドして配布しています。