TL;DR 対話システムを「エンドユーザーが使えるか」の観点で受け入れテストするとき、シナリオ生成も評価も LLM に任せたくなります。 しかし、LLM によるシミュレーション/評価には、生成発話のクオリティ、LLM as a Judge の限界、LLMベースシミュレーターの持つ譲歩問題など大きく5つの落とし穴が存在します。 合成...
アンソロピック、評価額141兆円でOpenAI超えへ──人類史上最大の資金調達ラウンド(Forbes JAPAN) - Yahoo!ニュース
Amazon Bedrock で利用可能になった GPT-6 Sol/Luna を試してみた
GPT-6 Sol、Luna 正式登場!OpenAI 價格砍半應戰 Claude Opus 5.5,免費用戶也能搶先用(2026 完整解析)
OpenAI「GPT-6 Sol/Luna」発表 料金半額、ただし普通のChatではまだ使えず
「The Goal」を読んだ:いくら量産しても、ボトルネックを守らなきゃ意味がない
まだコメントはありません。
コメントを送信しました。