週刊AIブリーフィング|モデルを比べる前に、評価・利用量・受け渡しを見る
2026年9月13日〜19日号|対象記録:9月13・14・16・17・19日
音声で会話するモデル、定型の判断を返すモデル、文書・スライド・デザインを一つの会話から扱う仕組み。選択肢が増えた今週は、導入判断に「どれが最も賢いか」以外の材料も並びました。
誰が評価したのか。どの仕事が利用量を使ったのか。途中成果を次の工程へどう渡すのか。今回は、記録が揃った9月13、14、16、17、19日の発表と実例から、モデル名の一段先にある比較軸をまとめます。
目次
新発表は、能力より先に使う条件まで読む
今週重なったのは、選択・評価・観測の三つ
反響の大きかった三つは、数字の先まで読む
今週じっくり見る工程:2人と数百のエージェントでCobbleDBを作る
使い方の例は、入力・承認・出力で見る
次に比較表へ足す四つの列
この投稿を読み続けるには購読してください
...
今週、こんなものを書きました|AIと、ことばと、音楽
こんにちは。鳴海です。
今週、こんなものを書きました。
■ AIのニュースから、次に試す使い方を見つける
新発表と実際の工程をつなぎ、仕事や作品づくりで次に試すAIの使い方を選べる二つの週刊ニュースレターを紹介しました。
https://www.narumitakayoshi.com/blog/weekly-ai-briefing-guide
■ AIの「最後の同意」を、仕事の根拠にしない ― 5モデルで試した記録
5つのAIへ反論を重ねた小規模試験から、会話の最後の同意を正解にせず、根拠を長い会話の外で確かめ直す方法を整理しました。
https://www.narumitakayoshi.com/blog/ai-last-agreement-not-evidence
■ AIは判断に、コードは計算に——18分のエージェントが85秒になった理由
広告運用エージェントの事例...
QAILaboratory|「まずこの画面から入れてください」と説明している日に
こんにちは、QAILaboratoryの鳴海です。今週は、何を作ったかより、どこで受け取ることにしたか、のほうを見ています。Instacartが、買い物を代行するAIアシスタントClementineを出しました。同社の説明では、利用者が送ったテキストメッセージ、または撮影した買い物リストの写真から、そのままカートを組み立てます。海外の事例というと、同じ機能を自社でも作れるかどうかを考えたくなります。ただ、この例で変わったのは機能ではなく、受け取る場所のほうです。利用者は、いつもの書き方のまま送っています。■ 真似るのは仕組みの大きさではなく、受け取る場所のほう目を留めておくとよいのは、入口の位置です。相手がすでに使っている形式、たとえば手書きのメモの写真や、いつも来る短い文面を、そのまま受け口にする。こちらの都合で作った入力欄に相手を連れてくる必要がなくなります。この置き方は、失敗し...
QAI Laboratory