ラッパー引数が不完全です

ユーザーはデータベースを購入しません。ユーザーは会計、物流、出版、顧客サポート、デザイン、または分析を購入します。製品層はジョブを定義し、コンテキストを収集し、インターフェイスを作成し、権限を強制し、例外を処理し、出力をアクションに接続します。 AI はそのロジックを変更しません。

この脆弱な製品は、ブランディングでモデル応答をラップし、アクセスに対して課金します。強力な製品は完全なジョブをラップします。つまり、何が作業を開始するのか、どの情報が信頼できるのか、品質はどのようなものなのか、どのアクションが許可されるのか、例外を人間がどのようにレビューするのか、顧客がどのような結果を測定するのかを知っています。

これが、「包装業者」が永続的なビジネスになる可能性がある一方で、技術的に洗練されたモデル製品が失敗する可能性がある理由です。問題は、企業が独自の機械学習をどれだけ保有しているかということではありません。それは、顧客の貴重なシステムをどの程度改善するか、そしてその改善を再現するのがどれほど難しいかです。

プロダクトはプロンプトではなくワークフローです。

迅速な品質は重要ですが、それはコンテキスト、ツール、権限、評価、インターフェイス、配布、サポート、説明責任内の 1 つのコンポーネントです。

モデルの機能がコモディティ化している

スタンフォード AI インデックスは、GPT-3.5 相当の MMLU スコアに達したモデルのクエリにかかるコストが、2022 年末から 2024 年末までに 280 倍以上削減されたことを記録しました。このレポートでは、以前ははるかに大規模なシステムを必要とした、より小型のモデルが能力のしきい値に達していることも判明しました。それ以来、価格とアーキテクチャは変化し続けています。

これは、フロンティア モデルが同一であることや、モデルの選択が無関係であることを意味するものではありません。これは、製品が永久的な希少性を想定できないことを意味します。現在高価なモデルを必要とする機能は、後で、より小型で安価なローカル モデルまたはオープン モデルで実行される可能性があります。プロバイダーが機能を直接追加する場合があります。競合他社はモデル間でルーティングを行う可能性があります。

モデルの依存関係により、次の 3 つの戦略的リスクが生じます。

  • 機能リスク: プロバイダーは、製品が適応できるよりも早く動作を改善、廃止、または変更します。
  • E経済的リスク: 価格、レート制限、コンテキスト コスト、またはレイテンシにより、現在のワークフローは採算が取れなくなります。
  • プラットフォーム リスク: プロバイダーは、同じユーザー関係をキャプチャするネイティブ製品を起動します。

防御は必ずしも基礎モデルをトレーニングする必要はありません。ワークフロー、顧客、データ、信頼はそのまま残るため、モデルが改善されるにつれてさらに便利になるレイヤーを構築しています。

堀 1: ワークフローの所有権

ワークフローの所有権とは、製品が個別の成果物を生成するのではなく、完全な繰り返しジョブを解決することを意味します。

Trigger仕事がいつ始まるかを知る

チケットが到着したり、ドキュメントが変更されたり、リードが認定されたり、ファイルがアップロードされたり、しきい値を超えたりします。

Contextどのような情報が支配しているのかを知る

承認されたデータ、ポリシー、履歴、例、制約を取得します。

Decisionどのような判断が必要かを知る

決定論的なルール、モデル推論、人間の裁量を分離します。

Action出力をツールに接続する

作成、ルーティング、更新、スケジュール、エクスポート、または承認の要求を行います。

Exception標準外のケースに対処する

不確実性を検出し、エスカレーションし、欠落しているコンテキストを尋ね、フォールバックを保持します。

Outcome結果を測定する

受諾、解決、収益、欠陥、サイクル タイム、またはその他のビジネス シグナルを追跡します。

汎用の筆記ツールはあらゆるモデルと競合します。規制された請求審査プロセスを理解し、適切な証拠を取得し、必須フィールドを強制し、監査可能なパケットを生成し、例外をルーティングする製品がシステム上で競合します。

ワークフローの深さもまた、定着率を生み出します。お客様は、テンプレート、統合、承認、履歴、チームの行動に投資してきました。このスイッチング コストは、蓄積された価値を反映している場合には正当ですが、製品がデータのエクスポートをブロックしたり、データを隠したりする場合には不正行為となります。

堀 2: 配布

ユーザーへの再現可能なパスがなければ、技術的に強力な製品はプロジェクトです。競合他社が同様のデモを迅速に構築できるため、AI はこのプレッシャーを増大させます。

配信は広告以上のものです。これには次のものが含まれます。

  • 信頼できる視聴者またはコミュニティの所有権。
  • ワークフローがすでに発生しているシステム内に存在します。
  • 連携したインセンティブを備えたパートナーシップ、マーケットプレイス、またはチャネル。
  • 購入者がツールを選択する前に問題を解決するコンテンツ。
  • 成果物の共有とコラボレーションを通じて広がるチームの採用。
  • 購入者のリスクと複雑さに応じた販売とオンボーディング。

最も強い分布は積の形です。有用な出力は送信されます。レポート、リンク、ファイル、ワークフロー、テンプレート、またはコラボレーションが別のユーザーを招待します。この製品は、必要なときに、たとえばヘルプ デスク、コード リポジトリ、ブラウザ、ドキュメント システム、または垂直プラットフォーム内に設置することもできます。

有償での買収は成長を開始する可能性がありますが、価値が評価され、置き換えが容易な製品を保護することはほとんどありません。モデルのインターフェースが統合されると、信頼できる問題の所有権がブランドになります。

堀 3: フィードバックと評価データ

「独自データ」は曖昧に使用されることがよくあります。顧客文書の山は自動的に堀になるわけではなく、より機密性の高い資料を収集すると責任が生じる可能性があります。貴重なデータは、多くの場合、結果に関連付けられた構造化されたフィードバックです。

  • どの出力が受け入れ、編集、拒否、またはエスカレーションされたか。
  • どのエラーが重大でしたか、そしてその理由。
  • どのコンテキストがタスクを解決したか。
  • どのユーザー、セグメント、またはシナリオがパフォーマンスを変化させたか。
  • 出力が使用された後に下流で何が起こったのか。
  • 時間の経過とともにワークフローがどのように変化したか。

このデータにより、プロンプト、取得、ルーティング、ユーザー エクスペリエンス、および評価が向上します。また、モデルがボトルネックではないことも明らかになります。

評価セットは、顧客の領域における品質を定義するため、製品資産です。プロバイダーがモデルを変更するとき、企業は製品が改善されたか低下したかをテストできます。その証拠がなければ、各モデルのアップデートは顧客に対する実際の実験になってしまいます。

フィードバックは合法的かつ有益なものでなければなりません。

顧客がデータの使用方法を理解または制御できない場合は、データを堀と呼ばないでください。収集を最小限に抑え、製品テレメトリーをトレーニング同意から分離し、機密サンプルを保護し、無差別なコンテンツの蓄積よりも結果ラベルを優先します。

堀 4: 信頼と運用の信頼性

信頼はマーケティングの形容詞ではありません。これは、製品が予測どおりに動作し、データを保護し、限界を認め、回復をサポートし、問題が発生した場合でも責任を負い続けることを示す蓄積された証拠です。

NIST の生成 AI プロファイルは、作話、プライバシー、情報の完全性、セキュリティ、偏見、過剰依存などのリスクを特定します。製品には、そのユースケースに重要なサブセットのコントロールが必要です。

  • 事実の主張が重要な場合の根拠とソースリンク。
  • 構造化出力の検証ルール。
  • アクションの許可と承認ゲート。
  • 明確な保持期間とトレーニング期間。
  • ログ、バージョン管理、インシデント対応。
  • フォールバックとエクスポート。
  • ワークフローを理解した人間によるサポート。
  • 正直な能力の限界。

信頼はゆっくりと深まり、すぐに崩壊する可能性があります。そのため、獲得すると永続的なアドバンテージになります。プロバイダーはボタンをコピーできます。長年にわたる信頼できる結果、ドメインのサポート、セキュリティ レビュー、顧客の信頼を即座にコピーすることはできません。

一般的な故障モード

失敗1ワークフローを使用しないデモ

製品は印象的な出力を生成しますが、トリガー、コンテキスト、レビュー、アクション、または結果を所有しません。

失敗2広範な約束、浅い使用

この製品はあらゆるチームに役立つと主張しているため、どのチームのシステムや品質基準にも深く適合しません。

失敗3流通上のメリットがない

ユーザーは高価な広告を通じてのみ製品を発見しますが、代替品は増え続けています。

失敗4フィードバックループがない

企業はプロンプトと出力を確認しますが、どの結果が正しかったか、または価値があったのかは知りません。

失敗5コスト消去速度を確認する

流暢な出力では多くの検証が必要になるため、ワークフローが遅くなるかリスクが高くなります。

失敗6上流の依存関係が製品になる

モデルの価格、ポリシー、またはネイティブ機能の変更により、経済性や差別化が失われます。

失敗7信頼は求めるものであり、獲得するものではない

この製品は、証拠、監査、セキュリティ、または回復なしに結果的な主張を行います。

失敗8保持力はロックインに依存します

顧客が留まるのは、製品が改善されたからではなく、データとワークフローが閉じ込められているからです。

失敗9購入者はユーザーではありません

調達部門は製品を承認しますが、作業者は、摩擦が増えたり、本来の仕事を見逃したりするため、承認を回避します。

これらの失敗は相互作用します。ワークフローの適合性が低いと使用率が低下し、成果データがほとんど得られず、改善が妨げられ、配布のコストが高くなり、企業は誇張された主張をするようになります。

レビュー後のユニットエコノミクス

AI 製品の経済性は、生成されたトークンやアクティブなシートごとではなく、受け入れられた結果ごとに計算される必要があります。

低モデル価格に隠れたコスト
Costなぜそれが重要なのか製品の反応
Inference長いコンテキスト、再試行、ツール、および推論により、基本トークンのコストが倍増する可能性がありますタスクのルーティング、キャッシュ、より小さなモデルの使用、コンテキストの制約
Review人間による検証は生成時間を超える可能性があるグラウンディング、検証、インターフェース、および信頼性信号を改善する
Error1 つの重大な失敗が何千もの安っぽい成功を支配する可能性がある重要度の重み付け、承認の追加、自動化の絞り込み
Integrationコネクタ、権限、メンテナンス、サポートは継続中です共通の統合を所有し、ワークフローを標準化する
Acquisition簡単にコピーできる機能により、有料マーケティングの圧力が高まるチャネル、製品主導の普及、またはドメインオーソリティを構築する
Churn目新しさが薄れたり、プラットフォームがその機能をバンドルするとユーザーは離れていきます繰り返し発生するワークフローの価値と蓄積されたコンテキストを提供します

METR が対照研究で経験豊富な開発者が AI を使用するのに時間がかかったという発見は、体感速度だけでは十分ではないことを思い出させます。製品は加速感ではなく、完成した仕事を評価しなければなりません。

製品存続スコアカード

ワークフローの深さ30点

製品は例外を含め、トリガーから結果まで繰り返されるジョブを所有していますか?

Distribution25点

反復可能なチャネル、埋め込まれたポジション、視聴者、または製品主導のループはありますか?

フィードバックの利点20点

使用により、製品を改善する結果に関連した合法的な証拠が生成されますか?

信頼と信頼20点

企業はデータの処理、品質、管理、監査可能性、および回復性を証明できますか?

モデルの回復力5点

上流プロバイダーが変更された場合、製品はルーティング、切り替え、または継続できますか?

Interpretation合計100個

50 未満: 機能のリスク。 50 ~ 70: 有用な製品ですが露出しています。 70 以上: 複利システム - 基礎となる市場が現実であると仮定します。

スコアは顧客の証拠に代わるものではありません。これにより、チームは次のモデルのリリース後も価値が残るものに名前を付ける必要があります。

重点を置いた電力会社が依然として勝てる理由

すべての耐久性のある製品に独自のトレーニング データや大規模なエンタープライズ プラットフォームが必要なわけではありません。焦点を絞ったユーティリティは、明快さ、スピード、プライバシー、検索の分散、優れた実行によって勝利を収めることができます。

Jivaro のブラウザ アプリは、ドキュメントの比較、画像のサイズ変更、正規表現のテスト、メタデータのプレビュー、Markdown の編集、テキストの分割、またはフロントエンドの実験の実行など、意図的に狭い戦略の例です。これらのタスクの多くは、生成的な AI を必要としません。製品の利点は、ユーザーが URL を開いてローカルでジョブを完了し、移植可能な結果を​​残して終了できることです。

このアプローチには限界があります (ユーティリティはコピーでき、多くのユーザーは使用頻度が低い) が、よくある AI の失敗、つまり決定論的な問題に確率論的な複雑さが加わることは回避できます。

最小の信頼できるソリューションを構築する

曖昧さ、言語、推論が実際の価値を生み出す場合は、AI を使用します。ジョブが変換、比較、検証、またはエクスポートである場合は、確定的なブラウザー処理を使用します。製品は、AI がどれだけ含まれているかではなく、解決されたワークフローによって判断される必要があります。

市場が次にもたらすもの

アプリケーションの価値がワークフローに近づくHigh

安価なモデルでは、生の機能の希少性が低くなります。実行、コンテキスト、結果を所有する製品は、より多くの価値を獲得します。

評価が商品の特徴となるHigh

お客様は、目に見えるテスト、モニタリング、モデル/バージョン履歴、および更新によって重要な作業が後退していないことを示す証拠を期待します。

垂直製品や部門別製品は一般的なアシスタントよりも長持ちしますMedium-high

役割または業界に組み込まれた製品は、より深いコンテキスト、統合、信頼を蓄積できます。

モデルルーティングがインフラストラクチャになるHigh

多くのアプリケーションは、タスク、コスト、レイテンシ、リスクに基づいて、フロンティア モデル、小規模モデル、ローカル モデル、または特殊なモデルの中から選択します。

信頼によってデモと本番環境が分離されるHigh

エージェントが実際に行動を起こす際には、セキュリティ、出所、許可、回復、サポートが購入基準となります。

多くの製品がプラットフォームに消えていくHigh

ワークフローや配布堀のない機能は、モデル プロバイダー、オペレーティング システム、または確立された SaaS ベンダーによってバンドルされます。

よくある質問

すべての AI ラッパーは運命にあるのでしょうか?

いいえ、モデルをラッピングするのは通常の製品開発です。リスクは、モデルの上に耐久性のあるワークフロー、配布、フィードバック、または信頼層を追加しないことです。

AI スタートアップには独自データが必要ですか?

いつもではありません。独自の結果フィードバックと評価は、生のコンテンツより価値がある場合があります。一部の製品は、顧客データに関するトレーニングを行わずに、配布、ワークフローの深さ、プライバシー、または実行によって成功します。

最強のAI製品堀は何ですか?

ほとんどのアプリケーション企業にとって、ワークフローの所有権は統合、保持、フィードバック、測定可能な成果を生み出すための基盤です。多くの場合、そのワークフローがビジネスになるかどうかは、配布と信頼によって決まります。

印象的な AI デモが本番環境で失敗するのはなぜですか?

デモでは理想的な入力が使用され、権限、統合、レイテンシ、レビュー、エッジケース、重大なエラー、サポート、およびダウンストリームの結果は無視されます。

基本モデルのプロバイダーはアプリケーションをコピーできますか?

機能とインターフェイスをコピーできます。顧客の詳細なワークフロー、統合、ドメインのフィードバック、サポート、販売関係、蓄積された信頼をコピーすることは困難です。

すべてのソフトウェア製品に AI を追加する必要がありますか?

いいえ。推論によってユーザーの業務が改善され、差異、コスト、ガバナンスが正当化される場合は、AI を追加します。多くの場合、決定論的ツールは、変換、検証、計算、比較、エクスポートに適しています。

出典と参考文献