arrow_backフィールドノートに戻る
AI 公開日 5 Aug 2026

ハイプなしのAI:現場エンジニアの実践ガイド

実プロジェクトでLLMとMLツールを使う際の、バズワードや魔法のような思考を排除した、実践的で地に足のついた入門です。

オンラインのAI関連コンテンツのほとんどは、超知能についての悲観的な見方か、チャットボットが火曜日までにあなたの仕事を奪うという熱狂的な主張かのどちらかに二分されています。どちらも何かを出荷するのに役立ちません。このガイドはその両方をスキップし、実際に現在のAIツール世代をどのように実プロジェクトで使うか、制限事項を明確にしながら説明します。

LLMが実際に行うこと

GPT-4やLlama 3のような大規模言語モデルは、膨大な量のテキストで訓練されたシーケンス内の次のトークンを予測します。それだけです。内部ファクトチェッカーもなく、セッション間の永続的なメモリもなく(構築しない限り)、人間が理解するような意味での理解もありません。質問すると、プロンプトの統計的に尤もらしい続きを生成しています。

これは実践的に重要です。モデルは、そのメソッドが「ライブラリが持っていそう」に聞こえるからという理由だけで、存在しないライブラリメソッドを呼び出すPython関数を自信を持って生成します。常にコードを実行してください。常にAPIリファレンスを確認してください。モデル出力を、速い、よく読んでいるが時々自分自身が知らないうちに嘘をつくインターンからの初稿として扱ってください。

実際のワークフロー:コードにLLMを使う

ChatGPTに「アプリを作ってくれ」と言う代わりに、実際に機能するパターンをここに示します。

  1. 関数シグネチャとdocstringを自分で書き、型とエッジケースを指定します。
  2. その正確な仕様に対して実装するようモデルに求めます。
  3. テストを別途自分で書きます。モデルが書いたばかりのコードのテストを書くようモデルに求めないでください。些細に合格するテストを書く傾向があります。
  4. テストを実行します。失敗を新しいプロンプトとしてフィードバックし、曖昧な「動作しません」という表現ではなく。
def parse_duration(text: str) -> int:
    """
    Parse strings like '1h30m', '45s', '2d' into total seconds.
    Raise ValueError on invalid input.
    """

モデルにこの正確な契約を与えることで、曖昧な説明よりもはるかに良い出力が得られ、テストする具体的なものが得られます。

Retrieval-augmented generation、平易な言葉で

RAGはバズワードとして投げられていますが、メカニズムは単純です。モデルが訓練中に記憶したことに依存するのではなく、クエリ時に関連ドキュメントをフェッチしてプロンプトに詰め込みます。

基本的なセットアップ:

  1. ドキュメントをチャンク化します(500〜1000トークンが一般的な出発点)。
  2. text-embedding-3-smallのようなモデルまたはbge-small-enのようなオープンモデルで各チャンクをエンベッドします。
  3. pgvectorを使用したPostgresなどの何かに、またはQdrantのような専用ストアにベクトルを保存します。
  4. クエリ時に、ユーザーの質問をエンベッドし、類似性検索(コサイン距離が標準)を実行し、上位kチャンクを質問とともにプロンプトに引き込みます。
SELECT content FROM docs
ORDER BY embedding <=> '[0.012, -0.045, ...]'
LIMIT 5;

これが、カットオフ日付までのデータで訓練されたチャットボットが、先週のあなたの内部wikiについての質問にまだ答えられる理由です。会社について推論しているのではなく、ドキュメントを読んで要約しています。

古典的なMLが依然として勝つ場所

すべての問題がtransformerを必要とするわけではありません。構造化表形式データ(アカウント年齢、使用頻度、サポートチケット)からチャーンを予測している場合、XGBoostやLightGBMのような勾配ブースティングツリーモデルは通常、LLMベースのアプローチより優れた性能を発揮し、数時間ではなく数分で訓練でき、実行コストは数分の一です。APIコールを求める前にscikit-learnのRandomForestClassifierまたはXGBoostを使用してください。特に、データがスプレッドシートに収まり、ターゲット変数が明確な数値またはカテゴリである場合。

コストとレイテンシは設計制約であり、事後考慮ではありません

GPT-4クラスの呼び出しはトークンごとに実際のお金がかかり、返すのに実際の秒数がかかります。すべてのユーザーに対してすべてのページロードで実行される機能を構築している場合、それはすぐに積み重なり、レイテンシは明らかになります。攻撃的にキャッシュし、トップティアの推論を必要としない何かにGPT-4o-miniやローカルLlama 3 8Bのような小さいモデルを使い、パイプラインの品質が実際に重要な部分に高価なモデル呼び出しを予約してください。

誰も警告しない障害モード

モデルは、訓練分布の外のものについて求められると、より少なくではなく、より多く幻想を見ます。不明なライブラリバージョン、社内用語、最近のCVE番号。答えが正確である必要がある場合(セキュリティアドバイザリ、法的引用、医療用量)、生成だけを信頼しないでください。毎回、一次情報に対して検証し、事後に人間によるレビューを信頼するのではなく、パイプラインにその検証ステップを構築してください。

AIツーリングは、それが考えるのを期待するのをやめて、チェックする必要がある高速パターンマッチャーとして扱い始めたら、本当に有用です。初日から検証ステップを構築すれば、自信を持った無意味なストリームの代わりに、実際の価値が得られます。

さらに進みたい場合は、Korra StudioのPythonおよびData Science トラックをチェックして、これらのツールで実際に生産的に機能させる基礎を学んでください。

この記事は AI の支援を受けて執筆し、Korra Studio の Michal Pilch(CISSP)が確認のうえ公開しました。

さらに先へ進む準備はできていますか?

これは Korra Studio ナレッジベースの 1 つのノートです。プラットフォームはすべてのトピックと 1 対 1 メンタリングをペアで提供します。

無料で始めるarrow_forward