インサイト

INSIGHTS

AIを業務で「使える」状態にするための実践知。RAGの精度設計や Forward Deployed Engineer(FDE)型の受託開発について、現場で手を動かした実装者の視点で書いています。

Dify / RAG精度

DifyでRAGの精度が出ないとき — Dify内でできること、Difyの外で解くこと

DifyでRAG(ナレッジベース)を作ったが、本番の質問で外し始めた——このときDify内で調整できる精度のツマミは、実は7つあります。一方で、精度を測る評価の仕組み・文書構造に沿った分割・クエリ拡張・Graph RAGは、Difyの外で解く領域です。どこまでDifyで粘り、どこから外に出すか。その線引きを、実装者の視点で解説します。

読む

データ分析

実データ2,290人の行動分析 — 計測設計がAIのデータ分析を決める

自社の診断アプリの実データ2,290人を、LLMが本番DBに読み取り専用SQLを発行して分析した事例。直観型が一般人口の2.4倍という発見と、それを短時間で可能にした計測設計、限界の開示までを実装者視点でまとめます。

読む

LLMO・AEO

LLMO(AEO)とは何をすることか — 自社3サイトの実測で分かった「効くこと・まだ効かないこと」

LLMO(LLM最適化)・AEOの解説は増えましたが、実測データで語られることはまれです。この記事は、自社で運用する3サイトの実測——AI経由流入は全体の約0.3%(ChatGPT 11セッション/30日)、IndexNowは202受理でも4日後46/54が未発見——をもとに、いま効くこと・まだ効かないこと・明日からの実務を、AI受託開発の実装者が整理します。

読む

LLMO・AEO

llms.txtの書き方と設置 — 3サイトで運用して分かったこと(実物リンク付き)

llms.txtは、サイトの概要と主要ページをAI(LLM)向けにまとめるテキストファイルの提案仕様です。実際に3サイトへ設置・運用している実物を公開しながら、書き方の手順、SPAサイトで配信が壊れる落とし穴と検証方法、そして「効果はまだ断定できない」という正直な現在地までを実装者の視点で解説します。

読む

経理AI・異常検知

経理AIはどこまで任せられるか — 経費監査の見逃しを0.2%にした3層設計

経理AIは「全部おまかせ」では作れません。大手メーカーの経費監査で、7か月分・明細4.3万行を対象に、監査が抜いた1,678件の捕捉99.8%(完全な見逃しは3件・0.2%)まで詰めた進行中の事例をもとに、ルールで確定・AIで仕分け・人が最終判断する3層設計と、「精度87%」の正しい読み方(的中率と捕捉率)を実装者の視点で解説します。

読む

RAG構築

RAG構築の手順 — 「1日でできる最小構成」と本番品質の間を、4層で埋める

RAG(検索拡張生成)を「とりあえず動く」まで作るのは1日仕事です。難しいのはそこから業務で使えるまでの距離——精度を決めるのはモデルではなく、データ整備・検索設計・評価・運用の積み上げです。何から作り、どの順で測るか。実案件で正答率38.8%→93.6%を実現した構築手順を、実装者の視点で示します。

読む

AIエージェント

AIエージェント開発の実務 — 「自律」を追わず、「裁量」を設計する

AIエージェント開発で最初に決めるべきは、モデルでもフレームワークでもなく「どこまで任せるか」です。ワークフローで足りる処理とエージェントが要る処理の見分け方、ツール設計、失敗時の縮退、Human-in-the-loopから自動化へ「卒業」する運用まで——2024年から見積エージェントを本番運用してきた実装者の視点で書きます。

読む

社内ナレッジ検索

エンタープライズサーチとは — 「探して一覧」から「調べて答える」へ、生成AI時代の社内検索

エンタープライズサーチとは、社内に散らばる文書・ナレッジを横断して探せるようにする仕組みです。Web検索と何が違うのか、検索窓はあるのに「使われない」のはなぜか、RAG(検索拡張生成)で「リンク一覧」から「出典つきの回答」へ何が変わるのか。社内文書検索で正答率38.8%→93.6%を実現した実装者の視点で、導入設計と製品/構築の判断軸まで示します。

読む

AI開発環境

エディタを替えるな、エージェントを繋げ — AI時代の開発環境を疎結合にする

AIのためにエディタを乗り換え、その重さと値上げに疲れていませんか。問題はエディタ選びではなく、エージェントとエディタの「結合様式」にあります。ACPやClaude CodeのIDEプロトコルが示す疎結合という選択肢を、Sublime Text用の接続層を自作して確かめた実装者の視点で解説します。

読む

AI立て直し

バイブコーディングで作ったAIを、本番品質に立て直す — 品質・セキュリティ・保守を取り戻す順番

バイブコーディングや安価な外注で「動くもの」はできた。しかし品質・セキュリティ・保守に不安が残り、次の投資を決められない——実測では、AIが生成したコードの45%がセキュリティテストに不合格です(Veracode調査)。全部を作り直す前に踏む順番(棚卸し→守る線→測れる化→直すか作り直すかの判断)を、立て直しを引き受けてきた実装者の視点で解説します。

読む

AI導入・PoC

AIのPoC止まりはなぜ起きるのか——「本番化する会社」との分かれ目と、抜け出す進め方

AIのPoCは、平均で半分近くが本番に乗る前に取りやめられています(S&P Global調査)。分かれ目は技術力ではなく始め方——目的・評価・運用の3つです。止まった状態から本番へ進める順番を、正答率38.8%→93.6%の実例を持つ実装者の視点で解説します。

読む

RAG精度診断

あなたのRAGはどこで精度を落としているか — 症状から原因を引く診断ガイド

RAG(検索拡張生成)がデモでは動くのに本番で精度が落ちる——原因はたいていモデルではなく、データ・検索・評価・運用の4層のどこかにあります。現場で聞く「症状」から疑うべき層を引き当て、次の一手(ハイブリッド/Graph/Agenticの選び方、評価と人間監査の設計)までを、正答率38.8%→93.6%の実例を持つ実装者の視点で示す診断ガイドです。

読む

RAG評価設計

RAGは「測れないと上がらない」— 評価セットの作り方と、人間監査を「卒業」する設計

RAGの精度を上げる最初の一歩は、賢いモデルでも新しい検索でもなく、評価セットという物差しを作ることです。検索と生成を分けて測る評価セットの作り方、決定的な採点はルールで・曖昧な質だけLLM-as-a-Judgeで測る使い分け、そして評価があるからこそ人間監査を「卒業」してフィードバックループを自動化できる設計を、実装者の視点で解説します。

読む

RAG検索設計

ハイブリッド検索とは — ベクトル検索+BM25でRAGの精度を上げる設計

ハイブリッド検索とは、意味の近さで探すベクトル検索と、語の一致で探すキーワード検索(BM25)を並走させて結果を束ねる検索構成です。ベクトル検索だけだと、社名や型番で聞いたときに別の資料が返ってくる——固有名詞の厳密一致を取りこぼすからです。RRFでの統合・リランキングの足し方から、「決定的に解ける処理はLLMよりルールで解く」という設計の考え方までを、実装者の視点で解説します。

読む

RAGデータ設計

RAGは前処理で8割決まる — 文書構造に沿ったチャンク設計とデータ整備

RAGの精度の話はつい検索やモデルに向かいますが、現場で最初に効くのは前処理です。文字数で機械的に切ると、答えの半分だけが入ったチャンクや文脈を失った断片が生まれ、検索がそれを拾ってもLLMは答えようがありません。文書構造に沿ったチャンク分割・メタデータ付与・古い版や廃止規程の整理といったデータ設計を、実装者の視点で解説します。

読む

営業自動化 / LLMエージェント

営業自動化AIの本番設計 — Slack見積エージェントと提案書自動生成の実例

Slackのリアクションで動く見積エージェントと、企業調査から提案書までを一気通貫で作る自動生成——本番で使われ続けている2つの営業AIを例に、「デモ止まり」で終わらせない設計原則(AIは提案・人が決める、業務への溶け込ませ方)を解説します。

読む

Graph RAG / 法令RAG

法令RAGはなぜ難しいか — 参照関係を辿るGraph RAGで「準用先まで読む」設計

法令や社内規程のRAGは、条文が参照・準用でつながっているため単純なベクトル検索では準用先を取りこぼします。エネルギーインフラ事業者の法令ナレッジで、参照関係を辿るGraph RAGと4軸評価により合格率を65%→約91%へ引き上げた設計を、実装者の視点で解説します。

読む

RAG精度設計

商社の文書検索で正答率を38.8%→93.6%にした4層設計

RAGがPoCでは動くのに本番で精度が落ちる──原因はモデルではなくデータ・検索・評価・運用にあります。大手総合商社の文書検索で正答率を38.8%から93.6%へ引き上げた4層設計を、実装者の視点で解説します。

読む