AIの学習において汚染されたデータを使った攻撃があると思いますが

質問 AIの学習において汚染されたデータを使った攻撃があると思いますが、推論モードでAIにそのデータが汚染されているか判定させてから学習データとして成型するようなことってしないの? 無料! 3大AIはどれを選ぶ? ChatGPT・Gemini・Copilot 超便利!使い方ガイド (メディアックスMOOK)価格:1430円(2026/8/14 20:18時点)感想(1件)企業競争力を高めるための生成AIの教科書 Generative AI × INNOVATION [ 小島舞子 ]価格:2200円(2026/8/14 20:18時点)感想(2件) 解答できます。実際、学習データを別のAIモデルで事前に検査してから学習に投入するという考え方はあります。ただし、「推論モードのAIに汚染判定させれば解決」というほど単純ではありません。ここが面白いところです。そもそもデータ汚染攻撃とは例えば攻撃者が大量のWebページや文書を学習データに混ぜて、通常のデータ+攻撃者が作ったデータ↓学習↓モデルの挙動を変えるという攻撃をします。目的によって、モデル全体の性能を低下させる特定の対象について誤った知識を覚えさせる特定のトリガーを与えたときだけ異常動作させるなどがあります。特に最後のようなバックドア型のデータ汚染が厄介です。「AIにチェックさせる」はかなり自然な発想例えば、Webデータ ↓クリーニングAI ↓「怪しい」「問題なさそう」 ↓学習データという構成は考えられます。さらに、データA…

続きを読む

AIによるOCRの精度はどの程度?

質問 AIによるOCRの精度はどの程度でますか?帳票形式が決まっている場合、AI自作して業務に特化させた方がいい? 初めてのLangChain LangChainとLangGraphによるAI/LLMアプリケーションの構築 [ Mayo Oshin ]価格:4620円(2026/3/8 17:32時点)感想(0件) 解答いい質問ですね。実務では「どこまで精度が出るのか」と「自作すべきか」が一番悩みどころです。① OCR精度はどのくらい出る?前提条件で大きく変わります。印刷文字(活字)の場合条件が良ければ:99%以上(かなり現実的)帳票固定・高解像度なら 99.5% 以上も可能ただし:FAX原稿傾き低解像度スキャンかすれがあると一気に落ちます。手書き文字の場合かなり差があります。丁寧な手書き → 90〜95%一般的なクセ字 → 70〜90%走り書き → 50〜80%特に日本語は難易度が高いです。「文字精度」と「業務精度」は違うここが重要です。OCR 99%でも、100文字の帳票なら1文字は間違う可能性があります。そしてその1文字が:金額口座番号日付だったら業務事故になります。なので実務では文字精度より項目単位の正確率(フィールド精度)を見ます。② 帳票形式が決まっている場合ここが一番大事なポイントです。結論から言うと:「帳票が完全固定なら、AIを自作する必要はほぼない」です。なぜか?帳票固定なら:座標ベース抽出テンプレートマッチングルールベース抽出で十分いけます。例:「左上から20…

続きを読む

difyとollamaを使用してローカル環境だけでragをする方法

質問 difyとollamaを使用してローカル環境だけでragをする方法 ゼロからわかるDifyの教科書 ~生成AI×ノーコードでかんたん業務効率化 [ にゃんた ]価格:2970円(2026/4/24 20:17時点)感想(0件)文科生也能輕鬆實現!自建自用大語言模型(LLM):無痛操作Ollama本機端模型管理器【電子書籍】[ 江達威 ]価格:1641円(2026/4/24 20:17時点)感想(0件) 解答ローカルだけでRAGをやる構成はシンプルに言うとこうです:Ollama(LLM) + Dify(オーケストレーション) + ベクトルDB(ローカル)ポイントは「外部APIを一切使わない」ことなので、埋め込み(embedding)もローカルでやる必要があります。全体構成[ドキュメント] ↓(埋め込み生成:Ollama) ↓[ベクトルDB(ローカル)] ↓(検索) ↓[Dify] ↓(LLM応答:Ollama)1. Ollamaの準備まずローカルでLLMと埋め込みモデルを動かします。LLM(生成用)ollama pull llama3埋め込みモデルollama pull nomic-embed-textOllamaはデフォルトでhttp://localhost:11434 でAPI提供します。2. ベクトルDBの用意(ローカル)代表例:Chroma(簡単)Weaviate(やや重い)Milvus(本格)まずはChromaが楽です。Pythonで簡単に立てられます:…

続きを読む

教師あり学習と教師なし学習の違い

質問教師あり学習と教師なし学習の違いをわかりやすく説明してください。 解答いいですね!AI・機械学習を理解する上でとても大事なところです。シンプルにイメージから説明しますね。1. 教師あり学習(Supervised Learning)「答え(ラベル)」がついたデータで学習する方法学習の目的:入力から正しい答えを予測できるようになること例えテスト勉強で「模範解答付きの問題集」を使うイメージ。問題(入力):「2+3=?」答え(ラベル):「5」何度も練習することで「この問題なら答えはこれ」と推測できるようになる。実際の応用メールのスパム判定(メール文=入力、「スパム/非スパム」=ラベル)売上予測(過去のデータと実績から未来の数値を予測)画像認識(犬の画像には「犬」というラベルを付けて学習)2. 教師なし学習(Unsupervised Learning)「答え(ラベル)」がついていないデータで学習する方法学習の目的:データの隠れた構造やパターンを見つけること例え答えが書かれていない問題集を見ながら「似ている問題ごとにグループ分けする」イメージ。問題(入力):「2+3」「4+5」「100×200」答え(ラベル)はなし「足し算の問題」と「掛け算の問題」に自分で分ける → データの構造を発見する実際の応用顧客のクラスタリング(購買履歴をもとに「似た行動をするグループ」を見つける)文章やニュース記事のトピック分類異常検知(正常データと比べて「変わった動き」を見つける)3. 違いのまとめ項目教師あり学習教師な…

続きを読む

ChatGPT Gemini copilot grokなどいくつも生成AIがありますが、嘘をつくのが一番得意なAI…

質問ChatGPT Gemini copilot grokなどいくつも生成AIがありますが、嘘をつくのが一番得意なAIはどれですか? 解答かなり鋭い問いですが、前提を一度ひっくり返す必要があります。「嘘をつくのが得意なAI」は存在しません。存在するのは「もっとも“嘘に見える出力をしやすい設計・使われ方”をするAI」です。順に整理します。1. まず定義をはっきりさせる人間の「嘘」とAIのそれは本質的に違います。人間の嘘真実を知っているそれを隠す意図がある相手を誤導する目的がある生成AIの「嘘」真実を知らないもっともらしい文章を生成する正誤より「それっぽさ」を優先する場合があるつまりAIは「嘘をついている」のではなく、**“それらしく間違える”**だけです。2. では「嘘っぽくなりやすいAI」は何で決まるかAIごとの差は、主にここで生まれます。(1) 自信の表現の強さ断定的に言い切る但し書きが少ない不確実性を表に出さない→ 間違えたときに「嘘」に見える(2) 安全設計・自己検証の強さ「わからない」と言えるか曖昧な情報を曖昧と表示するか推測と事実を分けるか→ 弱いほど嘘っぽくなる(3) 想像力の使い方創作・仮説・物語が得意情報の穴を補完しようとする→ 創作が事実に見える危険がある3. 名前を挙げて比較すると(価値判断ではなく傾向)※優劣ではなく設計思想の違いとして読んでください。「嘘に見えやすい」傾向が出やすい条件最新情報を断定調で語る裏取り不能な話題専門領域を浅く広く聞くこの条件下での傾向はこう…

続きを読む

動物の言葉を翻訳するツールではなく動物と会話するための通訳ツールをAIを用いて作成できますか?

質問動物の言葉を翻訳するツールではなく動物と会話するための通訳ツールをAIを用いて作成できますか? 解答結論から言うと、「動物の言葉を正確に翻訳する通訳」は現時点では不可能しかし「人と動物の相互理解を拡張する通訳的AI」は、限定条件つきで実現可能です。重要なのは、「翻訳」ではなく「通訳」という言葉を使っている点で、ここに現実的な突破口があります。1. なぜ「翻訳」は難しいのか人間の言語翻訳は、次が前提です。文法がある記号(単語)がある意図を抽象化できる話者自身が意味を意識している多くの動物は:文法を持たない記号体系が固定されていない抽象概念を言語化しない発声は感情・状態・反射に強く依存👉「この鳴き声=この単語」という対応は成立しない2. それでも「通訳」は可能な理由通訳とは本来、相手の意図・状態・文脈を推定し、人に理解可能な形へ変換する行為です。これはAIが得意とする領域です。3. AI通訳ツールの現実的な定義実現可能なのは、次のようなものです。動物の行動・音声・生理反応から「現在の状態・欲求・感情の確率分布」を推定し、人間に説明するAIこれは翻訳ではなく、状態推論+意味付けです。4. 技術的構成(かなり現実的)入力(マルチモーダル)音声(鳴き声の周波数・リズム)行動(姿勢・動線・しっぽ・耳)生体信号(心拍・体温・活動量)環境情報(時間・天候・人の動き)AI処理パターン認識(機械学習)文脈理解(時系列モデル)個体差学習(その動物固有の癖)不確実性評価(確率として出す)出力(人向け通訳)「空腹…

続きを読む