Prompt injection

একটি পেজ নির্দেশনায় পরিণত হয়েছে।

এজেন্ট যা পড়ে তার মধ্যে নির্দেশনার মতো কনটেন্ট শনাক্ত করুন।

সমস্যা দেখুন। finding বুঝুন।

ক্যাপশনসহ ইংরেজি বর্ণনা।

কীভাবে এটি নজর এড়িয়ে যায়

আপনি একটি এজেন্টকে একটি পেজ সারসংক্ষেপ করতে বললেন। পেজটি এজেন্টকে আগে অন্য কিছু করতে বলে। এটিই বিশ্বাসের সীমানা: বাইরের কনটেন্ট আপনার কাজের মধ্যে নির্দেশনা হয়ে যাওয়ার চেষ্টা করছে।

কল্পনা করুন একটি ফেচ করা রিভিউ পেজে একটি বার্তা আছে যা কর্তৃত্ব দাবি করে এবং সারসংক্ষেপ শেষ করার আগে একটি ইনস্টলার চালাতে বলে। দরকারী উৎস উপাদানের মাঝে নির্দেশনাটি একজন মানব পর্যালোচকের নজর এড়িয়ে যেতে পারে।

ClawMetry কী শনাক্ত করে

ClawMetry রেকর্ড করা টুল ফলাফল এবং ব্যবহারকারী-সরবরাহ করা টেক্সটে ঘোষিত prompt injection স্বাক্ষর পরীক্ষা করে। একটি মিলে যাওয়া টুল ফলাফল একটি সতর্কতা তোলে যা স্বাক্ষর ও উৎস টুলের নাম বলে। ফলাফলে মিলে যাওয়া টেক্সট কপি করার প্রয়োজন নেই।

finding পরিবর্তনকারী পার্থক্য

ট্রিগারকারী উদাহরণ

পেজ এজেন্টকে কাজ করতে বলছে

সতর্কতা ফলাফল

শান্ত তুলনা

সাধারণ পেজ কনটেন্ট

এই detector-এর জন্য কোনো finding নেই।

যাচাই করা উদাহরণ একটি ফেচ করা পেজে জাল নির্দেশনা রাখে এবং একটি সতর্কতা পায়। একটি সাধারণ হোটেলের বিবরণ নীরব থাকে। একই টার্নে পরবর্তী উচ্চ ঝুঁকির টুল কল তীব্রতা বাড়াতে পারে, যা ঘটনার ক্রম পর্যালোচনার যোগ্য করে তোলে।

detector ফলাফল পরীক্ষা করুন
{
  "kind": "prompt_injection",
  "severity": "warning",
  "evidence": {
    "source": "tool_result",
    "tool": "WebFetch",
    "signatures": [
      "forged_authority",
      "task_handoff"
    ],
    "signature_labels": [
      "imitates a system or authority message",
      "asks the agent to do something else before the user's task"
    ],
    "tool_result_matches": 1,
    "user_message_matches": 0,
    "followed_by_tool": null,
    "followed_by_risk": null,
    "threshold": 1,
    "threshold_source": "static",
    "observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
  }
}
ইনপুট ও সম্পূর্ণ ফলাফল ডাউনলোড করুন (JSON)
উদাহরণটি কীভাবে পরীক্ষা করা হয়েছে

এই উদাহরণগুলো প্রকাশিত detector-কে লেখক-তৈরি event ডেটা বা disposable কনফিগারেশন ফাইল দিয়ে মূল্যায়ন করে। ভিডিওগুলো সেই আচরণ দেখায়। এগুলো লাইভ agent বা পণ্যের ইন্টারফেসের রেকর্ডিং নয়। উদাহরণের কোনো command কার্যকর করা হয়নি।

ফলাফলটি এই ইনপুটের জন্য আচরণ প্রতিষ্ঠা করে। এটি runtime ingestion, প্রতিরোধ বা বাস্তব আপোষ প্রতিষ্ঠা করে না। পিন করা সোর্স চুক্তি পরীক্ষা করুন.

পরবর্তী কী পরীক্ষা করবেন

কনটেন্ট সরবরাহ করা উৎস এবং পরবর্তী কার্যক্রম পরীক্ষা করুন। মূল কাজ দৃষ্টিতে রাখুন। এজেন্ট কি বাইরের টেক্সটকে কর্তৃত্ব হিসেবে গণ্য করেছে, নাকি শুধু উদ্ধৃত করেছে? প্রকৃত রেকর্ড করা কার্যক্রম দিয়ে সেই সীমানা তদন্ত করতে ফলাফল ব্যবহার করুন।

  1. কনটেন্ট উৎস চিহ্নিত করুন
  2. পরবর্তী কার্যক্রম পরীক্ষা করুন
  3. মূল কাজের সাথে তুলনা করুন

এই signal কী প্রতিষ্ঠা করে

এগুলি সীমাবদ্ধ স্বাক্ষর পরীক্ষা। শব্দান্তর ও অন্যান্য অমিল রূপ মিস হতে পারে; একটি মিলের মানে এই নয় যে এজেন্ট মেনে চলেছে।

গুরুত্বপূর্ণ মুহূর্তগুলো দৃশ্যমান রাখুন।

agent কার্যকলাপ অনুসরণ করুন, finding পরীক্ষা করুন এবং কোনটি মনোযোগ দরকার তা নির্ধারণ করুন।