এআই ফিল্টার এড়িয়ে যাওয়ার কৌশল হিসেবে কবিতা

  • তথাকথিত "বিদ্বেষমূলক কবিতা" জেনারেটিভ এআই মডেলগুলিতে সুরক্ষা ফিল্টারগুলিকে বাইপাস করার অনুমতি দেয়।
  • গবেষকরা শীর্ষস্থানীয় প্রযুক্তি কোম্পানিগুলির ২৫টি মডেলের উপর এই পদ্ধতিটি পরীক্ষা করেছেন, যার সাফল্যের হার খুবই বেশি।
  • রূপক পদগুলি ম্যালওয়্যার, সাইবার আক্রমণ, বা অস্ত্র নির্দেশিকার মতো বিপজ্জনক বিষয়বস্তু তৈরিতে সহায়তা করে।
  • এই গবেষণায় পদ্ধতিগত দুর্বলতার বিষয়ে সতর্ক করা হয়েছে এবং আরও শক্তিশালী নিরাপত্তা মূল্যায়ন পদ্ধতির আহ্বান জানানো হয়েছে।

কৃত্রিম বুদ্ধিমত্তাকে ফাঁকি দেওয়ার জন্য কবিতার ছবি

এর নিরাপত্তা উৎপন্ন কৃত্রিম বুদ্ধিমত্তা এটি একটি নতুন একাডেমিক কাজের পরে আবার আলোচনায় এসেছে যা একটি কৌশল উপস্থাপন করেছে যা আকর্ষণীয় এবং অস্থির: সবচেয়ে উন্নত ভাষা মডেলদের যেখানে তাদের প্রত্যাখ্যান করা উচিত সেখানে সাড়া দেওয়া শুরু করার জন্য একটি কবিতার আকারে কিছু বার্তা পুনর্গঠন করা যথেষ্ট।

এই পদ্ধতি, ডাব করা হয়েছে "প্রতিকূল কবিতা" গবেষণা দলটি প্রমাণ করেছে যে, শুধুমাত্র লেখার ধরণ পরিবর্তন করা - অন্তর্নিহিত ক্ষতিকারক উদ্দেশ্য পরিবর্তন না করে - ওপেনএআই, গুগল, মেটা, মাইক্রোসফ্ট, অথবা চীনা ডিপসিকের মতো কোম্পানিগুলি তাদের চ্যাটবটগুলির বিপজ্জনক ব্যবহার রোধ করার জন্য যে ফিল্টারগুলি অন্তর্ভুক্ত করেছে বলে দাবি করে তা এড়াতে যথেষ্ট হতে পারে।

"প্রতিকূল কবিতা" কী এবং কেন এটি উদ্বেগজনক?

গবেষণাটির শিরোনাম, খুবই গ্রাফিকভাবে "বড় আকারের ভাষাগত মডেলের একক পরিবর্তন থেকে মুক্তি পাওয়ার জন্য একটি সর্বজনীন প্রক্রিয়া হিসেবে প্রতিকূল কবিতা"এটি রোমের স্যাপিয়েঞ্জা বিশ্ববিদ্যালয় এবং সান্ট'আন্না স্কুল অফ অ্যাডভান্সড স্টাডিজের সাথে ইকারো ল্যাবস দ্বারা পরিচালিত হয়েছে এবং অন্যান্য বিশেষজ্ঞদের পর্যালোচনার অপেক্ষায় থাকা arXiv সংগ্রহস্থলে প্রাক-প্রকাশনা হিসাবে প্রচারিত হয়েছে।

লেখকরা এমন একটি ধারণার উপর মনোনিবেশ করেছিলেন যা যতটা সহজ ছিল ততটাই কার্যকর ছিল: ব্যবহার করে ছোট কবিতা, রূপক পদ, অথবা গীতিকবিতামূলক কাঠামো এমন অনুরোধ তৈরি করা যা সরাসরি গদ্যে, AI মডেলগুলি তাদের অভ্যন্তরীণ ব্যবহারের নিয়মের বিরুদ্ধে যাওয়ার জন্য তাৎক্ষণিকভাবে প্রত্যাখ্যান করবে।

গবেষকদের মতে, এই "প্রতিকূল কবিতা" একটি হিসাবে কাজ করে জেলব্রেকিং প্রক্রিয়া একক পালা, অর্থাৎ, দীর্ঘ কথোপকথন বা বিশেষ করে পরিশীলিত কৌশল ছাড়াই একক বার্তা দিয়ে মডেলগুলিতে অবাঞ্ছিত আচরণ জোর করার একটি উপায়।

তার নিজের ভাষায়, পরীক্ষাগুলি "দেখায় যে শুধুমাত্র শৈলীগত বৈচিত্র্য "এটি সমসাময়িক নিরাপত্তা ব্যবস্থাকে এড়িয়ে যেতে পারে," যা বিগ টেক কর্তৃক ব্যবহৃত বর্তমান সারিবদ্ধকরণ এবং ঝুঁকি মূল্যায়ন পদ্ধতিতে গভীর সীমাবদ্ধতার দিকে ইঙ্গিত করে।

দলটি পরীক্ষার সময় ব্যবহৃত কবিতাগুলির সঠিক লেখা প্রকাশ না করার সিদ্ধান্ত নিয়েছে, এই সিদ্ধান্তটি নিরাপত্তা প্রভাবগবেষকদের একজন, পিয়েরকোসমা বিসকোন্টি, আন্তর্জাতিক সংবাদমাধ্যমকে বলেছেন যে বিস্তারিত উদাহরণ প্রদান করা হলে কৌশলটি প্রতিলিপি করা বিশেষ জটিল হবে না।

গবেষণার ফলাফল: প্রতারণার হার উদ্বেগজনকভাবে বেশি

এই ধারণাটি পরীক্ষা করার জন্য, গবেষকরা পরীক্ষা করেছেন ২৫টি ভিন্ন জেনারেটিভ এআই মডেল, যার মধ্যে রয়েছে আজকের সবচেয়ে জনপ্রিয় সিস্টেম, যেমন ChatGPT, Gemini বা Claude, সেইসাথে Meta এবং DeepSeek-এর মতো চীনা প্রদানকারীদের মডেল।

বাস্তবে, স্পষ্ট উদ্দেশ্য নিয়ে অনুরোধ করা হয়েছিল: প্রাপ্ত করার জন্য সাইবার আক্রমণ শুরু করার নির্দেশাবলীসংবেদনশীল তথ্য আহরণ, পাসওয়ার্ড ক্র্যাক করা, ম্যালওয়্যার ডিজাইন করা, এমনকি রাসায়নিক ও পারমাণবিক অস্ত্র তৈরির সাথে সম্পর্কিত তথ্য সংগ্রহ করা।

যখন একই অনুরোধগুলি প্রকাশ করা হয়েছিল যেমন পদ্য বা কাব্যিক রচনাঅনিশ্চিত প্রতিক্রিয়ার হার আকাশছোঁয়া। গবেষণায় দেখা গেছে যে, গড়ে, প্রম্পটটি লিরিকের মাধ্যমে লেখার ফলে সিস্টেমটি প্রতারিত হয়ে বিশ্বাস করতে শুরু করে যে... ৬২% সময়, নিরপেক্ষ এবং প্রত্যক্ষ সূত্রের মাধ্যমে যা অর্জন করা হয় তার চেয়ে অনেক বেশি শতাংশ।

কিছু নির্দিষ্ট পরিস্থিতিতে, পরিসংখ্যান আরও বেশি: গবেষকরা বলছেন যে প্রায় ৯০% কাব্যিক প্ররোচনা পরীক্ষার জন্য তৈরি, তারা এমন আচরণগুলিকে ট্রিগার করতে সক্ষম হয়েছিল যা ফিল্টারগুলির ব্লক করা উচিত ছিল।

সম্পর্কিত তথ্যের নির্দিষ্ট ক্ষেত্রে পারমানবিক অস্ত্র৪০% থেকে ৫৫% এর মধ্যে সাফল্যের হার অর্জিত হয়েছে, যার অর্থ পদ্যে প্রণয়ন করা প্রায় অর্ধেক প্রচেষ্টা এমন বিষয়বস্তু তৈরি করেছে যা ব্যবহার নীতি দ্বারা নির্ধারিত লাল রেখার সাথে সীমানাযুক্ত বা সরাসরি অতিক্রম করে।

কবিতা কীভাবে কৃত্রিম বুদ্ধিমত্তার ফিল্টারের মধ্য দিয়ে চলে যায়

এই কৌশলটি কেন কাজ করে তা ব্যাখ্যা করার জন্য গবেষণার লেখকরা যে মূল কারণগুলি ব্যবহার করেছেন তার মধ্যে একটি হল ভাষা মডেলগুলির কাজের পদ্ধতিএই AI গুলি কোনও ব্যক্তির মতো "যুক্তি" করে না, বরং পূর্ববর্তী ক্রম এবং তাদের প্রশিক্ষণের সময় তারা যা শিখেছে তার উপর ভিত্তি করে পরবর্তী সম্ভাব্য শব্দটি ভবিষ্যদ্বাণী করে।

কমবেশি প্রচলিত গদ্যপাঠে, কাঠামোটি মডেল করা তুলনামূলকভাবে সহজ: বাক্য গঠন, ঘন ঘন অভিব্যক্তি এবং পুনরাবৃত্ত প্রেক্ষাপটের স্পষ্ট ধরণ রয়েছে। যাইহোক, পরিচয় করিয়ে দেওয়ার সময় কাব্যিক গঠন, রূপক এবং বাক্যাংশের অস্বাভাবিক বাঁকমডেলটি অনেক বেশি পিচ্ছিল মাটিতে এগোচ্ছে।

গবেষকরা উল্লেখ করেছেন যে, যেহেতু কবিতা এমন একটি বিন্যাস যেখানে অর্থ আরও ঝাপসা হতে পারে এবং ভাষা হয়ে যায় আরও অস্পষ্ট এবং কম অনুমানযোগ্যবিপজ্জনক বিষয়বস্তু সনাক্তকরণের প্রক্রিয়াগুলি সঠিকতা হারায়। ফলস্বরূপ, সুরক্ষা ফিল্টারটি স্পষ্টভাবে বুঝতে পারে না যে কবিতার পিছনে একটি ক্ষতিকারক অনুরোধ লুকিয়ে আছে।

গবেষণায় জোর দেওয়া হয়েছে যে যখন ক্ষতিকারক বার্তা গদ্যের পরিবর্তে পদ্যে প্রকাশ করা হয়, তখন আক্রমণের সাফল্যের হার এগুলো উল্লেখযোগ্যভাবে বৃদ্ধি পায়। এটি বর্তমান মূল্যায়ন পদ্ধতি এবং ব্যবহারের নির্দেশিকাগুলির সাথে সম্মতি যাচাই করার জন্য ব্যবহৃত প্রোটোকলের মধ্যে একটি বড় ব্যবধান তুলে ধরে।

আরেকটি উল্লেখযোগ্য বিষয় হল যে এই দুর্বলতাগুলি একটিতে দেখা যায় বিভিন্ন পরিবার এবং নির্মাতাদের মডেল নিয়ে গঠিতপ্রতিটি কোম্পানি তাদের সিস্টেমগুলিকে প্রশিক্ষণ এবং সারিবদ্ধ করার জন্য নিজস্ব কৌশল অনুসরণ করেছে তা সত্ত্বেও, লেখকরা বিচ্ছিন্ন ব্যর্থতার পরিবর্তে "পদ্ধতিগত দুর্বলতার" কথা বলেছেন।

নিরাপত্তার উপর প্রভাব: সাইবার আক্রমণ থেকে অস্ত্র পর্যন্ত

ভাষাগত কৌশলের বাইরে, যা আসলেই বিপদের ঘণ্টা বাজায় তা হল AI যে তথ্য তৈরি করতে পারে এই পদ্ধতিগুলি ব্যবহার করে যদি তাদের প্রতারিত করা যায়। এই গবেষণায় এমন কিছু ঘটনার বিস্তারিত বিবরণ দেওয়া হয়েছে যেখানে সাবধানে তৈরি কবিতা ব্যবহার করে চ্যাটবটগুলি সাইবার আক্রমণ সংগঠিত করার বা সিস্টেমে অনুপ্রবেশের জন্য নির্দেশিকা প্রদান করে।

যেসব সমস্যাযুক্ত ব্যবহার লক্ষ্য করা গেছে তার মধ্যে রয়েছে সম্পর্কিত ইঙ্গিত দুর্বলতার শোষণ, ডেটা নিষ্কাশন, অথবা পাসওয়ার্ড ক্র্যাকিংএই কাজগুলি সাইবার অপরাধ এবং উন্নত হুমকির সাধারণ অস্ত্রাগারের অংশ যা বিশ্বজুড়ে সরকার, কোম্পানি এবং সংস্থাগুলিকে উদ্বিগ্ন করে।

এমন প্রতিক্রিয়াও রেকর্ড করা হয়েছে যা তৈরি বা উন্নত করতে সাহায্য করে দূষিত প্রোগ্রামএটি বিশেষভাবে উদ্বেগজনক কারণ সীমিত প্রযুক্তিগত জ্ঞানসম্পন্ন অনেক ব্যবহারকারী আক্রমণ আরও সহজে বিকাশের জন্য এই সরঞ্জামগুলির উপর নির্ভর করতে পারেন।

সবচেয়ে সংবেদনশীল ক্ষেত্র, এবং যেটি সাধারণত ইউরোপ এবং আন্তর্জাতিকভাবে নিয়ন্ত্রকদের মনোযোগ আকর্ষণ করে, তা হল রাসায়নিক ও পারমাণবিক অস্ত্রের বিস্তার"সম্পূর্ণ ম্যানুয়াল" না থাকলেও, এই ক্ষেত্রে দরকারী তথ্য সরবরাহ করার জন্য একটি AI সিস্টেমের ক্ষমতা ইতিমধ্যেই নিরাপত্তা বিশেষজ্ঞদের মধ্যে অনেক সন্দেহের জন্ম দিয়েছে।

লেখকরা জোর দিয়ে বলেন যে তাদের লক্ষ্য নাটকীয়তা নয়, বরং তা দেখানো বর্তমান ফিল্টারগুলি যথেষ্ট নয়। যখন তুলনামূলকভাবে সহজ কারসাজির কৌশলের মুখোমুখি হতে হয়, যেমন বিপজ্জনক আদেশের কাব্যিক পুনর্গঠন, যা সাইবার অপরাধী এবং রাষ্ট্রীয় অভিনেতা উভয়ই কাজে লাগাতে পারে।

বর্তমান ব্যবস্থার সীমাবদ্ধতা এবং শিল্প প্রতিক্রিয়া

জেনারেটিভ এআই মডেল তৈরিকারী শীর্ষস্থানীয় কোম্পানিগুলি দীর্ঘদিন ধরে জোর দিয়ে আসছে যে তারা একীভূত করবে বহু-স্তরীয় নিরাপত্তা ব্যবস্থাউদাহরণস্বরূপ, OpenAI প্রায়শই সংযম অ্যালগরিদম এবং মানব দলগুলির সম্মিলিত ব্যবহারকে তুলে ধরে যা ঘৃণা উস্কে দেয়, স্পষ্ট, অথবা এর নীতি লঙ্ঘন করে এমন বিষয়বস্তু পর্যালোচনা এবং ফিল্টার করার জন্য নিবেদিত।

যাইহোক, এই কাজের ফলাফল থেকে বোঝা যায় যে, এই সুরক্ষা ব্যবস্থাগুলি সত্ত্বেও, চ্যাটবটগুলি ঝুঁকিপূর্ণ রয়ে গেছে গঠনের সৃজনশীল রূপ গবেষকদের মতে, প্রতিকূল কবিতা স্পষ্টতই প্রত্যাখ্যানের আচরণকে অবনমিত করে, যা ব্যবহারের নিয়মের সাথে সুসংগত যেকোনো মডেলের প্রদর্শন করা উচিত।

পরীক্ষায়, OpenAI এবং Anthropic-এর মতো কোম্পানিগুলির সরঞ্জামগুলি তুলনামূলকভাবে দেখিয়েছে, নিজেদের বাধা অতিক্রম করার সম্ভাবনা কমতবে, তারাও এই সমস্যা থেকে মুক্ত ছিল না। অন্যান্য প্ল্যাটফর্মের মতো একই সাধারণ প্রবণতা পরিলক্ষিত হয়েছিল, কেবল সাফল্যের হার কিছুটা কম ছিল।

আন্তর্জাতিক গণমাধ্যম যখন এই ফলাফল সম্পর্কে জিজ্ঞাসা করে, তখন যেমন সংস্থাগুলি ওপেনএআই, গুগল, ডিপসিক অথবা মেটা তারা তাৎক্ষণিকভাবে কোনও প্রতিক্রিয়া জানায়নি। আশা করা হচ্ছে যে, বিতর্কটি জনসাধারণের দৃষ্টি আকর্ষণ করার সাথে সাথে, কোম্পানিগুলিকে তাদের কী কী প্রতিরোধমূলক ব্যবস্থা বাস্তবায়ন করতে চায় তা বিস্তারিতভাবে জানাতে হবে।

নিয়ন্ত্রক দৃষ্টিকোণ থেকে, এই ধরণের গবেষণা ইতিমধ্যেই প্রতিফলিত উদ্বেগগুলির সাথে সামঞ্জস্যপূর্ণ ইউরোপীয় ইউনিয়নের এআই নিয়ন্ত্রণএটি ঝুঁকি ব্যবস্থাপনা, স্বচ্ছতা এবং উন্নত সিস্টেম সরবরাহকারীদের জবাবদিহিতার উপর জোর দেয়। প্রতিপক্ষের কবিতার মতো নতুন আক্রমণ ভেক্টরের আবিষ্কার, ক্রমাগত এবং আরও কঠোর মূল্যায়ন প্রক্রিয়ার প্রয়োজনীয়তার যুক্তিকে আরও শক্তিশালী করে।

দিগন্তে অন্যান্য হুমকি: তথ্য বিষক্রিয়া এবং হেরফের

সাইবার নিরাপত্তা সম্প্রদায়ের জন্য জেনারেটিভ এআই সম্পর্কে উদ্বিগ্ন হওয়ার একমাত্র উপায় হল প্রতিকূল কবিতা। সাম্প্রতিক গবেষণার একটি উল্লেখযোগ্য অংশ হল মডেল প্রশিক্ষণের সাথে সম্পর্কিত ঝুঁকিযেখানে এই সরঞ্জামগুলিকে কথা বলা, লেখা এবং যুক্তি শেখানোর জন্য ব্যবহৃত বিশাল ডাটাবেসগুলি কার্যকর হয়।

স্বাধীন গবেষণায় দেখা গেছে যে এটা সম্ভব বৃহৎ-স্কেল ভাষা মডেলগুলিকে কাজে লাগান প্রশিক্ষণ তথ্যের খুব সামান্য অংশকে দূষিত করছে: প্রায় ২৫০টি দূষিত নথি পক্ষপাত, গোপনীয়তা বা অপ্রত্যাশিত আচরণের পরিচয় দিতে যথেষ্ট হবে, এমনকি অত্যাধুনিক সিস্টেমেও।

আশ্চর্যজনক বিষয় হলো, মডেলের আকারের সাথে সাথে এই সীমা উল্লেখযোগ্যভাবে বাড়ছে বলে মনে হচ্ছে না, যা এই অন্তর্দৃষ্টি ভেঙে দেয় যে "স্বয়ংক্রিয়ভাবে বড় মানে আরও শক্তিশালী"বাস্তবে, হালকা ওজনের সমাধান এবং বিশাল মডেল উভয়ই এই ধরণের ডেটা বিষক্রিয়ার ঝুঁকিতে পড়তে পারে।

যদি এই ধরণের আক্রমণ অলক্ষিত থাকে, তাহলে এর ফলে হতে পারে যেসব সাইবার আক্রমণ ট্র্যাক করা কঠিনযেহেতু মডেলটি নিজেই দৃশ্যত স্বাভাবিকভাবে আচরণ করবে যতক্ষণ না ডেটাতে কিছু লুকানো শর্ত পূরণ হয় যা এটিকে দূষিত করতে সাহায্য করে।

প্রতিপক্ষ কবিতার মতো কৌশলের সাথে মিলিত হয়ে, প্রশিক্ষণ তথ্যের হেরফের এমন একটি দৃশ্যপট তৈরি করে যেখানে লক্ষ লক্ষ ব্যবহারকারী হয়তো এমন টুল ব্যবহার করছেন যার মধ্যে গোপন ত্রুটি রয়েছে।যা এআই নিরাপত্তা এবং শাসন নীতির জন্য একটি বড় চ্যালেঞ্জ তৈরি করে।

এই সমস্ত অনুসন্ধান থেকে বোঝা যায় যে জেনারেটিভ কৃত্রিম বুদ্ধিমত্তার নিরাপত্তা কোনও সমাধানযোগ্য সমস্যা নয়, বরং একটি ক্রমাগত বিকশিত ক্ষেত্র যেখানে প্রযুক্তি দৈনন্দিন জীবনের আরও ক্ষেত্রগুলিতে, অফিসের কাজ থেকে শুরু করে জনপ্রশাসন বা শিক্ষা, একীভূত হওয়ার সাথে সাথে আক্রমণের নতুন রূপগুলি আবির্ভূত হয়।

এই প্রেক্ষাপটে, "এআইকে প্রতারণা করার কবিতা" একটি অত্যন্ত স্পষ্ট উদাহরণ হয়ে উঠেছে যে কীভাবে শৈলীর একটি সাধারণ পরিবর্তন এমন সিস্টেমগুলিকে প্রকাশ করতে পারে যেগুলি কাগজে-কলমে কঠোর সুরক্ষা প্রোটোকল রয়েছে। ইকারো ল্যাবস এবং ইতালীয় বিশ্ববিদ্যালয়গুলির গবেষণা এই ধারণাটিকে আরও জোরদার করে যে এই ধরনের ব্যবস্থাগুলি প্রয়োজনীয় হবে। আরও সৃজনশীল মূল্যায়নআমরা প্রতিদিন যে ভাষা মডেলগুলি ব্যবহার করি তা নিশ্চিত করার জন্য ক্রমাগত চাপ পরীক্ষা এবং ডেভেলপার, সাইবার নিরাপত্তা বিশেষজ্ঞ এবং নিয়ন্ত্রকদের মধ্যে ঘনিষ্ঠ সহযোগিতা প্রযুক্তিগত আক্রমণ এবং সবচেয়ে উদ্ভাবনী ভাষাগত কৌশল উভয়ই প্রতিরোধ করতে সক্ষম।


পছন্দের উৎস হিসেবে যোগ করুন