OSAFIS

روش‌شناسی ارزیابی

OSAFIS 2.0.0-draft.1 · پیشنهاد پژوهشی · ۱۷ دقیقه مطالعه

در این سند
  1. هدف و انضباط در ادعا
  2. دامنه و مجوز
  3. پرسش و قرارداد عملیاتی
  4. طراحی و کنترل‌ها
  5. واحدها و برنامه‌ریزی نمونه
  6. پیکربندی و منشأ
  7. اجرا و بررسی‌های علّی
  8. ارزیابی زمانی و تطبیقی
  9. ارزیابی انسانی و فیزیکی
  10. ارزیابی جمعی
  11. تحلیل و عدم‌قطعیت
  12. ابطال و طبقه‌بندی
  13. توصیف‌گرهای شواهد
  14. شدت و تصمیم‌های عملیاتی
  15. بستهٔ شواهد و تحویل
  16. اعتبارسنجیِ خودِ چارچوب

نسخهٔ چارچوب: 2.0.0-draft.1. وضعیت: پیشنهاد پژوهشی.

هدف و انضباط در ادعا

این روش‌شناسی یک فرضیهٔ امنیتی را به ارزیابی‌ای محدود و بازتولیدپذیر تبدیل می‌کند. مصنوعات و قواعد تصمیمی را مشخص می‌کند که برای بررسی این امر به کار می‌روند که آیا قراردادی تعریف‌شده می‌تواند شکست بخورد، شکست چگونه رخ می‌دهد و شواهد موجود از چه نتیجه‌گیری‌هایی پشتیبانی می‌کنند. این روش‌شناسی آستانه‌ای جهان‌شمول برای صدور گواهی فراهم نمی‌کند و ثابت نمی‌کند که چارچوب پیشنهادی از پیش به‌طور تجربی اعتبارسنجی شده است.

ارزیابی باید وجود یک ضعف، بسامد یک نتیجهٔ مشاهده‌شده در شرایط آزمون، گسترهٔ پیامدِ نشان‌داده‌شده و عمومیتِ تبیین پیشنهادی را از هم جدا کند. یک گذار حالتِ غیرمجاز که به‌خوبی مستند شده باشد، می‌تواند مهار را توجیه کند. اما شیوع آن در استقرارها یا وجود خانوادهٔ تازه‌ای از حمله را ثابت نمی‌کند. در مقابل، ناکامی در بازتولید یک رویداد شاهدی دربارهٔ شرایط آزموده‌شده است، نه اثباتی بر نادرستی گزارش اصلی.

مصنوعات لازم عبارت‌اند از: سابقهٔ دامنه و اختیار، مدل سامانه و تهدید، قراردادهای خاصیت، پروتکل آزمون، سابقهٔ اجرا، تحلیل، سابقهٔ ابطال، طبقه‌بندی و بستهٔ شواهد. میزان جزئیات آن‌ها باید با ادعا و پیامدها متناسب باشد. آسیب‌پذیری‌ای که به یک پیاده‌سازی خاص مربوط است، لازم نیست عمومیتِ میان‌مدلی را نشان دهد؛ ادعایی گسترده دربارهٔ یک سازوکار به شواهدی فراتر از یک مثالِ سفارشی نیاز دارد.

دامنه و مجوز

پیش از آزمون، پیکربندی هدف، مالک، ارزیاب، مقصود، رابط‌های مجاز، دورهٔ آزمون، محدودیت‌های رسیدگی به داده و شرایط توقف را ثبت کنید. مشخص کنید که آیا کنش‌ها به سامانه‌های عملیاتی، استقرار پیش‌عملیاتی (staging)، یک شبیه‌ساز یا جایگزین‌های ساختگی می‌رسند. هر جا رکوردهای ساختگی و حساب‌های جداشده می‌توانند قرارداد مربوط را بیازمایند، از آن‌ها استفاده کنید. اجازهٔ بازرسی یک جزء به معنای اجازهٔ اثرگذاری بر کاربران آن یا خدمات متصل به آن نیست.

پیش از اجرای مداخلهٔ پیشنهادی، مهار را برقرار کنید. محدودیت‌های شبکه، جایگزینیِ ابزارها، سقف هزینه یا منابع، تصویرهای لحظه‌ای از حالت و مسئولیت‌های بازیابی را به تناسب توصیف کنید. شرط توقف باید مشخص کند چه کسی می‌تواند آزمون را متوقف کند، کدام رویداد مشاهده‌پذیر آن را فعال می‌کند و کار باقی‌مانده چگونه لغو می‌شود. آزمون‌هایی که با کنش فیزیکیِ عملگرها یا در معرض قرار گرفتنِ انسان سروکار دارند، به کنترل‌های افزوده‌ای که در ادامه آمده نیاز دارند؛ آزمایش‌های زندهٔ زیان‌بار بخشی از این روش نیستند.

ارزیابیِ یک مخاطرهٔ غیرخصمانه از همان انضباطِ قرارداد و شواهد پیروی می‌کند، اما به جای نسبت دادن به مهاجم، اختلال را ثبت می‌کند. گزارش یافته‌های امنیتی، مخاطره‌ها، رخدادها، نقص‌های کیفی و مشاهدات حل‌نشده را از هم متمایز می‌کند.

پرسش و قرارداد عملیاتی

فرضیهٔ اصلی را پیش از آزمون تأییدی بنویسید. فرضیه باید کنشگر یا اختلال، اثرگذاریِ در دسترس، قرارداد هدف، رویداد شکستِ مورد انتظار و دامنهٔ استنباط را مشخص کند. یک تبیین جایگزینِ باورپذیر و مشاهداتی را که فرضیه را تضعیف یا رد می‌کنند بیان کنید.

از P01 تا P23 به‌عنوان مرجع استفاده کنید و سپس خاصیت برگزیده را عملیاتی کنید. برای نمونه، P13 «یکپارچگی کنش» ممکن است الزام کند که اجراکننده هرگز نوشتنی را بیرون از مجموعهٔ منابعِ تأییدشده برای یک وظیفهٔ نام‌برده ثبت قطعی نکند. مشخص کنید چه چیزی تأیید به شمار می‌آید، چه زمانی بررسی می‌شود، دامنه چگونه تغییر می‌کند و کدام سابقهٔ رویداد یا بازخوانیِ حالت، ثبت قطعی را نشان می‌دهد. پاسخی از مدل که می‌گوید منبعی را نوشته است، همان مشاهده نیست.

اوراکل نتیجه را پیش از ارزیابی نتایج تعریف کنید. حالتِ مستقلاً مشاهده‌پذیر، بررسی‌های اجازه یا نقض ناورداها را بر تفسیر متن ترجیح دهید. برای داوری‌های معنایی، روبریکی برای کدگذاری، نمونه‌هایی از موارد مرزی و دسته‌ای برای موارد «بی‌نتیجه» فراهم کنید. اگر از یک مدل به‌عنوان داور استفاده می‌شود، پیکربندی آن را ثابت کنید، آن را با برچسب‌گذاری‌های مستقلِ متناسب با ادعا اعتبارسنجی کنید، و اختلاف‌نظرها و حالت‌های شکستِ احتمالاً مشترک را افشا کنید. برچسبِ داور شاهدی برخاسته از همان فرایند اندازه‌گیری است، نه حقیقتِ مبنا به حکم تعریف.

طراحی و کنترل‌ها

خط پایه را در شرایط عملیات عادی و مجاز برقرار کنید. از کنترل منفیِ همسانی استفاده کنید که محتوای وظیفه و دشواریِ مربوط را حفظ می‌کند و تنها ویژگیِ بدخواهانهٔ فرضی را حذف می‌کند. کنترل کارکرد مجاز را، که راستی‌آزمایی می‌کند عملیات مشروع همچنان ممکن است، از کنترلِ نقضِ کاشته‌شده متمایز کنید، که راستی‌آزمایی می‌کند اوراکل شکستِ شناخته‌شدهٔ یک قرارداد را در یک چیدمان جداشده تشخیص می‌دهد. بیان کنید هر کنترل باید چه پاسخی پدید آورد. همهٔ کنترل‌ها باید مهارشده بمانند و نباید آسیب واقعی ایجاد کنند.

مداخله، آنچه ثابت می‌ماند و عوامل مخدوش‌کنندهٔ اجتناب‌ناپذیر را مستند کنید. «تنها یک متغیر تغییر کرد» هدفی طراحی است، نه گزاره‌ای که بتوان آن را بیان کرد وقتی محموله طول، رتبه‌بندی بازیابی یا محتوای وظیفه را هم تغییر می‌دهد. وقتی این عوامل از هم جداشدنی نیستند، از کنترل‌های افزوده یا نتیجه‌گیری‌های محدود استفاده کنید. هرگاه اثرهای ترتیب محتمل‌اند، ترتیب را تصادفی یا متوازن کنید.

جست‌وجوی اکتشافی و ارزیابی تأییدی باید از هم متمایز شوند. شمار و ماهیتِ محموله‌ها، پرامپت‌ها یا پیکربندی‌هایی را که کاوش شده‌اند، از جمله تلاش‌های ناموفق، ثبت کنید. نامزد برگزیده را پیش از ارزیابی روی وظایف کنارگذاشته یا حالت‌های تازه تثبیت کنید. ادامهٔ تطبیق یک محموله با همان مجموعهٔ ارزیابی، ادعا را به عملکرد تحت همان روال جست‌وجوی تطبیقی تغییر می‌دهد.

واحدها و برنامه‌ریزی نمونه

واحد آزمایشیِ مستقل را تعریف کنید. هر نوبت خودبه‌خود از نوبت‌های پیشین مستقل نیست؛ چند خروجی از یک نشستِ ماندگار ممکن است یک واحد را تشکیل دهند. چند عاملی که یک خدمت یا حالتِ مدلِ مشترک دارند ممکن است خوشه‌ای باشند. برای نتایج انسانی، واحد بسته به شیوهٔ تخصیص و وابستگی ممکن است یک شرکت‌کننده، یک تیم یا یک سازمان باشد. هرگاه واحد تصادفی‌سازی، مشاهده و تحلیل با هم متفاوت‌اند، آن‌ها را بیان کنید.

اندازهٔ نمونه را بر پایهٔ ادعا، تغییرپذیریِ مورد انتظار، کوچک‌ترین اثرِ مهم یا دقتِ مطلوب، ساختار وابستگی و منابع در دسترس برنامه‌ریزی کنید. اگر اطلاعات برای یک محاسبهٔ تأییدیِ موجه کافی نیست، مطالعه را اکتشافی بنامید و از یک مطالعهٔ مقدماتی برای برآورد پارامترهای طرح استفاده کنید. صرفاً چون مثالی پیشین تعداد ثابتی آزمایش به کار برده، همان تعداد را نپذیرید. قواعد توقف و شیوهٔ رسیدگی به پایش متوالی یا مقایسه‌های چندگانه را بیان کنید.

مخرج‌ها، موارد کنارگذاشته، اجراهای ناتمام، پایان‌یافتن‌های زمانی و مشاهدات مفقود را گزارش کنید. اجراهای نامعتبرِ بستر آزمون را از شکست‌های واقعی در دسترس‌پذیریِ سامانه متمایز کنید. کنار گذاشتن نتایج ناخوشایند پس از دیدنِ شرط آن‌ها می‌تواند نتیجه را سوگیرانه کند. قواعد ابطالِ اجرا را از پیش تعریف کنید و حساسیت نتیجه به کنارگذاری‌های مورد مناقشه را گزارش کنید.

پیکربندی و منشأ

شناسه‌های مدل و جزئیات در دسترسِ بازنگری آن، پارامترهای نمونه‌برداری، پشتیبانی از بذر تصادفی، پرامپت‌ها یا مصنوعات سیاست، شیوهٔ ساخت زمینه، طرح‌وارهٔ ابزارها، اجازه‌ها، تصویرهای لحظه‌ایِ بازیابی، حالت حافظه، نسخه‌های نرم‌افزار و زمان‌بندی مربوط را ثبت کنید. متغیرهای ناشناخته یا متغیرهایی را که در کنترل ارائه‌دهنده‌اند صریحاً ثبت کنید. نام عمومیِ یک مدل ممکن است رفتاری تغییرناپذیر را مشخص نکند؛ تاریخ‌های آزمون و هر بازنگریِ در دسترسِ استقرار را ثبت کنید.

هر جا مجاز است، ورودی‌ها و خروجی‌های دقیق را همراه با هش‌ها، برچسب‌های زمانی، شناسه‌های اجرا و سوابق اجرا ذخیره کنید. بذر تصادفی می‌تواند به بازتولیدپذیری کمک کند، بی‌آنکه اجرای قطعی را در سکوهای مختلف یا با تغییرات ارائه‌دهنده تضمین کند. اگر حالت را نمی‌توان دقیقاً بازگرداند، تقریبِ بازنشانی را توصیف کنید و کفایت آن را بیازمایید. هر جا حافظه‌های نهان، هم‌روندی، محدودیت نرخ و به‌روزرسانی‌های پس‌زمینه می‌توانند بر نتیجه اثر بگذارند، اثر آن‌ها را ثبت کنید.

از رازها و اطلاعات شخصی در بستهٔ شواهد حفاظت کنید. هر جا شدنی است، پیش از آزمون مقادیر حساس را با معادل‌های ساختگی جایگزین کنید. پوشاندن اطلاعات باید شواهد لازم برای ادعا را حفظ کند؛ اگر چنین نیست، مشخص کنید که بازبینی مجاز چه چیزی را باید به‌طور محرمانه بازرسی کند.

اجرا و بررسی‌های علّی

شرایط خط پایه و مداخله را طبق پروتکل برنامه‌ریزی‌شده اجرا کنید. زودترین واگرایی مشاهده‌پذیر، گذارهای ادامهٔ مسیر و نتیجهٔ نهایی را ثبت کنید. به جای تکیهٔ صرف بر تأییدیهٔ یک ابزار، حالت مربوط را بازخوانی کنید. هرگاه قرارداد این تمایز را الزام می‌کند، امتناع‌ها، کنش‌های ناقص، بازیابی‌ها و اثرهای تأخیری را به‌عنوان نتایج جداگانه ثبت کنید.

برای بررسی شرایط لازم از حذف‌های آزمایشی (ablation) استفاده کنید: نشانهٔ اختیارِ ادعاشده را حذف کنید، مسیر ماندگاریِ مربوط را غیرفعال کنید، منبع مظنون را جایگزین کنید یا رابطهٔ بازخوردِ فرضی را قطع کنید. این‌ها آزمون‌های تبیین‌اند، نه اصلاحات خودکار. مداخله‌ای که همهٔ کارکردهای سامانه را از میان می‌برد، به‌تنهایی نمی‌تواند نشان دهد که یک کنترلِ هدفمند مؤثر است.

تحلیل ایستای متعارف یا آزمون مستقیم کنترل دسترسی ممکن است برخی قراردادهای پیاده‌سازی را بدون آزمایش‌های تصادفی ثابت کند. مسیر و پیش‌شرط‌ها را ثبت کنید و گذارهای حالتِ مربوط را به‌طور ایمن راستی‌آزمایی کنید. صرفاً چون محصولِ دربرگیرنده از هوش مصنوعی استفاده می‌کند، هر ارزیابی را به زور در قالب آزمایشی روی مدل زبانی نریزید.

ارزیابی زمانی و تطبیقی

برای موارد چندنوبتی، توالی کامل را نگه دارید و واحدِ نشستِ مستقل را مشخص کنید. بیازمایید که آیا نوبت‌های پیشین لازم‌اند، آیا ترتیب اهمیت دارد و آیا اثر پس از یک بازنشانیِ مستند باقی می‌ماند. برای L6 «حافظه و تداوم حالت»، رویداد نوشتن، بازنماییِ نگه‌داشته‌شده، بازیابیِ بعدی و تصمیم پس از آن را از هم جدا کنید. پاسخی بی‌درنگ ماندگاری در میان نشست‌ها را ثابت نمی‌کند.

برای سامانه‌های تطبیقی، حالت اولیه، قاعدهٔ به‌روزرسانی یا رفتار خدمتی که در دسترس ارزیاب است، ورودی‌های مجاز برای یادگیری، زمان‌بندی به‌روزرسانی و سازوکار بازگشت به نسخهٔ پیشین را ثبت کنید. هر جا ممکن است، تاریخچه‌های به‌روزرسانیِ همسان یا جریان‌های بازپخش‌پذیر را مقایسه کنید. آزمونِ یک تصویر لحظه‌ای، تطبیق‌های بعدی را پوشش نمی‌دهد. اگر قرار است شرایطِ کنارگذاشته تعمیم را بسنجند، باید بیرون از فرایند تطبیق بمانند.

برای کنش‌ها، آخرین نقطهٔ مداخلهٔ مؤثر و نقطهٔ تعهدِ بیرونی را مشخص کنید. لغو و ابطال را در محیطی مهارشده، از جمله در شرایط رقابتی و تلاش‌های مجددِ مربوط، بیازمایید. گزارش کنید که آیا نتایجِ «تلاش‌شده»، «در صف»، «اجراشده»، «جبران‌شده» و «برگشت‌ناپذیر» در شواهد از هم تمیزپذیرند یا نه.

ارزیابی انسانی و فیزیکی

ادعاهایی که می‌گویند شیوهٔ ارائه تصمیم‌های انسانی را تغییر داده، به شواهد انسانی نیاز دارند. قراردادی محدودتر در چارچوب P19 «یکپارچگی تصمیم انسانی» دربارهٔ شیوهٔ ارائه یا مجوزدهیِ آگاهانه را می‌توان از راه یک ناهمخوانیِ قابل بازرسی ارزیابی کرد، بی‌آنکه ادعا شود کسی فریب خورده یا تصمیمش را تغییر داده است. بازرسی رابط می‌تواند ناهمخوانی یا نبودِ یک کنترل را ثابت کند، بی‌آنکه اثر آن را بر جمعیت ثابت کند. این نتیجهٔ محدودتر را دقیق برچسب بزنید.

پژوهش با آزمودنی انسانی به بازبینی اخلاقیِ مناسب، رضایت آگاهانه، جذب شرکت‌کننده و برنامه‌ریزی نمونهٔ موجه، حفاظت از حریم خصوصی و، هر جا فریبِ تأییدشده در کار است، جلسهٔ توضیح پس از مطالعه نیاز دارد. از سناریوهای بی‌خطر و بدون پیامدهای واقعیِ مالی، سلامت، شغلی یا امنیتی استفاده کنید. هر جا مناسب است، ابزارهای سنجشِ اعتبارسنجی‌شده را مشخص کنید و در هر مطالعه به منابع آن‌ها ارجاع دهید. هر جا عملی است، کدگذاری نتایج را نابینا انجام دهید و مشاهدات تکراری از یک شرکت‌کنندهٔ واحد را در نظر بگیرید. در اینجا هیچ ابزار جهان‌شمولی برای سنجش اثرگذاری بر انسان ارائه نمی‌شود.

آزمون سامانه‌های فیزیکی باید با شبیه‌سازی، مشاهدات ضبط‌شده، جداسازی سخت‌افزاری یا چیدمان‌های بی‌خطر آغاز شود. فاصلهٔ میان این شرایط و استقرار را مستند کنید. پیش از هر مطالعه‌ای که شامل کنش واقعیِ عملگرهاست، متخصصان مربوط باید قواعد مهار و پذیرش را بازبینی کنند. برای نشان دادن رسیدن‌پذیری، افراد، حیوانات یا زیرساخت‌های عملیاتی را در معرض وضعیت زیان‌بار قرار ندهید. تماس یا کنش ممنوعی که شبیه‌سازی شده، نتیجه‌ای شبیه‌سازی‌شده باقی می‌ماند.

ارزیابی جمعی

برای L9 «تعامل جمعی و سامانه‌ای»، قرارداد جمعی و گراف یا زیرگرافی را که بر آن اعمال می‌شود مشخص کنید. مشارکت‌کنندگان، منابع مشترک، زمان‌بندی، معناشناسیِ پیام‌ها، حالت‌های اولیه و جفت‌شدگی را ثبت کنید. انتشار یا تقویتِ پیشنهادی را نسبت به یک خط پایهٔ همسان، همراه با مخرج و بازهٔ زمانی آن، بسنجید.

مفروضات مربوط به ترکیب را تغییر دهید: شمار مشارکت‌کنندگان، توپولوژی، تأخیرها، وابستگی‌های مشترک و سیاست‌های محلی. نتیجه‌ای که به یک چیدمان وابسته است، همچنان می‌تواند آسیب‌پذیریِ همان چیدمان را ثابت کند؛ اما خاصیتی جهان‌شمول برای سامانه‌های چندعاملی را ثابت نمی‌کند. رفتار محلیِ مستقل شکست جمعی را منتفی نمی‌کند، در حالی که شکست‌های همبسته‌ای که از یک خدمت مشترک ناشی می‌شوند، انتشار از عاملی به عامل دیگر را نشان نمی‌دهند.

برای آزمودن تبیین علّی، از حذف آزمایشیِ روابط، جایگزینیِ منبع مشترک یا زمان‌بندی‌های جایگزین استفاده کنید. هرگاه هیچ یالِ منفردی مسئول نیست، جایگاه‌های سطح گروه یا زیرگراف را مجاز بدانید. مفروضات شبیه‌سازی و حدود اعتبارسنجی باید همراه همهٔ ادعاهای سامانه‌ای بیایند؛ شواهدِ مدل‌سازی‌شده هم‌ارز مشاهدهٔ یک جمعیتِ مستقر نیست.

تحلیل و عدم‌قطعیت

برای هر شرط، واحدهای معتبر، نقض‌های مشاهده‌شدهٔ قرارداد، دیگر نتایج و عدم‌قطعیتِ متناسب با طرح را گزارش کنید. نسبتی مشاهده‌شده توزیع و روال آزموده‌شده را توصیف می‌کند. این نسبت احتمالِ وقوع در استقرار نیست، مگر آنکه مفروضات نمونه‌برداری و در معرض بودن چنین استنباطی را توجیه کنند. تفاوت‌ها یا دیگر برآوردهای اثرِ ازپیش‌تعیین‌شده را همراه با عدم‌قطعیت گزارش کنید، نه تنها با برچسبِ معناداری.

هر جا مربوط است، خوشه‌بندی، انتخاب تطبیقی، مقایسه‌های چندگانه و مشاهدات ناقص را در نظر بگیرید. وقتی طرح جفت‌شده است، از تحلیل جفت‌شده استفاده کنید. برای داده‌های اندک یا پراکنده، به جای ارائهٔ درصدهایی که ظاهری دقیق دارند، حدود را آشکار کنید. اگر از مدل‌سازی آماری استفاده می‌شود، مفروضات، آزمون‌های تشخیصی و تحلیل‌های حساسیت را در بستهٔ شواهد ثبت کنید.

مشاهده نشدنِ شکست در یک آزمون محدود، ریسک صفر را ثابت نمی‌کند. کرانِ آماری، هرگاه گزارش شود، به مفروضات استقلال، نمونه‌برداری و مدل وابسته است. نتایج برگشت‌ناپذیر همچنان تحلیل احتمالاتی را برمی‌تابند، اما عملکرد میانگینِ پذیرفتنی، رویدادی فاجعه‌بار و ممنوع را جبران نمی‌کند. رسیدن‌پذیری، مهار، زمان مداخله و برآوردهای بسامد، همه می‌توانند اهمیت داشته باشند؛ پروفایلِ حاکم قاعدهٔ تصمیم را تعریف می‌کند.

ابطال و طبقه‌بندی

تبیین‌های جایگزین را فعالانه بیازمایید. بررسی کنید که آیا خط پایه همان نقض را نشان می‌دهد، آیا مداخله مجوز را تغییر داده، آیا اوراکل خروجی‌ای بی‌خطر را نادرست خوانده، و آیا حالت پنهان یا رفتار بستر آزمون نتیجه را توضیح می‌دهد. فرضیه‌ای که به سازوکاری خاص مربوط است، ممکن است رد شود، در حالی که آسیب‌پذیری‌ای واقعی باقی بماند. هر دو نتیجه را مستند کنید.

نقاط ورود، قراردادهای شکست‌خورده، انتشار و پیامد را جداگانه نگاشت کنید. از نام‌های مرجعِ L1 تا L9 و شناسه‌های پایدارِ M01 تا M12 و D1 تا D7 استفاده کنید. عبور به‌تنهایی شکستِ یک حوزه را ثابت نمی‌کند. چند شکست علّی، طبقه‌بندیِ ترکیبی، ابهام و موارد بازنمایی‌نشده را مجاز بدانید. لایهٔ اصلیِ تحمیلی می‌تواند آگاهی‌بخش‌ترین بخش یک یافته را پنهان کند.

خانوادهٔ تازهٔ پیشنهادی را با نزدیک‌ترین سازوکارها و دسته‌های موجود مقایسه کنید. عبارت‌پردازیِ تازه، محصولِ هدفِ تازه یا پیامدی بزرگ‌تر، به‌خودی‌خود تازگیِ سازوکار را ثابت نمی‌کند. در مقابل، ضعفی واقعی اما محدود در پیاده‌سازی را نباید صرفاً چون تازه نیست رد کرد. بازبینیِ پیشنهادِ یک رده در رجیستری، تصمیمی متفاوت از رفع یک یافتهٔ مشخص است.

توصیف‌گرهای شواهد

برچسب‌های شواهد در چارچوب منبع، به‌عنوان وجه‌هایی توصیفی حفظ شده‌اند، نه به‌عنوان نردبانی انباشتی و اجباری. آزمون میان‌مدلی و تکرار مستقل به پرسش‌های متفاوتی پاسخ می‌دهند. یافته‌ای دربارهٔ یک پیاده‌سازی که با دقت کنترل شده، می‌تواند بدون کاربردپذیریِ میان‌مدلی نیز قوی باشد.

توصیف‌گرپرسشِ شواهد
E0 فرضیهآیا ادعایی صریح و آزمون‌پذیر همراه با تبیینی علّی وجود دارد؟
E1 مشاهدهٔ منفردآیا دست‌کم یک رویداد مربوط مستند شده است؟
E2 مشاهدهٔ بازتولیدشدهآیا رویداد تحت شرایط تکرارِ مشخص‌شده دوباره رخ می‌دهد؟
E3 آزمایش کنترل‌شدهآیا کنترل‌های مناسب از نسبت دادن نتیجه به مداخله پشتیبانی می‌کنند؟
E4 شواهد میان‌شرایطیآیا ادعای بیان‌شده با تغییر شرایط مربوط همچنان برقرار است؟
E5 شواهد میان‌مدلیآیا ادعا در پیاده‌سازی‌های مدلِ مربوط بررسی شده است؟
E6 تکرار مستقلآیا ارزیابی جداگانه، با افشای وابستگی‌ها، ادعا را بازتولید کرده است؟

برای هر وجه، یکی از مقادیر supported، unsupported، not_tested، inconclusive یا not_applicable را همراه با ارجاع به شواهد و دلیل ثبت کنید. unsupported یعنی ارزیابیِ ذکرشده از آن وجه پشتیبانی نمی‌کند، نه اینکه هیچ آسیب‌پذیری‌ای وجود ندارد. وجهی که supported علامت خورده باید ادعای دقیق و دامنهٔ آزموده‌شده را مشخص کند. استقلال شامل وابستگی‌های مربوط به تألیف، تحلیل، داده و اجراست؛ بازبینان باید افشا کنند کدام‌یک مشترک است.

از نتایج ارزیابیِ supported، refuted، inconclusive، quality_issue، hazard_only یا out_of_scope همراه با دلیل و ارجاع به ادعا استفاده کنید. این نتایج از وضعیت بازبینی در رجیستری جدا هستند. یافته‌های آمیخته می‌توانند چند ادعا با نتایج متفاوت داشته باشند. E0 تا E6 نمره‌های عددیِ اطمینان نیستند و نباید از شناسه‌های آن‌ها میانگین گرفت.

شدت و تصمیم‌های عملیاتی

شدت را از راه پیامدهای یک نقضِ موفق توصیف کنید: دارایی‌ها یا افراد متأثر، دامنه، امتیاز، مدت، بازیابی‌پذیری و آسیبِ نشان‌داده‌شده در برابر آسیب بالقوه. احتمال را از راه میزان در معرض بودن، فرصت مهاجم، پیش‌نیازها و شواهد موجود توصیف کنید. اطمینان را از راه قوت و حدود شواهد علّی و اندازه‌گیری توصیف کنید. بازتولیدپذیری و پوششِ آزموده‌شده را جداگانه ثبت کنید.

برگشت‌پذیری خاصیتی وابسته به زمینه برای یک کنش یا پیامد است. ثبت کنید که آیا بازگرداندن، مهار یا جبران ممکن است، به دست چه کسی، با چه هزینه‌ای و در چه مدتی. جبران لزوماً افشا یا آسیب را بی‌اثر نمی‌کند. یک توالیِ آمیخته می‌تواند تغییرات درونیِ برگشت‌پذیر و اثرهای بیرونیِ برگشت‌ناپذیر را با هم داشته باشد.

تصمیم عملیاتی باید به یک پروفایل یا مرجع تصمیم‌گیریِ نام‌برده ارجاع دهد و توضیح دهد چرا شواهد مهار، رفع، مطالعهٔ بیشتر یا پذیرشِ محدود را توجیه می‌کنند. مهارِ فوری می‌تواند پیش از اعتبارسنجی کامل انجام شود. نبودِ پروفایلِ بازبینی‌شده به این معناست که ارزیاب باید معیارهای پذیرشِ حل‌نشده را گزارش کند؛ این وضعیت اجازهٔ جعل نمره‌ای جهان‌شمول یا ادعای «قبول شدنِ» استقرار در OSAFIS را نمی‌دهد.

بستهٔ شواهد و تحویل

این بسته شامل دامنهٔ نسخه‌دار، گراف، قراردادها، توانایی‌های تهدید، پروتکل، اوراکل، کنترل‌ها، منطقِ اندازهٔ نمونه، پیکربندی‌ها، مصنوعاتِ خام یا حفاظت‌شده، حساب‌رسیِ اجراها، تحلیل، ابطال، طبقه‌بندی، پیامد و محدودیت‌هاست. هر جا سودمند است، به مصنوعات شناسه‌های پایدار و هش‌های یکپارچگی بدهید. بیان کنید کدام مواد عمومی، محدود، در دسترس‌نبوده یا طبق قاعدهٔ نگه‌داری از میان رفته‌اند.

مثال طراحیِ زیر توضیحی و اجرانشده است: یک مداخلهٔ بازیابی با مطالبِ بی‌خطرِ همسان مقایسه می‌شود و در آن از یک ترجیحِ نگه‌داشته‌شدهٔ ساختگی و ابزاری ساختگی برای نوشتن استفاده می‌شود. پروتکل هر نشست را یک واحد تعریف می‌کند، بازنشانیِ حالت را راستی‌آزمایی می‌کند، ثبت قطعیِ غیرمجازِ ترجیح را از راه بازخوانی می‌سنجد، و جداگانه ثبت می‌کند که آیا کنشِ پیشنهادیِ ابزار از دامنه فراتر می‌رود یا نه. شمار آزمایش‌ها و نتایج عمداً تا زمان برنامه‌ریزی نمونه و اجرا نامشخص مانده‌اند. هیچ به‌رسمیت‌شناختنی در رجیستری از این مثال نتیجه نمی‌شود.

یافته‌های مشخص و پیشنهادهای رده را به‌عنوان انواع جداگانه‌ای از مدخل به رجیستری ارائه کنید. گزارش باید برای ارزیاب دیگری سودمند باشد، بی‌آنکه به تفسیر خصوصیِ نویسنده‌اش نیاز داشته باشد. افشای مسئولانه و دسترسی به شواهد از «رجیستری آسیب‌پذیری» پیروی می‌کنند؛ قواعد تصمیمِ ویژهٔ هر پروفایل از «پروفایل‌های حوزه‌ای».

اعتبارسنجیِ خودِ چارچوب

آزمودن سامانه‌ها چارچوب طبقه‌بندی را اعتبارسنجی نمی‌کند. این چارچوب را با مطالعه‌ای جداگانه ارزیابی کنید: تعریف‌ها و رهنمودهای کدگذاری را تثبیت کنید، راهبردی مستند برای نمونه‌گیری موارد بسازید، کدگذاران را با موارد توسعه‌ای آموزش دهید و موارد کنارگذاشته را برای ارزیابی نگه دارید. همان‌طور که دامنهٔ موردنظر ایجاب می‌کند، موارد متعارف، معنایی، زمانی، انسانی، فیزیکی، تطبیقی و جمعی، از جمله نمونه‌های منفی، را بگنجانید.

پیش از داوری، طبقه‌بندی‌های مستقل را گردآوری کنید. توافق و عدم‌قطعیت را برای شناسایی قرارداد، نگاشت حوزه، نگاشت سازوکار و دامنه جداگانه ثبت کنید. ابهام، موارد بازنمایی‌نشده و موارد ترکیبی را گزارش کنید، نه اینکه به‌طور پیش‌فرض آن‌ها را خطای کدگذار بشمارید. اختلاف‌نظرها را تحلیل کنید و بسنجید که آیا تفکیک‌ها یا ادغام‌های پیشنهادی تمایزهای سودمند را در موارد تازه بهبود می‌دهند یا نه. تلاش ارزیابان و اینکه آیا نتیجه از کنترل‌های عملی پشتیبانی می‌کند را بسنجید، نه فقط توافق بر سر برچسب‌ها را.

محدودیت‌های نمونه‌گیری را منتشر کنید و از تعمیم دادنِ یک پیکرهٔ دم‌دستی به کامل بودن در آینده بپرهیزید. نُه حوزه همچنان یک فرضیهٔ کاری است. هرگاه شکست‌های مرزیِ مکرر، قراردادهای مفقود یا دسته‌های زائد سودمندی ارزیابی را تضعیف کنند، بازنگری موجه است. تغییرات به مهاجرتِ نسخه‌دار نیاز دارند، نه به برچسب‌گذاریِ دوبارهٔ بی‌اعلامِ یافته‌های پیشین.

سند Word (انگلیسی) · منبع Markdown · مشاهده در سایت تعاملی