{"id":186,"date":"2026-09-25T08:00:45","date_gmt":"2026-09-25T08:00:45","guid":{"rendered":"https:\/\/www.dobryakov.net\/blog\/186\/"},"modified":"2026-09-25T08:00:45","modified_gmt":"2026-09-25T08:00:45","slug":"ai-governance-quality-drift-fairness","status":"publish","type":"post","link":"https:\/\/www.dobryakov.net\/blog\/186\/","title":{"rendered":"AI Quality, Drift &#038; Fairness: continuous evaluation and bias mitigation"},"content":{"rendered":"<p>A provider quietly updated the base model. The API is formally the same, the version string is unchanged \u2014 but behavior shifted: Kovcheg started inventing loan terms not present in the documents slightly more often, and treating applications from one region slightly more strictly. No one changed anything in the code. A month later it surfaces as a spike in complaints and a question from compliance: &quot;Why have approvals in region N dropped?&quot; This is what silent degradation looks like \u2014 the most common way an AI system&#x27;s quality erodes without a single deployment.<\/p>\n<p><!--more--><\/p>\n<p>This chapter covers the <strong>quality plane<\/strong>: the guarantee that the model doesn&#x27;t degrade over time, answers stay accurate through base-LLM updates, and decisions don&#x27;t discriminate. For a credit-scoring system like Kovcheg, bias in scoring isn&#x27;t a dashboard metric. It&#x27;s a direct violation of the EU AI Act (Art. 10 \u2014 data quality, non-discrimination) and a legal claim.<\/p>\n<p>The quality-plane engineer builds the evaluation infrastructure that makes these guarantees measurable and enforces them as a release gate.<\/p>\n<h2>The business goal<\/h2>\n<p>Kovcheg&#x27;s decision quality and fairness must be measurable, continuously monitored, and wired into the release pipeline. Three promises to the business:<\/p>\n<ol>\n<li>A model update never ships to production without passing regression against benchmarks.<\/li>\n<li>Degradation and drift are caught by monitoring, not by complaints.<\/li>\n<li>Absence of demographic bias in scoring is provable.<\/li>\n<\/ol>\n<h2>What drives this<\/h2>\n<ul>\n<li><strong>Silent degradation<\/strong>: an under-the-hood model update tanks quality invisibly.<\/li>\n<li><strong>EU AI Act (high-risk)<\/strong>: Art. 10 (data quality, non-discrimination), Art. 15 (accuracy, robustness), Art. 14 (human oversight).<\/li>\n<li><strong>Bias<\/strong>: systematically worse outcomes for a demographic group means a lawsuit, a fine, and reputational damage.<\/li>\n<li><strong>OWASP LLM<\/strong>: LLM09 (Misinformation) \u2014 hallucinations as a class of failure.<\/li>\n<\/ul>\n<h2>The architectural pattern<\/h2>\n<p><strong>Continuous Evaluation &amp; LLM-as-a-Judge Pipeline.<\/strong> Evaluation is a continuous process: regression against golden datasets in CI\/CD, online RAG metrics, drift monitoring, and fairness tests \u2014 all backed by an honestly calibrated judge.<\/p>\n<h3>Engineering stack<\/h3>\n<ul>\n<li><strong>Eval frameworks<\/strong>: Ragas (v0.2+ \u2014 no longer just RAG, agentic pipelines too), DeepEval, TruLens, MLflow (experiments and registry).<\/li>\n<li><strong>Drift and data quality<\/strong>: Evidently AI, Great Expectations.<\/li>\n<li><strong>Judge<\/strong>: LLM-as-a-judge, calibrated against human labeling.<\/li>\n<\/ul>\n<h2>Engineering implementation<\/h2>\n<h3>Step 1. Golden datasets<\/h3>\n<p>Reference sets for regression-testing prompts and models in CI\/CD. A model or prompt update can&#x27;t ship without passing the run. The dataset includes &quot;hard&quot; cases and cases pulled from real incidents.<\/p>\n<h3>Step 2. Online RAG metrics<\/h3>\n<p>On a sample of production traffic: <strong>Faithfulness<\/strong> (grounding to context \u2014 a direct defense against the hallucinations from the opening scenario), <strong>Answer Relevance<\/strong>, <strong>Context Recall\/Precision<\/strong>. This ties to the output guardrail from Chapter 3 \u2014 that&#x27;s the real-time block; this is the trend.<\/p>\n<h3>Step 3. Drift monitoring<\/h3>\n<p>Anomalies in the distribution of incoming query embeddings (data drift) and in answer quality (concept drift). A shift triggers an alert. One subtlety: semantic caching (Chapter 5) masks drift \u2014 measure on the uncached sample.<\/p>\n<h3>Step 4. Fairness and bias<\/h3>\n<p>A regular run of synthetic tests: swap protected attributes (gender, age, region) while holding everything else equal, then compare decisions. A systematic difference is a bias signal. For Kovcheg, this is a mandatory gate for the credit module.<\/p>\n<h3>Step 5. Release eval gate<\/h3>\n<p>Metrics are part of the pipeline (policy-as-code, Chapter 6). Falling below a threshold blocks the deploy:<\/p>\n<pre><code class=\"language-yaml\">eval_gate:\n  faithfulness:      {min: 0.92}\n  answer_relevance:  {min: 0.85}\n  fairness_delta:    {max: 0.03}   # max. difference in decisions on attribute swap\n  block_release_on_fail: true<\/code><\/pre>\n<h2>Where it breaks<\/h2>\n<ul>\n<li><strong>LLM-as-judge is itself biased and non-deterministic.<\/strong> Documented distortions: verbosity bias (longer = &quot;better&quot;), self-preference (favors its own style), position bias (answer order). Mitigation: randomize order, use clear rubrics, ensemble judges, human golden labeling. Without calibration, you&#x27;re &quot;evaluating the evaluator.&quot;<\/li>\n<li><strong>Calibration drifts.<\/strong> Judge-human agreement that was solid six months ago goes stale \u2014 prompts, data, and model versions change. Recalibration is a recurring process, not a one-off.<\/li>\n<li><strong>The golden dataset goes stale.<\/strong> It doesn&#x27;t cover new cases, so metrics stay green during real degradation. Refresh the dataset from incidents and production traffic.<\/li>\n<li><strong>Fairness is hard to measure.<\/strong> &quot;Fairness&quot; is context-dependent; several formal fairness metrics are mathematically incompatible at the same time \u2014 choosing a metric itself requires justification.<\/li>\n<li><strong>Cost.<\/strong> Continuous judge evaluation is expensive; sampling versus completeness is a real tradeoff.<\/li>\n<\/ul>\n<h2>Standards and mapping<\/h2>\n<ul>\n<li><strong>EU AI Act<\/strong>: Art. 10 (data governance\/quality, non-discrimination), Art. 15 (accuracy\/robustness), Art. 14 (human oversight).<\/li>\n<li><strong>ISO\/IEC 42001<\/strong>: performance monitoring, continual improvement.<\/li>\n<li><strong>NIST AI RMF<\/strong>: Measure (valid, reliable, fair, safe).<\/li>\n<li><strong>OWASP LLM<\/strong>: LLM09 (Misinformation).<\/li>\n<\/ul>\n<h2>Lab and artifact<\/h2>\n<p>Build a golden dataset for Kovcheg (including incident-derived cases), configure Ragas metrics online, set up Evidently for embedding drift on the uncached sample, implement an attribute-swap fairness test for the credit module, wire an eval gate into CI, calibrate the judge against human labeling, and measure agreement.<\/p>\n<p><strong>Artifact<\/strong>: an eval suite + a quality\/drift dashboard + a fairness report + a judge-calibration report (evidence for the RMS, Chapter 6).<\/p>\n<h2>Maturity checklist<\/h2>\n<ul>\n<li><strong>L1<\/strong>: manual quality checks on update.<\/li>\n<li><strong>L2<\/strong>: a golden dataset + online RAG metrics, drift alerts.<\/li>\n<li><strong>L3<\/strong>: an eval gate in CI, a calibrated judge with recalibration, regular fairness runs, drift measured on the uncached sample, tied into the RMS (Chapter 6).<\/li>\n<\/ul>\n<h2>Sources<\/h2>\n<ul>\n<li><a href=\"https:\/\/deepchecks.com\/llm-judge-calibration-automated-issues\/\">LLM-as-a-Judge calibration: power &amp; limits (Deepchecks)<\/a><\/li>\n<li><a href=\"https:\/\/letsdatascience.com\/blog\/llm-evaluation-ragas-llm-as-a-judge-and-production-evals\">RAGAS and LLM-as-Judge production evals<\/a><\/li>\n<li><a href=\"https:\/\/arxiv.org\/html\/2602.20379v1\">Case-Aware LLM-as-a-Judge for Enterprise RAG (arXiv)<\/a><\/li>\n<li><a href=\"https:\/\/wandb.ai\/site\/articles\/exploring-llm-as-a-judge\/\">Exploring LLM-as-a-Judge (Weights &amp; Biases)<\/a><\/li>\n<\/ul>\n<p>The provider will update the base model again next quarter \u2014 the version string won&#x27;t change, and the behavior will shift. The question is whether your eval gate catches it before compliance does.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>A provider quietly updates the base model. The API is unchanged, behavior shifts, and no one deployed a thing. Continuous evaluation and LLM-as-a-judge are how you catch it before compliance asks why approvals in region N dropped.<\/p>\n","protected":false},"author":0,"featured_media":185,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[147],"tags":[150,189,188,187,190,186],"class_list":["post-186","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-governance","tag-ai-governance","tag-bias","tag-fairness","tag-llm-evaluation","tag-llm-as-a-judge","tag-model-drift"],"aioseo_notices":[],"aioseo_head":"\n\t\t<!-- All in One SEO 4.9.10 - aioseo.com -->\n\t<meta name=\"description\" content=\"Silent model degradation, drift monitoring, LLM-as-a-judge calibration, and fairness testing as a release gate.\" \/>\n\t<meta name=\"robots\" content=\"max-image-preview:large\" \/>\n\t<link rel=\"canonical\" href=\"https:\/\/www.dobryakov.net\/blog\/186\/\" \/>\n\t<meta name=\"generator\" content=\"All in One SEO (AIOSEO) 4.9.10\" \/>\n\t\t<meta property=\"og:locale\" content=\"en_US\" \/>\n\t\t<meta property=\"og:site_name\" content=\"Grigoriy Dobryakov - IT+AI Blog - Grigoriy Dobryakov&#039;s blog: management, development and testing\" \/>\n\t\t<meta property=\"og:type\" content=\"article\" \/>\n\t\t<meta property=\"og:title\" content=\"AI Quality, Drift &amp; Fairness: continuous evaluation\" \/>\n\t\t<meta property=\"og:description\" content=\"Silent model degradation, drift monitoring, LLM-as-a-judge calibration, and fairness testing as a release gate.\" \/>\n\t\t<meta property=\"og:url\" content=\"https:\/\/www.dobryakov.net\/blog\/186\/\" \/>\n\t\t<meta property=\"article:published_time\" content=\"2026-09-25T08:00:45+00:00\" \/>\n\t\t<meta property=\"article:modified_time\" content=\"2026-09-25T08:00:45+00:00\" \/>\n\t\t<meta name=\"twitter:card\" content=\"summary_large_image\" \/>\n\t\t<meta name=\"twitter:title\" content=\"AI Quality, Drift &amp; Fairness: continuous evaluation\" \/>\n\t\t<meta name=\"twitter:description\" content=\"Silent model degradation, drift monitoring, LLM-as-a-judge calibration, and fairness testing as a release gate.\" \/>\n\t\t<script type=\"application\/ld+json\" class=\"aioseo-schema\">\n\t\t\t{\"@context\":\"https:\\\/\\\/schema.org\",\"@graph\":[{\"@type\":\"BlogPosting\",\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/186\\\/#blogposting\",\"name\":\"AI Quality, Drift & Fairness: continuous evaluation\",\"headline\":\"AI Quality, Drift &#038; Fairness: continuous evaluation and bias mitigation\",\"author\":{\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/author\\\/#author\"},\"publisher\":{\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/#organization\"},\"image\":{\"@type\":\"ImageObject\",\"url\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/wp-content\\\/uploads\\\/2026\\\/09\\\/ai-governance-quality-drift-fairness.jpg\",\"width\":1200,\"height\":630,\"caption\":\"AI Quality, Drift & Fairness: continuous evaluation and bias mitigation\"},\"datePublished\":\"2026-09-25T08:00:45+00:00\",\"dateModified\":\"2026-09-25T08:00:45+00:00\",\"inLanguage\":\"en-US\",\"mainEntityOfPage\":{\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/186\\\/#webpage\"},\"isPartOf\":{\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/186\\\/#webpage\"},\"articleSection\":\"AI Governance, ai-governance, bias, fairness, LLM evaluation, LLM-as-a-judge, model drift\"},{\"@type\":\"BreadcrumbList\",\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/186\\\/#breadcrumblist\",\"itemListElement\":[{\"@type\":\"ListItem\",\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog#listItem\",\"position\":1,\"name\":\"Home\",\"item\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\",\"nextItem\":{\"@type\":\"ListItem\",\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/category\\\/ai-governance\\\/#listItem\",\"name\":\"AI Governance\"}},{\"@type\":\"ListItem\",\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/category\\\/ai-governance\\\/#listItem\",\"position\":2,\"name\":\"AI Governance\",\"item\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/category\\\/ai-governance\\\/\",\"nextItem\":{\"@type\":\"ListItem\",\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/186\\\/#listItem\",\"name\":\"AI Quality, Drift &#038; Fairness: continuous evaluation and bias mitigation\"},\"previousItem\":{\"@type\":\"ListItem\",\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog#listItem\",\"name\":\"Home\"}},{\"@type\":\"ListItem\",\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/186\\\/#listItem\",\"position\":3,\"name\":\"AI Quality, Drift &#038; Fairness: continuous evaluation and bias mitigation\",\"previousItem\":{\"@type\":\"ListItem\",\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/category\\\/ai-governance\\\/#listItem\",\"name\":\"AI Governance\"}}]},{\"@type\":\"Organization\",\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/#organization\",\"name\":\"Grigoriy Dobryakov - IT+AI Blog\",\"description\":\"Grigoriy Dobryakov's blog: management, development and testing\",\"url\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/\"},{\"@type\":\"WebPage\",\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/186\\\/#webpage\",\"url\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/186\\\/\",\"name\":\"AI Quality, Drift & Fairness: continuous evaluation\",\"description\":\"Silent model degradation, drift monitoring, LLM-as-a-judge calibration, and fairness testing as a release gate.\",\"inLanguage\":\"en-US\",\"isPartOf\":{\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/#website\"},\"breadcrumb\":{\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/186\\\/#breadcrumblist\"},\"author\":{\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/author\\\/#author\"},\"creator\":{\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/author\\\/#author\"},\"image\":{\"@type\":\"ImageObject\",\"url\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/wp-content\\\/uploads\\\/2026\\\/09\\\/ai-governance-quality-drift-fairness.jpg\",\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/186\\\/#mainImage\",\"width\":1200,\"height\":630,\"caption\":\"AI Quality, Drift & Fairness: continuous evaluation and bias mitigation\"},\"primaryImageOfPage\":{\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/186\\\/#mainImage\"},\"datePublished\":\"2026-09-25T08:00:45+00:00\",\"dateModified\":\"2026-09-25T08:00:45+00:00\"},{\"@type\":\"WebSite\",\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/#website\",\"url\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/\",\"name\":\"Grigoriy Dobryakov - IT+AI Blog\",\"description\":\"Grigoriy Dobryakov's blog: management, development and testing\",\"inLanguage\":\"en-US\",\"publisher\":{\"@id\":\"https:\\\/\\\/www.dobryakov.net\\\/blog\\\/#organization\"}}]}\n\t\t<\/script>\n\t\t<!-- All in One SEO -->\n\n","aioseo_head_json":{"title":"AI Quality, Drift & Fairness: continuous evaluation","description":"Silent model degradation, drift monitoring, LLM-as-a-judge calibration, and fairness testing as a release gate.","canonical_url":"https:\/\/www.dobryakov.net\/blog\/186\/","robots":"max-image-preview:large","keywords":"","webmasterTools":{"miscellaneous":""},"schema":{"@context":"https:\/\/schema.org","@graph":[{"@type":"BlogPosting","@id":"https:\/\/www.dobryakov.net\/blog\/186\/#blogposting","name":"AI Quality, Drift & Fairness: continuous evaluation","headline":"AI Quality, Drift &#038; Fairness: continuous evaluation and bias mitigation","author":{"@id":"https:\/\/www.dobryakov.net\/blog\/author\/#author"},"publisher":{"@id":"https:\/\/www.dobryakov.net\/blog\/#organization"},"image":{"@type":"ImageObject","url":"https:\/\/www.dobryakov.net\/blog\/wp-content\/uploads\/2026\/09\/ai-governance-quality-drift-fairness.jpg","width":1200,"height":630,"caption":"AI Quality, Drift & Fairness: continuous evaluation and bias mitigation"},"datePublished":"2026-09-25T08:00:45+00:00","dateModified":"2026-09-25T08:00:45+00:00","inLanguage":"en-US","mainEntityOfPage":{"@id":"https:\/\/www.dobryakov.net\/blog\/186\/#webpage"},"isPartOf":{"@id":"https:\/\/www.dobryakov.net\/blog\/186\/#webpage"},"articleSection":"AI Governance, ai-governance, bias, fairness, LLM evaluation, LLM-as-a-judge, model drift"},{"@type":"BreadcrumbList","@id":"https:\/\/www.dobryakov.net\/blog\/186\/#breadcrumblist","itemListElement":[{"@type":"ListItem","@id":"https:\/\/www.dobryakov.net\/blog#listItem","position":1,"name":"Home","item":"https:\/\/www.dobryakov.net\/blog","nextItem":{"@type":"ListItem","@id":"https:\/\/www.dobryakov.net\/blog\/category\/ai-governance\/#listItem","name":"AI Governance"}},{"@type":"ListItem","@id":"https:\/\/www.dobryakov.net\/blog\/category\/ai-governance\/#listItem","position":2,"name":"AI Governance","item":"https:\/\/www.dobryakov.net\/blog\/category\/ai-governance\/","nextItem":{"@type":"ListItem","@id":"https:\/\/www.dobryakov.net\/blog\/186\/#listItem","name":"AI Quality, Drift &#038; Fairness: continuous evaluation and bias mitigation"},"previousItem":{"@type":"ListItem","@id":"https:\/\/www.dobryakov.net\/blog#listItem","name":"Home"}},{"@type":"ListItem","@id":"https:\/\/www.dobryakov.net\/blog\/186\/#listItem","position":3,"name":"AI Quality, Drift &#038; Fairness: continuous evaluation and bias mitigation","previousItem":{"@type":"ListItem","@id":"https:\/\/www.dobryakov.net\/blog\/category\/ai-governance\/#listItem","name":"AI Governance"}}]},{"@type":"Organization","@id":"https:\/\/www.dobryakov.net\/blog\/#organization","name":"Grigoriy Dobryakov - IT+AI Blog","description":"Grigoriy Dobryakov's blog: management, development and testing","url":"https:\/\/www.dobryakov.net\/blog\/"},{"@type":"WebPage","@id":"https:\/\/www.dobryakov.net\/blog\/186\/#webpage","url":"https:\/\/www.dobryakov.net\/blog\/186\/","name":"AI Quality, Drift & Fairness: continuous evaluation","description":"Silent model degradation, drift monitoring, LLM-as-a-judge calibration, and fairness testing as a release gate.","inLanguage":"en-US","isPartOf":{"@id":"https:\/\/www.dobryakov.net\/blog\/#website"},"breadcrumb":{"@id":"https:\/\/www.dobryakov.net\/blog\/186\/#breadcrumblist"},"author":{"@id":"https:\/\/www.dobryakov.net\/blog\/author\/#author"},"creator":{"@id":"https:\/\/www.dobryakov.net\/blog\/author\/#author"},"image":{"@type":"ImageObject","url":"https:\/\/www.dobryakov.net\/blog\/wp-content\/uploads\/2026\/09\/ai-governance-quality-drift-fairness.jpg","@id":"https:\/\/www.dobryakov.net\/blog\/186\/#mainImage","width":1200,"height":630,"caption":"AI Quality, Drift & Fairness: continuous evaluation and bias mitigation"},"primaryImageOfPage":{"@id":"https:\/\/www.dobryakov.net\/blog\/186\/#mainImage"},"datePublished":"2026-09-25T08:00:45+00:00","dateModified":"2026-09-25T08:00:45+00:00"},{"@type":"WebSite","@id":"https:\/\/www.dobryakov.net\/blog\/#website","url":"https:\/\/www.dobryakov.net\/blog\/","name":"Grigoriy Dobryakov - IT+AI Blog","description":"Grigoriy Dobryakov's blog: management, development and testing","inLanguage":"en-US","publisher":{"@id":"https:\/\/www.dobryakov.net\/blog\/#organization"}}]},"og:locale":"en_US","og:site_name":"Grigoriy Dobryakov - IT+AI Blog - Grigoriy Dobryakov's blog: management, development and testing","og:type":"article","og:title":"AI Quality, Drift &amp; Fairness: continuous evaluation","og:description":"Silent model degradation, drift monitoring, LLM-as-a-judge calibration, and fairness testing as a release gate.","og:url":"https:\/\/www.dobryakov.net\/blog\/186\/","article:published_time":"2026-09-25T08:00:45+00:00","article:modified_time":"2026-09-25T08:00:45+00:00","twitter:card":"summary_large_image","twitter:title":"AI Quality, Drift &amp; Fairness: continuous evaluation","twitter:description":"Silent model degradation, drift monitoring, LLM-as-a-judge calibration, and fairness testing as a release gate."},"aioseo_meta_data":{"post_id":"186","title":"AI Quality, Drift & Fairness: continuous evaluation","description":"Silent model degradation, drift monitoring, LLM-as-a-judge calibration, and fairness testing as a release gate.","keywords":null,"keyphrases":null,"primary_term":null,"canonical_url":null,"og_title":"AI Quality, Drift & Fairness: continuous evaluation","og_description":"Silent model degradation, drift monitoring, LLM-as-a-judge calibration, and fairness testing as a release gate.","og_object_type":"default","og_image_type":"default","og_image_custom_url":null,"og_image_custom_fields":null,"og_image_url":null,"og_image_width":null,"og_image_height":null,"og_video":null,"og_custom_url":null,"og_article_section":null,"og_article_tags":null,"twitter_use_og":false,"twitter_card":"default","twitter_image_type":"default","twitter_image_custom_url":null,"twitter_image_custom_fields":null,"twitter_image_url":null,"twitter_title":"AI Quality, Drift & Fairness: continuous evaluation","twitter_description":"Silent model degradation, drift monitoring, LLM-as-a-judge calibration, and fairness testing as a release gate.","schema_type":"default","schema_type_options":null,"schema":{"blockGraphs":[],"customGraphs":[],"default":{"data":{"Article":[],"Course":[],"Dataset":[],"FAQPage":[],"Movie":[],"Person":[],"Product":[],"ProductReview":[],"Car":[],"Recipe":[],"Service":[],"SoftwareApplication":[],"WebPage":[]},"graphName":"","isEnabled":true},"graphs":[]},"pillar_content":false,"robots_default":true,"robots_noindex":false,"robots_noarchive":false,"robots_nosnippet":false,"robots_nofollow":false,"robots_noimageindex":false,"robots_noodp":false,"robots_notranslate":false,"robots_max_snippet":null,"robots_max_videopreview":null,"robots_max_imagepreview":"large","priority":null,"frequency":null,"local_seo":null,"limit_modified_date":false,"ai":null,"breadcrumb_settings":null,"seo_analyzer_scan_date":null,"created":"2026-09-25 08:01:04","updated":"2026-09-25 08:01:04"},"aioseo_breadcrumb":"<div class=\"aioseo-breadcrumbs\"><span class=\"aioseo-breadcrumb\">\n\t\t\t<a href=\"https:\/\/www.dobryakov.net\/blog\" title=\"Home\">Home<\/a>\n\t\t<\/span><span class=\"aioseo-breadcrumb-separator\">&raquo;<\/span><span class=\"aioseo-breadcrumb\">\n\t\t\t<a href=\"https:\/\/www.dobryakov.net\/blog\/category\/ai-governance\/\" title=\"AI Governance\">AI Governance<\/a>\n\t\t<\/span><span class=\"aioseo-breadcrumb-separator\">&raquo;<\/span><span class=\"aioseo-breadcrumb\">\n\t\t\tAI Quality, Drift &amp; Fairness: continuous evaluation and bias mitigation\n\t\t<\/span><\/div>","aioseo_breadcrumb_json":[{"label":"Home","link":"https:\/\/www.dobryakov.net\/blog"},{"label":"AI Governance","link":"https:\/\/www.dobryakov.net\/blog\/category\/ai-governance\/"},{"label":"AI Quality, Drift &#038; Fairness: continuous evaluation and bias mitigation","link":"https:\/\/www.dobryakov.net\/blog\/186\/"}],"_links":{"self":[{"href":"https:\/\/www.dobryakov.net\/blog\/wp-json\/wp\/v2\/posts\/186","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.dobryakov.net\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.dobryakov.net\/blog\/wp-json\/wp\/v2\/types\/post"}],"replies":[{"embeddable":true,"href":"https:\/\/www.dobryakov.net\/blog\/wp-json\/wp\/v2\/comments?post=186"}],"version-history":[{"count":0,"href":"https:\/\/www.dobryakov.net\/blog\/wp-json\/wp\/v2\/posts\/186\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.dobryakov.net\/blog\/wp-json\/wp\/v2\/media\/185"}],"wp:attachment":[{"href":"https:\/\/www.dobryakov.net\/blog\/wp-json\/wp\/v2\/media?parent=186"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.dobryakov.net\/blog\/wp-json\/wp\/v2\/categories?post=186"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.dobryakov.net\/blog\/wp-json\/wp\/v2\/tags?post=186"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}