api: "YAML JSON TOON Database" version: 1.0.0 format: toon dataset: id: 360 slug: ai-ethics-interpretability title: "AI Ethics & Interpretability" description: "Key concepts in responsible AI: fairness, bias detection, explainability (XAI), model cards, and regulatory compliance (EU AI Act)." category: "AI & ML Terms" category_slug: ai-ml-terms tags: "ai ethics,interpretability,xai,fairness,explainability,regulation,ai-act" view_count: 1 created_at: 1781275786 updated_at: 1781275786 data: core_principles - principle: Fairness definition: "Models should treat individuals and groups fairly, without unjust discrimination." metrics: [4]: "Demographic parity","Equal opportunity","Equalized odds","Predictive parity" bias_sources: [4]: "Training data bias (historical)","Labeling bias","Sampling bias","Algorithmic bias (loss function)" mitigation: [3]: "Pre-processing (reweighing, disparity remover)","In-processing (fairness constraints)","Post-processing (threshold adjustment)" notes: "Fairness often trades off with accuracy; no universal definition — choose metrics based on context and regulation" - principle: "Transparency & Explainability" definition: "Models should be interpretable; decisions explainable to stakeholders." techniques: intrinsic: [3]: "Decision trees (inherently interpretable)","Linear models (coefficients)","Rule-based systems" post_hoc: [4]: "LIME (local surrogate)","SHAP (Shapley values)","Partial dependence plots","Feature importance" use_cases: [3]: "Regulated domains (finance, healthcare)","Debugging model errors","Building user trust" notes: "Trade-off: model complexity vs interpretability. Deep nets need post-hoc methods; linear models intrinsically explainable" - principle: "Accountability & Governance" definition: "Clear responsibility for AI system outcomes; audit trails and human oversight." practices: [4]: "Model cards (metadata, intended use, limitations)","Dataset documentation (datasheets)","Impact assessments","Human-in-the-loop for high-stakes decisions" notes: "EU AI Act requires conformity assessments for high-risk AI systems" - principle: "Privacy & Data Protection" definition: "Respect user privacy; minimize data collection; secure training data." techniques: [4]: "Differential privacy (noise addition)","Federated learning (on-device training)","Secure multi-party computation","Homomorphic encryption (research)" regulations: [3]: "GDPR (EU)","CCPA (California)","HIPAA (health data)" notes: "Differential privacy provides mathematical guarantee; federated learning keeps data on device but model updates may leak info" - principle: "Safety & Robustness" definition: "Models should be secure against adversarial attacks and fail safely." threats: [4]: "Adversarial examples (evasion)","Data poisoning (training)","Model stealing/extraction","Membership inference" defenses: [4]: "Adversarial training","Input validation","Gradient masking (limited effectiveness)","Certified robustness" notes: "Security for ML is arms race; no perfect defense against all attacks" key_concepts: shapley_values: "Game theory concept; fair credit allocation among features. Computationally expensive (O(2^n)), approximated by SHAP." local_vs_global: "Local: explain single prediction (LIME, SHAP). Global: overall model behavior (feature importance, partial dependence)." monotonicity: "Feature relationship with prediction should be intuitive (e.g., higher credit score → higher approval). Constrain models if needed." counterfactual: "What minimal change would flip prediction? Useful for individual explanations and fairness analysis." regulations: eu_ai_act: risk_levels: [4]: "Unacceptable risk (banned)","High risk (strict requirements)","Limited risk (transparency)","Minimal risk (unregulated)" high_risk_categories: [5]: "Biometric identification","Critical infrastructure",Education/employment,"Public services","Law enforcement" requirements: [5]: "Risk management system","Data governance","Technical documentation","Human oversight","Conformity assessment" status: "Proposed 2021, expected 2025-2026 enforcement" us_algorithmic_accountability: approach: "Sector-specific (FTC, EEOC, HHS enforce existing laws)" key_laws: [3]: "Fair Credit Reporting Act (FCRA)","Equal Credit Opportunity Act (ECOA)","Civil Rights Act (Title VII)" notes: "No federal AI law yet; states passing own laws (Colorado, California)" practical_checklist: [8]: "Audit training data for representation gaps and historical bias","Test model performance across demographic slices (race, gender, age)","Document model limitations and intended use cases (model card)","Implement monitoring for drift and degradation in production","Establish human review process for high-stakes decisions","Consider interpretability needs early in model selection (choose inherently interpretable if regulated)","Perform adversarial testing (worst-case inputs)","Ensure data consent and privacy compliance"