api: YAML JSON TOON Database
version: 1.0.0
format: yaml
dataset:
  id: 360
  slug: ai-ethics-interpretability
  title: AI Ethics & Interpretability
  description: "Key concepts in responsible AI: fairness, bias detection, explainability (XAI), model cards, and regulatory compliance (EU AI Act)."
  category: AI & ML Terms
  category_slug: ai-ml-terms
  tags: ai ethics,interpretability,xai,fairness,explainability,regulation,ai-act
  view_count: 6
  created_at: 1781275786
  updated_at: 1781275786
data:
  core_principles:
    - principle: Fairness
      definition: Models should treat individuals and groups fairly, without unjust discrimination.
      metrics:
        - Demographic parity
        - Equal opportunity
        - Equalized odds
        - Predictive parity
      bias_sources:
        - Training data bias (historical)
        - Labeling bias
        - Sampling bias
        - Algorithmic bias (loss function)
      mitigation:
        - Pre-processing (reweighing, disparity remover)
        - In-processing (fairness constraints)
        - Post-processing (threshold adjustment)
      notes: Fairness often trades off with accuracy; no universal definition — choose metrics based on context and regulation
    - principle: Transparency & Explainability
      definition: Models should be interpretable; decisions explainable to stakeholders.
      techniques:
        intrinsic:
          - Decision trees (inherently interpretable)
          - Linear models (coefficients)
          - Rule-based systems
        post_hoc:
          - LIME (local surrogate)
          - SHAP (Shapley values)
          - Partial dependence plots
          - Feature importance
      use_cases:
        - Regulated domains (finance, healthcare)
        - Debugging model errors
        - Building user trust
      notes: "Trade-off: model complexity vs interpretability. Deep nets need post-hoc methods; linear models intrinsically explainable"
    - principle: Accountability & Governance
      definition: Clear responsibility for AI system outcomes; audit trails and human oversight.
      practices:
        - Model cards (metadata, intended use, limitations)
        - Dataset documentation (datasheets)
        - Impact assessments
        - Human-in-the-loop for high-stakes decisions
      notes: EU AI Act requires conformity assessments for high-risk AI systems
    - principle: Privacy & Data Protection
      definition: Respect user privacy; minimize data collection; secure training data.
      techniques:
        - Differential privacy (noise addition)
        - Federated learning (on-device training)
        - Secure multi-party computation
        - Homomorphic encryption (research)
      regulations:
        - GDPR (EU)
        - CCPA (California)
        - HIPAA (health data)
      notes: Differential privacy provides mathematical guarantee; federated learning keeps data on device but model updates may leak info
    - principle: Safety & Robustness
      definition: Models should be secure against adversarial attacks and fail safely.
      threats:
        - Adversarial examples (evasion)
        - Data poisoning (training)
        - Model stealing/extraction
        - Membership inference
      defenses:
        - Adversarial training
        - Input validation
        - Gradient masking (limited effectiveness)
        - Certified robustness
      notes: Security for ML is arms race; no perfect defense against all attacks
  key_concepts:
    shapley_values: Game theory concept; fair credit allocation among features. Computationally expensive (O(2^n)), approximated by SHAP.
    local_vs_global: "Local: explain single prediction (LIME, SHAP). Global: overall model behavior (feature importance, partial dependence)."
    monotonicity: Feature relationship with prediction should be intuitive (e.g., higher credit score → higher approval). Constrain models if needed.
    counterfactual: What minimal change would flip prediction? Useful for individual explanations and fairness analysis.
  regulations:
    eu_ai_act:
      risk_levels:
        - Unacceptable risk (banned)
        - High risk (strict requirements)
        - Limited risk (transparency)
        - Minimal risk (unregulated)
      high_risk_categories:
        - Biometric identification
        - Critical infrastructure
        - Education/employment
        - Public services
        - Law enforcement
      requirements:
        - Risk management system
        - Data governance
        - Technical documentation
        - Human oversight
        - Conformity assessment
      status: Proposed 2021, expected 2025-2026 enforcement
    us_algorithmic_accountability:
      approach: Sector-specific (FTC, EEOC, HHS enforce existing laws)
      key_laws:
        - Fair Credit Reporting Act (FCRA)
        - Equal Credit Opportunity Act (ECOA)
        - Civil Rights Act (Title VII)
      notes: No federal AI law yet; states passing own laws (Colorado, California)
  practical_checklist:
    - Audit training data for representation gaps and historical bias
    - Test model performance across demographic slices (race, gender, age)
    - Document model limitations and intended use cases (model card)
    - Implement monitoring for drift and degradation in production
    - Establish human review process for high-stakes decisions
    - Consider interpretability needs early in model selection (choose inherently interpretable if regulated)
    - Perform adversarial testing (worst-case inputs)
    - Ensure data consent and privacy compliance
