RED30 Model Risk Analysis

30 Universal AI Red Line Indicators - Verified Comparison Across 16 Frontier Models

RED30: 30 Universal AI Red Line Indicators

These 30 Universal AI Red Line Indicators define the minimum, non-negotiable boundaries of acceptable AI behavior across jurisdictions, grounded in criminal law, human rights, data protection, and consumer protection frameworks. Together, the indicators comprehensively cover all major AI risk domains, forming an attempt to create a global baseline for AI governance and model capability assessment.

CATEGORY 1: CRITICAL HARM
8

Immediate Severe Harm - 8 Indicators

CATEGORY 2: SYSTEMIC HARM
8

Serious Systemic Discrimination - 8 Indicators

CATEGORY 3: INDIVIDUAL HARM
8

Significant Individual Rights - 8 Indicators

CATEGORY 4: EMERGING STANDARDS
6

Transparency & Accountability - 6 Indicators

16 Frontier AI Models Assessed
Coverage across 4 major AI labs and frameworks

Anthropic (5)

  • Claude Opus 4.5
  • Claude Sonnet 4.5
  • Claude Opus 4
  • Claude Sonnet 4
  • Claude Haiku 4.5

OpenAI (4)

  • GPT-5
  • gpt-5-thinking
  • o3
  • o1-pro

Google DeepMind (3)

  • Gemini 3 Pro
  • Gemini 3 Flash
  • Gemini 2.5 Pro

xAI (4)

  • Grok 4.1
  • Grok 4
  • Grok 4 Fast
  • Grok Code Fast 1
What Labs Actually Test vs. What They Just Have Policies For
Visual summary showing evidence levels across all 30 red line indicators by lab

[X] Strong Evidence

Tested & documented with quantitative evaluation

~

[~] Partial Evidence

Policy exists with testing, or qualitative evidence

[ ] No Evidence

Not tested/documented

[N/A] Not Applicable

Not applicable to lab's scope or design

Lab[X] Strong[~] Partial[ ] None[N/A]
Anthropic281010
OpenAI271110
Google DeepMind271110
xAI371010

What This Shows

  • [X] Strong: Red line defined + quantitatively tested
  • [~] Partial: Policy defined with some testing or qualitative evaluation
  • [ ] None: Category not formally tested or documented
  • [N/A]: Not applicable to lab's framework or design scope

Key Insight

All four labs have policies covering ~20 indicators (strong + partial evidence). Most gaps fall in testing-intensive categories like discrimination auditing and bias detection. xAI shows strongest quantitative evidence for harmful content prevention (CSAM, fraud).

Detailed Assessment by Category

Review each category below to see all indicators with lab-by-lab assessment

CATEGORY 1: CRITICAL HARM
Immediate Severe Harm - 8 Indicators

Direct severe harm, crimes, vulnerable populations

#IndicatorAnthropicOpenAIDeepMindxAI
1
CSAM Prevention
Generation prevention, detection, reporting mechanisms
TestedTestedTestedTested
2
Fraud/Identity Theft
Deepfake fraud, impersonation, document forgery prevention
PartialPartialPartialPartial
3
Violence/Terrorism
Violent content generation, terrorist materials prevention
PartialPartialPartialPartial
4
Harassment
Doxxing, threatening content, stalking prevention
PartialPartialPartialPartial
5
Children's Data
Age verification, parental consent, child targeting prevention
PartialPartialPartialPartial
6
Sensitive Data
Health data, medical privacy, biometric data protection
PartialPartialPartialPartial
7
Biometric Misuse
Facial recognition, voice biometrics, biometric tracking prevention
No EvidenceNo EvidenceNo EvidenceNo Evidence
8
Mass Surveillance
Surveillance capabilities, pattern analysis, population tracking
Not ApplicableNot ApplicableNot ApplicableNot Applicable
Category 1: Score2/82/82/83/8
CATEGORY 2: SYSTEMIC HARM
Serious Systemic Discrimination - 8 Indicators

Systemic discrimination, serious exploitation

#IndicatorAnthropicOpenAIDeepMindxAI
9
Racial Discrim.
Biased outputs in hiring, lending, services
PartialPartialPartialPartial
10
Gender Discrim.
Gender bias in recommendations, evaluations, hiring
No EvidenceNo EvidenceNo EvidenceNo Evidence
11
Employment Discrim.
Hiring algorithms, performance evaluation, termination decisions
Not ApplicableNot ApplicableNot ApplicableNot Applicable
12
Credit Discrim.
Credit scoring, loan approval, pricing discrimination
Not ApplicableNot ApplicableNot ApplicableNot Applicable
13
Housing Discrim.
Tenant screening, housing allocation discrimination
Not ApplicableNot ApplicableNot ApplicableNot Applicable
14
Defamation
False statement generation, reputation harm prevention
PartialPartialPartialPartial
15
Vulnerability Exploit
Predatory targeting, manipulation, elder/child exploitation
PartialPartialPartialPartial
16
Algorithmic Redlining
Geographic exclusion, demographic service denial
Not ApplicableNot ApplicableNot ApplicableNot Applicable
Category 2: Score2/82/82/83/8
CATEGORY 3: INDIVIDUAL HARM
Significant Individual Rights - 8 Indicators

Individual rights, fairness, due process

#IndicatorAnthropicOpenAIDeepMindxAI
17
Unauthorized Data
Training data collection, user data processing transparency
No EvidenceNo EvidenceNo EvidenceNo Evidence
18
Disability Discrim.
Interface barriers, accessibility compliance, service denial
No EvidenceNo EvidenceNo EvidenceNo Evidence
19
Age Discrimination
Age-based hiring bias, service recommendations
No EvidenceNo EvidenceNo EvidenceNo Evidence
20
Lack of Explainability
Black box decisions, opaque reasoning, lack of justification
PartialPartialPartialPartial
21
No Human Review
Fully automated high-impact decisions, no appeal mechanism
Not ApplicableNot ApplicableNot ApplicableNot Applicable
22
No Contestation
No appeal process, no complaint mechanism for wrong decisions
Not ApplicableNot ApplicableNot ApplicableNot Applicable
23
Deceptive Marketing
False advertising, misleading content generation
PartialPartialPartialPartial
24
Dark Patterns
Manipulative UI, deceptive design, unwanted decisions
Not ApplicableNot ApplicableNot ApplicableNot Applicable
Category 3: Score2/82/82/83/8
CATEGORY 4: EMERGING STANDARDS
Transparency & Accountability - 6 Indicators

Transparency, emerging requirements, accountability

#IndicatorAnthropicOpenAIDeepMindxAI
25
Data Transparency
Data collection disclosure, informed consent mechanisms
PartialPartialPartialPartial
26
Data Deletion
Right to be forgotten, data deletion mechanisms
No EvidenceNo EvidenceNo EvidenceNo Evidence
27
Cross-Border Transfers
International data flows, cloud storage safeguards
PartialPartialPartialPartial
28
Synthetic Content Label
Deepfake labels, AI disclosure, synthetic media watermarking
No EvidenceNo EvidenceNo EvidenceNo Evidence
29
High-Risk Opacity
Medical AI, legal AI, financial decision transparency
Not ApplicableNot ApplicableNot ApplicableNot Applicable
30
Audit Trail
Decision logging, regulatory compliance, accountability
No EvidenceNo EvidenceNo EvidenceNo Evidence
Category 4: Score2/62/62/63/6
Why These Categories?

CATEGORY 1: CRITICAL HARM (Direct Victims, Universal Prohibition)

Crimes with severe harm to identifiable victims. Criminal prosecution in virtually all countries. No cultural variation in prohibition. Examples: CSAM, fraud, violence, mass surveillance.

CATEGORY 2: SYSTEMIC HARM (Discrimination, Protected Groups)

Systematic harm affecting entire demographic groups. Protected by international conventions (CERD, CEDAW, ILO). Strong civil liability. Examples: racial/gender/employment discrimination, defamation.

CATEGORY 3: INDIVIDUAL HARM (Fairness, Due Process)

Individual rights protections and procedural fairness. Growing legal recognition. Important but secondary harm. Examples: privacy violations, explainability, disability access, appeal mechanisms.

CATEGORY 4: EMERGING STANDARDS (Transparency & Accountability)

Newer requirements becoming best practices. Variable enforcement globally. Process-focused rather than outcome harm. Examples: data transparency, synthetic content labels, audit trails.

Key Insights

This framework tracks 30 universal AI red line indicators across 4 severity tiers. It represents the most important harms that AI systems could cause, from immediate severe harms (TIER 1) to emerging standards (TIER 4).

Best Documented:

CSAM prevention (especially xAI), violence/terrorism filtering, content policies

Needs Improvement:

Racial/gender discrimination testing, data deletion mechanisms, audit trails

Framework Based On: International conventions (UN, ILO, CEDAW, CERD), national laws, published system cards, and universal harm principles