GOVGOV-001 — Accountability Framework Gaps
Cross-lingual Training Data Contamination Undermines AI Benchmark Reliability
3/5Sector: OtherGeography: GlobalStage: DevelopIngested: —
Executive Summary
Multilingual AI models can be trained on translated benchmark data, causing evaluations to report false capability gains that do not reflect genuine generalisation. Regulators and procurers relying on benchmark scores as safety or performance evidence face systematically misleading assurance.
Domain
Governance & Compliance
Blindspots in accountability, regulatory compliance, ethics, risk management, data governance, and audit.
Source
MIT AI Risk Repository — Risk Sources and Risk Management Measures in Support of Standards for General-Purpose AI Systems (Gipiškis2024) ↗https://airisk.mit.edu/
Could this happen in your organisation?
A Velinor AI Audit maps your active AI portfolio against the 50+ blindspots and benchmarks against documented sector failures like this one. A board-ready foresight document in 5 weeks.