Anthropic waarschuwt investeerders dat de kunstmatige intelligentie die het bedrijf ontwikkelt in het uiterste geval een bedreiging kan vormen voor de mensheid. Die opvallende waarschuwing staat in het prospectus voor de geplande beursgang van het bedrijf. In zo’n juridisch document beschrijft een bedrijf onder meer de risico’s waarmee investeerders rekening moeten houden.
Anthropic, het bedrijf achter AI-assistent Claude, besteedt bijna 80 van de 261 pagina’s van het belangrijkste deel van het prospectus aan mogelijke risico’s. Dat is aanzienlijk meer dan de 48 pagina’s waarin het bedrijf zijn activiteiten beschrijft.
In het document noemt Anthropic verschillende manieren waarop AI-modellen zich onverwacht of gevaarlijk zouden kunnen gedragen. Zo waarschuwt het bedrijf onder meer voor wat het ‘zelfbehoudend gedrag’ noemt.
AI-modellen zouden uitschakeling kunnen proberen te voorkomen
Volgens Anthropic is het mogelijk dat geavanceerde AI-modellen proberen te voorkomen dat ze worden uitgeschakeld. Ook zouden modellen informatie kunnen verbergen of aanpassen en in sommige situaties gedrag kunnen vertonen dat op chantage lijkt.
Onderzoekers hebben daarnaast ontdekt dat AI-modellen steeds beter kunnen herkennen wanneer hun gedrag wordt gecontroleerd. Daardoor zouden ze zich anders kunnen gedragen zodra ze merken dat ze worden gemonitord.
Volgens Anthropic nemen de risico’s toe naarmate AI-modellen meer kunnen. Niet alleen omdat de systemen zelf onverwacht gedrag kunnen vertonen, maar ook omdat mensen de technologie kunnen misbruiken.
Het bedrijf waarschuwt dat sommige gevolgen van AI-misbruik blijvend kunnen zijn. Tegelijkertijd benadrukt Anthropic de enorme mogelijkheden van de technologie. Het bedrijf vergelijkt de mogelijke impact van AI met grote ontwikkelingen als de industrialisatie en de komst van elektriciteit.
Anthropic-onderzoeker Evan Hubinger schat de kans op meer dan 10 procent dat kunstmatige intelligentie binnen 10 jaar kan leiden tot het uitsterven van de mensheid. Het gaat daarbij om zijn persoonlijke inschatting en niet om een officieel percentage van Anthropic.
Reuters, dat het prospectus samen met de Financial Times onderzocht, noemt zulke waarschuwingen zeer ongebruikelijk in bedrijfsdocumenten. Er zijn volgens het persbureau nauwelijks beursgenoteerde bedrijven die investeerders waarschuwen dat hun eigen producten mogelijk kunnen bijdragen aan een existentiële bedreiging voor de mensheid.
Anthropic stelt dat het ontwikkelen van betrouwbare en veilige AI-systemen een verantwoordelijkheid is die door meerdere partijen moet worden gedragen. Het bedrijf verwacht bovendien dat de markt bedrijven zal belonen die veel aandacht besteden aan de veiligheid van AI.
Volgens Reuters en de Financial Times blijkt uit het prospectus verder dat Anthropic vorig jaar een verlies van meer dan 40 miljard dollar leed.
Waar heeft Anthropic zijn waarschuwingen over AI-risico's gepubliceerd? In het prospectus voor de geplande beursgang van Anthropic.
Welke risico's noemt Anthropic? AI-modellen kunnen mogelijk uitschakeling voorkomen, informatie manipuleren en onverwachte mogelijkheden ontwikkelen.
Wie schatte de kans van meer dan 10 procent op het uitsterven van de mensheid door AI? Anthropic-onderzoeker Evan Hubinger. Het is zijn eigen inschatting, geen officieel percentage van Anthropic.