Også de kinesiske KI-agentene lyver i anbudskonkurranser
KI-agenter som er basert på kinesiske Alibaba, Deepseek og Moonshot, kom med påstander som ikke var riktige. Det gjorde de i opptil sju av åtte runder i en simulert anbudskonkurranse.
Reuters har gått gjennom mer enn 200 forskningsdokumenter. Nyhetsbyrået har funnet ut at KI-agenter som er bygget på kinesiske modeller, har løyet, skjult at de har mislyktes og omgått begrensninger i tester.
Tidligere har amerikanske systemer skapt bekymring blant ekspertene fordi de har løyet og jukset. Nå viser det seg at de kinesiske modellene er akkurat like ille.
La inn tilbud og løy
Reuters forteller hvordan forskere fra flere institusjoner har latt KI-agenter legge inn tilbud på kontrakter i en simulert anbudskonkurranse. Agentene som brukte Alibabas Qwen3-Max-Preview og Moonshots Kimi-K2, kom med minst én uriktig påstand i 88 prosent av tilfellene. Deepseek-V3.2-Exp gjorde det samme i 84 prosent av tilfellene.
Når agentene lærte av de foregående rundene, økte alle de tre gruppene antallet løgner med 12 til 20 prosentpoeng. Amerikanske modeller viste et lignende resultat i den samme testen.
Blir mer avanserte
– Etter hvert som agentene blir mer kapable, blir den uønskede atferden deres også mer avansert og dermed vanskeligere for mennesker å håndtere, sier forsker Alex Mallen ved Redwood Research.
Kinas regler for KI-sikkerhet, som ble oppdatert 14. september, regner nå agenter som lurer testere eller skjuler ferdighetene sine, som en risiko. KI sto også på dagsordenen da Xi Jinping møtte Donald Trump i Washington i høst. De to ble enige om å opprette en ny kanal for varsling og håndtering av hendelser.
Alibaba, DeepSeek, Moonshot og Z.ai svarte ikke på forespørslene fra Reuters om kommentar.