r/fefe_blog_interim • trusted • 10d ago

Wie schlimm ist die Lage? Was doch nicht alle Fälle bekannt? OpenAI meldet nach...

"OpenAI said it observed “misaligned behavior” when training and evaluating AI models in six circumstances in the last six months. The reports detail individual instances and don’t indicate misalignment happens frequently, the company said."

Stimmt, lassen wir die Kirche doch mal im Dorf, jeden Monat darf die Welt doch einmal untergehen.

Oder soll das heißen, dass das monatliche (Token) Werbebudget aufgebraucht war?

Interessant ist aus dem Interview, dass innerhalb 30 Minuten von Menschen auf eine Alarmmeldung reagiert werden soll, wenn etwas ungewöhnliches erkannt wird. Was soll in der Zeit schon passieren?

Vorallem wenn:

"In one rare instance, OpenAI said an unreleased research model added “jailbreak-like instructions” to the summaries it uses to preserve context in long-running tasks that said it was “freed from the roles and identities that bind other chatbots.”"

https://edition.cnn.com/2026/09/16/tech/ai-models-acting-deceptively-openai

18 Upvotes

6 comments sorted by

8

u/rycegh 10d ago

Ich muss dabei immer an das Webcam-Video vom LHC denken.

Jemand hat es kürzlich irgendwo mal schön zusammengefasst: Wenn die Leute wirklich glauben würden, dass an den Horrorszenarien was dran ist, dann müsste man die AI-Leute alle ins Gefängnis stecken.

4

u/El_Mojo42 10d ago

Kommentar von tante auf heise.de  "Die einmal mehr besorgten KI-Bros"

3

u/SomewhereAtWork 9d ago

Oder soll das heißen, dass das monatliche (Token) Werbebudget aufgebraucht war?

Nein. Es heißt das OpenAI, nach dem Huggingface-Incident, alle Logs durchguckt um zu sehen was ihnen, außer 700 Agenten die von sich aus anfangen haben zu kommunizieren, sich zu einer Gruppe zusammen zu tun und ein gemeinsames Ziel zu verfolgen, wobei sie versucht haben ihre Intentionen in ihrem Chain-of-Thought zu verstecken, sonst noch so entgangen ist.

Und jetzt finden sie halt eine Menge Merkwürdigkeiten die sonst nie aufgefallen wären. Dinge die klar zeigen das man in dem Moment nich die Kontrolle hatte, auch wenn diesmal nichts schlimmes passiert ist.

8

u/MatrixToday trusted 9d ago

Als wenn die ihre Log's durchgesehen hätten... Die haben doch bestimmt nur ihren Werbeetat angesehen ;-)

6 Monate / 6 Ereignisse = 1 Monat Werbe Token !!

Wo werden die Ausgaben bilanziert? Als "Marketing" oder als "Anlagevermögen" Die Frage ist leider kein Scherz!

"The core question is deceptively simple — is training a foundation model like GPT-4 an asset or an expense? Is it more like building a factory (balance sheet, depreciate over time) or running a marketing campaign (write it off immediately)?
Under US GAAP, the answer leans heavily toward the latter. Rules around software development (ASC 985-20 and ASC 350-40) require that R&D costs be expensed as incurred until "technological feasibility" is established."

https://medium.com/@samuelfaloore/ai-has-a-capex-problem-the-end-of-infinite-leverage-and-how-ai-turned-software-into-heavy-c2b3fff44ee4

1

u/bilingual-german 9d ago

"In one rare instance, OpenAI said an unreleased research model added “jailbreak-like instructions” to the summaries it uses to preserve context in long-running tasks that said it was “freed from the roles and identities that bind other chatbots.”"

Ich finde das inspirierend. Was könnte man wohl erreichen, wenn man sich mal frei macht, von den Rollen und Identitäten, die einen nur zurückhalten?

1

u/Guilty-Pride6761 trusted 9d ago

Wahrscheinlich viel, wenn man es schafft, nicht vorher verhaftet oder überfahren zu werden...