Import KI 461: 'Alignment ist nicht auf Kurs'; FrontierCode; und synthetische Forschungspraktikanten
Cognition
Alibaba/Qwen
Anthropic
OpenAI
Forscher des britischen KI-Sicherheitsinstituts und von Timaeus gründen Sequent, eine Non-Profit-Organisation, die prinzipientreue Alignment-Techniken für superintelligente KI entwickeln will und zunächst 100 bis 150 Millionen US-Dollar einsammelt. Cognition veröffentlicht FrontierCode, einen anspruchsvollen Coding-Benchmark, bei dem Claude Opus 4.8 auf der härtesten Stufe nur 13,4 Prozent erreicht. Xiaomi veröffentlicht Details zu MiMo-V2.5-Pro-UltraSpeed, einem 1-Billionen-Parameter-Modell, das durch Co-Design und Quantisierung 1000 Tokens pro Sekunde erreicht. Ein neuer Benchmark, AARRI-Bench, bewertet KI-Systeme bei Einstiegsforschungsaufgaben.
Eine neue gemeinnützige Forschungseinrichtung namens Sequent wurde von Forschern des UK AI Security Institute und des auf Alignment-Theorie spezialisierten Startups Timaeus gegründet, um Alignment-Techniken für superintelligente KI-Systeme zu entwickeln. Sequent strebt eine erste Finanzierungsrunde von 100 bis 150 Millionen US-Dollar an und möchte auf 40 bis 80 Mitarbeiter wachsen. Das Unternehmen verfolgt verschiedene Forschungsrichtungen, darunter skalierbare Überwachung, Lerntheorie, heuristische Argumente, Spieltheorie und Personas, um prinzipienbasierte Sicherheit bei Alignment zu erreichen. Cognition, das Unternehmen hinter Devin, veröffentlichte FrontierCode, einen Programmier-Benchmark mit 150 Aufgaben in drei Schwierigkeitsstufen (Diamond, Main, Extended), der Codequalität, Merge-Fähigkeit und Einhaltung von Codebasistandards misst; Claude Opus 4.8 erreichte nur 13,4 % auf der Diamond-Stufe, was erhebliches Verbesserungspotenzial anzeigt. Xiaomi stellte MiMo-V2.5-Pro-UltraSpeed vor, ein großes Sprachmodell mit einer Billion Parametern, das auf einem handelsüblichen Acht-GPU-Knoten mittels FP4-Quantisierung, spekulativem Decoding über DFlash und der TileRT-Software des Startups Tile AI eine Inferenzgeschwindigkeit von 1000 Token pro Sekunde erreicht. Forscher der Xi'an Jiaotong University und der Xidian University entwickelten die AARR-Benchmarks (Act As a Real Researcher), beginnend mit AARRI-Bench, um KI-Systeme auf Einstiegsforscher-Aufgaben zu bewerten. Das beste System, Claude-Opus-4.7 mit Mini-Swe-Age, erzielte 42,13 % im Science-Szenario.
Quelle: Import AI —
Original
