Ressort

Modelle & Forschung

Neue Modelle, Benchmarks, Papers und Methoden. 34 Beiträge, jeder mit seiner Quellenlage.

Aufmacher2 Min. · vor 18 Std.

Multiverse räumt ungleichen Trainingsstand hinter QAH-Benchmarkvergleich ein

Ein Hugging-Face-Beitrag stellt Quantization-Aware Healing für ein komprimiertes, 4-Bit-quantisiertes Sprachmodell vor. Die dort beworbenen Vorteile gegenüber einem bfloat16-Modell lassen sich nach eigener Einräumung jedoch nicht allein der Quantisierungs-Methodik zuschreiben.

1 unabhängig · Primärquelle vorhanden
Symbolbild zum Thema Hybride Sprachmodelle: Tastatur, Tasse und ausgeschalteter Monitor bei Nacht. Kein Foto des berichteten Ereignisses.KI-Symbolbild2 Min.

Preprint untersucht getrennte Rollen von Attention und rekurrentem Zustand in hybriden Sprachmodellen

Eine neue arXiv-Arbeit berichtet auf Basis von Eingriffen in Zwischenspeicher von Qwen3.5 und Falcon-H1: Der KV-Cache trug vor allem exakten Abruf, während der rekurrente Zustand Ausgabesprache und Persona stärker bewahrte.

Modelle & Forschungvor 18 Std.

Studie: Letzte Encoder-Stufe ist bei zwei ASR-Modellen eine kritische Grenze

Ein arXiv-Preprint berichtet, dass das Umgehen des letzten Encoder-Blocks bei zwei Conformer-Large-Spracherkennern fast stets zu abweichenden Ausgaben führte. Die Autoren sehen darin eine mechanistische Voraussetzung für Halluzinationen – nicht deren vollständige Erklärung.

Modelle & Forschungvor 18 Std.
Symbolbild: Stapel bedruckter Blätter auf einem Schreibtisch. Kein Foto des berichteten Ereignisses.KI-Symbolbild2 Min.

Preprint: Verteilungsabgleich erhöht sprachübergreifende Konsistenz, mit Vorbehalten bei offenen Antworten

Eine einheitliche Auswertung von Methoden zur Verbesserung mehrsprachiger Frage-Antwort-Systeme berichtet robuste Konsistenzgewinne durch direkten Verteilungsabgleich. Bei offen formulierten Antworten traten jedoch vereinzelt Genauigkeitsverluste auf, besonders außerhalb des Englischen.

Modelle & Forschungvor 18 Std.
Symbolbild zum Thema Training von Sprachmodellen: Tastatur, Tasse und ausgeschalteter Monitor bei Nacht. Kein Foto des berichteten Ereignisses.KI-Symbolbild2 Min.

Hugging Face beschreibt offene Reproduktion eines RL-Trainings für JavaScript-Aquarelle

Ein Blogbeitrag schildert, wie ein Coding-Modell mit TRL und OpenEnv p5.brush-Programme zur Erzeugung von Bildern trainiert wurde. Datensatz, Umgebung, Skripte und trainierte Modelle sollen offen verfügbar sein.

Modelle & Forschungvor 18 Std.
Symbolbild zum Thema generative Sprachmodelle: Tastatur, Tasse und ausgeschalteter Monitor bei Nacht. Kein Foto des berichteten Ereignisses.KI-Symbolbild2 Min.

Hugging-Face-Leitfaden meldet IFStruct-Anstieg für LFM2.5-350M nach GRPO-Feintuning

Ein Blogbeitrag beschreibt einen LoRA- und GRPO-Workflow, mit dem Liquid AIs 350-Millionen-Parameter-Modell in einer lokalen Auswertung von 22,6 auf 29,7 Prozent bei IFStruct kam. Das Ergebnis stammt aus einem einzelnen, spezifischen Setup.

Modelle & Forschungvor 18 Std.
Symbolbild zum Thema Textmodelle für semantische Suche: Tastatur, Tasse und ausgeschalteter Monitor bei Nacht. Kein Foto des berichteten Ereignisses.KI-Symbolbild2 Min.

Qwen veröffentlicht Qwen3-Modelle für Embeddings und Reranking unter Apache 2.0

Die neue Qwen3-Embedding-Serie soll Textsuche, Retrieval und Reranking abdecken. Qwen nennt Modellgrößen von 0,6 bis 8 Milliarden Parametern und berichtet über einen Spitzenplatz im MTEB-Multilingual-Ranking.

Modelle & Forschungvor 3 Tagen
Symbolbild: Stapel bedruckter Blätter auf einem Schreibtisch. Kein Foto des berichteten Ereignisses.KI-Symbolbild2 Min.

Google stellt experimentelles Science-One-Framework für überprüfbare KI-Forschung vor

Der Forschungsprototyp verknüpft Behauptungen mit Evidenzketten. Google berichtet in eigenen Tests über vollständig überprüfbare Ergebnisse und Benchmark-Erfolge, doch unabhängige Bestätigung liegt nicht vor.

Modelle & Forschungvor 3 Tagen
Symbolbild: Platine mit einem unbeschrifteten Prozessor auf einer Werkbank. Kein Foto des berichteten Ereignisses.KI-Symbolbild1 Min.

Qwen stellt Vorschau auf multimodales Modell Qwen VLo vor

Laut dem Qwen-Team verbindet Qwen VLo Bildverständnis und Bilderzeugung in einem Modell. Die Vorschau ist über Qwen Chat erreichbar, hat aber ausdrücklich benannte Einschränkungen.

Modelle & Forschungvor 3 Tagen
Symbolbild: Offene Karteikartenschublade. Kein Foto des berichteten Ereignisses.KI-Symbolbild3 Min.

Google Research sieht Abruf als Engpass bei Faktenwissen großer Sprachmodelle

Ein neuer Test namens WikiProfile soll unterscheiden, ob Modelle Fakten gespeichert haben oder sie auf direkte Nachfrage abrufen können. Google berichtet bei zwei Modellen eine deutliche Lücke zwischen beiden Fähigkeiten.

Modelle & Forschungvor 3 Tagen
Symbolbild: Platine mit einem unbeschrifteten Prozessor auf einer Werkbank. Kein Foto des berichteten Ereignisses.KI-Symbolbild2 Min.

Qwen veröffentlicht Qwen2.5-Omni als offen verfügbares multimodales Modell

Das Qwen Team beschreibt Qwen2.5-Omni als End-to-End-Modell für Text, Bilder, Audio und Video, das Text- und Sprachantworten fortlaufend ausgeben soll.

Modelle & Forschungvor 3 Tagen
Symbolbild: Notizbuch mit handschriftlichen Skizzen neben einem Laptop. Kein Foto des berichteten Ereignisses.KI-Symbolbild2 Min.

IBM beschreibt Granite 4.2 als offene Reasoning-Modelle mit bis zu 30 Milliarden Parametern

Laut einem offiziellen Beitrag auf Hugging Face umfasst die unter Apache 2.0 veröffentlichte Modellfamilie drei dichte Decoder-only-LLMs. Die 8B- und 30B-Varianten erhielten zusätzlich agentisches Reinforcement Learning in realen Umgebungen.

Modelle & Forschungvor 3 Tagen
Symbolbild: Zwei aufgeschlagene Nachschlagewerke auf einem Schreibtisch. Kein Foto des berichteten Ereignisses.KI-Symbolbild2 Min.

Qwen veröffentlicht Qwen3-Modellfamilie mit acht offenen Sprachmodellen

Das Qwen Team stellt zwei Mixture-of-Experts-Modelle und sechs dichte Modelle bereit. Die Modelle sind laut Anbieter über Hugging Face, ModelScope und Kaggle verfügbar; Leistungsangaben beruhen bislang auf Eigenangaben.

Modelle & Forschungvor 3 Tagen
Symbolbild: Klemmbrett mit leerer Tabelle, Stift und Stoppuhr auf einer Laborbank. Kein Foto des berichteten Ereignisses.KI-Symbolbild2 Min.

Google DeepMind startet Pilot für doppelblinde Prüfung von Gemini Flash Lite

Der Konzern will ein Gemini-Flash-Lite-Modell in einer vertraulichen, kryptografisch abgesicherten Umgebung gegen externe Benchmarks testen. Die Ankündigung beruht bislang auf einer eigenen Mitteilung von Google DeepMind.

Modelle & Forschungvor 3 Tagen
Symbolbild: Platine mit einem unbeschrifteten Prozessor auf einer Werkbank. Kein Foto des berichteten Ereignisses.KI-Symbolbild2 Min.

Google Research stellt TimesFM-3 für multivariate Zeitreihenprognosen vor

Das neue Zeitreihen-Foundation-Modell mit 330 Millionen Parametern ist laut Google auf mehr als einer Billion Zeitpunkten vortrainiert und soll Prognosen ohne aufgabenspezifisches Fine-Tuning ermöglichen.

Modelle & Forschungvor 3 Tagen
Symbolbild: Studiokopfhörer auf einem Mischpult. Kein Foto des berichteten Ereignisses.KI-Symbolbild1 Min.

Qwen aktualisiert seinen TTS-Dienst mit Unterstützung für drei chinesische Dialekte

Das über die Qwen API verfügbare Update Qwen-TTS unterstützt laut Qwen sieben chinesisch-englische Stimmen, darunter Stimmen für Pekingesisch, Shanghainesisch und Sichuanesisch.

Modelle & Forschungvor 3 Tagen
Symbolbild: Graukarte und Objektivdeckel auf einem Holztisch. Kein Foto des berichteten Ereignisses.KI-Symbolbild1 Min.

Qwen veröffentlicht Qwen-Image, ein 20B-Modell für Bildgenerierung und -bearbeitung

Das Qwen Team beschreibt Qwen-Image als MMDiT-Bildgrundmodell mit Schwerpunkt auf komplexem Textrendering und präziser Bildbearbeitung. Testbar sei es über die Option „Image Generation“ in Qwen Chat.

Modelle & Forschungvor 3 Tagen
Symbolbild: Graukarte und Objektivdeckel auf einem Holztisch. Kein Foto des berichteten Ereignisses.KI-Symbolbild1 Min.

Qwen stellt Qwen-Image-Edit für Bildbearbeitung vor

Das auf dem 20B-Modell Qwen-Image basierende System soll semantische und visuelle Bearbeitungen sowie Texteingriffe auf Chinesisch und Englisch unterstützen. Leistungsangaben stammen bislang vom Anbieter selbst.

Modelle & Forschungvor 3 Tagen
Symbolbild: Nahaufnahme einer Platine mit einem unbeschrifteten Prozessor auf einer Werkbank. Kein Foto des berichteten Ereignisses.KI-Symbolbild2 Min.

Google berichtet über lernende Fehlerkorrektur-Steuerung auf Willow-Quantenprozessor

Laut einem Google-Research-Beitrag passte ein Reinforcement-Learning-System während der Berechnung Steuerparameter anhand erkannter Quantenfehler an. Tests auf dem supraleitenden Willow-Prozessor zeigten unter anderem bessere Stabilität bei künstlich erzeugter Drift.

Modelle & Forschungvor 3 Tagen

Qwen-Team stellt GSPO für skalierbareres Reinforcement Learning von Sprachmodellen vor

Der Entwickler des Qwen-Modells beschreibt GSPO als sequenzbasiertes Verfahren, das in eigenen Versuchen gegenüber GRPO stabiler und effizienter gewesen sei. Die Angaben stammen ausschließlich aus einem Blogbeitrag des Teams.

Modelle & Forschungvor 3 Tagen
Symbolbild: Gefaltete Papierkarte und Kompass auf einem Holztisch. Kein Foto des berichteten Ereignisses.KI-Symbolbild2 Min.

Google Research stellt MAPL-EMIT zur automatisierten Methanplumen-Erkennung aus Satellitendaten vor

Das gemeinsam mit NASA-JPL-Fachleuten entwickelte Deep-Learning-System soll Methanplumen in EMIT-Daten erkennen, verstärkte Konzentrationen abschätzen und Quellen lokalisieren. Google veröffentlicht dazu Daten, Modell und Software – weist aber auf fortbestehende Fehlalarme hin.

Modelle & Forschungvor 3 Tagen
Symbolbild: Graukarte und Objektivdeckel auf einem Holztisch. Kein Foto des berichteten Ereignisses.KI-Symbolbild2 Min.

Qwen veröffentlicht QVQ-Max als Modell für visuelles Schlussfolgern

Der Anbieter beschreibt QVQ-Max als erste offizielle Version eines Modells, das Inhalte aus Bildern und Videos analysieren und daraus Lösungen ableiten soll. Unabhängige Tests liegen im vorliegenden Material nicht vor.

Modelle & Forschungvor 3 Tagen
Symbolbild: Gefaltete Papierkarte und Kompass auf einem Holztisch. Kein Foto des berichteten Ereignisses.KI-Symbolbild2 Min.

Google Research stellt ME-POIs für ortsbezogene KI-Modelle vor

Das Forschungsframework ergänzt Textinformationen zu Orten um aggregierte, anonymisierte Bewegungsmuster. Google berichtet bei Tests in Los Angeles und Houston deutliche relative Verbesserungen bei Vorhersagen für bislang ungesehene Orte.

Modelle & Forschungvor 3 Tagen

ArXiv-Preprint stellt RW-LoRA für dezentrales LoRA-Fine-Tuning per Random Walk vor

Bei RW-LoRA wandert ein einzelnes Modell-Token durch ein Netzwerk und wird nacheinander an lokalen Zielen aktualisiert. Die Autoren berichten von Konvergenzgarantien sowie vergleichbarer Leistung bei geringerem Kommunikations- und Rechenaufwand als bei Gossip-basiertem LoRA.

Modelle & Forschungvor 3 Tagen
Symbolbild: Stapel bedruckter Blätter auf einem Schreibtisch. Kein Foto des berichteten Ereignisses.KI-Symbolbild2 Min.

ArXiv-Preprint stellt ReNFT gegen Moduskollaps bei nachtrainierten Diffusionsmodellen vor

Die Autoren berichten, dass ihre Recalibration-Methode bei PickScore und GenEval fast die Belohnungswerte von NFT hält und zugleich die gemessene Vielfalt nach DreamSim-Div steigert. Die Ergebnisse stammen bislang aus einem nicht begutachteten Preprint.

Modelle & Forschungvor 3 Tagen
Symbolbild: Zwei aufgeschlagene Nachschlagewerke auf einem Schreibtisch. Kein Foto des berichteten Ereignisses.KI-Symbolbild1 Min.

Qwen stellt Qwen-MT-Update als qwen-mt-turbo über seine API vor

Laut Qwen basiert das Übersetzungsmodell auf Qwen3, unterstützt Übersetzungen zwischen 92 Sprachen und bringt Funktionen für Terminologie, Domänenvorgaben und Translation Memory mit. Die Leistungsangaben stammen bislang allein vom Anbieter.

Modelle & Forschungvor 3 Tagen

Preprint stellt Aufmerksamkeitsmaß für In-Context Learning infrage

Eine Studie zu Llama-2-7B berichtet, dass sich ein aufmerksamkeitsbasiertes Ziel fast bis zu seiner theoretischen Grenze steigern ließ, ohne dass ein Verhaltensmaß für In-Context Learning zunahm. Zugleich sank die MMLU-Genauigkeit.

Modelle & Forschungvor 3 Tagen

MIT News porträtiert drei frühere MIT-Forschende in IBM-Rollen für KI und Quantencomputing

Ein Beitrag des MIT-IBM Computing Research Lab verfolgt die Wege von Srinivasan Arunachalam, Zhang-Wei Hong und Irene Ko zu IBM. Im Mittelpunkt stehen Arbeiten zu agentischen Systemen, vertrauenswürdiger KI und Quanten-Maschinenlernen.

Modelle & Forschungvor 3 Tagen

Anthropic-Newsroom bündelt undatierte Hinweise zu MHS, Opus 5 und Claude Code

Auf einer Anthropic-Newsroom-Seite erscheinen Auszüge zu einem Forschungsvorabzug des Model Hardware Standard, zu Opus-5-Verbesserungen und zu Claude Code. Die vorliegenden Angaben reichen jedoch nicht aus, um daraus ein einzelnes, datierbares Ereignis abzuleiten.

Modelle & Forschungvor 3 Tagen
Symbolbild: Klemmbrett mit leerer Tabelle, Stift und Stoppuhr auf einer Laborbank. Kein Foto des berichteten Ereignisses.KI-Symbolbild3 Min.

Hugging Face stellt BenchMIRT zur Prüfung einzelner Fragen in LLM-Benchmarks vor

Die Methode nutzt multidimensionale Item-Response-Theorie, um bei 16 ausgewählten Benchmarks zwei dominante Leistungsdimensionen zu identifizieren: Sicherheit und allgemeines Schlussfolgern.

Modelle & Forschungvor 3 Tagen