Cedric Scharnke, O. Krüger, Uta Bohnebeck · Staats- und Universitätsbibliothek Bremen 2026 · 2026
DOI: 10.26092/elib/6503
Counts differ because each database indexes a different set of publications. We treat OpenAlex as the canonical count; Google Scholar is not shown (no API, and crawling it violates its ToS).
Label-Free Concept Bottleneck Models nutzen eine Zwischenschicht aus LLM-generierten Konzepten, um Entscheidungen bei der Klassifikation von Bildern nachvollziehbar zu machen. Diese Arbeit greift diesen Ansatz auf und untersucht, wie sich alternative Sprachmodelle und Promptvarianten auf die generierten Konzeptmengen und die resultierende Klassifikation auswirken. Konkret werden anhand der Datensätze CIFAR-10, CIFAR-100 und CUB-200-2011 drei LLMs mit je sechs Promptvarianten in insgesamt 54 Konfigurationen mit der GPT-3-Baseline verglichen. Lexikalisch unterscheiden sich die generierten Konzeptmengen häufig stark von der Baseline, ohne dass daraus unmittelbar auf semantisch neue oder bessere Konzepte geschlossen werden kann. In den drei für die qualitative Betrachtung ausgewählten Fallbeispielen aus CUB-200-2011 finden sich bei Baseline und Mistral-P5 sowohl visuell nachvollziehbare als auch nicht erkennbare stark beitragende Konzepte. Auch für die ergänzten Unexpected-Konzepte ergibt sich kein eindeutiger Erklärungsgewinn. Die höchsten beobachteten Klassifikationsgenauigkeiten liegen 0,97 Prozentpunkte bei CIFAR-10, 1,68 Prozentpunkte bei CIFAR-100 und 0,52 Prozentpunkte bei CUB-200-2011 über der jeweiligen Baseline. Alle drei Bestkonfigurationen verwenden dabei mehr finale Konzepte als ihre Baseline. Die gepaarte Fehleranalyse auf CUB-200-2011 zeigt zudem, dass die höheren Gesamtgenauigkeiten aus gleichzeitig korrigierten und neu entstandenen Fehlklassifikationen hervorgehen. Insgesamt zeigen die Ergebnisse, dass Sprachmodell und Prompt die Zusammensetzung der Concept Bottlenecks deutlich verändern und teilweise höhere Klassifikationsgenauigkeiten ermöglichen. Ein zusätzlicher Erklärungswert gegenüber der Baseline lässt sich anhand der vorliegenden Evaluation jedoch nicht nachweisen. Für eine belastbarere Bewertung sollte insbesondere untersucht werden, ob unterschiedlich formulierte Konzepte inhaltlich dieselben Merkmale beschreiben. Zudem sind eine skalierbare Bewertung der visuellen Nachvollziehbarkeit und mehrere unabhängige Läufe erforderlich.
No comments yet — start the discussion below.