
Konferenzbeitrag2026
Konferenzbeitrag 86Pedagogical-fit feedback improved 51 of 62 weak AI-tutor responses, but scaffolding gains created trade-offs
Benjamin Barlog, Hudson Craig, Zedong Peng
IEEE 27th International Conference on Information Reuse and Integration for Data Science (IRI 2026)
Barlog, Craig and Peng evaluated ChatGPT, Gemini, Gemma 4 and Qwen 3 across 240 introductory-programming tutoring scenarios with a six-part Pedagogical Suitability Index. Baseline scores differed modestly, while targeted feedback improved 51 of 62 weak cases. The largest gain was scaffolding, but prerequisite ordering and Bloom-level alignment sometimes declined, showing why tutoring quality needs multiple measures rather than one composite score.
AI tutorspedagogical fitscaffolding
500-Wörter-Zusammenfassung lesen →