AIEDHKAI in Education Hub of Knowledge
BerandaMisiBeritaAkademiTentang
BerandaMisiBeritaAkademiTentang
← Kembali ke Berita Riset

#LLM evaluation

LLM evaluation

1 makalah

A diverse group of computing students and an instructor compare AI tutoring responses with a prerequisite map and scaffolded Python exercises
Makalah konferensi2026
Makalah konferensi 86

Pedagogical-fit feedback improved 51 of 62 weak AI-tutor responses, but scaffolding gains created trade-offs

Benjamin Barlog, Hudson Craig, Zedong Peng

IEEE 27th International Conference on Information Reuse and Integration for Data Science (IRI 2026)

Barlog, Craig and Peng evaluated ChatGPT, Gemini, Gemma 4 and Qwen 3 across 240 introductory-programming tutoring scenarios with a six-part Pedagogical Suitability Index. Baseline scores differed modestly, while targeted feedback improved 51 of 62 weak cases. The largest gain was scaffolding, but prerequisite ordering and Bloom-level alignment sometimes declined, showing why tutoring quality needs multiple measures rather than one composite score.

AI tutorspedagogical fitscaffolding
Baca ringkasan 500 kata →
AIEDHKAI in Education Hub of Knowledge

AIEDHK adalah pusat pengetahuan multibahasa untuk riset, pengembangan, dan inovasi pembelajaran bertanggung jawab dengan AI dalam pendidikan.

Navigasi

BerandaMisiBeritaAkademiTentang

Tautan ekosistem

Dr. Peter Hu DongpinPedaNova TechnologyMAISCAIS
© 2026 AIEDHK. Semua hak dilindungi.