答对一道难题和一道简单题,提供的信息不同;主观题拿到部分分,也不应被粗暴改成“对或错”。
METHODS, EXPLAINED算法藏在后台,
算法藏在后台,
依据必须讲得明白。
PLJ 的方法不是为了给报告增加术语,而是为了解决三个具体问题:题目是否可靠、学生现在在哪里、下一步应先做什么。
ONE SIMPLE IDEA
让所有人的作答,帮助看懂一个人的表现。
模型会同时看学生答了哪些题、这些题在群体中的表现,以及估计结果有多大不确定性。
最终不是只给一个神秘数字,而是把它翻译成位置、能力结构、复盘题与下一阶段建议。
MODEL TOOLKIT
不同问题,用不同工具。
每张卡片同时说明“它做什么”和“现在能不能正式用”。
01已使用
CTT检查试卷质量
题目过偏或区分度不足,会影响后续分析。CTT 用于检查难度、区分度和整卷稳定性。
数据质检 · 试卷质量02生物已验证
MML–GPCM估计总体学习能力
同样的分数可能来自不同题目。模型把题目难易和部分得分一起考虑,得到比简单正确率更稳定的总体能力估计。
能力指数 · 同场位置03试点中
Confirmatory MIRT拆开看能力结构
总能力像总览,细分能力像地图。按命题蓝图把表现拆成若干内容模块,观察学生内部结构是否均衡。
模块雷达 · 强弱结构04生物已验证
G–DINA诊断知识与做题能力
不只统计某类题答对几道,而是结合一组题的作答模式,估计相关知识和能力是否稳定掌握。
掌握画像 · 复盘方向05需锚题
Equating比较不同难度的考试
两次考试难度不同,原始分不能直接画趋势。需要共同题或其他等值设计,才能把不同试卷放到同一把尺子上。
成长趋势 · 跨卷比较06需配对数据
Score & Rank连接高考分数与位次
只有拿到足够可靠的同届或历史配对数据,才能把能力位置转换为高考分数区间和省位次。正式结果会给出不确定范围。
估分 · 省位次 · 升学定位FROM DATA TO DECISION
从学校文件到学生报告。
- 01接收与整理
逐题得分、总分、学生身份与双向细目表统一格式。
- 02质量核验
逐题分对账、异常记录、试题与整卷质量检查。
- 03模型估计
总体能力、模块结构和知识—能力诊断。
- 04解释与交付
生成学生、家长能看懂且老师可管理的报告。
CURRENT EVIDENCE
把“已验证”和“计划实现”分开写。
已经做到:4 场广东联考数据已统一整理;生物完成总体能力、模块画像和知识 × 做题能力试点验证;报告由同一份算法结果驱动。
仍需数据:其他学科要先达到标注标准;跨次趋势需要锚题与稳定学号;当前届高考估分和省位次需要配对高考成绩及一分一段数据。