选择模型
从变化方式选择候选模型
选择函数之前,先说明变量和单位。记 $t$ 为从 1950 年末起经过的年数,$P(t)$ 为对应年末的人口总数,单位是万人。
已知 1950 年末人口为 $55196$ 万人,1959 年末人口为 $67207$ 万人。这两个年份分别对应 $t=0$ 和 $t=9$。
这段时间的逐年数据呈现平稳增长,散点没有明显突变,相邻年份的增长比例也大致接近。若假设单位时间内的相对增长速度在短期内近似稳定,就可以选取指数型候选模型:
其中,$A$ 是初始人口数,$r$ 描述平均相对增长速度。当 $t$ 以年为单位时,$r$ 是每年的增长参数。
选择指数型的依据是近似稳定的比例变化。仅仅知道“人口在增长”,还不足以确定模型;如果变化结构不同,候选函数也应改变。
确定参数
用已知数据确定参数
选定指数型后,用两个已知年份的数据确定 $A$ 和 $r$。
当 $t=0$ 时,$e^{r\cdot0}=1$,所以 $P(0)=A=55196$。再将 1959 年末的 $t=9$、$P(9)=67207$ 代入模型,得到
两边同除以正数 $55196$,得到
两边都为正数,可以取自然对数。由 $\ln(e^{9r})=9r$,得到
再将两边除以 $9$,就确定了增长参数:
将 $A$ 和取近似值后的 $r$ 代回,得到描述 1950—1959 年数据的模型:
按该模型,每经过一年,人口数乘以的因子是 $e^r\approx1.02212$。下文的模型计算值均使用这里的 $r=0.021876$。
范围 $0\le t\le9$ 记录的是建模和校验所使用的时段。它并不表示这个公式在所有年份都会成立。
数据检验
用中间数据检查模型
参数由 1950 年和 1959 年的数据确定,模型在这两个定参点吻合是定参过程的结果。要检查模型是否可用,还应看未参与定参的中间年份。
把 1951 年、1954 年、1958 年对应的 $t=1$、$t=4$、$t=8$ 代入模型,再与实际值比较:
| 年份 | 模型计算值 /万人 | 实际值 /万人 |
|---|---|---|
| 1951 | 56417 | 56300 |
| 1954 | 60243 | 60266 |
| 1958 | 65753 | 65994 |
三个年份的偏差大小分别为 $117$ 万人、$23$ 万人和 $241$ 万人,相对于当年的总人口都较小。若把全部年份画成散点图,这些点也会落在模型曲线附近。
这样的检验支持模型在已观测时段内是一个较好的近似,不能证明人口在此后的所有年份都按这个公式变化。
条件外推
外推结果必须带上条件
如果假定上述增长条件一直不变,可以把模型延伸到 1990 年。1990 年对应 $t=40$,已经超出了前面检验的 $0\le t\le9$。
在“原增长条件继续成立”的假设下,将 $t=40$ 代入,得到
换算为亿人,这个结果约为 $13.24$ 亿人。但 1990 年的实际人口约为 $11.43$ 亿人,模型多估了约 $1.81$ 亿人。
这不是前面的代数计算自相矛盾,而是长期外推超出了校验时段,人口增长条件和增长速度也发生了变化。
$13.24$ 亿人只是“原假设继续成立”之下的条件结果。计算出一个数值,并不能保证现实会按原来的条件继续变化。
完整模型
一个模型完整包含什么
回看这个人口模型,建立公式只是完整过程中的一部分。
先定义变量、单位和实际范围,再根据数据、图象和变化机制选择候选函数。接着,用已知数据确定参数,用其他数据检验偏差。最后,解释结果的实际含义,并说明它在哪个范围内可信。
假设说明为什么选择这个函数,参数让函数对应具体数据,检验说明近似是否合理,边界说明结果可以用到哪里。这些内容与公式共同构成一个完整的模型。
模型的可信程度,要由假设、数据检验和使用范围共同支持。