LLMs Interview Note 1.1.1 语言模型
本文为 LLMs Interview Note 的学习笔记。
语言模型
语言模型,最初是在信息理论的背景下研究的。香农在信息论中引入了熵,用于衡量一段文本被压缩后的期望比特数;熵越小,代表文本的结构性越强,也即信息量越少,编码的长度也就越短。
本文为 LLMs Interview Note 的学习笔记。
语言模型,最初是在信息理论的背景下研究的。香农在信息论中引入了熵,用于衡量一段文本被压缩后的期望比特数;熵越小,代表文本的结构性越强,也即信息量越少,编码的长度也就越短。
self-attention二次方复杂度带来的计算挑战 → 加速推理和减少内存消耗
现有的模型大多基于较小的语料,而且是针对特定任务的
从meta-learning的角度来看,multi-task learning需要相当多的 (task, dataset) 组合作为train sample,这是不现实的
方差分析(Analysis of Variance,ANOVA)是一种检验方法,可以用来比较两个及以上个样本之间的平均值是否存在显著差异。 由于各种因素的影响,研究所得的数据呈现波动状。造成波动的原因可分成两类,一种是不可控的随机因素(比如实验误差等,服从于某种正态分布),另一种是研究中施加的对结果形成影响的可控因素。