个人语料库作为学习引擎

日常

用自己说过的话学外语,个性化语料库如何改变语言学习方式

语料库语言学习数据驱动学习

我一直在想一个问题,有没有办法让自己学语言的速度快一点。市面上的教材和课程都是通用的,它们不会知道我说过什么话、经常用哪些词、在什么场景下需要表达什么内容。这些课程设计的很好,但它们跟我的个人需求之间,始终隔着一层。

后来我有了一个想法。把我日常的高频词汇和表达提取出来,做成一个属于自己的语料库。然后把这个语料库翻译成日语和英语,在真实数据中学习。这个想法不是来自哪本书,而是来自一个很简单的观察。我每天说来说去的内容其实就那些,如果把那些内容转化成另一种语言,学起来会快很多。

语料库语言学告诉我们一个道理。可靠的语言分析,需要建立在真实的语言实例之上。而不是靠预设的语法规则。学习者通过观察真实语料中的频率、搭配和上下文,自己发现语言规律。这个过程在学术界叫做数据驱动学习。它的优势是学习者接触到的不是人造的例句,而是真实场景中发生过的语言。

我的语料库至少应该包含几个层次。原始句子是从哪里来的,当时在什么场景下说的,我想表达的意思是什么,正确的表达应该是什么,我经常犯的错误类型是什么。这些维度加在一起,语料库就不是一个简单的单词列表了,它变成了一个带有上下文的学习环境。

把聊天记录转化成学习语料,这个思路也符合认知卸载的原则。大脑的工作记忆是有限的,如果把语言规律的外部表征建立好,可以减少记忆负担,把注意力留给理解和生成。但认知卸载也有一个前提,外部系统必须足够可靠,能把正确的语言形式保存下来,而不是把错误也一起固化进去。

这个计划还没有完全落地。但我已经找到了方向。语料库的结构设计比我想象的要复杂。因为每一条语料都需要标注场景、意图和错误类型。不过方向是对的。我用了自己这些年的语言数据来做这件事。这些数据对我来说,比任何一本教材都更贴近我的表达习惯。

参考文献

  1. Johns, T. (1991). Should you be persuaded: Two examples of data-driven learning. ELR Journal, 4, 1–16. https://www.cambridge.org/core/journals/language-teaching/article/datadriven-learning-from-collins-cobuild-dictionary-to-chatgpt/DF57AE64E4CB82543F47733C6AAD48D4
  2. Sinclair, J. (1991). Corpus, concordance, collocation. Oxford University Press. https://www.cambridge.org/core/journals/language-teaching/article/corpus-linguistics-for-language-teaching-and-learning-a-research-agenda/CABC78CDD77B7799BE293F7F66A48352
  3. Risko, E. F., & Gilbert, S. J. (2016). Cognitive offloading. Trends in Cognitive Sciences, 20(9), 676–688. https://pubmed.ncbi.nlm.nih.gov/27542527