分词与上下文窗口

上半页看它把文字切成什么;下半页看它一次能记住多少。

一、它读到的不是字,是 token

在下面改动文字,切分结果实时变化。绿色是汉字,黄色是英文与数字,灰色是标点。

0
字符数
0
切成几块
0
token 估算
这是一个近似演示。上面的方块画的是切分位置,真实的切分由模型自带的分词器决定。 中文一个汉字大致占一到两个 token,常见字算一个,较少见的算两个,所以这里按 1.4 倍估算; 英文常用词无论多长,整词通常只算一个,因此一段夹着 HTML、JavaScript 这类词的文字, token 数反而比字符数少。估一段纯中文需求的用量,按字数的一点五倍算就够用了。

二、窗口装满之后,最早的内容被挤出去

把窗口调到很小,然后一条一条往里发消息,看第一条约束什么时候消失。

46 token
本次会话已用 0 token
开头那条约束已经被挤出窗口。它现在看不见"不要拆成多个文件"这句话了。 此后它很可能又开始拆文件,而这不是它不听话,是那段文字已经不在它眼前。
对策就是右边那个按钮。一个会话只做一件事;它开始重复犯已经纠正过的错误时, 开一个新会话,把定下来的约束重新贴一次。