PHP可通过字符级N-grams(如n=3)结合余弦相似度实现轻量语言识别:先为各语言构建N-grams频率模型,再比对输入文本与各模型的相似度,返回最高分语言代码。

PHP 本身不内置 N-grams 语言识别功能,但你可以用 N-grams 特征 + 简单统计模型(如朴素贝叶斯或余弦相似度)实现轻量级语言识别。核心思路是:为每种语言构建 N-grams 频率模型,再比对输入文本的 N-grams 分布与各语言模型的相似度,取最匹配的语言。
提取字符级 N-grams(推荐用于语言识别)
语言识别通常用字符 N-grams(如 2-gram、3-gram),而非词 N-grams,因为无需分词、跨语言通用(尤其对中文、阿拉伯语等无空格语言更鲁棒)。
示例:提取 "hello" 的 3-grams(trigrams):
- "hel"
- "ell"
- "llo"
PHP 实现:
立即学习“PHP免费学习笔记(深入)”;
function getCharNgrams($text, $n = 3) {
$text = mb_strtolower(trim($text), 'UTF-8');
$grams = [];
$len = mb_strlen($text, 'UTF-8');
for ($i = 0; $i <= $len - $n; $i++) {
$gram = mb_substr($text, $i, $n, 'UTF-8');
// 可选:过滤掉含控制字符或纯空白的 gram
if (preg_match('/^\p{L}{' . $n . '}$/u', $gram)) {
$grams[] = $gram;
}
}
return $grams;
}构建多语言 N-grams 模型(离线训练)
你需要一组已知语言的文本样本(如维基百科摘要、Common Crawl 子集),为每种语言统计高频 N-grams(建议 top 1000–5000)。可存为 PHP 数组或 JSON 文件。
示例结构(languages.php):
return [
'en' => ['the' => 12450, 'and' => 9832, 'ing' => 8761, /* ... */],
'es' => ['que' => 15203, 'los' => 11890, 'del' => 10433, /* ... */],
'zh' => ['的' => 28450, '了' => 22103, '在' => 19876, /* ... */], // 注意:中文用 UTF-8 字符,n=1 或 n=2 更合适
];⚠️ 提示:中文、日文、韩文建议用 n=1(字频)或 n=2(字对),避免 n=3 导致稀疏;拉丁语系常用 n=3(trigrams)效果较好。
计算相似度并识别语言
对输入文本提取 N-grams 后,用**余弦相似度**或**Jaccard 相似度**对比其与各语言模型的重合程度。余弦更稳定,推荐使用:
- 将每种语言模型转为向量(按统一 gram 词表索引,值为 log 频次或 TF-IDF 加权)
- 将待测文本也转为同维度向量(未出现的 gram 计 0)
- 计算余弦值:
cos(θ) = (A·B) / (||A|| × ||B||)
简化版(无需完整向量空间,适合小规模):
function detectLanguage($text, $models, $n = 3) {
$grams = array_count_values(getCharNgrams($text, $n));
$scores = [];
<pre class="brush:php;toolbar:false;">foreach ($models as $lang => $model) {
$dot = 0;
$normA = 0;
$normB = 0;
// 只遍历交集 gram(节省内存)
$common = array_intersect_key($grams, $model);
foreach ($common as $gram => $cnt) {
$dot += $cnt * $model[$gram];
}
foreach ($grams as $cnt) {
$normA += $cnt * $cnt;
}
foreach ($model as $cnt) {
$normB += $cnt * $cnt;
}
$score = $normA && $normB ? $dot / (sqrt($normA) * sqrt($normB)) : 0;
$scores[$lang] = $score;
}
arsort($scores);
return key($scores); // 返回最高分语言代码}
// 使用示例 $models = require 'languages.php'; echo detectLanguage("Bonjour le monde", $models, 3); // 输出: 'fr'
实用建议与注意事项
- 预处理很重要:统一小写、去标点(保留字母/汉字/假名/谚文)、清理 HTML/URL,但别删空格(空格是西语重要 gram)
- 平衡 n 值:n=2(bigrams)泛化强但区分弱;n=3(trigrams)精度高但对短文本(
- 避免过度依赖单一样本:模型应来自多样化文本(新闻、社媒、技术文档),否则识别偏科(如用编程教程训模型,会误判 "print" 是英语而非法语)
- 短文本怎么办:若输入少于 10 字,优先查常见语言关键词("the"/"le"/"el"/"der")+ 字符集检测(如含汉字→zh,含ひらがな→ja)作兜底
不复杂但容易忽略:实际项目中,用现成库(如 Textcat 的 PHP 绑定、或调用 Python 的 langdetect)更省心;自研适合学习、定制或嵌入极简环境。



















