file_get_contents是读取中小文件(≤10MB)最简单高效的方式,返回字符串且自动处理编码;大文件须用fopen()+fgets()流式逐行读取,避免内存溢出。

file_get_contents 读取文本文件最简单方式
直接用 file_get_contents 就能一次性拿到整个文件内容,不用 fopen/fread/close 那套流程。它默认以二进制安全方式读取,对 UTF-8、GBK 等常见编码的纯文本都适用,前提是文件本身没损坏。
常见错误是忽略返回值判断:file_get_contents 失败时返回 false,而不是空字符串。如果没检查就直接 strlen 或 json_decode,容易触发 Warning 或逻辑错乱。
- 确保文件路径正确,相对路径基于当前执行脚本位置,不是 web 根目录
- PHP 进程需有该文件的读取权限(尤其在 Linux 下常因用户组问题失败)
- 大文件慎用——比如超过 100MB 时可能触发内存限制(
memory_limit),报Fatal error: Allowed memory size exhausted
$content = file_get_contents('/path/to/data.txt');
if ($content === false) {
throw new RuntimeException('无法读取文件:' . error_get_last()['message']);
}
echo $content;
读取大文件要用 fgets 逐行处理
当文件体积明显超过 PHP 内存限制(比如日志文件几百 MB),file_get_contents 会直接崩溃。这时必须流式读取,fgets 是最轻量的选择——它每次只读一行,内存占用几乎恒定。
注意 fgets 保留换行符 \n,而 file_get_contents 不会自动 trim;另外 Windows 和 Linux 换行符不同(\r\n vs \n),但 fgets 能正确识别。
立即学习“PHP免费学习笔记(深入)”;
- 必须用
fopen打开后配对fclose,否则文件句柄泄漏 - 避免用
feof做 while 条件——它可能在最后一行后多读一次空行,推荐用fgets返回值是否为false判断 - 如果需要跳过 BOM(如 UTF-8 BOM),得手动检测开头三字节
\xEF\xBB\xBF
$fp = fopen('/path/to/big.log', 'r');
if (!$fp) {
throw new RuntimeException('fopen 失败');
}
while (($line = fgets($fp)) !== false) {
// 处理单行,例如过滤、解析、写入数据库
echo rtrim($line, "\r\n"); // 清掉换行符
}
fclose($fp);
file 函数把文件转成数组每行一项
如果目标是“按行处理并保留结构”,file 比 file_get_contents + explode("\n") 更可靠——它原生支持跨平台换行符识别,并自动去掉每行末尾的换行符(除非指定 FILE_IGNORE_NEW_LINES 标志)。
但它依然会把整个文件载入内存,所以不解决大文件问题;优势在于代码简洁、语义明确,适合配置文件、CSV 头部、小批量数据等场景。
- 默认返回数组每个元素是不含换行符的一行;加
FILE_IGNORE_NEW_LINES无变化,加FILE_SKIP_EMPTY_LINES可跳过空行 - Windows 上用
\r\n换行的文件,file能正确拆分,而explode("\n", $str)可能产生带\r的脏数据 - 如果文件末尾有空行,
file默认也会生成一个空数组项,需用array_filter清洗
$lines = file('/path/to/list.txt', FILE_IGNORE_NEW_LINES | FILE_SKIP_EMPTY_LINES);
foreach ($lines as $i => $line) {
printf("[%d] %s\n", $i, $line);
}
编码问题不能只靠函数选对
PHP 文件读取函数本身不转换编码,file_get_contents 和 file 返回的是原始字节流。如果文件是 GBK 编码却当 UTF-8 解析,中文就会变乱码——这不是函数的问题,是后续使用环节的锅。
常见误区是以为加个 mb_convert_encoding 就万事大吉,但若源编码判断错了(比如把 GBK 当成 BIG5),转换结果照样错。建议优先用 mb_detect_encoding 辅助判断,但别全信它——对短文本或纯 ASCII 内容识别率低。
- Web 场景下,输出前务必用
header('Content-Type: text/plain; charset=utf-8')告诉浏览器编码,否则浏览器可能自行猜测 - 写入文件时如果用了
file_put_contents,记得确认内容已经是目标编码,不要依赖函数自动转码 - Linux 终端里用
file -i filename查看真实编码,比 PHP 检测更准
真正难的不是读出来,而是知道读出来的东西到底是什么编码——这点很容易被忽略,直到上线后发现用户上传的 Excel 导出文本全是问号。



















