PHP-ML上的内存不足

PHP-ML上的内存不足,php,machine-learning,memory,php-ml,Php,Machine Learning,Memory,Php Ml,我正在尝试用PHP-ML实现一个情绪分析。我有一个大约15000个条目的训练数据集。我让代码正常工作,但是,我必须将数据集减少到100个条目才能正常工作。当我尝试运行完整数据集时,出现以下错误: Fatal error: Allowed memory size of 134217728 bytes exhausted (tried to allocate 917504 bytes) in C:\Users\<username>\Documents\Github\phpml\vendo

我正在尝试用PHP-ML实现一个情绪分析。我有一个大约15000个条目的训练数据集。我让代码正常工作,但是,我必须将数据集减少到100个条目才能正常工作。当我尝试运行完整数据集时,出现以下错误:

Fatal error: Allowed memory size of 134217728 bytes exhausted (tried to allocate 917504 bytes) in C:\Users\<username>\Documents\Github\phpml\vendor\php-ai\php-ml\src\Phpml\FeatureExtraction\TokenCountVectorizer.php on line 95
致命错误:第95行C:\Users\\Documents\Github\phpml\vendor\php ai\php ml\src\phpml\FeatureExtraction\tokencountvectorier.php中允许的内存大小为134217728字节(试图分配917504字节)
我有两个文件是index.php:

<?php 

declare(strict_types=1);
namespace PhpmlExercise;

include 'vendor/autoload.php';

include 'SentimentAnalysis.php';

use PhpmlExercise\Classification\SentimentAnalysis;
use Phpml\Dataset\CsvDataset;
use Phpml\Dataset\ArrayDataset;
use Phpml\FeatureExtraction\TokenCountVectorizer;
use Phpml\Tokenization\WordTokenizer;
use Phpml\CrossValidation\StratifiedRandomSplit;
use Phpml\FeatureExtraction\TfIdfTransformer;
use Phpml\Metric\Accuracy;
use Phpml\Classification\SVC;
use Phpml\SupportVectorMachine\Kernel;

$dataset = new CsvDataset('clean_tweets2.csv', 1, true);
$vectorizer = new TokenCountVectorizer(new WordTokenizer());
$tfIdfTransformer = new TfIdfTransformer();
$samples = [];
foreach ($dataset->getSamples() as $sample) {
    $samples[] = $sample[0];
}
$vectorizer->fit($samples);
$vectorizer->transform($samples);
$tfIdfTransformer->fit($samples);
$tfIdfTransformer->transform($samples);
$dataset = new ArrayDataset($samples, $dataset->getTargets());
$randomSplit = new StratifiedRandomSplit($dataset, 0.1);

$trainingSamples = $randomSplit->getTrainSamples();
$trainingLabels     = $randomSplit->getTrainLabels();

$testSamples = $randomSplit->getTestSamples();
$testLabels      = $randomSplit->getTestLabels();

$classifier = new SentimentAnalysis();
$classifier->train($randomSplit->getTrainSamples(), $randomSplit->getTrainLabels());
$predictedLabels = $classifier->predict($randomSplit->getTestSamples());

echo 'Accuracy: '.Accuracy::score($randomSplit->getTestLabels(), $predictedLabels);

这个错误是由于在内存中加载的内容比PHP设置为在一个进程中处理的内容要多。还有其他原因,但这些都不太常见

在您的例子中,您的PHP实例似乎配置为允许使用的最大内存128MB。在机器学习中,这并不多,如果你使用大型数据集,你肯定会达到这个极限

要将允许PHP使用的内存量更改为1GB,可以编辑
PHP.ini
文件并设置

memory_limit = 1024M
如果您没有访问php.ini文件的权限,但仍有更改设置的权限,则可以在运行时使用

<?php
    ini_set('memory_limit', '1024M');
请注意,大多数共享主机解决方案等对允许使用的内存量都有严格的限制,而且通常很低

你可以做的其他事情有
  • 如果从文件加载数据,请查看
    fgets
    SplFileObject::fgets
    以逐行加载读取的文件,而不是立即将整个文件读入内存
  • 确保您运行的是尽可能最新的PHP版本
  • 确保PHP扩展是最新的
  • 禁用不使用的PHP扩展
  • 取消设置
    数据或大对象,这些数据或对象已处理完毕,不再需要存储在内存中。请注意,PHP的垃圾收集器不一定会立即释放内存。相反,在设计上,当它感觉到所需的CPU周期存在时,或者在脚本即将耗尽内存之前,不管先发生什么,它都会这样做
  • 您可以使用类似于
    echo memory\u get\u usage()/1024.0的东西kb’。PHP_EOL
    打印程序中给定位置的内存使用情况,尝试分析不同部分使用的内存量

在文章下面有一些提示,其中之一是“如果您尝试运行完整的数据集(14000行),您可能会注意到该过程可能会占用大量内存。尝试实现模型持久性,这样就不必在每次运行时对其进行培训。”此外,我还成功地从csv文件中删除了90%的数据。
<?php
    ini_set('memory_limit', '1024M');
php_value memory_limit 1024M