MongoDB
 sql >> Datenbank >  >> NoSQL >> MongoDB

Mongodb kann mit Node.js nicht mit großen Datenmengen gefüllt werden

Wie Robbie sagte, sind Streams der richtige Weg. fs.createReadStream() sollte anstelle von .readFileSync() verwendet werden . Ich würde damit beginnen, einen Zeilenleser zu erstellen, der einen Pfad und die Zeichenfolge/Regex verwendet, auf die Sie aufteilen möchten:

linereader.js

var fs = require("fs");
var util = require("util");
var EventEmitter = require("events").EventEmitter;

function LineReader(path, splitOn) {

    var readStream = fs.createReadStream(path);
    var self = this;
    var lineNum = 0;
    var buff = ""
    var chunk;

    readStream.on("readable", function() {

        while( (chunk = readStream.read(100)) !== null) {
            buff += chunk.toString();
            var lines = buff.split(splitOn);

            for (var i = 0; i < lines.length - 1; i++) {
                self.emit("line",lines[i]);
                lineNum += 1;
            }
            buff = lines[lines.length - 1];
        }
    });
    readStream.on("close", function() {
        self.emit("line", buff);
        self.emit("close")
    });
    readStream.on("error", function(err) {
        self.emit("error", err);
    })
}
util.inherits(LineReader, EventEmitter);
module.exports = LineReader;

Dies liest eine Textdatei und gibt "Zeilen"-Ereignisse für jede gelesene Zeile aus, sodass Sie nicht alle auf einmal im Speicher haben. Gehen Sie dann mit dem async-Paket (oder einer beliebigen async-Schleife, die Sie verwenden möchten) durch die Dateien und fügen Sie jedes Dokument ein:

app.js

var LineReader = require("./linereader.js");
var async = require("async");

var paths = ["./text1.txt", "./text2.txt", "./path1/text3.txt"];
var reader;

async.eachSeries(paths, function(path, callback) {

    reader = new LineReader(path, /\n/g);

    reader.on("line", function(line) {
        var doc = turnTextIntoObject(line);
        db.collection("mycollection").insert(doc);
    })
    reader.on("close", callback);
    reader.on("error", callback);
}, function(err) {
    // handle error and finish;
})