Der Parser-Treiber übernimmt das SQL-Parsing und unterstützt verschiedene Operatoren und Funktionen, die auf die abgefragten Daten angewendet werden können. Dieses Kapitel beschreibt den genauen Sprachumfang sowie die angebotenen Operatoren, Funktionen und Pseudospalten im Detail.
Derzeit unterstützen die meisten Treiber nur Lesen per SQL SELECT-Statement. INSERT, UPDATE und DELETE sind schon in einigen Treibern umgesetzt.
In den folgenden Syntaxbeschreibungen stehen eckige Klammern für optionale Bestandteile.
Ein senkrechter Strich trennt Alternativen: Es darf genau eine der angegebenen Varianten verwendet werden.
Platzhalter in spitzen Klammern wie <expression> oder <identifier> stehen für Ausdrücke bzw. Namen, die an dieser Stelle eingesetzt werden.
SELECT liest Daten aus der Quelle oder berechnet Ausdrücke ohne Quelle. Die FROM-Klausel hat mehrere Varianten für Dateien, Verzeichnisse und Objekte.
SELECT <expression-1> [ AS <identifier-1> ]
, <expression-2> [ AS <identifier-2> ]
...
, <expression-n> [ AS <identifier-n> ]
[
FROM <identifier>.FILES() | <identifier>[.<identifier>] [tableColumns] [tableOptions]
[ WHERE <expression> ]
[ FILTER <filter-text> [ ENDFILTER ] ]
[ ORDERBY <orderby-text> [ ENDORDERBY ] ]
]
Es gibt folgende Varianten bei der Tabellenangabe:
Es wird keine Quelle benötigt. Die Abfrage gibt eine Zeile zurück und das Ergbnis sind die angegebenen Ausdrücke, die auf Literalen basieren.
Die Metadaten der Pseudospalten können dann verwendet werden.
In der Regel muss der Dateiname in doppelten Anführungsstrichen angegeben werden, da bereits das Punkt Zeichen für die Dateierweiterung nicht Teil eines nicht geschützen Identifiers ist.
In der Regel muss der Dateiname in doppelten Anführungsstrichen angegeben werden, da bereits das Punkt Zeichen für die Dateierweiterung nicht Teil eines nicht geschützen Identifiers ist.
INSERT schreibt einen neuen Datensatz in die Quelle. Die Spaltenliste und die VALUES-Liste müssen dieselbe Anzahl von Einträgen haben. Nicht alle Treiber unterstützen INSERT.
INSERT INTO <identifier>[.<identifier>] ( <identifier-1>, ... <identifier-n> )
VALUES ( <expression-1>, ... <expression-n> )
UPDATE ändert vorhandene Datensätze in der Quelle. FILTER ist Pflicht, damit die Quelle die zu ändernden Datensätze identifizieren kann. Nicht alle Treiber unterstützen UPDATE.
UPDATE <identifier>[.<identifier>]
SET <identifier-1> = <expression-1>
[ , <identifier-2> = <expression-2> ]
...
FILTER <filter-text> [ ENDFILTER ]
DELETE entfernt Datensätze in der Quelle. FILTER ist optional: Mit FILTER werden nur die Datensätze gelöscht, die die Quelle anhand des Filtertexts identifiziert. Ohne FILTER löscht das Statement alle Datensätze der angegebenen Tabelle. Nicht alle Treiber unterstützen DELETE.
DELETE FROM <identifier>[.<identifier>]
[ FILTER <filter-text> [ ENDFILTER ] ]
Mit COLUMNS wird die Spaltenliste der Quelle angegeben. Die Namen müssen zur Quelle passen; bei Csv- und Excel-Dateien können sie mit den Spaltenüberschriften abgeglichen werden.
COLUMNS ( <identifier-1>, ... <identifier-n> ) [ HEADLINE <ganze Zahl> ]
Die optionale Angabe
HEADLINE <ganze Zahl>
können nur in den csv- und excel-Treibern verwendet werden.
SEPARATED BY, QUOTED BY und ENCODING steuern, wie eine dateibasierte Textquelle gelesen wird. Die folgenden Angaben können in beliebiger Reihenfolge stehen:
SEPARATED BY <Ein Zeichen in einfachen Anführungsstrichen>
QUOTED BY <Ein Zeichen in einfachen Anführungsstrichen>
ENCODING <Zeichenkette in einfachen Anführungsstrichen>
Wenn SEPARATED BY nicht angegeben wurde, wird ein Komma verwendet.
Wenn QUOTED BY nicht angegeben wurde, wird der doppelte Anführungsstrich verwendet.
Wenn ENCODING nicht angegeben wurde, wird UTF-8 verwendet.
FILTER und ORDERBY reichen herstellerspezifische Ausdrücke unverändert an die Quelle weiter. Nicht jeder Treiber unterstützt beide Schlüsselwörter.
Einige Treiber unterstützen das FILTER und / oder das ORDERBY Keyword. Dazu gehören:
Die jeweilige Syntax die innerhalb von FILTER ... ENDFILTER (bzw. bis zum Ende) und analog ORDERBY ... ENDORDERBY (bzw. bis zum Ende) wird nicht interpretiert, sondern direkt an die Quelle weitergereicht.
Das Schlüsselwort heißt
ORDERBY, nichtORDER BY.Nicht alle Quellen lassen Kommentare zu. Zum Auskommentieren muss der Block oberhalb von FILTER oder ORDERBY liegen, da dort der SQL-Parser die Kommentare erkennt und ausblendet.
Identifier werden für Tabellennamen, Spaltennamen in der Quelle oder als Alias verwendet.
Identifier in doppelten Anführungsstriche werden case-sensitiv behandelt und erlauben Sonderzeichen.
Identifier ohne doppelte Anführungszeichen werden in Kleinbuchstaben gewandelt.
Beim Vergleich von Spaltennamen in csv- und excel-Dateien zu den Spaltenüberschriften wird die Groß- und Kleinschreibung ignoriert (case insensitiv).
Literale sind fest im SQL angegebene Werte. Es gibt Zahlen, Zeichenketten sowie die Schlüsselwörter NULL, TRUE und FALSE.
Ganzzahlige Literale sind vom Datentyp BIGINT.
Sie haben einen Wertebereich von -263 bis 263-1 und werden als Ziffernfolge angegeben, z. B. 42.
Dezimalzahlen sind vom Datentyp DOUBLE.
Sie enthalten einen Dezimalpunkt, z. B. 3.14, 3. oder .5.
Zeichenketten können beliebig lang sein und haben den Datentyp VARCHAR.
Zeichenkettenliterale werden von einfachen Anführungsstrichen umschlossen.
Um einen einfachen Anführungsstrich in einer Zeichenkette zu erhalten, müssen zwei Anführungsstiche angegeben werden.
Zeichenketten können auch mehrzeilig sein.
SELECT 'Karens'' Backstube', '!hallo
Du da!';
Ausgabe
column_1 column_2
-------- --------
Karens' Backstube !hallo
Du da!
NULL
Der Nullwert kann als Literal über das Schlüsselwort NULL angegeben werden.
TRUE
Der Wahrheitswert Wahr wird mit dem Schlüsselwort TRUE angegeben.
FALSE
Der Wahrheitswert Falsch wird mit dem Schlüsselwort FALSE angegeben.
Die folgenden Pseudospalten können in Ausdrücken ohne Klammern verwendet werden:
ROWNUMBER — Zeilennummer in der QuelleCURRENT_DATE — TagesdatumCURRENT_TIMESTAMP — aktuelles Tagesdatum mit Uhrzeit (lokal, ohne Zeitzone)DIRECTORY, FILENAME, FILEDATE — Dateimetadaten (nur dateibasierte JDBC-Treiber)Details finden sich im Abschnitt Pseudospalten.
Expressions sind Ausdrücke, die Literale, Spaltenamen aus der Quelle, Pseudospalten, Operatoren, Fallunterscheidungen oder integrierte Funktion kombinieren können.
Statt einer Expression kann auch das Zeichen * angegeben werden. Dann ist kein Alias zulässig.
Die Prioritäten entsprechen ANSI-SQL.
Zur Veränderung der Priorität können Ausdrücke in runden Klammern gesetzt werden. Der Ausdruck innerhalb eines runde Klammernpaars wird vor den äußeren Operation berechnet.
Ein Fragezeichen ist ein JDBC-Parameterplatzhalter. Die Werte werden später über die Setter-Methoden des JDBC-PreparedStatement in der Reihenfolge der Fragezeichen gebunden.
?