]> git.ipfire.org Git - thirdparty/public-inbox.git/log
thirdparty/public-inbox.git
4 years agoindex: ignore some warnings, set {current_info} for v1
Eric Wong [Wed, 16 Dec 2020 23:19:03 +0000 (23:19 +0000)] 
index: ignore some warnings, set {current_info} for v1

-index runs on data that's already frozen in git, so there's
no point in warning users about it.

While we're at it, set the {current_info} prefix for v1 as
we do in v2 inboxes in case new problems show up.

4 years agoinboxwritable: warn_ignore: "Bad UTF7 data escape"
Eric Wong [Wed, 16 Dec 2020 23:19:02 +0000 (23:19 +0000)] 
inboxwritable: warn_ignore: "Bad UTF7 data escape"

As with the other messages in this callback, there's
nothing we can do about invalid messages ending up in
our Maildirs for -watch.

4 years agoextsearchidx: lock eidxq on full --reindex
Eric Wong [Wed, 16 Dec 2020 23:04:53 +0000 (23:04 +0000)] 
extsearchidx: lock eidxq on full --reindex

Incremental indexing can use the `eidxq' reindexing queue for
handling deletes and resuming interrupted indexing.  Ensure
those incremental -extindex invocations do not steal (and
prematurely perform) work that an "-extindex --reindex"
invocation is handling.

4 years agosearchidxshard: simplify newline elimination
Eric Wong [Tue, 15 Dec 2020 02:02:24 +0000 (02:02 +0000)] 
searchidxshard: simplify newline elimination

This overdue change fixes {current_info} to not inject a newline
into every warning message.

Simpler code helps us avoid bugs and the need to make
fixes like commit 44de182766037948d62bc2a8ba924de2264dd5fc
("searchidxshard: chomp $eidx_key from pipe").

4 years agoextsearchidx: reindex releases over.sqlite3 handles properly
Eric Wong [Tue, 15 Dec 2020 02:02:23 +0000 (02:02 +0000)] 
extsearchidx: reindex releases over.sqlite3 handles properly

When checkpointing and yielding the lock to other processes,
we need to ensure any open DB statement handles are closed,
since they reference and prevent DB FDs from being closed
and unlocked.

And clean up some progress reporting while we're at it.

4 years agoextsearchidx: simplify reindex code paths
Eric Wong [Tue, 15 Dec 2020 02:02:22 +0000 (02:02 +0000)] 
extsearchidx: simplify reindex code paths

Since we're inside a Xapian transaction, calling ->index_raw
followed by ->shard_add_eidx_info calls on the same docid
doesn't seem to hurt indexing performance.  It definitely
reduces FS read traffic and IPC from git at the cost of some
more IPC between the parent and workers.  Nevertheless, the code
and FD reductions seem worth it.

4 years agoextsearchidx: checkpoint releases locks
Eric Wong [Tue, 15 Dec 2020 02:02:21 +0000 (02:02 +0000)] 
extsearchidx: checkpoint releases locks

--reindex can take many hours or days, ensure we release
locks according to --batch-size so automated fetch+index
jobs can write new data to indices while we update old data.

4 years agoextsearchidx: reindex works on Xapian, too
Eric Wong [Tue, 15 Dec 2020 02:02:20 +0000 (02:02 +0000)] 
extsearchidx: reindex works on Xapian, too

Instead of just working on over.sqlite3, we need to work on
the Xapian DBs as well.  While no changes to our Xapian use
have taken place recently, they could in the future and
--reindex exists to account for that.

4 years agoextindex: support --rethread and content bifurcation
Eric Wong [Tue, 15 Dec 2020 02:02:19 +0000 (02:02 +0000)] 
extindex: support --rethread and content bifurcation

--rethread is useful for dealing with bugs and behaves
just like it does with current inboxes.

This is in case our content deduplication logic changes for
whatever reason and causes previously merged messages to be
considered "different".  As with v2, this won't allow us to
merge messages in a way that allows deduplicating messages which
were previously considered different, but v2 inboxes do not
allow that, either.

In other words, this makes the --reindex and --rethread
switches of -extindex match the behavior of v2 -index.

4 years agoover: sort xref3 by xnum if ibx_id repeats
Eric Wong [Tue, 15 Dec 2020 02:02:18 +0000 (02:02 +0000)] 
over: sort xref3 by xnum if ibx_id repeats

While unlikely to happen, it may be possible for messages
from the same inbox to get indexed multiple times.  Provide
consistent results in this case for ease-of-testing.

4 years agoextindex: delete stale messages from over.sqlite3
Eric Wong [Tue, 15 Dec 2020 02:02:17 +0000 (02:02 +0000)] 
extindex: delete stale messages from over.sqlite3

In addition to removing stale messages from Xapian, we must
also remove them from over.sqlite3.

4 years agoextindex: preliminary --reindex support
Eric Wong [Tue, 15 Dec 2020 02:02:16 +0000 (02:02 +0000)] 
extindex: preliminary --reindex support

--reindex allows us to catch missed and stale messages due to
-extindex vs -index races prior to commit 02b2fcc46f364b51
("extsearchidx: enforce -index before -extindex").

We'll also rely on reindex to internally deal with v1/v2 inbox
removals and partial-unindexing of messages which are only
removed from one inbox out of many.

This reindex design is completely different than how normal
v1/v2 inbox reindex operates due to extindex having multiple
histories to work with.  Instead of scanning git history, this
relies exclusively on comparing over.sqlite3 contents between
the v1/v2 inboxes and the extindex.

Changes to Xapian behavior also get picked up, now.  Xapian indexing
is handled by workers with minimal IPC to the parent process.
This results in more read I/O but fewer writes when dealing
with cross-posted messages.

Changes to $smsg->populate and --rethread still need further
work.

4 years agot/psgi_v2: ignore warnings on missing P::M::ReverseProxy
Eric Wong [Wed, 16 Dec 2020 04:39:37 +0000 (04:39 +0000)] 
t/psgi_v2: ignore warnings on missing P::M::ReverseProxy

Plack::Test::ExternalServer doesn't depend on
Plack::Middleware::ReverseProxy, so we need to account for
some warnings in stderr if P::M::RP is missing.

4 years agoinbox: ->uidvalidity returns undef w/o ->mm
Eric Wong [Wed, 16 Dec 2020 23:56:29 +0000 (23:56 +0000)] 
inbox: ->uidvalidity returns undef w/o ->mm

While totally unindexed inboxes are rare, we still support
them for v1 and may hit code which calls this method.  Just
return `undef' when ->mm access fails.

4 years agoimap: rename parse_query => parse_imap_query
Eric Wong [Wed, 16 Dec 2020 23:55:34 +0000 (23:55 +0000)] 
imap: rename parse_query => parse_imap_query

Avoid confusing hackers since this conflicts with a method name
provided by (Search::)Xapian::QueryParser.

4 years agodaemon: simplify fork() failure checks
Eric Wong [Tue, 15 Dec 2020 11:47:17 +0000 (11:47 +0000)] 
daemon: simplify fork() failure checks

The defined-or `//' operator in 5.10 allows us to golf down
our code slightly.

4 years agodaemon: support --daemonize without Net::Server::Daemonize
Eric Wong [Tue, 15 Dec 2020 11:47:16 +0000 (11:47 +0000)] 
daemon: support --daemonize without Net::Server::Daemonize

We don't actually need Net::Server::Daemonize to support
the --daemonize flag, since the daemonize() sub provided
by N::S::D doesn't exactly do the things we want.

4 years agoPublicInbox::Feed owns `feedmax' default value
Eric Wong [Fri, 11 Dec 2020 20:49:58 +0000 (20:49 +0000)] 
PublicInbox::Feed owns `feedmax' default value

There's no need to have extra code in the Inbox package for this
or to waste dozens of bytes for every Inbox object which uses
the default value.

This makes our code more flexible w.r.t Inbox-like ExtSearch
objects and fixes uninitialized value warnings with ->ALL.

4 years agodoc: v2-format: drop repeated word
Kyle Meyer [Sat, 12 Dec 2020 18:24:48 +0000 (18:24 +0000)] 
doc: v2-format: drop repeated word

4 years agodoc: add public-inbox-extindex-format(5) manpage
Eric Wong [Sat, 12 Dec 2020 09:31:42 +0000 (09:31 +0000)] 
doc: add public-inbox-extindex-format(5) manpage

The CLI tool still needs usability work, and "misc" is still in
flux, but the core message indexing part is stable (since it's
stolen from v2 :P).

4 years agonntp+www: drop List-* and Archived-At headers
Eric Wong [Thu, 10 Dec 2020 22:38:47 +0000 (22:38 +0000)] 
nntp+www: drop List-* and Archived-At headers

These headers can conflict with headers in the DKIM signature;
and parsing the DKIM-Signature header to determine whether or
not we can safely add a header would be more code and CPU
cycles.

Since IMAP seems fine without these headers (and JMAP will
likely be, too), there's likely no need to continue appending
these to every message.  Nowadays, developers seem sufficiently
trained to use URLs with Message-IDs in them.  So drop the
headers and save some cycles and bandwidth all around.

4 years agoextmsg: avoid exceptions when /all/$MSGID/ fails
Eric Wong [Thu, 10 Dec 2020 23:04:50 +0000 (23:04 +0000)] 
extmsg: avoid exceptions when /all/$MSGID/ fails

If a message can't be found in ->ALL, we shouldn't attempt to
enter code paths which iterate normal inboxes or attempt to
access non-existent fields (e.g. {name}, {newsgroup},
{inboxdir}) in the ExtSearch object.

4 years agomanifest: account for future cache in MiscIdx docdata
Eric Wong [Thu, 10 Dec 2020 08:35:47 +0000 (08:35 +0000)] 
manifest: account for future cache in MiscIdx docdata

We'll be storing private data inside the "" (empty string) key
of the JSON doc we use for store for manifest.js.gz generation.
This private data will allow us to reduce FS activity at and
speed up startup times, but some will also be in Xapian boolean
terms and values for searching and filtering.

4 years agoextsearchidx: enforce -index before -extindex
Eric Wong [Wed, 9 Dec 2020 09:25:12 +0000 (09:25 +0000)] 
extsearchidx: enforce -index before -extindex

We cannot set xref3 data without the `xnum' column to
tie it to the per-inbox over.sqlite3 DB.  So ensure we don't
read brand-new history that only exists in git, but instead
rely on last_commit and last_xap15-$EPOCH metadata in msgmap
to decide how far we can index.

Before this change, it was possible to miss messages in
the extindex if -index did not run (which will be fixable by
upcoming --reindex support in -extindex).

4 years agot/extsearch: use indexlevel=basic in inboxes
Eric Wong [Wed, 9 Dec 2020 09:25:11 +0000 (09:25 +0000)] 
t/extsearch: use indexlevel=basic in inboxes

There's no need for per-inbox Xapian DBs when using extindex, so
reduce wear on the poor systems this test runs on.

4 years agosearchidx: all indexers check for bad blobs
Eric Wong [Wed, 9 Dec 2020 09:25:10 +0000 (09:25 +0000)] 
searchidx: all indexers check for bad blobs

This should help us detect bugs in our code or storage
synchronization problems more easily.  This probably won't
detect corrupted git storage, but can detect corrupted SQLite
files.

"Bad blobs, bad blobs, whatcha gonna do when they come for you?"

4 years agowww+nntp: deal with lack of addresses for ->ALL
Eric Wong [Wed, 9 Dec 2020 23:33:00 +0000 (23:33 +0000)] 
www+nntp: deal with lack of addresses for ->ALL

Since extindex is an amalgamation of several inboxes, discerning
an appropriate address for List-Post: would be expensive and
most likely unnecessary.  Some legacy/historical inboxes may
have no active address, either, so don't attempt to set the
List-Post header if no addresses are configured.

4 years agoextsearchidx: ck_existing: set $OID for warning context
Eric Wong [Tue, 8 Dec 2020 21:21:30 +0000 (21:21 +0000)] 
extsearchidx: ck_existing: set $OID for warning context

The content_hash() hash in the same scope may trigger warnings
for a given blob, so ensure we correctly report the blob where
it happens.

4 years agoadmin: resolve_repo_dir => resolve_inboxdir
Eric Wong [Tue, 8 Dec 2020 21:21:29 +0000 (21:21 +0000)] 
admin: resolve_repo_dir => resolve_inboxdir

We've stopped referring to inboxdirs as "repos" a while ago
since v2 inboxes have multiple git repos associated with them.

So update the name to reflect that and avoid an unnecessary
export that's only used by a test case.

4 years agoextindex: do not use current dir like -index does
Eric Wong [Tue, 8 Dec 2020 21:21:28 +0000 (21:21 +0000)] 
extindex: do not use current dir like -index does

At least not for resolving inboxes, since there's no good way
for a user to specify what is an inbox or extindex directory
without a command-line switch.

Instead of changing the -extindex command, we change the -index
command internals to rely on the new {-use_cwd} flag to avoid
internal use of negation, since double-negatives and the like
are confusing to me.

4 years agorename {pi_config} fields to {pi_cfg}
Eric Wong [Tue, 8 Dec 2020 21:21:27 +0000 (21:21 +0000)] 
rename {pi_config} fields to {pi_cfg}

{pi_config} may be confused with the documented `PI_CONFIG'
environment variable, and we'll favor vowel-removal to be
consistent with our usage of object references.

The `pi_' prefix may stay in some places, for now; since a
separate namespace may come into this codebase for local/private
client-tooling.

For InboxIdle, we'll also remove an invalid comment about
holding a reference to the PublicInbox::Config object, too.

4 years agonntp: replace {ng} with {ibx} for consistency
Eric Wong [Tue, 8 Dec 2020 21:21:26 +0000 (21:21 +0000)] 
nntp: replace {ng} with {ibx} for consistency

They're PublicInbox::Inbox objects just like the rest of
the non-NNTP code.  So rename the NNTP code for consistency
with the rest of the codebase.  Furthermore, {ng} and $ng
may be confused with the `--ng' switch for -init, and that's
a non-ref scalar string.

4 years agotreewide: replace {-inbox} with {ibx} for consistency
Eric Wong [Tue, 8 Dec 2020 21:21:25 +0000 (21:21 +0000)] 
treewide: replace {-inbox} with {ibx} for consistency

{ibx} is shorter and is the most prevalent abbreviation
in indexing and IMAP code, and the `$ibx' local variable
is already prevalent throughout.

In general, the codebase favors removal of vowels in variable
and field names to denote non-references (because references are
"lighter" than non-references).

So update WWW and Filter users to use the same code since
it reduces confusion and may allow easier code sharing.

4 years agosearch: reinstate "uid:" internal search prefix
Eric Wong [Sat, 5 Dec 2020 22:22:46 +0000 (22:22 +0000)] 
search: reinstate "uid:" internal search prefix

User-supplied queries (via PublicInbox::IMAPsearchqp) may
restrict messages to certain UID ranges in addition to the
limits we impose ourselves for mailbox slices.  So we'll
continue to ask Xapian::QueryParser to "uid:" numeric ranges.

Fixes: 4b551c884a648b45 ("imap: support isearch and reduce Xapian queries")
4 years agoshard_add_eidx_info: pass $eidx_key instead of $ibx object
Eric Wong [Mon, 7 Dec 2020 07:40:53 +0000 (07:40 +0000)] 
shard_add_eidx_info: pass $eidx_key instead of $ibx object

This improves consistency with sibling methods such as
->shard_remove_eidx_info and ->add_xref3.  Passing the
$eidx_key scalar is preferable to the entire $ibx object
for IPC-friendliness.

4 years agosearchidx: remove $oid parameter from most calls
Eric Wong [Mon, 7 Dec 2020 07:40:52 +0000 (07:40 +0000)] 
searchidx: remove $oid parameter from most calls

Xapian docids have been tied to the over {num} column for
nearly 3 years, now; and OIDs are no longer stored in Xapian
document data.  There's no need to increase code and IPC
complexity by passing the OID around.

4 years agoextsearchidx: remove needless SHA-1 check
Eric Wong [Mon, 7 Dec 2020 07:40:51 +0000 (07:40 +0000)] 
extsearchidx: remove needless SHA-1 check

There is no need to verify checksums of data already stored in
git.  Doing this ourselves also limits flexibility in moving to
other hashes.

4 years agooveridx: wrap eidx_key => ibx_id mapping
Eric Wong [Mon, 7 Dec 2020 07:40:50 +0000 (07:40 +0000)] 
overidx: wrap eidx_key => ibx_id mapping

This makes things a little less noisy and will be
called by ExtSearchIdx.

4 years agoover: gracefully show invalid ibx_id
Eric Wong [Mon, 7 Dec 2020 07:40:49 +0000 (07:40 +0000)] 
over: gracefully show invalid ibx_id

While "public-inbox-extindex --gc" invocations try to ensure
proper ordering, it is still possible for users to change
the `inboxes' tables via sqlite3(1) or similar means.  So
show a "missing://ibx_id=$ibx_id" placeholder to avoid undefined
variable warnings.

URLs such as "imaps://..." will eventually be supported as
eidx_keys, so having a URL-like "missing://" as a placeholder
probably makes sense.

4 years agooveridx: {num} column is INTEGER PRIMARY KEY
Eric Wong [Sat, 5 Dec 2020 22:59:31 +0000 (22:59 +0000)] 
overidx: {num} column is INTEGER PRIMARY KEY

INTEGER PRIMARY KEY can be an alias for ROWID in SQLite and is
already unique, so there's no need for a separate UNIQUE(num)
index.

With a smallish ~3K, freshly indexed v2 inbox, this results in a
~40K space savings, reducing over.sqlite3 from 1.375M to 1.335M
(post-VACUUM).

This only affects newly-indexed inboxes; existing DBs will
require manual intervention to take advantage of space savings.

Link: https://www.sqlite.org/rowidtable.html
4 years agoimap: support isearch and reduce Xapian queries
Eric Wong [Sat, 5 Dec 2020 11:10:45 +0000 (11:10 +0000)] 
imap: support isearch and reduce Xapian queries

Since IMAP search (either with Isearch or traditional per-Inbox
search) only returns UIDs, we can safely set the limit to the
UID slice size(*).  With isearch, we can also trust the Xapian
result to fit any docid range we specify.

Limiting Xapian results to 1000 was making ->ALL docid <=>
per-Inbox UID impossible since results could overlap between
ranges unpredictably.

Finally, we can map the ->ALL docids into per-Inbox UIDs and
show them to the client in the UID order of the Inbox, not the
docid order of the ->ALL extindex.

This also lets us get rid of the "uid:" query parser prefix
and use the Xapian::Query API directly to reduce our search
prefix footprint.

For mbox.gz downloads in WWW, we'll also make a best effort to
preserve the order from the Inbox, not the order of extindex;
though it's possible large result sets can have non-overlapping
windows.

(*) by definition, UID slice size is a "safe" value which
    shouldn't OOM either the server or clients.

4 years agoisearch: emulate per-inbox search with ->ALL
Eric Wong [Sat, 5 Dec 2020 10:11:38 +0000 (10:11 +0000)] 
isearch: emulate per-inbox search with ->ALL

Using "eidx_key:" boolean prefix to limit results to a given
inbox, we can use ->ALL to emulate and replace per-Inbox
xap15/[0-9] search indices.

With this change, the presence of "extindex.all.topdir" in the
$PI_CONFIG will cause the WWW code to use that extindex and
ignore per-inbox Xapian DBs in xap15/[0-9].

Unfortunately IMAP search still requires old per-inbox indices,
for now.  Mapping extindex Xapian docids to per-Inbox UIDs and
vice-versa is proving tricky.  Fortunately, IMAP search is
rarely used and optional.  The RFCs don't specify expensive
phrase search, either, so `indexlevel=medium' can be used in
per-inbox Xapian indices to save space.

For primarily WWW (and future JMAP) users; this should result in
significant disk space, FD, and page cache footprint savings for
large instances with many inboxes and many cross-posted
messages.

4 years agoinbox: simplify ->search and callers
Eric Wong [Sat, 5 Dec 2020 10:11:37 +0000 (10:11 +0000)] 
inbox: simplify ->search and callers

Stop leaking WWW/PSGI-specific logic into classes like
PublicInbox::Inbox, which is used universally.

We'll also decouple $ibx->over from $ibx->search and just deal
with duplicate the code inside ->over to reduce argument
complexity in ->search.

This is also a step in moving away from using {psgi.errors}
to ease code sharing between IMAP, NNTP, and command-line
interfaces.  Perl's built-in `warn' and `local $SIG{__WARN__}'
provides all the flexibility we need to control warning output
and should be universally understood by Perl hackers who may
be unfamiliar with PSGI.

4 years agoextmsg: use ->ALL for "global" MID lookups
Eric Wong [Fri, 4 Dec 2020 22:03:49 +0000 (22:03 +0000)] 
extmsg: use ->ALL for "global" MID lookups

As with NewsWWW and NNTP, we can use ->ALL to completely
avoid trying SQLite/Xapian lookups across hundreds/thousands
of inboxes.

4 years agonewswww: use ->ALL to avoid O(n) inbox scan
Eric Wong [Fri, 4 Dec 2020 22:03:48 +0000 (22:03 +0000)] 
newswww: use ->ALL to avoid O(n) inbox scan

We can avoid doing a Message-ID lookup on every single inbox
by using ->ALL to scan its over.sqlite3 DB.  This mimics NNTP
behavior and picks the first message indexed, though redirecting
to /all/$MESSAGE_ID/ could be done.

With the current lore.kernel.org set of inboxes (~140), this
provides a 10-40% speedup depending on inbox ordering.

4 years agosearch: remove mdocid export
Eric Wong [Fri, 4 Dec 2020 22:03:47 +0000 (22:03 +0000)] 
search: remove mdocid export

There's no need to export it, as shown by the change to
SearchView.  This should pave the way to making search
more flexible and allow per-Inbox search to reuse ->ALL.

4 years agonntp: small speed up for multi-line responses
Eric Wong [Fri, 4 Dec 2020 22:03:46 +0000 (22:03 +0000)] 
nntp: small speed up for multi-line responses

Using a non-zero-length separator for `join' requires extra work
inside Perl.  We can shove the cost of appending "\r\n" into the
`map' loop, instead.  This speeds up the `join' operation.

The "deferred" log entry for a "LISTGROUP org.kernel.vger.linux-kernel"
command (with nearly 3.8 million messages) goes from ~3.96s to 3.86s
on my workstation.

4 years agonntp: xref_by_tc: simplify slightly
Eric Wong [Fri, 4 Dec 2020 22:03:45 +0000 (22:03 +0000)] 
nntp: xref_by_tc: simplify slightly

We can invalidate ibx->{newsgroup} at config load-time to avoid
having to check ibx->{newsgroup} validity in To/Cc: matching.
This saves us some hash lookups in all cases.

4 years agoover: ensure old, merged {tid} is really gone
Eric Wong [Fri, 4 Dec 2020 12:09:29 +0000 (12:09 +0000)] 
over: ensure old, merged {tid} is really gone

We must use the result of link_refs() since it can trigger
merge_threads() and invalidate $old_tid.  In case
merge_threads() isn't triggered, link_refs() will return
$old_tid anyways.

When rethreading and allocating new {tid}, we also must update
the row where the now-expired {tid} came from to ensure only the
new {tid} is seen when reindexing subsequent messages in
history.  Otherwise, every subsequently reindexed+rethreaded
message could end up getting a new {tid}.

Reported-by: Kyle Meyer <kyle@kyleam.com>
Link: https://public-inbox.org/meta/87360nlc44.fsf@kyleam.com/
4 years agonntp: make ->ALL Xref generation more fuzzy
Eric Wong [Mon, 30 Nov 2020 23:37:42 +0000 (23:37 +0000)] 
nntp: make ->ALL Xref generation more fuzzy

For ->ALL users, this mitigates the regression introduced
by commit 811b8d3cbaa790f59b7b107140b86248da16499b
("nntp: xref: use ->ALL extindex if available"), since
it's common to cross post messages to some mailing
lists with per-list trailers for unsubscribe information.

We won't bother dealing with Bcc-ed messages since those
are nearly all spam when it comes to public mailing lists.

Fixes: 811b8d3cbaa790f5 ("nntp: xref: use ->ALL extindex if available")
Link: https://public-inbox.org/meta/20201130194201.GA6687@dcvr/
4 years agonntpd: move {newsgroup} name check to config
Eric Wong [Tue, 1 Dec 2020 01:35:46 +0000 (01:35 +0000)] 
nntpd: move {newsgroup} name check to config

With 50K newsgroups in the config file, this doesn't slow down
`PublicInbox::Config->new->fill_all' any measurable amount on
my busy old workstation.

This should prevent invalid newsgroup names from getting into
into extindex and catch user errors sooner, rather than later.

v2:
  - delete {newsgroup} if invalid to avoid ->nntp_url link
  - simplify -imapd and explain remaining check

4 years agot/extsearch: test ->has_threadid
Eric Wong [Sun, 29 Nov 2020 20:19:47 +0000 (20:19 +0000)] 
t/extsearch: test ->has_threadid

Since has_threadid predates the existence of ExtSearch, we can
be certain the Xapian DB can collapse by threadid.

4 years agogit: ensure subclassed ->fail gets called
Eric Wong [Sun, 29 Nov 2020 10:52:30 +0000 (10:52 +0000)] 
git: ensure subclassed ->fail gets called

Some of these changes may not be strictly necessary, but it
makes code easier to maintain and change.  Hackers
using/modifying this code will no longer wonder if a particular
callsite needs to care about subclasses or not.

4 years agogit: set non-blocking flag in case of other bugs
Eric Wong [Sun, 29 Nov 2020 10:52:29 +0000 (10:52 +0000)] 
git: set non-blocking flag in case of other bugs

This makes GitAsyncCat more resilient to bugs in Gcf2 or even
git-cat-file itself.  I noticed -imapd stuck on read(2) from
the Gcf2 pipe, so there may be a bug somewhere in Gcf2 or
PublicInbox::Git.  This should make us more resilient to them
and hopefully help us notice and fix them.

4 years agoextindex: support `--gc' to remove dead inboxes
Eric Wong [Sun, 29 Nov 2020 05:09:35 +0000 (05:09 +0000)] 
extindex: support `--gc' to remove dead inboxes

Inboxes may be removed or newsgroups renamed over time.
Introduce a switch to do garbage collection and eliminate stale
search and xref3 results based on inboxes which remain in the
config file.

This may also fixup stale results leftover from any bugs which
may leave stale data around.

This is also useful in case a clumsy BOFH (me :P) is swapping
between several PI_CONFIGs and accidentally indexed a bunch of
inboxes they didn't intend to.

4 years agov2writable: detect shard count for ExtSearchIdx properly
Eric Wong [Sun, 29 Nov 2020 05:09:34 +0000 (05:09 +0000)] 
v2writable: detect shard count for ExtSearchIdx properly

Otherwise, any explicitly set shard counts were ignored and
we'd be counting CPUs every single time.

4 years agonntpd: remove redundant {groups} shortcut
Eric Wong [Sat, 28 Nov 2020 05:09:16 +0000 (05:09 +0000)] 
nntpd: remove redundant {groups} shortcut

It's not worth confusing hackers reading the source to have
two ways to access the same (large) hash table.  So just
go through PublicInbox::Config objects for now since the
extra hash lookup isn't going to be noticeable.

I've also started favoring "for" instead of "foreach"
since they're the equivalent perlop and less wear on
my fingers + keyboard.

4 years agonntp: XPATH uses ->ALL extindex, too
Eric Wong [Sat, 28 Nov 2020 05:09:15 +0000 (05:09 +0000)] 
nntp: XPATH uses ->ALL extindex, too

Another 30-40% speedup when testing against a local
lore.kernel.org mirror.  In either case, we'll consistently sort
the response for ease-of-testing and client-side
cache-friendliness.

4 years agonntp: art_lookup: use mid_lookup and simplify
Eric Wong [Sat, 28 Nov 2020 05:09:14 +0000 (05:09 +0000)] 
nntp: art_lookup: use mid_lookup and simplify

This lets us take advantage of mid_lookup speedup from the
previous commit.

While we're at it, start moving towards using `$ibx' as the
abbreviation for PublicInbox::Inbox objects even in the NNTP
code, since they've been shared with the WWW code for several
years, now.

4 years agonntp: speed up mid_lookup() using ->ALL extindex
Eric Wong [Sat, 28 Nov 2020 05:09:13 +0000 (05:09 +0000)] 
nntp: speed up mid_lookup() using ->ALL extindex

We can reuse "xref3" information in extindex to quickly match
messages matching a given Message-ID across hundreds or
thousands of newsgroups with a few SQL statements.

"XHDR Xref $MESSAGE_ID" is around 40% faster, on top of
previous speedups.

4 years agonntp: NEWGROUPS uses long_response
Eric Wong [Sat, 28 Nov 2020 05:09:12 +0000 (05:09 +0000)] 
nntp: NEWGROUPS uses long_response

We can amortize the cost of NEWGROUPS time filtering using the
long_response API.  This lets us handle hundreds/thousands of
inboxes without monopolizing the event loop for this command.

Further speedup is possible using MiscSearch, but that requires
not-yet-done indexing changes to MiscIdx.

4 years agoextindex: fix delete (`d') handling
Eric Wong [Sat, 28 Nov 2020 08:45:21 +0000 (08:45 +0000)] 
extindex: fix delete (`d') handling

We need to completely remove a message from over.sqlite3 and
Xapian when no references remain, otherwise users will still see
the removed messages in NNTP overviews and WWW search
results/summaries.

References to messages are now solely handled by the `xref3'
table of over.sqlite3.  We can also trust `xref3' when deciding
whether to remove only the "O$eidx_key" and "G$lid" terms from a
document in Xapian or to remove the entire Xapian document.

4 years agosearchidxshard: chomp $eidx_key from pipe
Eric Wong [Sat, 28 Nov 2020 07:06:50 +0000 (07:06 +0000)] 
searchidxshard: chomp $eidx_key from pipe

We were accidentally adding "\n" to terms (which Xapian happily
accepts), causing incompatibilities when enabling parallel
sharding in some invocations of -extindex but not others.

This is an extindex incompatibility and starting a new extindex
will be required to take advantage of in-development features,
so it's not urgent to start another one, either.
(other incompatible things may happen before a 1.7 release)

4 years ago*index: more consistent graceful shutdown checks
Eric Wong [Fri, 27 Nov 2020 21:33:55 +0000 (21:33 +0000)] 
*index: more consistent graceful shutdown checks

v1 and v2 inbox indexing now supports graceful shutdown checks
just like ExtSearchIdx.  Additionally, we'll consistently
perform quit checks at the top of loops for consistency.

Interaction with the --xapian-only and --sequential-shard
options are a bit lacking, and will warn the user to use
"--reindex --xapian-only" to fix.

4 years agonntp: xref: use ->ALL extindex if available
Eric Wong [Fri, 27 Nov 2020 09:52:54 +0000 (09:52 +0000)] 
nntp: xref: use ->ALL extindex if available

Getting Xref for cross-posted messages is an O(n) operation
where `n' is the number of newsgroups on the server.  This works
acceptably when there are dozens of groups, but would be
unnacceptable when there's tens of thousands of newsgroups.

With ~140 newsgroups, a lore.kernel.org mirror already handles
"XHDR Xref $MESSAGE_ID" requests around 30% faster after
creating the xref3.idx_nntp index.

The SQL additions to ExtSearch.pm may be a bit strange and
seem more appropriate for Over.pm; however it currently makes
sense to me since those bits of over.sqlite3 access are
exclusive to ExtSearch and can't be used by traditional
v1/v2 inboxes...

4 years agonntp: xref: simplify sub signature
Eric Wong [Fri, 27 Nov 2020 09:52:53 +0000 (09:52 +0000)] 
nntp: xref: simplify sub signature

We'll be using the `xref3' table in extindex to speed up xref(),
and that'll require comparisons against $smsg->{blob}.  So pass
the entire $smsg through.

4 years agonntp: some minor golfing
Eric Wong [Fri, 27 Nov 2020 09:52:52 +0000 (09:52 +0000)] 
nntp: some minor golfing

Reduce screen real estate usage to reduce human attention span
requirements.

4 years agot/extsearch: show a more realistic case
Eric Wong [Fri, 27 Nov 2020 09:52:51 +0000 (09:52 +0000)] 
t/extsearch: show a more realistic case

Different messages to different public Inboxes are likely to
have different List-IDs, so show that we can deduplicate based
on content (but per-mailing-list trailers need to go through a
PublicInbox::Filter::* or be disabled by mailing list admins).

4 years agonntp: move LIST iterators to long_response
Eric Wong [Fri, 27 Nov 2020 09:52:50 +0000 (09:52 +0000)] 
nntp: move LIST iterators to long_response

Iterating through many newsgroups can hog the event loop if many
random seeks are required.  Avoid monopolizing the event loop in
that case by using the long_response API.

For now, we can still rely on grep() since it seems to work
reasonably well with 50K test newsgroup names.

4 years agonntp: LIST ACTIVE.TIMES use angle brackets around address
Eric Wong [Fri, 27 Nov 2020 09:52:49 +0000 (09:52 +0000)] 
nntp: LIST ACTIVE.TIMES use angle brackets around address

This matches the example shown in RFC 3977, section 7.6.1.3

4 years agomiscsearch: implement ->newsgroup_matches
Eric Wong [Fri, 27 Nov 2020 09:52:48 +0000 (09:52 +0000)] 
miscsearch: implement ->newsgroup_matches

This may be used to speed up newsgroup searches down-the-line,
but the grep perlop isn't too shabby, at the moment.

4 years agonntp: NEWNEWS: speed up filtering
Eric Wong [Fri, 27 Nov 2020 09:52:47 +0000 (09:52 +0000)] 
nntp: NEWNEWS: speed up filtering

With 50K newsgroups, the filtering phase goes from ~2000 seconds
to ~90 MILLISECONDS by relying on the grep perlop.  This moves
->over checking out of the main dispatch and amortizes the cost
via long_response.  (Fairly scheduled) long_response time in
newnews_i now takes ~360 seconds as opposed to ~30 seconds
before this change, however; but the initial filtering speedup
eliminating 2000s is more than worth it.

4 years agonntp: use grep operation for wildmat matching
Eric Wong [Fri, 27 Nov 2020 09:52:46 +0000 (09:52 +0000)] 
nntp: use grep operation for wildmat matching

Based on experiences with the IMAP server, this ought to be
significantly faster (as to be demonstrated in the next
commit).

4 years agomm: min/max: return 0 instead of undef
Eric Wong [Fri, 27 Nov 2020 09:52:45 +0000 (09:52 +0000)] 
mm: min/max: return 0 instead of undef

This simplifies callers and allows empty newsgroups to be
represented (the WWW UI may be insufficient there, too).

4 years agonntpd: share {groups} hash with {-by_newsgroup} in Config
Eric Wong [Fri, 27 Nov 2020 09:52:44 +0000 (09:52 +0000)] 
nntpd: share {groups} hash with {-by_newsgroup} in Config

There's no need to duplicate a potentially large hash,
but we can keep the inexpensive shortcut to it.  We may
eventually drop the {groups} shortcut if it's no longer
useful.

4 years agonntp: use Inbox->uidvalidity instead of ->mm->created_at
Eric Wong [Fri, 27 Nov 2020 09:52:43 +0000 (09:52 +0000)] 
nntp: use Inbox->uidvalidity instead of ->mm->created_at

This is memoized, and may allow us some future flexibility w.r.t
PublicInbox::Inbox-like objects.  While we're at it, use
defined-or ("//") in case somebody really set a public-inbox
creation time to the Unix epoch.

4 years agoextsearchidx: deduplicate alternates based on st_dev + st_ino
Eric Wong [Mon, 23 Nov 2020 23:32:29 +0000 (23:32 +0000)] 
extsearchidx: deduplicate alternates based on st_dev + st_ino

This allows us to filter out duplicate alternates entries in case
there's symlinks or bind mounts in play, as I (and perhaps some
other users) tend to use symlinks and/or bind mounts heavily.

4 years agowwwattach: prevent deep-linking via Referer match
Eric Wong [Mon, 23 Nov 2020 14:15:35 +0000 (14:15 +0000)] 
wwwattach: prevent deep-linking via Referer match

This prevents `<img src=' tags from being used to deep-link
image attachments from HTML outside of the current host and
reduces potential for abuse.

Some browsers (e.g. Firefox) favor content detection and will
display images irrespective of the Content-Type header being
"application/octet-stream", and "Content-Disposition: attachment"
doesn't stop them, either.

Tested with dillo and Firefox.

Reported-by: Leah Neukirchen <leah@vuxu.org>
4 years agogcf2: workaround libgit2 alternates bug for extindex
Eric Wong [Tue, 24 Nov 2020 00:35:51 +0000 (00:35 +0000)] 
gcf2: workaround libgit2 alternates bug for extindex

While libgit2 handles alternates with relative paths properly
for v2 epochs; nesting them another layer with extindex uses
the wrong relative path expansion (and is inconsistent with
git(1) behavior).

Fortunately, it's possible to work around this libgit2 bug
entirely within Gcf2 and avoid further special cases throughout
the rest of our code to support extindex.

Link: https://bugs.debian.org/975607
4 years ago*search: simplify retry_reopen users
Eric Wong [Mon, 23 Nov 2020 07:06:02 +0000 (07:06 +0000)] 
*search: simplify retry_reopen users

Every callback uses `$self', and creating short-lived
array references is not necessary when it's just as
easy to copy the array in Perl (unlike C).

4 years agomanifest: support faster generation via [extindex "all"]
Eric Wong [Mon, 23 Nov 2020 07:06:01 +0000 (07:06 +0000)] 
manifest: support faster generation via [extindex "all"]

For a mirror of lore.kernel.org with >140 inboxes, this speeds
up manifest.js.gz generation from ~1s to 40ms on my HW.  This
is still unacceptable when dealing with thousands of inboxes,
but gets us closer to where we need to be.

4 years agoextsearchidx: do not short-circuit MiscIdx on no-op v2 prepare
Eric Wong [Mon, 23 Nov 2020 07:06:00 +0000 (07:06 +0000)] 
extsearchidx: do not short-circuit MiscIdx on no-op v2 prepare

This was intended to make development easier; but also allows us
description, URL, and address changes to be picked up
independently of message history.

4 years agomiscidx: store absolute git_dir of each epoch in docdata
Eric Wong [Mon, 23 Nov 2020 07:05:59 +0000 (07:05 +0000)] 
miscidx: store absolute git_dir of each epoch in docdata

This will make it possible to map reference repos in case
somebody uses the feature.

4 years agomiscidx: cleanup git processes after manifest indexing
Eric Wong [Mon, 23 Nov 2020 07:05:58 +0000 (07:05 +0000)] 
miscidx: cleanup git processes after manifest indexing

We shouldn't leave "cat-file --batch" processes around when
we're done with an epoch or inbox, since there could be
many thousands.

4 years agoextsearch: fix remaining "eindex" references
Eric Wong [Mon, 23 Nov 2020 07:05:57 +0000 (07:05 +0000)] 
extsearch: fix remaining "eindex" references

We'll replace "$EINDEX" => "$EXTINDEX" in a user-visible
line and also some hacker-only tests.

"eindex" is no longer used because it rhymes with "reindex",
so remove the last instance of it.

Fixes: 6b0fed3b03263ba2 ("extsearch: rename -eindex to -extindex")
4 years agomiscidx: put grokmirror manifest entries in Xapian docdata
Eric Wong [Mon, 23 Nov 2020 07:05:56 +0000 (07:05 +0000)] 
miscidx: put grokmirror manifest entries in Xapian docdata

This should make it possible for us quickly generate
manifest.js.gz files with less random I/O and process
spawning in the WWW code.

4 years agoinbox: git_epoch: remove ->version check
Eric Wong [Mon, 23 Nov 2020 07:05:55 +0000 (07:05 +0000)] 
inbox: git_epoch: remove ->version check

If $epoch is supplied to this method, there's already epochs and
an extra method call for ->version is a pointless waste of CPU
cycles.

4 years agomanifest: use ibx->git_epoch method for v2
Eric Wong [Mon, 23 Nov 2020 07:05:54 +0000 (07:05 +0000)] 
manifest: use ibx->git_epoch method for v2

We can slightly reduce the amount of version-specific logic,
here.

4 years agogit: add manifest_entry method
Eric Wong [Mon, 23 Nov 2020 07:05:53 +0000 (07:05 +0000)] 
git: add manifest_entry method

We'll be using this for MiscIdx and pre-generating the necessary
JSON for manifest.js.gz, so make it easier to share code for
generating per-repo JSON entries for grokmirror.

4 years agomove JSON module portability into PublicInbox::Config
Eric Wong [Mon, 23 Nov 2020 07:05:52 +0000 (07:05 +0000)] 
move JSON module portability into PublicInbox::Config

We'll be using JSON in MiscIdx and MiscSearch, and
PublicInbox::Config seems like an appropriate place to put it.

4 years agomiscsearch: a new Xapian sub-DB for extindex
Eric Wong [Mon, 23 Nov 2020 07:05:51 +0000 (07:05 +0000)] 
miscsearch: a new Xapian sub-DB for extindex

This will be used to index and search Inbox objects and perhaps
individual git repositories/epochs for grokmirror manifest.js.gz
generation.  There is no sharding planned for this at the moment
since inbox count should remain low (~100K to 1M) compared to
message count.

Folding this into the existing sharded DBs could be possible;
but would likely increase query and maintenance costs, as well
as development complexity.  So we'll use a few more inodes and
FDs at runtime, instead.

4 years agoextindex: remove skip-docdata option
Eric Wong [Wed, 18 Nov 2020 08:22:27 +0000 (08:22 +0000)] 
extindex: remove skip-docdata option

Since extindex is entirely new, it doesn't have backwards
compatibility concerns and never stored docdata, anyways.

4 years agov2writable: avoid initiating leftover unindex if interrupted
Eric Wong [Sun, 15 Nov 2020 23:27:23 +0000 (23:27 +0000)] 
v2writable: avoid initiating leftover unindex if interrupted

We can also avoid a needless progress message on log2stack
interruptions, too.

4 years agosearchidx: check for graceful shutdown in log2stack
Eric Wong [Sun, 15 Nov 2020 23:20:17 +0000 (23:20 +0000)] 
searchidx: check for graceful shutdown in log2stack

The initial "git log" invocation for a git epoch can be time
consuming, so check for graceful shutdown at each line to ensure
timely shutdowns and avoid SSD/HDD wear.

4 years agot/eml.t: workaround newer Email::MIME* behavior
Eric Wong [Sun, 15 Nov 2020 08:56:09 +0000 (08:56 +0000)] 
t/eml.t: workaround newer Email::MIME* behavior

Recent (2020) versions of Email::MIME (and/or dependencies)
have different behavior than historical versions which seem
to be less DWIM and perhaps technically more correct.  We'll
retain historical behavior for now, since it doesn't seem to
cause real problems and DWIM-ness is often required to make
sense of historical mail.

Tested on a FreeBSD 11.4 VM with the following packages:

p5-Email-MIME-1.949
p5-Email-MIME-ContentType-1.024_1
p5-Email-MIME-Encodings-1.315_2

4 years agoextindex: support graceful shutdown via QUIT/INT/TERM
Eric Wong [Fri, 13 Nov 2020 11:11:44 +0000 (11:11 +0000)] 
extindex: support graceful shutdown via QUIT/INT/TERM

Just like the daemon processes, -extindex now supports graceful
shutdown via the same signals.  This lets users avoid having to
repeat indexing messages when a power outage strikes during a
long (multi-hour/day) indexing run.

Per-inbox (v1/v2) -index graceful shutdowns are not supported,
yet, but is planned for later.

4 years ago*index: discard sync->{todo} on iteration
Eric Wong [Fri, 13 Nov 2020 11:11:43 +0000 (11:11 +0000)] 
*index: discard sync->{todo} on iteration

There's no need to continuously append to {todo} when indexing
multiple inboxes.  They're not redundantly indexed (because the
IdxStack is discarded, making it a noop), but it's still a waste
of memory keeping the $unit hashrefs around.

4 years ago*index: avoid per-epoch --batch-check processes
Eric Wong [Fri, 13 Nov 2020 11:11:42 +0000 (11:11 +0000)] 
*index: avoid per-epoch --batch-check processes

Since all.git (v2) and ALL.git (extindex) encompass every single
epoch or indexed inbox; and is_ancestor() only uses hexadecimal
OIDs; there is no good reason to use $unit->{git} for an
epoch-local $git->check.

This prevents dozens/hundreds of --batch-check processes from
being left running after indexing and can improve locality
if size checks are being done (since that uses --batch-check,
too).

Theoretically several epochs may have conflicting OIDs, but
we're screwed in those cases, anyways, so we might as well
detect it earlier (though I'm not sure what the behavior would
be :x).

4 years ago*index: checkpoints write last_commit metadata
Eric Wong [Fri, 13 Nov 2020 11:11:41 +0000 (11:11 +0000)] 
*index: checkpoints write last_commit metadata

This will set us up for supporting graceful shutdown
on -index without repeating any work.

4 years agosearchidx: fix fallback on unindex miss
Eric Wong [Tue, 10 Nov 2020 03:20:29 +0000 (03:20 +0000)] 
searchidx: fix fallback on unindex miss

In case of other bugs or intentional corruption of over.sqlite3,
we don't want to attempt dereferencing a non-ref scalar when
calling ->mid_delete in the fallback code path.

Noticed while chasing another bug in extindex development...