IA Batch : attendre quelques heures, payer moins

· Roberto Sirolo · 2 min de lecture

Toutes les requêtes à l'IA n'ont pas la même urgence. Certaines, vous les faites en écrivant et il vous faut la réponse tout de suite ; d'autres, vous pourriez les lancer avant de fermer l'ordinateur et les retrouver faites le lendemain. NovLore traite ces deux cas différemment, et savoir lequel est lequel économise des crédits.

Ce qu'est l'IA Batch

L'IA Batch met votre travail dans une file d'attente au lieu de l'exécuter à l'instant. La réponse arrive après des heures, pas des secondes. En échange de l'attente, le traitement coûte moins : l'API que NovLore utilise pour ces travaux — la Batch API de Claude — est facturée à environ la moitié de la même requête en temps réel.

Ce n'est pas une version dégradée du modèle. C'est le même modèle, avec une livraison différée.

Quand l'attente est une bonne affaire

Le batch est rentable quand la tâche est lourde et que vous ne la regardez pas :

  • générer un chapitre entier à partir du plan et de la bible de l'œuvre ;
  • une large passe sur la structure du livre ;
  • des travaux en bloc que vous comptiez laisser tourner en faisant autre chose.

Dans tous ces cas, rester devant l'écran avec la barre qui tourne ne vous apportait aucun avantage. Autant déplacer le travail dans la file et le payer moins cher.

Quand il vous faut vraiment la réponse tout de suite

Le temps réel reste le bon choix quand la latence est justement le sujet :

  • le chat avec Scintilla, où vous réfléchissez avec l'assistant ;
  • la modification d'un passage sélectionné, que vous faites et relisez en quelques secondes ;
  • la correction à la volée pendant que vous écrivez.

Ici, une attente de plusieurs heures casserait le flux de travail au lieu de l'aider. Le coût plein est le prix de la réactivité, et dans ces cas la réactivité en vaut la peine.

Comment ça marche dans NovLore

Vous envoyez le travail dans la file, l'appli l'enregistre et vous laisse continuer à écrire. Elle vérifie l'état par intervalles ; quand le résultat est prêt, il vous attend. Vous n'avez pas à garder la page ouverte ni l'ordinateur allumé.

La règle pratique est unique : si vous n'avez pas besoin de regarder l'IA travailler, envoyez-la en batch. Si vous vous en servez pour réfléchir, gardez le temps réel.

Questions fréquentes

Combien de temps dois-je attendre, exactement ?

Cela dépend de la charge. En général on parle d'heures, pas de jours. C'est prévu pour du travail que l'on lance et que l'on reprend plus tard, pas pour quelque chose dont on a besoin dans la même session.

Le résultat du batch est-il de moindre qualité ?

Non. Le modèle est le même et les instructions sont les mêmes : seul le moment de la livraison change. Le seul compromis est le temps, pas le texte.

Continuer la lecture

NovLore est le studio d'écriture où la structure et le texte de votre œuvre vivent au même endroit.