La funzione di ricompensa nel reinforcement learning: come funziona e cos’è il reward hacking
Cos'è la funzione di ricompensa nel reinforcement learning, come si progetta e perché il reward hacking mette alla prova ogni sistema di AI.
OpenAI porta GPT-Live-1 nell'API a 0,05 dollari al minuto: voce full-duplex, gestione naturale delle interruzioni e delega del ragionamento ad Astra.
Cos'è la funzione di ricompensa nel reinforcement learning, come si progetta e perché il reward hacking mette alla prova ogni sistema di AI.
Sam Altman ha detto ai dipendenti che OpenAI è aperta a rallentare lo sviluppo dell'AI, anche insieme ad altri laboratori, per motivi di sicurezza.
Google lancia l'app Gemini per Windows 10 e 11: si apre con Alt + Space, lavora sopra le tue applicazioni e sfida Copilot sul suo terreno.
Cohere lancia North Small Translate, modello di traduzione open weight da 218 miliardi di parametri: nei test WMT26 batte DeepL e Google Translate.
Un hacker ha orchestrato centinaia di agenti AI per violare 440 server PaperCut in 48 paesi, Italia inclusa. Cosa rivela il report di GreyNoise.
Positron ha raccolto 875 milioni di dollari a una valutazione di 5 miliardi per portare sul mercato i suoi chip di inferenza basati su memoria commodity.
Microsoft punta a più che triplicare la capacità dei suoi data center, dagli attuali 12 GW a oltre 38 GW entro il 2032, per sostenere la…
Anthropic lancia Claude Commerce Agents, il blueprint open source per costruire in pochi giorni agenti AI per lo shopping e per i merchant.
Come creare immagini con l'intelligenza artificiale: come funziona, quali strumenti scegliere e come scrivere prompt efficaci per risultati di qualità.